← Alle Experimente
exp_15

k-Anonymität

Reicht es, Namen zu löschen, um Daten zu anonymisieren? Du kannst eine Tabelle vergröbern, bis niemand mehr allein dasteht, und danach selbst versuchen, Personen wiederzufinden.

Die Uniklinik will Behandlungsdaten für eine Studie teilen. Namen und Adressen sind schon gelöscht. Übrig sind Alter, Postleitzahl, Geschlecht und die Diagnose.

Alle 41 Menschen sind erfunden. Aber mit ein bisschen Zusatzwissen (Nachbarin, Kollege, Zeitungsartikel) findet man trotzdem Leute wieder. Vergröber die Spalten, bis jede Zeile mindestens k − 1 Doppelgänger hat.

  • Depression
  • Kreuzbandriss
  • Asthma
  • Migräne
  • Bluthochdruck
  • Diabetes Typ 2
  • Bandscheibenvorfall
  • Borreliose
  • Gruppe groß genug
  • zu klein
  • gelöscht
  • alle dieselbe Diagnose

Missionen

Ziel
k: Größe der kleinsten Gruppe 1
Risiko Wiedererkennen (1/k)
beste Vermutung einer Diagnose
eindeutig
l: Diagnosen pro Gruppe, mindestens
Genauigkeit übrig
Zeilen gelöscht

Spiel Angreifer:in

Über wen weißt du was?

  • Gruppe mit mindestens k
  • Gruppe zu klein
  • alle mit derselben Diagnose
  • passt zum Wissen der Angreifer:in

Was steckt dahinter?

Namen löschen ist noch keine Anonymisierung. Alter, PLZ und Geschlecht sind nicht geheim, aber zusammen zeigen sie oft auf genau eine Person. Solche Spalten heißen Quasi-Identifikatoren. Die Informatikerin Latanya Sweeney hat im Jahr 2000 mit Daten der Volkszählung von 1990 geschätzt, dass sich 87 % der Menschen in den USA allein über fünfstellige Postleitzahl, Geburtsdatum und Geschlecht eindeutig bestimmen lassen. Als Doktorandin hatte sie davor schon die Krankenakte des Gouverneurs von Massachusetts in angeblich anonymen Klinikdaten gefunden, mit einer Wählerliste, die sie für 20 Dollar gekauft hatte.

Ihre Antwort darauf war die k-Anonymität. Jede Kombination aus Quasi-Identifikatoren muss dabei mindestens k-mal vorkommen. Dahin kommt man durch Vergröbern (34 wird zu 30–39, 72074 zu 720**) oder indem man Zeilen löscht, die immer noch rausstechen. Beides kostet Genauigkeit, und genau mit diesem Abwägen kannst du oben spielen. Ein paar Jahre später hat sich gezeigt, dass k allein nicht reicht: Haben alle in einer Gruppe dieselbe Diagnose, verrät die Gruppe sie trotzdem. l-Diversität verlangt deshalb mindestens l verschiedene sensible Werte pro Gruppe.

Gut zu wissen

  • Es gibt zwei Risiken. Wiedererkennen: Bei k Doppelgängern liegt die Chance, auf die richtige Zeile zu zeigen, bei 1/k. Und die Diagnose verraten: Die „beste Vermutung“ ist, wie viele in der schlimmsten Gruppe dieselbe häufigste Diagnose haben. Vergleichen sollte man das mit der Grundrate, also dem, was man ohne jedes Wissen raten würde: hier 20 %.
  • In der Praxis legt man vorher eine Schwelle fest. Für Studienberichte, die sie veröffentlicht, empfiehlt die Europäische Arzneimittel-Agentur ein Risiko fürs Wiedererkennen von höchstens 0,09 (etwa k = 11). Ältere Richtwerte reichen von Gruppen mit mindestens 3 (Risiko 0,33) bis mindestens 20 (0,05), am häufigsten ist 5 (0,2). Je weniger man kontrolliert, wer die Daten bekommt, desto strenger.
  • Die 87 % wurden später mit der Volkszählung von 2000 nachgerechnet: Da kamen etwa 63 % raus. Immer noch die meisten.
  • Die Stufe „60+“ ist einer echten Regel nachgebaut: Bei der US-Methode HIPAA Safe Harbor wird jedes Alter über 89 zu „90 oder älter“, und von der Postleitzahl dürfen nur die ersten drei Ziffern bleiben, und auch nur, wenn in dem Gebiet mehr als 20.000 Menschen wohnen.
  • In der DSGVO macht das einen großen Unterschied: Anonyme Daten sind keine personenbezogenen Daten mehr. Pseudonymisierte (Name durch eine Nummer ersetzt) schon (Erwägungsgrund 26).
  • „Genauigkeit übrig“ ist hier einfach der Durchschnitt, wie weit jede Spalte vergröbert ist. Echte Werkzeuge wie ARX (für medizinische Daten an der TU München entwickelt) nutzen genauere Maße und viel mehr Spalten.
  • „Schlag was vor“ probiert alle 50 Kombinationen durch und nimmt die, die k mit der meisten Genauigkeit schafft. Mit Löschen nimmt es oft den billigen Weg, und genau da versteckt sich die Gruppe mit nur einer Diagnose.
  • Auch l-Diversität hat Lücken, zum Beispiel wenn die Diagnosen in einer Gruppe zwar verschieden, aber alle gleich heikel sind. Heute setzt man deshalb oft auf Differential Privacy: zufälliges Rauschen mit mathematischer Garantie. Die US-Volkszählung 2020 wurde so veröffentlicht.

So macht man das in echt

  • 1. Direkte Merkmale löschen: Name, Adresse, Versichertennummer, und auch Freitext, weil in Arztbriefen gern Namen stecken.
  • 2. Wie Angreifer:innen denken: Was könnte jemand schon wissen? Daraus folgt, welche Spalten Quasi-Identifikatoren sind. Aufnahmedaten und seltene Diagnosen gehören oft auch dazu.
  • 3. Risikomodell und Schwellen festlegen, Vergröberungs-Stufen pro Spalte definieren und ein Werkzeug die Lösung suchen lassen, die am meisten übrig lässt. ARX (für medizinische Daten) und sdcMicro (ein R-Paket, das Statistikämter nutzen) machen genau das, was die Missionen hier machen, nur mit Tausenden Zeilen und viel mehr Spalten.
  • 4. Prüfen, ob das Ergebnis für die Forschungsfrage noch taugt, und jede Entscheidung aufschreiben. Eine Anonymisierung wird auch an ihrer Dokumentation gemessen.
  • In der Medizin ist Anonymisierung selten der einzige Schutz. Oft werden die Daten stattdessen von einer unabhängigen Treuhandstelle pseudonymisiert, und Forschende dürfen nur in einer geschützten Umgebung damit arbeiten, mit Vertrag. In Deutschland betreibt die Medizininformatik-Initiative dafür Datenintegrationszentren an den Unikliniken, in Tübingen ist das das meDIC im Konsortium DIFUTURE.

Quellen

  • Sweeney, L. (2002). k-anonymity: A model for protecting privacy. International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems, 10(5), 557–570.
  • Sweeney, L. (2000). Simple demographics often identify people uniquely. Carnegie Mellon University, Data Privacy Working Paper 3. (die 87 %)
  • Golle, P. (2006). Revisiting the uniqueness of simple demographics in the US population. Proceedings of the 5th ACM Workshop on Privacy in Electronic Society, 77–80. (die 63 %)
  • Machanavajjhala, A., Kifer, D., Gehrke, J. & Venkitasubramaniam, M. (2007). l-diversity: Privacy beyond k-anonymity. ACM Transactions on Knowledge Discovery from Data, 1(1), Article 3.
  • Li, N., Li, T. & Venkatasubramanian, S. (2007). t-closeness: Privacy beyond k-anonymity and l-diversity. Proceedings of the 23rd IEEE International Conference on Data Engineering, 106–115.
  • European Medicines Agency (2025). External guidance on the implementation of the European Medicines Agency Policy 0070 on the publication of clinical data for medicinal products for human use, Version 1.5, EMA/90915/2016. (die Schwelle 0,09)
  • El Emam, K. & Malin, B. (2015). Concepts and methods for de-identifying clinical trial data. In Institute of Medicine, Sharing Clinical Trial Data: Maximizing Benefits, Minimizing Risk, Anhang B. National Academies Press. (die Richtwerte für Schwellen)
  • Prasser, F. & Kohlmayer, F. (2015). Putting statistical disclosure control into practice: The ARX data anonymization tool. In A. Gkoulalas-Divanis & G. Loukides (Hrsg.), Medical Data Privacy Handbook (S. 111–148). Springer.
  • Templ, M., Kowarik, A. & Meindl, B. (2015). Statistical disclosure control for micro-data using the R package sdcMicro. Journal of Statistical Software, 67(4), 1–36.
  • 45 CFR § 164.514(b)(2), HIPAA Privacy Rule, Safe Harbor. DSGVO: Erwägungsgrund 26.