Das Problem der Datenschutzschwelle in Namensregistern
Sie schlagen einen Nachnamen in einem nationalen Register nach, und er ist nicht da.
Was haben Sie daraus gelernt? Je nachdem, welches Länderregister Sie abgefragt haben, eines von drei völlig verschiedenen Dingen: dass der Nachname null Träger hat, dass er eine gewisse Zahl von Trägern hat, die die Behörde Ihnen nicht nennt, oder überhaupt nichts. Die leere Zelle sieht in allen drei Fällen identisch aus. Nur die Offenlegungsregel des Registers unterscheidet sie, und diese Regel wohnt irgendwo anders als in der Datendatei.
Das wird in dem Moment wichtig, in dem Sie auf die Abwesenheit hin handeln. Bedeutet Abwesenheit null, ist das Löschen des Eintrags korrekt. Bedeutet Abwesenheit „unterhalb der Schwelle", zerstört sein Löschen echte Daten. Dieselbe Evidenz, dieselbe Handlung, entgegengesetztes Urteil — entschieden allein durch eine Fußnote in einer Richtlinie.
Wir stießen darauf, während wir am 17. Juli 2026 Nachnamenkorpora für 63 Sprachregionen prüften (heute 64), und übertrugen beinahe eine korrekte Entscheidung von einem Land auf ein anderes, wo sie ein schwerer Fehler gewesen wäre. Hier ist die Vergleichstabelle, von der wir uns wünschten, sie hätte vorher existiert.
Der Vergleich
| Register | Schwelle | Abwesenheit bedeutet | Kann man danach bereinigen? |
|---|---|---|---|
| Taiwan, MOI | Keine — veröffentlicht Nachnamen mit 1 Träger (643 davon) | Wirklich null | Ja |
| Dänemark, DST | <3 unterdrückt, aber null wird separat gemeldet | Hängt von der Nachricht ab | Pro Name |
| Südkorea, KOSTAT | ≥5 Träger; der Rest zusammengefasst in 기타 („Sonstige") | Unbekannt | Nein |
| Spanien, INE | ≥20 Träger (statistische Vertraulichkeitsregel) | Unbekannt | Nein |
| Frankreich, INSEE | ≥30 Geburten 1891–2000; der Rest zusammengefasst als AUTRES NOMS | Unbekannt | Nein |
| Ukraine | Es existiert überhaupt kein Register | Nichts | Nein |
| Lettland | Es existiert kein Register pro Nachname | Nichts | Nein |
Sieben Register, vier verschiedene Bedeutungen für dieselbe Leerstelle.
Dänemark: das Register, das die Frage direkt beantwortet
Dänemark verdient den längsten Abschnitt, weil es etwas tut, das keine andere Quelle hier tut — es unterscheidet die beiden Zustände explizit, in Worten. Danmarks Statistik betreibt ein Namensorakel: Sie fragen nach einem bestimmten Nachnamen und erhalten eine von zwei Antworten.
| DST-Antwort | Was sie bedeutet | Korrekte Handlung |
|---|---|---|
Der er færre end 3 personer med efternavnet X | 1–2 Träger existieren; die Zahl ist verborgen | Behalten, Gewicht 1 |
Der er ingen personer med efternavnet X | Null Träger | Löschen |
„Es gibt weniger als 3 Personen mit dem Nachnamen X" und „es gibt keine Personen mit dem Nachnamen X" sind verschiedene Sätze, und Dänemark ist bereit, beide zu sagen. Diese einzelne Designentscheidung verwandelt eine Datenschutzschwelle aus einem Hindernis in einen Entscheider pro Name.
Deshalb behielten wir Thurah und Vagn — beide fallen in das Datenschutzband, beide sind echte dänische Nachnamen, die von einer oder zwei Personen getragen werden — und deshalb löschten wir Pedersgaard. Das Register versäumt nicht bloß, Pedersgaard aufzuführen; es erklärt ausdrücklich, dass niemand ihn trägt. Das macht ihn zu einem Phantom, zusammengesetzt aus einem plausiblen Modell (Peders- + -gaard), statt in einer Bevölkerung beobachtet.
Das Argument beruht vollständig auf der Existenz zweier Nachrichten. Antwortete DST færre end 3 auch für null — wie eine naive Lesart von „Zählungen unter 3 unterdrücken" nahelegen würde —, wäre Pedersgaard von Thurah nicht zu unterscheiden, und wir hätten ihn behalten müssen. Die Schwelle hätte die Evidenz verschluckt. Die Offenlegungs-Richtlinie, nicht der Schwellenwert, ist es, was dänische Daten auf diese Weise nutzbar macht.
Taiwan und Südkorea: Spiegelbilder
Diese beiden sind der Grund, warum dieser Artikel existiert. Nachbarn, beide ostasiatisch, beide mit konzentrierten Nachnamenverteilungen, beide mit detaillierten amtlichen Statistiken — und auf entgegengesetzten Seiten dieses Problems, ohne dass irgendetwas im Erscheinungsbild der Daten es Ihnen verriete.
Taiwan: überhaupt kein Boden
Das Innenministerium Taiwans veröffentlicht 643 Nachnamen mit genau einem Träger und 406 mit zweien — hinab bis zu Namen japanischen Ursprungs wie 八谷 und 大久保, die von einer einzigen Person unter 23 Millionen getragen werden. Es gibt überhaupt keinen Datenschutzboden.
Diese Eigenschaft macht das Register zu einem Falsifikationsinstrument. Abwesenheit bedeutet null Träger, Punkt. Als wir also 33 Nachnamen in unserem taiwanischen Korpus fanden, die das Register nicht enthält — 亓官, 漆雕, 巫馬, 段干, 百里, 東郭, 南門, 子車, 梁丘, 左丘, 東門, 西門, 南宮, 長孫, 宇文, 公孫, 萬俟, 聞人, 鍾離, 仲孫, 拓跋 und andere —, war ihr Löschen korrekt. Sie waren dem 百家姓 entnommen, einem klassischen Text aus dem 11. Jahrhundert, und in einen Datensatz übernommen worden, der lebende Menschen beschreiben sollte. Niemand in Taiwan trägt sie.
Südkorea: ein Boden bei fünf
Der Zensus von KOSTAT veröffentlicht nur Nachnamen mit fünf oder mehr Trägern. Alles Seltenere wird in 기타 zusammengefasst — „Sonstige". Ein koreanischer Nachname, der in der veröffentlichten Tabelle fehlt, könnte also vier Träger haben, oder zwei, oder keinen, und die Tabelle kann Ihnen nicht sagen, welches davon zutrifft.
Die taiwanische Löschlogik ist daher in Korea ungültig. Nicht „weniger verlässlich" — ungültig. Sie schließt aus einer Abwesenheit, die keine Information trägt. Wir waren nahe daran, sie trotzdem anzuwenden, auf der gänzlich vernünftig klingenden Grundlage, dass wir genau dies soeben erfolgreich in einem Nachbarland mit einem sehr ähnlich aussehenden Datensatz getan hatten. Der Unterschied liegt nicht in den Daten. Er liegt in einer Offenlegungsregel, die anderswo veröffentlicht ist.
Und selbst in Taiwan entscheidet das Erscheinungsbild nichts
Die schärfste Lektion kam aus dem Inneren des Landes, in dem Bereinigen erlaubt war. 澹臺 sieht genau aus wie die 33 Geister: ein archaischer zusammengesetzter Nachname direkt aus dem 百家姓 — exakt das Profil, für dessen Übereinstimmung wir gerade 33 Einträge gelöscht hatten. Er landete auf dieser Grundlage auf der Löschliste.
Er hat 2 Träger. Er steht im Register. Er blieb.
So auch 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) und 呼延 (1) — alle archaisch aussehend, alle echt. Zugleich hat 歐陽 7.653 Träger und 東郭 null, und keine noch so große philologische Sachkenntnis trennt sie durch Betrachtung.
Nur der Zähler unterscheidet sie. Niemals das Erscheinungsbild. Ein Register ohne Datenschutzboden lizenziert kein Urteil nach Augenschein; es lizenziert Nachschlagen.
Wo nichts existiert: Ukraine und Lettland
Der dritte Zustand — Abwesenheit bedeutet nichts — ist der am wenigsten bequeme, mit dem man leben muss.
Die Ukraine hat überhaupt kein zur Überprüfung verfügbares Nachnamenregister. Kein mit Schwelle versehenes; keines. Wissenschaftliche Arbeiten veröffentlichen eine Top 100 und hören auf. Das Bereinigen eines ukrainischen Nachnamen-Schwanzes reduziert sich also darauf, Einträge danach zu löschen, wie sie klingen, und wir haben diese Heuristik gemessen: angewandt auf gezielt ausgewählte „verdächtigste" Kandidaten, erzeugte „klingt seltsam" eine Falsch-Positiv-Rate von 21 % — echte Nachnamen, die von identifizierbaren Menschen getragen werden (eine Opernsängerin, ein ehemaliger Oberbefehlshaber der Streitkräfte, eine Komponistenfamilie), sitzen im selben Schwanz wie die echten Erfindungen. Der Kontext macht es unausweichlich: Die Ukraine hat 707.685 einzigartige Nachnamen mit durchschnittlich 64 Trägern je Name. In einer so geformten Verteilung ist selten und seltsam die Grundlinie, kein Defektsignal.
Lettland fügt eine Variante hinzu, die eine Erwähnung wert ist, weil sie wie das Gegenteil aussieht. Lettland veröffentlicht sehr wohl ein durchsuchbares Orakel pro Name — live, aktuell, exakt die Form des dänischen Werkzeugs. Fragen Sie einen Nachnamen ab, und Sie erhalten eine Zählung.
Nur ist es eine Datenbank ausschließlich der Vornamen. Fragen Sie Ozoliņš ab, einen der häufigsten Nachnamen des Landes, und Sie erhalten null Zeilen. Fragen Sie Ivanovs ab, und Sie erhalten drei Menschen, die Ivanovs als Vornamen tragen. Das Orakel beantwortet eine andere Frage, flüssig und mit ernster Miene — und ein Register, das aussieht wie das Werkzeug, das Sie brauchen, ist gefährlicher als eine offensichtliche Abwesenheit, weil es eine Zahl zurückgibt und die Zahl für Ihren Zweck bedeutungslos ist.
So reiht sich Lettland zur Ukraine: kein Register pro Nachname, Abwesenheit bedeutet nichts, Bereinigen verboten.
Dienstkategorien, die sich als Namen ausgeben
Eine Schwelle muss den unterdrückten Rest irgendwo unterbringen, und wohin er geht, ist gewöhnlich eine Zeile, die genau wie ein Name aussieht.
| Register | Die Kategorie | Was sie ist | Wo sie sitzt |
|---|---|---|---|
| Taiwan, MOI | 其他 | „Sonstige" — der zusammengefasste Rest | Rang #147, 5.174 Zählung |
| Südkorea | 기타 | „Sonstige" — alles unter 5 Trägern | In der Nachnamentabelle |
| Frankreich, INSEE | AUTRES NOMS | Alles unter 30 Geburten, 1891–2000 | In der nationalen Datei |
其他 auf Rang #147 ist diejenige, über die man nachdenken sollte. Sie ist nicht in einem Schwanz vergraben, in den Sie nie schauen würden. Sie sitzt bequem innerhalb jeder mechanischen „nimm die Top 200"-Scheibe, in einer plausiblen Position, formatiert identisch zu jedem echten Nachnamen ringsum. Nehmen Sie einen Top-N-Schnitt ohne einen expliziten Ausschluss, und „Sonstige" wird in Ihrem Datensatz zum 147.-häufigsten Nachnamen Taiwans.
Schweden liefert die seltsamste Variante. Sein Vornamenregister führt das gesamte Alphabet als Namen: M (305 Träger), A (120), S (65), I (22), K (17), B (5), Z (3). Das ist keine schwedische Namenspraxis; es sind Datensätze, bei denen nur eine Initiale überlebte. Der Beweis ist strukturell statt ästhetisch — alle 26 Buchstaben sind vorhanden, was nicht dem Verhalten einer Namensverteilung entspricht.
Doch beachten Sie, was dieses Argument nicht lizenziert. Md (1.361 Träger) ist kein Buchstabe des Alphabets; es ist die bangladeschische Passabkürzung von Muhammad, und 1.361 Einwohner Schwedens haben es als ihren gesetzlichen Rufnamen registriert. Es blieb. Ebenso Thi (3.717) — in einem geparsten vietnamesischen Korpus ist diese Zeichenfolge ein berüchtigtes Artefakt, aber im schwedischen Register ist sie eine bewusste Registrierung. Die Regel, die M fängt, darf Md nicht fangen, und „sieht aus wie ein Artefakt" kann sie nicht auseinanderhalten.
Solche Artefakte pflanzen sich in geparsten Korpora fort, nicht in gesetzlichen Registern. In vietnamesischen Häufigkeitsdaten sitzt Y auf Rang 55 mit 0,092 % — und ist überhaupt kein Nachname. Es ist ein männlicher Ehrentitel der Völker der Ê Đê und Gia Rai, ungefähr „Herr". Der Beweis ist der Quelle intern: Wäre Y ein Nachname, würden die tatsächlichen Klannamen dieser Völker nahe bei ihm sitzen. Stattdessen ist Niê auf #210 (0,005 %) und Rơ auf #247. Y ist achtzehnmal „häufiger" als der Klan, zu dem es angeblich gehört, weil ein Parser das erste Token des Namens jedes Ê-Đê- und Gia-Rai-Mannes nahm und es unter „Nachname" ablegte. Dieselbe Quelle hat Thị auf #149 — einen weiblichen Mittelnamen — plus Ka auf #123 und A auf #129.
Gesetzliche Register sind gegen diese Klasse strukturell immun: Das Feld lautet „der Nachname auf dem Dokument", also kann es keinen Ehrentitel enthalten. Geparste Korpora sind es nicht. Zu wissen, welche Art von Quelle Sie in Händen halten, sagt Ihnen, welche Artefakte zu erwarten sind.
Schwellen verbergen auch Dinge, die keine Schwellen sind
Manche Register schließen ganze Bevölkerungen aus, und dieser Ausschluss wird nicht als Schwelle offengelegt, weil er keine ist.
Die INSEE-Datei Frankreichs schließt im Ausland geborene Menschen aus — etwa 10,7 % der französischen Bevölkerung. Das ist keine Datenschutzregel; es ist ein systematischer Ausschnitt der Referenzbevölkerung, und er wirkt fast ausschließlich auf eine Schicht. Nachnamen wie Cissé oder Benali werden nur über die in Frankreich geborenen Kinder dieser Träger gezählt. Die Datei zählt zudem Geburten, nicht lebende Träger — eine zweite Einheitsverschiebung über der ersten. Die Richtung des Fehlers ist bekannt; die Größe nicht, und eine Multiplikation mit einem geratenen Koeffizienten wäre Anpassung, nicht Korrektur.
Das Register selbst zeigt die Schicht ankommen, nach Geburtskohorte, pro 100.000:
| Nachname | 1941–1950 | 1991–2000 | Änderung |
|---|---|---|---|
TRAORE | 0,10 | 35,76 | ×358 |
DIALLO | 0,37 | 35,59 | ×96 |
NGUYEN | 3,76 | 55,35 | ×15 |
MARTIN | 359,65 | 280,93 | −22 % |
Das schwedische Vornamenregister bietet eine zweite Spielart: Es zählt lebende Träger aller Altersstufen, ohne dass überhaupt eine Altersaufschlüsselung verfügbar wäre. Rund 20 % seiner Masse sind Kinder im Alter von 0–17, sodass seit den 2010ern modische Namen für jede rein erwachsenenbezogene Anwendung überzeichnet sind und Namen, deren Träger größtenteils gestorben sind, unterzeichnet. Richtung bekannt, Größe unbekannt, keine ehrliche Korrektur verfügbar.
Keines von beiden ist eine Datenschutzschwelle. Beide sind derselbe Fehlermodus: die veröffentlichte Bevölkerung ist nicht die Bevölkerung, die Sie angenommen haben, und nichts in der Datei sagt das.
Was damit zu tun ist
- Finden Sie die Offenlegungsregel, bevor Sie die Daten anrühren. Sie steht in einer Methodiknotiz, nicht in der Datendatei, und sie bestimmt, was eine leere Zelle bedeutet.
- Stellen Sie fest, in welchem von drei Zuständen Sie sich befinden. Abwesenheit = null (handeln Sie danach), Abwesenheit = unterdrückt (nicht), gar keine Quelle (nicht, und sagen Sie es).
- Bevorzugen Sie Register, die null separat melden. Dänemarks Zwei-Nachrichten-Design ist mehr wert, als eine niedrigere Schwelle es wäre. Der Wert einer Schwelle ist nicht ihre Zahl; es ist, ob null von Unterdrückung unterscheidbar ist.
- Übertragen Sie niemals eine Bereinigungsentscheidung über Grenzen hinweg. Taiwan und Korea sehen gleich aus und sind Gegenteile. Die Entscheidung gehört dem Register, nicht dem Erscheinungsbild der Daten.
- Schließen Sie Dienstkategorien explizit aus.
其他,기타,AUTRES NOMSund verirrte Initialen sehen wie Namen aus und überleben jeden mechanischen Top-N-Schnitt. - Prüfen Sie die Einheit und die Referenzbevölkerung, nicht nur die Schwelle. Geburten ≠ Träger. Bürger ≠ Einwohner. Alle Altersstufen ≠ Erwachsene. Positionen ≠ Menschen.
- Wenn nichts existiert, ist „keine Daten" der Befund. Einen Schwanz danach zu bereinigen, wie er klingt, hat eine gemessene Falsch-Positiv-Rate von 21 %. Das ist keine Heuristik; es ist Datenzerstörung mit einer plausiblen Tarngeschichte.
Daten mit Stand 2026-07-17
Alles hier beschriebene Registerverhalten wurde am 17. Juli 2026 im Zuge des Aufbaus gewichteter Nachnamenkorpora für die 63 Sprachregionen beobachtet, die der Korpus zu jenem Zeitpunkt umfasste; en_IE wurde am 18. Juli 2026 hinzugefügt und brachte die Menge auf 64. Die Schwellen sind, wie von jeder Behörde zu jenem Datum veröffentlicht. Das dänische Zwei-Nachrichten-Verhalten, die taiwanischen Einträge mit einem einzelnen Träger, das lettische Nur-Vornamen-Orakel und das vietnamesische Ehrentitel-Artefakt wurden jeweils gegen die Quelle verifiziert statt erschlossen. Die Zeilen zu Ukraine und Lettland sind negative Befunde — wiederholte Versuche, eine nationale Nachnamenquelle pro Name zu finden, ergaben keine verfügbare.
Quellen:
- Taiwan, Innenministerium — Nachnamen-Ranglisten und -Zählungen nach Altersgruppe, 30. Juni 2023 (OGDL 1.0): data.gov.tw/dataset/126774
- Dänemark, Danmarks Statistik — Namensstatistiken und Nachschlagen pro Name: dst.dk/da/Statistik/emner/bor… · offener Datensatz dänischer Vor- und Nachnamen: sprogteknologi.dk/dataset/fornavne-og-ef…
- Südkorea, KOSTAT — Zensus zu Bevölkerung und Wohnungen 2015, Nachnamenstatistik (인구주택총조사 성씨 통계): kostat.go.kr
- Spanien, INE — Nachnamen mit ≥20 Trägern, Zensus vom 1. Januar 2025; Methodiknotiz zur Vertraulichkeitsregel: ine.es/daco/daco42/nombyapel/…
- Frankreich, INSEE — Fichier des noms de famille 1891–2000 (≥30 Geburten national; Rest zusammengefasst als
AUTRES NOMS): insee.fr/fr/statistiques/353663… - Schweden, SCB — Nachnamen und tilltalsnamn-Vornamen, 31. Dezember 2022: scb.se
- Lettland, PMLP — Vornamen-Datenbank (Nachnamen nicht abgedeckt): personvardi.pmlp.gov.lv · Lettland, CSP — Zensus 2021: stat.gov.lv
- Ukraine — kein Register pro Name verfügbar; nur wissenschaftliche Top-100-Listen
- Vietnam — hoten.org-Häufigkeitsdatensätze VNTH01 (n = 1.682.729) und SG01 (n = 241.000), CC BY 4.0 wie im Seitentext erklärt; kein staatliches Register