Gefälschte ID > Artikel > Woher unsere Taiwan-Namensdaten stammen

Woher unsere Taiwan-Namensdaten stammen

Jedes Gewicht in unserem taiwanischen Nachnamen-Datensatz lässt sich auf eine benannte Zeile in einem staatlichen Register mit einer daneben stehenden Trägerzahl zurückführen. Nichts im Kopf ist modelliert, interpoliert oder aus einem Nachbarland entlehnt. Das trifft auf keine andere von uns gepflegte Sprachregion zu, und es lohnt sich, genau zu erklären, was das einbringt — und was es nach wie vor nicht leistet.

Diese Seite dokumentiert das verwendete Register, die Grenze zwischen dem, was wir gemessen, und dem, was wir geschätzt haben, die für die taiwanische Onomastik spezifischen Fallstricke und die Dinge, die wir nicht behoben haben.

Das verwendete Register

FeldWert
Datensatz姓氏排名與人數按三階段年齡分 (Nachnamen-Rang und Bevölkerung nach drei Altersgruppen)
Herausgeber內政部戶政司 — Abteilung für Haushaltsregistrierung, Innenministerium
Portalhttps://data.gov.tw/dataset/126774
Referenzdatum30. Juni 2023 (民國112年6月30日)
Tiefe2.731 verschiedene Nachnamen, jeder auf 3 Altersgruppen aufgeteilt (0–14, 15–64, 65+)
FelderStatistikjahr, Rang, Nachname, Altersgruppe, Bevölkerungszahl
LizenzGovernment Open Data Licence v1
Bevölkerungsbasis23.373.283

Der begleitende narrative Bericht — 《全國姓名統計分析》, 8. Auflage, veröffentlicht im Oktober 2023 — nennt die zentralen Aggregate: Die 10 häufigsten Nachnamen decken 12.339.778 Menschen ab, also 52,79 % der Bevölkerung, und die Top 100 decken 22.582.375 ab, also 96,62 %.

Die Diskrepanz 2.731 gegen 1.785

Dasselbe Ministerium sagt, Taiwan habe 1.785 Nachnamen: 1.667 Ein-Zeichen-Nachnamen, die 23.337.790 Menschen abdecken, plus 118 zusammengesetzte Nachnamen, die 27.404 Menschen abdecken. Diese beiden Zahlen ergeben zusammen mit 8.089 Menschen, die indigene traditionelle Namen oder transliterierte ausländische Namen tragen, exakt die Landesbevölkerung. Warum also führt der offene Datensatz 2.731 Zeilen?

Wir haben keine dokumentierte Antwort; das Ministerium veröffentlicht keinen Abgleich. Die plausibelste Lesart ist, dass die Zahl 1.785 nur die Kategorien 單姓 + 複姓 umfasst, während der Rohdatensatz den verbleibenden Topf von 8.089 Personen als einzelne Zeilen auflistet — rund 946 seltene Namensstrings mit im Schnitt unter neun Trägern pro Stück. Das geht arithmetisch bequem auf, aber wir haben es nicht Zeile für Zeile verifiziert. Die ehrliche Aussage lautet: Die Lücke ist wahrscheinlich der Topf mit indigenen und transliterierten Namen, und wir wissen es nicht mit Sicherheit.

Was wir gemessen und was wir geschätzt haben

Gemessen. Jeder Nachname in der Datei und jedes daran gehängte Gewicht stammt aus dem Register. Das Gewicht ist die Trägerzahl des Registers, wörtlich gespeichert:

weight = count          # 陳 → 2618994, not a rescaled 255

Keine Potenzkurve, keine rangbasierte Anpassung, kein Expertenurteil in der Reihenfolge. Unsere Top-10-Reihenfolge — 陳, 林, 黃, 張, 李, 王, 吳, 劉, 蔡, 楊 — ist die vom Ministerium veröffentlichte Reihenfolge, nicht unsere Rekonstruktion davon.

Historische Anmerkung. Bis zur Formatänderung wurden Gewichte auf eine 8-Bit-Skala umskaliert als round(255 × count / count(陳)), was einen Rundungsboden einführte: Ein Gewicht von 1 war 2.618.994 / 255 = 10.271 Träger wert, sodass jeder Nachname darunter überrepräsentiert war. Das erzwang einen Tiefen-Grenzwert bei rund 2.000 Trägern, 401 Einträge. Beide Beschränkungen sind verschwunden: Die Datei führt nun echte Zählungen und liefert den vollständigen Korpus aus. Zahlen aus älteren Builds — 401 Nachnamen, Gewicht 255 für 陳 — beziehen sich auf jenes abgelöste Format, weshalb sie zu nichts passen, was Sie aus der heute ausgelieferten Datei berechnen können.

Geschätzt. Nichts in den Gewichten. Das einzige verbleibende Urteil betrifft, welche Zeilen als unbrauchbar auszuschließen sind (siehe unten), nicht, wie die behaltenen Zeilen zu bewerten sind.

Gar nicht geschätzt: die Altersaufteilung. Das Register schlüsselt jeden Nachnamen nach drei Altersgruppen auf, und wir fassen sie zusammen. Unsere Datei trägt keine Altersstruktur.

Fallstricke speziell für Taiwan

Es gibt keine Datenschutzschwelle — Abwesenheit bedeutet also wirklich null

Die meisten Statistikbehörden unterdrücken kleine Zählungen. Taiwan nicht. Das Register veröffentlicht 643 Nachnamen mit genau einem Träger und 406 mit zwei, hinunter bis zu Namen japanischen Ursprungs wie 八谷 und 大久保, die von einer einzigen Person unter 23 Millionen getragen werden.

Das ändert, was das Register leisten kann. In den meisten Ländern könnte ein Nachname, der in offiziellen Daten fehlt, selten sein, unterdrückt sein oder ein Datenfehler sein — man kann es nicht sagen. In Taiwan bedeutet fehlend null Träger, Punkt.

Das haben wir genutzt. Unsere frühere Liste enthielt 33 Nachnamen aus dem 百家姓, der Fibel der Hundert Familiennamen aus dem 11. Jahrhundert — 亓官, 漆雕, 東郭, 南門, 段干, 百里, 公孫, 萬俟 und andere. Jeder einzelne hat null Träger in Taiwan. Sie standen dort, weil die Liste aus einem klassischen Text statt aus einer lebenden Bevölkerung aufgebaut worden war. Sie sind verschwunden.

Aber 澹臺 blieb, und das ist die ganze Lehre

澹臺 ist ein archaischer Zwei-Zeichen-Nachname aus derselben Fibel, angesiedelt in derselben semantischen Nachbarschaft wie die Geister und ihnen zum Verwechseln ähnlich. Er stand auf unserer Löschliste. Er steht im Register mit zwei lebenden Trägern, also blieb er.

Nichts an seinem Erscheinungsbild unterscheidet ihn von 東郭. Nur der Zähler tut es. Dasselbe gilt für 歐陽 (7.653), 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) und 呼延 (1) — alle echt, alle behalten. Ein Register ist kein Weg, zu bestätigen, was man ohnehin schon vermutete; es ist ein Weg, gesagt zu bekommen, dass man bei einer bestimmten Zeile falschlag.

Das ist auch der Grund, warum die taiwanische Bereinigung nicht dieselbe Bereinigung anderswo rechtfertigt. Die Ukraine hat kein Nachnamenregister, sodass das Löschen merkwürdig aussehender ukrainischer Nachnamen ein Löschen nach Bauchgefühl wäre. Der Unterschied ist der Zähler, nicht die Offensichtlichkeit des Defekts.

異體字: Varianten-Schriftzeichen sind verschiedene Nachnamen, und das Register beweist es

Die taiwanische Haushaltsregistrierung erfasst die Schriftform, und mehrere Nachnamen existieren in mehr als einer legalen orthografischen Variante (異體字): 温/溫, 黄/黃, 鐘/鍾, 凃/涂/塗, 藍/籃, 龎/龐.

Die verführerische Regel lautet: „Taiwan verwendet traditionelle Zeichen, also behalte 溫 und verwirf 温." Das Register erledigt diese Regel mit einer einzigen Zahl: 温 hat 42.171 Träger und 溫 hat 13.956. Die angeblich falsche Form ist dreimal häufiger. Die Regel anzuwenden würde 42.000 echte Bürger löschen und 14.000 behalten.

Das sind keine festlandchinesischen Vereinfachungen, sondern legale Varianten im taiwanischen 戶籍; die Ähnlichkeit zu vereinfachten Formen ist zufällig, weil die Vereinfachung oft eine bereits existierende Variante übernahm. Die Verhältnisse gehen in beide Richtungen: 黃 1.402.808 gegen 黄 34.531 und 鍾 152.550 gegen 鐘 28.759 begünstigen die traditionelle Form, aber 龎 2.099 gegen 龐 1.171 ist umgekehrt. Es gibt keine Regel. Es gibt nur die Tabelle. Wir behalten beide Formen jedes Paares.

Davon getrennt sind 丘 (4.361) und 邱 (343.469) überhaupt keine Varianten, sondern verschiedene Nachnamen — 邱 entstand aus 丘 unter dem Qing-Tabu über Konfuzius' Vornamen 孔丘.

其他 ist kein Nachname

Rang 147 im Register ist 其他 — „andere" — mit 5.174 Menschen. Es ist eine Servicekategorie, und jeder mechanische „nimm die Top N"-Durchlauf schluckt sie und erzeugt einen Datensatz, in dem 5.174 Taiwaner „Andere" heißen. Wir haben es ausdrücklich ausgeschlossen.

Der Kopf ist nicht Chinas Kopf

Wer festlandchinesische Annahmen importiert, versteht Taiwan falsch. 陳 führt mit 11,21 %, 林 ist Zweiter mit 8,33 %, und 王 — der häufigste Nachname in Festlandchina — ist nur Rang 6 mit 4,09 %. Das sind verschiedene Bevölkerungen mit verschiedenen Geschichten, keine Dialekte einer einzigen „chinesischen" Liste.

Warum wir nicht mehr bei 401 Nachnamen aufhören

Tiefe hatte früher einen messbaren Preis. Weil ein Gewicht von 1 ganze 10.271 Träger wert war, überzeichnete sich jeder Eintrag unterhalb dieser Schwelle selbst. Die über die Datei summierte implizierte Bevölkerung ergibt eine Zahl der „behaupteten Abdeckung", und unter der 8-Bit-Skala war das eine harte Beschränkung — dies ist die Tabelle, die den Grenzwert im Build vom 17. Juli 2026 rechtfertigte:

Tiefen-SchwelleEinträgeBehauptete AbdeckungReale Abdeckung
≥ 2.000401109,8 %99,61 %
≥ 1.000414110,3 %99,69 %
≥ 500440111,5 %99,76 %
≥ 100579117,6 %99,90 %
ganzes Register2.730212,1 %100,00 %

Alle 2.730 Nachnamen auf jener Skala zu laden hätte einen Datensatz erzeugt, der zwei Taiwans behauptet: Das Problem war die Phantom-Masse des Schwanzes, nicht seine Länge.

Diese Beschränkung existiert nicht mehr. Mit echten Trägerzahlen gibt es keinen Rundungsboden und keine Phantom-Masse, also gibt es keinen Grund zu kürzen. Die ausgelieferte Datei führt alle 2.707 verwertbaren Nachnamen, deren Gewichte sich auf 23.367.536 gegen eine Bevölkerungsbasis von 23.373.283 summieren — eine behauptete Abdeckung von 99,98 %, was schlicht die reale Abdeckung ist, weil behauptet und real nun dieselbe Messung sind. Die obige Tabelle bleibt erhalten, weil ältere Dokumente ihre Zahlen zitieren; sie beschreibt ein Format, das wir nicht mehr ausliefern.

Unsere Regressions-Suite gibt 99,9 % aus, nicht 99,98 %, und das ist ein dritter Nenner statt eines vierten Fehlers. ng_regression_tests.php teilt durch eine gerundete heutige Bevölkerungsschätzung von 23.400.000, während diese Seite durch die registereigene Basis von 23.373.283 teilt. Die Zeile der Suite — 52.81% top-10-in-corpus · 99.9% coverage · 52.73% product — ist auf jener Basis intern konsistent; gegen die Registerbasis liest sich dieselbe Identität als 52,81 % × 99,98 % = 52,79 %, was der veröffentlichte Top-10-Anteil des Registers ist. Keiner ist falsch; falsch ist, den einen gegen den Nenner des anderen zu zitieren.

Die Asymmetrie, die den alten Build bestimmte, war beabsichtigt: Wir fügten unterhalb von 2.000 Trägern nichts hinzu, aber wir löschten auch keine bereits vorhandenen echten Einträge (慕容 1, 通 1, 澹臺 2). Das Hinzufügen war durch die Skala begrenzt; etwas Echtes zu löschen stand nie zur Debatte. Jetzt ist nichts mehr durch die Skala begrenzt, und die Regel reduziert sich auf ihre zweite Hälfte.

Top 10

RangNachnameTräger (= gespeichertes Gewicht)Bevölkerungsanteil
12.618.99411,21 %
21.947.5208,33 %
31.402.8086,00 %
41.239.8805,30 %
51.199.9205,13 %
6955.0354,09 %
7935.6844,00 %
8737.6073,16 %
9684.5312,93 %
10617.7992,64 %

Jede Zählung oben ist die Registerzahl, wörtlich in der ausgelieferten Datei gespeichert — es gibt keinen Rekonstruktionsschritt mehr, und keine Zeile braucht ein ~. Die Anteile werden gegen die Bevölkerungsbasis von 23.373.283 berechnet und können um ±0,02 Prozentpunkte von der ministeriumseigenen Rundung abweichen.

52,79 % und 52,81 % sind zwei verschiedene Messungen

Diese beiden Zahlen tauchen überall in unserer Dokumentation auf und sind keine Diskrepanz. Es sind dieselben zehn häufigsten Nachnamen über zwei verschiedenen Nennern:

ZahlNennerNachnamenTräger
52,79 %Das vollständige Register des Ministeriums, wie veröffentlicht2.73123.373.283
52,81 %Unser Korpus, nach Ausschluss unbrauchbarer Zeilen2.70723.367.536

Die Lücke sind 24 Zeilen und 5.747 Träger — 0,0246 % der Bevölkerung — und wir wissen genau, welche Zeilen es sind: die Servicekategorie 其他 (5.174 Träger, kein Nachname) plus 23 Zeilen im Unicode-Bereich für den privaten Gebrauch (Private Use Area), in dem das Ministerium seltene Zeichen kodiert, die keine Unicode-Zuweisung haben und für jeden Leser als leere Kästchen dargestellt würden.

Eine kleine Scheibe des Schwanzes zu entfernen lässt die Top Ten unberührt, während es den Nenner verkleinert, sodass unser Anteil geringfügig höher ausfällt. Aus der ausgelieferten Gewichtsdatei berechnet: Die zehn häufigsten summieren sich auf 12.339.778, was 52,8074 % unseres Korpus und 52,7944 % der vollständigen Registerbasis entspricht. Die korrekte Formulierung lautet daher „das Register ergibt 52,79 %; unser Korpus ergibt, nach Ausschluss von 24 unbrauchbaren Zeilen, 52,81 %" — niemals „ungefähr 52,8 %", denn so würde sich eine echte Diskrepanz verstecken.

Bekannte Einschränkungen

  • Die Lücke 2.731 / 1.785 ist ungeklärt. Unsere Lesart ist plausibel und unverifiziert.
  • 24 Registerzeilen sind ausgeschlossen — die Servicekategorie 其他 plus 23 Zeilen aus der Private Use Area. Das ist alles, was wir weglassen: 5.747 Träger, 0,0246 % der Bevölkerung. Die Tiefenkürzung, die früher ~2.330 Schwanz-Nachnamen entfernte, ist verschwunden.
  • Der Schwanz wird nun mit voller Genauigkeit ausgeliefert, und das ist ein Unterschied der Art. Unter der 8-Bit-Skala fiel alles zwischen 2.000 und 10.271 Trägern auf Gewicht 1 zusammen und überzeichnete sich um bis zu ~5×. Echte Zählungen beseitigen die Verzerrung vollständig; jedes Dokument, das jenen Boden beschreibt, beschreibt das alte Format.
  • Die Altersstruktur wird verworfen. Das Register hat sie; wir nutzen sie nicht. 郭 ist der am stärksten gealterte Nachname in Taiwan (Alterungsindex 158,64), und unsere Daten können das nicht ausdrücken.
  • Die Identität Top-10 × Abdeckung ist keine Verifikation. Unseren Top-10-Anteil im Korpus mit der behaupteten Abdeckung des Korpus zu multiplizieren reproduziert den Top-10-Anteil auf Bevölkerungsebene, und zwar unabhängig davon, was in der Datei steht: Beide Seiten werden aus denselben Gewichten berechnet, sodass sich die Identität auf (a/b) × (b/c) = a/c reduziert, was für beliebige Eingaben gilt. Unsere Regressions-Suite führt dies als informative Ausgabe mit festem PASS, nicht als Test. Die Gewichte stammen aus diesem Register, sodass eine Übereinstimmung damit die Arithmetik beweist, nicht die Wahrheit.

Daten mit Stand 2026-07-18

Referenzdatum des Registers: 30. Juni 2023. Datensatz zuletzt überprüft und neu gebaut: 18. Juli 2026. Korpus: 2.707 Nachnamen mit echten Trägerzahlen, die 99,98 % der taiwanischen Bevölkerung abdecken. Die Dateien für männliche und weibliche Träger sind byteweise identisch — taiwanische Nachnamen flektieren nicht nach Geschlecht.

Zahlen aus älteren Builds passen nicht zu dieser Seite. Dokumente, die vor dem 18. Juli 2026 verfasst wurden, beschreiben einen Korpus von 401 Nachnamen auf einer 8-Bit-Gewichtsskala und nennen 99,61 % Abdeckung, 109,8 % behauptete Abdeckung und einen Top-10-Anteil im Korpus von 48,14 %. Diese Zahlen waren für jenes Format korrekt und sind für die ausgelieferte Datei falsch. Die heutigen Entsprechungen sind 2.707 Nachnamen, 99,98 % Abdeckung und ein Top-10-Anteil im Korpus von 52,81 %. Gegen die ausgelieferte Gewichtsdatei am 18. Juli 2026 verifiziert.

Quellen

← Artikel