Gefälschte ID > Artikel > Achtundvierzig von Fünfhundert: Eine klassische Nachnamenliste trifft auf ein Register

Achtundvierzig von Fünfhundert: Eine klassische Nachnamenliste trifft auf ein Register

Das 百家姓 — die Hundert Familiennamen — ist eine chinesische Fibel aus dem 11. Jahrhundert. Es ist eine gereimte Folge von Nachnamen, verfasst, um Kindern Schriftzeichen beizubringen, und es wird seit etwa neunhundert Jahren ununterbrochen nachgedruckt. Es ist außerdem, noch immer, das, wonach die Leute greifen, wenn sie „eine Liste chinesischer Nachnamen" brauchen — auch Leute, die Software bauen.

Wir haben es gegen ein modernes Register mit Einzelnamenzählung geprüft. Von den 500 verschiedenen Einträgen der von uns getesteten Fassung haben 48 überhaupt keine Träger in diesem Register — nicht wenige, nicht unterdrückte, null. 39 dieser 48 sind zweizeichige Nachnamen.

Das klingt nach einer Geschichte über aussterbende Doppelnachnamen. Ist es nicht, und der Teil, der es zu etwas anderem macht, ist die interessantere Hälfte: echte Doppelnachnamen sind lebendig und zählbar, und der häufigste im Register kommt in der klassischen Liste gar nicht vor.

Das Register

Der Vergleich funktioniert überhaupt nur wegen einer ungewöhnlichen Eigenschaft der Quelle. Taiwans Innenministerium veröffentlicht Nachnamenzählungen ohne Datenschutzschwelle: 643 Nachnamen mit genau einem Träger, 406 mit genau zwei, und so weiter bis ganz nach unten. Die meisten statistischen Ämter unterdrücken kleine Zählungen, was Abwesenheit mehrdeutig macht — ein fehlender Nachname könnte selten sein, könnte unterdrückt sein, könnte ein Parser-Fehler sein. Hier bedeutet fehlend null.

FeldWert
HerausgeberInnenministerium, Taiwan
Stichtag30. Juni 2023
Verschiedene Einträge2.731
Bevölkerungsbasis23.373.283
Unterdrückungkeine — Zählungen bis hinab zu 1 Träger veröffentlicht

Wir haben dieses Register, seine Lizenz, seine Eigenheiten und die Diskrepanz zwischen 2.731 und 1.785 in seiner eigenen Dokumentation gesondert aufgearbeitet — siehe Woher unsere Taiwan-Namensdaten stammen. Dieser Artikel handelt nicht vom Register. Er handelt davon, was mit einer historischen Liste geschieht, wenn man sie einem Register gegenüberstellt.

Eines gilt es durchgehend festzuhalten: Dieses Register erfasst 23 Millionen Menschen, nicht die 1,4 Milliarden der chinesischsprachigen Welt. „Null Träger in Taiwan" ist eine harte, verifizierte Tatsache. „Ausgestorben" ist eine Behauptung über eine viel größere Bevölkerung, die diese Datei nicht stützen kann, und wir stellen sie nicht auf. Was die Datei beweisen kann, ist, dass eine im 11. Jahrhundert erstellte Liste nicht die Nachnamen einer bestimmten Bevölkerung des 21. Jahrhunderts beschreibt — genau die Behauptung, die die Leute implizit aufstellen, wenn sie sie als Datenquelle verwenden.

Das Ergebnis, aufgeteilt nach Eintragslänge

EintragstypIn der ListeIm Register vorhandenFehlendFehlend-Anteil
Einzelzeichen43842992,1 %
Zweizeichig62233962,9 %
Gesamt500452489,6 %

Die Einzelzeichen-Hälfte der Liste ist in ausgezeichnetem Zustand: 98 % ihrer Einträge haben lebende Träger. Die Doppelhälfte ist ein Münzwurf, der schlecht ausgeht — fast zwei Drittel davon hat niemanden.

Die neun fehlenden Einzelzeichen-Einträge sind 薊, 充, 終, 弘, 夔, 融, 空, 養 und 郈. Acht von ihnen tauchen im Register in keiner Form auf; 弘 überlebt nur innerhalb eines dreizeichigen Eintrags, 卜思弘, den eine einzige Person trägt.

Die 39 fehlenden Doppelnamen sind das klassische Mobiliar des Genres: 萬俟, 聞人, 公冶, 宗政, 單于, 太叔, 公孫, 仲孫, 鍾離, 宇文, 長孫, 閭丘, 司空, 丌官, 司寇, 仉督, 子車, 巫馬, 公西, 漆雕, 樂正, 壤駟, 公良, 拓跋, 夾谷, 宰父, 穀梁, 段干, 百里, 東郭, 南門, 歸海, 羊舌, 微生, 梁丘, 左丘, 東門, 西門, 南宮.

Mehrere davon sind berühmt. 長孫 und 宇文 sind die Nachnamen des Tang- und des Nördlichen-Zhou-Adels. 公孫 und 司空 durchziehen den klassischen Kanon. Ihr Ruhm ist genau das Problem: ein Nachname, den jeder gelesen hat, ist nicht ein Nachname, wie irgendjemand heißt.

Die Hälfte, die den Artikel ehrlich hält

Endete die Geschichte hier, wäre die naheliegende Schlussfolgerung, dass zweizeichige Nachnamen ein Archaismus sind und jeder Datensatz, der sie mitführt, sich mit Poesie aufpolstert. Diese Schlussfolgerung ist falsch, und das Register sagt es in Zahlen.

Doppelnachnamen aus der klassischen Liste, die sehr wohl Träger haben:

NachnameTrägerRang im Register
歐陽7.653130
司徒478324
上官294383
端木186450
諸葛180456
皇甫115521
尉遲63640
申屠60649
司馬49691
軒轅26822
澹台22.051
公羊12.146
呼延12.302
慕容12.629

23 der 62 Doppelnamen der Liste sind echt. 慕容 und 呼延 haben je genau einen Träger, und 澹台 hat zwei — was bedeutet, dass eine Bereinigung nach dem Muster „das sieht archaisch aus, löschen" echte, identifizierbare, lebende Menschen gelöscht hätte. Nichts am Erscheinungsbild von 慕容 unterscheidet es von 東郭. Nur der Zähler tut es.

Und nun der Befund, der die ganze Übung neu rahmt. Das Register enthält 1.062 mehrzeichige Nachnameneinträge. Nur 23 davon stammen aus der klassischen Liste. Die übrigen 1.038 kommen darin gar nicht vor — einschließlich jedes einzelnen der häufigsten:

NachnameTrägerRangIn der klassischen Liste?
張簡9.162122nein
歐陽7.653130ja
范姜4.259153nein
周黃594304nein
江謝533319nein
張廖491322nein
司徒478324ja
姜林321376nein
上官294383ja
翁林294384nein

Taiwans häufigster Doppelnachname ist 張簡 mit 9.162 Trägern, und die klassische Liste hat nie von ihm gehört. Auch nicht von 范姜, noch von 張廖, noch von 周黃, 江謝, 姜林 oder 翁林 — die allesamt 端木, 諸葛 und 司馬 überragen, jene Doppelnamen, mit denen jede Liste „chinesischer Doppelnachnamen" aufmacht.

Das sind Doppelnachnamen, gebildet durch das Zusammenfügen zweier bestehender Familiennamen — eine Praxis, die mit Adoption und gemeinsamen Abstammungsarrangements verbunden und in Hakka-Gemeinschaften stark vertreten ist. (Dieser letzte Satz ist Hintergrund, nicht etwas, das wir aus der Datei abgeleitet haben; was die Datei beweist, sind die Zählungen und die Abwesenheit.) Der Mechanismus, der sie hervorbringt, lief noch Jahrhunderte nach Abfassung der Fibel, und er läuft bis heute.

Die korrekte Zusammenfassung lautet also nicht „Doppelnachnamen sind tot." Sie lautet: die historische Liste irrt sich über Doppelnachnamen in beide Richtungen zugleich. Sie führt 39 mit, die keine Träger mehr haben, und ihr fehlen die 1.038, die welche haben — 21.087 Menschen, die kein aus einer Liste abgeleiteter Datensatz überhaupt enthält.

Worin die klassische Liste wirklich gut ist

Es wäre unfair und falsch, zu schließen, die Fibel sei nutzlos. Am Register gemessen:

MaßWert
Von den 452 überlebenden Einträgen der Liste abgedeckte Bevölkerung98,84 %
Anteil der verschiedenen Nachnamen des Registers, die sie enthält16,6 %
Register-Nachnamen, die in der Liste fehlen2.279
Von diesen 2.279 gehaltene Bevölkerung1,16 %

Liest man diese beiden Zeilen zusammen, tritt der wahre Charakter der Liste hervor. Als eine Liste, welche Nachnamen die meisten Menschen haben, ist sie ausgezeichnet — 452 Einträge decken fast 99 % einer 23-Millionen-Bevölkerung ab. Als eine Liste, welche Nachnamen existieren, liegt sie um den Faktor sechs daneben.

Diese Asymmetrie ist keine Eigenart dieser Fibel. Es ist das, was jede kopflastige Verteilung mit jeder kuratierten Liste macht: den Kopf richtig zu treffen ist leicht, den Schwanz richtig zu treffen ist eine andere Arbeit, die eine andere Art von Quelle erfordert. Eine Liste, die 98,84 % der Menschen erfasst und dabei 83 % der Nachnamen verfehlt, ist nicht „größtenteils richtig". Sie hat bei der einen Frage recht und bei der anderen unrecht, und von innerhalb der Datei sehen die beiden Fragen identisch aus.

Drei weitere Weisen, in denen die Liste kein Ranking ist

Die Reihenfolge ist keine Häufigkeitsreihenfolge. Die Fibel beginnt mit 趙錢孫李 — Zhao, Qian, Sun, Li. Im Register liegen diese auf den Rängen 44, 101, 49 und 5. 趙 führt die Fibel an, weil es der kaiserliche Nachname der Song-Dynastie war, unter der der Text zusammengestellt wurde; die Folge danach ist vom Reim getrieben. Die echten Top Fünf sind 陳, 林, 黃, 張, 李, und nur 李 steht überhaupt in der Nähe des Anfangs der klassischen Folge. Wer die Reihenfolge der Liste als Näherung für Häufigkeit verwendet — und Generatoren tun das — erhält eine Verteilung, die schon ab Position eins falsch ist.

Das Schriftzeichen ist nicht der Nachname. Vier der Top-100-Nachnamen des Registers fehlen in der Liste gänzlich, und alle vier sind orthografische Varianten von Einträgen, die sehr wohl darin stehen:

Register-ZeichenTrägerRangKlassisches ZeichenTrägerRang
42.1716413.956104
34.531801.402.8083
28.75988152.55034
16.3749827.29889

Das Paar 温/溫 ist das eindrücklichste: Die Variante, die in der klassischen Liste fehlt, hat dreimal so viele Träger wie die darin enthaltene. Eine Regel der Form „nutze die kanonische Form aus der Liste" würde 42.171 Menschen löschen und 13.956 behalten. Die Haushaltsregistrierung erfasst die geschriebene Form, und beide Formen sind rechtsgültig; es gibt kein kanonisches Zeichen, auf das man zurückfallen könnte, nur eine Tabelle.

Die Liste hat keine feste Länge. Die von uns getestete Fassung führt 500 verschiedene Einträge — 438 einzeichige und 62 Doppelnamen. Die am häufigsten zitierte Zahl ist 504 (444 einzeichig, 60 Doppelnamen). Das Song-Original wird meist mit 411 angegeben. Ausgaben unterscheiden sich, spätere Erweiterungen unterscheiden sich, und Transkriptionen unterscheiden sich von beidem.

Das ist keine Fußnote — es disqualifiziert die Liste für den Gebrauch, den die Leute ihr zumuten. Ein Nenner, der zwischen Ausgaben um 20 % schwankt, kann keine Aussage der Form „N der klassischen Nachnamen sind ausgestorben" stützen. Unsere eigenen 48-von-500 sind vom selben Problem begrenzt: es sind 48 dieser Rekonstruktion. Was die Zahl überdauert, ist die Gestalt des Ergebnisses — dass der Doppelnamen-Abschnitt bei etwa 60 % versagt, während der Einzelzeichen-Abschnitt bei etwa 2 % versagt —, weil sich dieses Verhältnis nicht bewegt, wenn die Ausgabe wechselt.

Warum Listen wie diese immer wieder als Daten verwendet werden

Drei Eigenschaften lassen eine historische Liste wie einen Datensatz wirken, obwohl sie keiner ist:

  1. Sie sieht vollständig aus. Sie hat eine feste Mitgliedschaft, eine Reihenfolge und einen autoritativ klingenden Namen. Register sind unordentlich, unvollständig und mühsam zu parsen. Die Liste ist ein sauberes Array.
  2. Sie ist frei von Lizenzreibung. Ein Text aus dem 11. Jahrhundert hat keine Datenbankrechte, keine Namensnennungspflicht, keine Nutzungsbedingungen. Ein modernes Register kann alle drei haben. Die billigste Quelle ist sehr oft die älteste, und Kostendruck selektiert still auf Altertümlichkeit.
  3. Sie hat größtenteils recht, und zwar auf die Weise, die das Versagen verbirgt. Die Abdeckungszahl von 98,84 % bedeutet, dass ein aus der Liste gebauter Datensatz in jedem beiläufigen Test korrekt aussieht. Die Fehler leben im Schwanz und in den Doppelnamen — also genau in den Einträgen, die ein Prüfer am wenigsten bemerken und ein Generator am seltensten ausgeben würde.

Die allgemeine Form: eine historische Liste ist eine Momentaufnahme des Ansehens zum Zeitpunkt der Abfassung; ein Register ist ein Zensus der Lebenden. Sie beantworten verschiedene Fragen und widersprechen einander in beide Richtungen. Jede Namens-, Orts- oder Kategorienliste, die älter ist als die Bevölkerung, auf die sie angewandt wird, hat diese Eigenschaft — ein Onomastikon aus dem 19. Jahrhundert, ein Gazetteer von Pfarreien, ein Kanon „traditioneller" Berufe. Das 百家姓 ist einfach der Fall, in dem sich die Diskrepanz exakt messen lässt, weil eine Seite bis hinab zur einzelnen Person veröffentlicht.

Was wir mit dem Ergebnis gemacht haben

Unsere eigenen taiwanischen Nachnamendaten führen 2.707 Einträge, jeder trägt die Trägerzahl des Registers wörtlich mit und deckt 99,98 % der Bevölkerungsbasis ab. Es ist eine Teilmenge des Registers statt einer kuratierten Liste, sodass keiner der 48 Phantom-Einträge darin ist; die Prüfung fand null. Es enthält 慕容 mit Gewicht 1 und 澹台 mit Gewicht 2, weil sie echt sind. Es enthält 張簡 mit 9.162, weil es echt und häufig ist.

Dieser Zustand ist jung. Eine frühere Version derselben Datei war teilweise aus dem klassischen Text gebaut und führte archaische Einträge ohne Träger mit; sie wurden entfernt, sobald wir Einzelnamenzählungen hatten, gegen die wir sie entfernen konnten. Die vollständige Geschichte dieser Bereinigung — samt des Eintrags, den wir beinahe nach seinem Erscheinungsbild gelöscht hätten und wieder einsetzen mussten — steht in Was wir bei Namensdaten falsch gemacht haben.

Die Regel, die wir daraus mitgenommen haben, und die, für die dieser Artikel existiert:

Eine klassische Liste sagt Ihnen, was eine Kultur für lehrenswert hielt. Ein Register sagt Ihnen, wie die Menschen heißen. Nutzen Sie das Erste zum Lesen und das Zweite zum Zählen, und lassen Sie nie eine Liste entscheiden, was zu löschen ist.


Daten mit Stand 2026-07-21

Alle Zahlen wurden am 21. Juli 2026 neu aus der primären Registerdatei berechnet, nicht aus unseren eigenen Notizen oder aus früheren Berichten. Ränge sind Positionen im nach Trägerzahl geordneten Register; wo kein Rang angegeben ist, fällt der Eintrag außerhalb der von uns tabellierten Rangmenge. Anteile sind gegen die Bevölkerungsbasis des Registers von 23.373.283 berechnet.

Was gemessen ist und was nicht:

  • Gemessen: jede Zählung, jeder Rang, jede Anwesenheit und Abwesenheit in diesem Artikel, berechnet durch exakten Zeichenkettenvergleich gegen die Registerdatei. Byte-Ebenen-Fallstricke wurden geprüft und keiner löste aus — keine Byte-Order-Marks, keine Nullbreiten- oder geschützten Leerzeichen, keine Kurz-gegen-Langzeichen-Diskrepanz, keine Verschiebung durch Unicode-Normalisierung.
  • Nicht gemessen: alles über das chinesische Festland und alles darüber, ob ein Nachname außerhalb Taiwans existiert. „Fehlend" bedeutet durchweg fehlend in diesem Register.
  • Hintergrund, nicht abgeleitet: die historischen Anmerkungen dazu, warum die Fibel mit 趙 beginnt, und zum Ursprung zusammengefügter Doppelnachnamen. Das ist Kontext; die Zahlen bestehen auch ohne ihn.
  • Ausgabenabhängig: der Nenner von 500. Siehe den Abschnitt oben.

Quellen:

  • Taiwan, Innenministerium — 姓氏排名與人數按三階段年齡分 (Nachnamenrang und Bevölkerung nach drei Altersstufen), Stichtag 30. Juni 2023, 2.731 verschiedene Nachnamen, Bevölkerungsbasis 23.373.283, Government Open Data Licence v1. <data.gov.tw/dataset/126774&gt;
  • 百家姓 — die klassische Fibel, in einer weit verbreiteten Rekonstruktion mit 438 einzeichigen und 62 zweizeichigen Einträgen (500 verschiedene). Ausgaben variieren; die üblich zitierte Gesamtzahl ist 504.
  • Verwandte Seiten: Woher unsere Taiwan-Namensdaten stammen zum Register selbst und Was als Nachname zählt zu den definitorischen Fragen, die all dem zugrunde liegen.

← Artikel