Woher unsere China-Namensdaten stammen
Fragen Sie, welcher Nachname in China am häufigsten ist, und Sie bekommen eine selbstbewusste Antwort, die die Daten nicht hergeben. 王 und 李 unterscheiden sich um 0,06 Prozentpunkte — rund 800.000 Menschen von 1,3 Milliarden, also deutlich innerhalb des Rauschens einer Momentaufnahme der Haushaltsregistrierung. „Der häufigste Nachname in China" ist eine Frage ohne sinnvolle Antwort, und das Erste, was ein ehrlicher Datensatz tun muss, ist aufhören so zu tun, als wäre es anders.
Diese Seite dokumentiert die Quelle hinter unseren chinesischen Nachnamengewichten, was wir messen konnten und was nicht, und die große Lücke in der Mitte des veröffentlichten Bestands, die wir bewusst nicht mit Erfindung gefüllt haben.
Das verwendete Register
| Feld | Wert |
|---|---|
| Quelle | 全国户籍人口姓氏统计 — landesweite Nachnamenanalyse der Haushaltsregistrierung |
| Herausgeber | 公安部治安管理局 — Büro für öffentliche Sicherheit, Ministerium für öffentliche Sicherheit |
| Stichtag | April 2007 |
| Veröffentlichte Tiefe | Top 100 Nachnamen mit Bevölkerungsanteilen |
| Unter Rang 100 | Nichts. Es existiert keine veröffentlichte Tabelle. |
| Grundlage | Haushaltsregistrierung (户籍), keine Zensus-Stichprobe |
Veröffentlichte Ankerwerte, auf die wir uns stützen:
- 王 — 92.881.000 Menschen, 7,25 %
- 李 — 92.074.000 Menschen, 7,19 %
- 张 — 87.502.000 Menschen, 6,83 %
- Top 10: 王, 李, 张, 刘, 陈, 杨, 黄, 赵, 吴, 周 — jeweils über 20 Millionen; zusammen 42,9 %
- Top 100: 84,77 % der Bevölkerung
Was wir gemessen und was wir geschätzt haben
Gemessen. Die Ränge 1–100 und damit die Form des Kopfes. Die Gewichte sind eine lineare Umskalierung der veröffentlichten Anteile gegen 王:
weight = round(255 × share / 7.25)
Hier gibt es ein ungewöhnliches Detail, zu dem wir offen sein wollen. Als wir den vorhandenen Kopf der Datei gegen die Tabelle von 2007 prüften, erwarteten wir angepasste Werte und fanden stattdessen Registerwerte: 23 der obersten Einträge wichen um weniger als 2 % ab (nur 黄 lag um 4 % daneben). Das Plateau an der Spitze — 王 255, 李 252, 张 240 — wurde nicht konstruiert, um flach auszusehen. Es fiel aus den echten Anteilen. Die Neukalibrierung von 2026 skalierte die Ränge 1–157 um; sie leitete sie nicht neu ab.
Geschätzt — und wir wollen dabei deutlich sein. Die Ränge 158–460 liegen alle auf Gewicht 1, und das ist um etwa den Faktor 50 falsch. Siehe unten.
Fallstricke speziell für China
Die Top 5 sind ein Plateau, keine Rangliste
王 7,25 %, 李 7,19 %, 张 6,83 %. Der Abstand zwischen Erstem und Zweitem beträgt 0,06 Prozentpunkte. Die Haushaltsregistrierung ist kein Zensus; sie hinkt Migration, Abmeldung und Geburtenmeldung um Spannen hinterher, die bequem größer sind als 0,06 Prozentpunkte.
Also: 王, 李 und 张 bilden ein Plateau. Jeder Datensatz, jeder Artikel und jede Infografik, die „#1 王" als Tatsache präsentiert, überinterpretiert die Quelle. Unsere Gewichte bewahren das Plateau, weil das Plateau das ist, was die Messung aussagt. Dass benachbarte Ränge nahezu gleich sind, ist kein zu glättender Fehler — es ist der Befund.
Dieselbe Vorsicht gilt weiter unten. 赵, 吴 und 周 landen in unserer Datei alle auf Gewicht 71, was bedeutet, dass unsere Daten sie nicht ordnen können. Das Register kann es, gerade eben — 赵 2,06 %, 周 2,02 %, 吴 2,00 %. Auf einer ganzzahligen Skala sind das eine einzige Zahl.
公安部 und 袁义达 zählen unterschiedlich — und keiner liegt falsch
Das ist die Falle, die zwei widersprüchliche „offizielle" chinesische Nachnamenranglisten hervorbringt.
Die MPS-Analyse von 2007 zählt 萧 und 肖 getrennt, ebenso 戴/代 und 傅/付. Die vielzitierten Ranglisten des Demografen 袁义达 führen sie zusammen, mit der Begründung, die Aufspaltung sei ein Artefakt der Zeichenvereinfachung des 20. Jahrhunderts und schreibtechnischer Ersetzung und keine echte Trennung von Abstammungslinien.
Beide sind vertretbar. Sie erzeugen unterschiedliche Rangfolgen, und daraus abgeleitete Listen lassen sich nicht zusammenfügen. Unsere folgt der MPS-Konvention, weil unsere Gewichte aus der MPS-Tabelle stammen, und das Vermischen von Konventionen innerhalb eines Datensatzes ist der Weg, auf dem man einen Nachnamen anderthalbmal zählt.
Leser unserer Taiwan-Seite werden die Form davon wiedererkennen: Taiwans Register zählt 温 und 溫 getrennt, weil es Schriftformen erfasst. Dasselbe zugrunde liegende Phänomen, eine andere institutionelle Antwort, und in beiden Fällen setzt sich die Konvention der Quelle gegen unser Gefühl davon durch, was ein Nachname „sein sollte".
Für die Ränge 100–300 gibt es keine veröffentlichte Tabelle — also haben wir keine erfunden
Hier ist das ehrliche Loch in der Mitte unserer chinesischen Daten.
Die MPS veröffentlicht die Top 100 (84,77 %). Die Arbeit von 袁义达 aus 2006 veröffentlicht einen Ausschnitt — „129 Nachnamen bei ≥0,1 % machen 87 % aus" —, was eine Aggregatzahl ist, keine Tabelle pro Rang. Die einzige systematische Quelle für die Ränge 100–300 ist das Buch 《中国姓氏·三百大姓》 (袁义达 / 邱家儒, 2007), das uns nicht vorlag.
Die Ränge 158–460 in unserem Korpus tragen daher alle Gewicht 1. Das ist sachlich falsch, und wir wissen genau, wie falsch. Auf diesem gemeinsamen Boden sitzen 欧阳 mit ungefähr einer Million Trägern und 壤驷 / 漆雕 / 澹台 mit jeweils ein paar Tausend. Das reale Verhältnis liegt in der Größenordnung von 50:1; unsere Daten sagen 1:1. Schlimmer noch, diese Einträge sind nach ihrer Reihenfolge in der Fibel 百家姓 geordnet, nicht nach Häufigkeit — dieser Abschnitt der Datei ist eine Liste, keine Kurve.
Wir hätten eine plausibel aussehende Potenzkurve über diesen Bereich interpolieren können. Sie hätte besser ausgesehen und wäre erfunden gewesen. Die Lücke ist real, sie ist dokumentiert, und die Lösung ist das Buch, nicht eine Formel.
Abdeckung gegen die Zahl in der Datei
Unser Korpus umfasst 460 Nachnamen und deckt rund 91 % der Bevölkerung ab. Das erklärt sofort eine Zahl, die man zu „korrigieren" versucht: der Top-10-Anteil innerhalb unserer Datei beträgt 42,3 %, nicht 42,9 %. Unterschiedliche Nenner — 42,9 % ist ein Anteil aller Chinesen, 42,3 % ist ein Anteil einer Datei, die nicht jeden chinesischen Nachnamen enthält.
Das ehrliche datei-interne Ziel ist 42,9 % ÷ 91 % ≈ 47 %, und das erreichen wir nicht. 42,3 % ist die Obergrenze, kein Manko: die Top 10 (1.496 Gewichtseinheiten) und die Ränge 11–157 (1.742 Einheiten) sind an echte Registeranteile gebunden, und die 303 Schwanzeinträge können nicht weniger als 1 wiegen (=303 Einheiten). Jede Zahl über 42,3 % erfordert, die Ränge 11–157 zu untertreiben — sie also zu belügen, damit eine Aggregatzahl richtig aussieht.
Die Prüfung, die uns ertappt hat
Eine Diagnose ist es wert, veröffentlicht zu werden, weil sie übertragbar ist. Wenn ein Gewicht von 1 einem Anteil von share(top1) / 255 der Bevölkerung entspricht, dann sagt die Summe aller Gewichte, multipliziert damit, wie viel Bevölkerung die Datei zu beschreiben behauptet:
claimed coverage = sum(weights) × share(top1) / max(weight)
Vor der Neukalibrierung von 2026 behauptete unsere chinesische Datei 114 % von China. Das ist arithmetisch unmöglich, und es bewies, dass der Schwanz überbewertet war, ohne dass es ein Urteil darüber brauchte, welche Einträge falsch aussahen. Nach der Neukalibrierung behauptet sie 100,7 %.
Top 10
| Rang | Nachname | Gewicht | Träger | Bevölkerungsanteil |
|---|---|---|---|---|
| 1 | 王 | 255 | 92.881.000 | 7,25 % |
| 2 | 李 | 252 | 92.074.000 | 7,19 % |
| 3 | 张 | 240 | 87.502.000 | 6,83 % |
| 4 | 刘 | 189 | > 20.000.000 | ~5,37 % |
| 5 | 陈 | 158 | > 20.000.000 | ~4,49 % |
| 6 | 杨 | 107 | > 20.000.000 | ~3,04 % |
| 7 | 黄 | 82 | > 20.000.000 | ~2,33 % |
| 8 | 赵 | 71 | > 20.000.000 | 2,06 % |
| 9 | 吴 | 71 | > 20.000.000 | 2,00 % |
| 10 | 周 | 71 | > 20.000.000 | 2,02 % |
⚠ Was gemessen ist und was Arithmetik ist. Die Ränge 1–3 sind veröffentlichte Zählungen und Anteile. Die Ränge 4–7 zeigen Anteile, die aus dem gespeicherten Gewicht rekonstruiert sind — die Datei behält ein ganzzahliges Gewicht, nicht den ursprünglichen Anteil, sodass diese nur bis auf Rundung wiederherstellbar sind. Die Ränge 8–10 zeigen die veröffentlichten Anteile, weshalb sie nicht in Gewichtsreihenfolge stehen: die Datei kann 2,00 % nicht von 2,06 % trennen. Die MPS gibt nur an, dass jeder der Top 10 über 20 Millionen Träger hat; Zählungen pro Nachname unter Rang 3 stehen nicht in der von uns verwendeten veröffentlichten Zusammenfassung.
Beachten Sie, dass die Rekonstruktion leicht zu niedrig läuft: unsere Gewichte ergeben rückgerechnet eine Top 10 von ~42,5 % gegen die veröffentlichten 42,9 % und eine Top 100 von 84,0 % gegen die veröffentlichten 84,77 %. Dieses Manko von ~0,8 Prozentpunkten ist ganzzahlige Rundung, die sich über 100 Einträge in eine gleichbleibende Richtung anhäuft.
Bekannte Einschränkungen
- Die Ränge 158–460 sind flach und ungeordnet. Der schwerwiegendste Mangel in dieser Sprachregion. ~50:1 an realer Variation, komprimiert auf 1:1, sequenziert nach einer klassischen Fibel statt nach Häufigkeit. Behebbar nur durch die Beschaffung von 《中国姓氏·三百大姓》.
- Die Daten stammen von 2007. Neunzehn Jahre alt. Die MPS hat neuere Berichte veröffentlicht (《二〇二〇年全国姓名报告》, 《二〇二一年全国姓名报告》), aber diese enthalten keine gleichwertige vollständige Top-100-Anteilstabelle, weshalb wir nicht gewechselt haben. Zur Einordnung: der Bericht von 2020 gibt die Top 5 mit 30,8 % der registrierten Bevölkerung an; unser auf 2007 kalibrierter Kopf impliziert 31,1 %. Das ist ein Signal zeitlicher Stabilität von derselben Behörde — ein Beleg, dass sich die Verteilung kaum bewegt hat — und ausdrücklich keine unabhängige Bestätigung, dass unsere Zahlen richtig sind.
- Die Top 10 lassen sich mit unseren Daten unter Rang 3 nicht ordnen. Und sollten es eigentlich auch nicht. Siehe den Plateau-Abschnitt.
- Die Abdeckung liegt bei ~91 %. Die verbleibenden ~9 % der Bevölkerung tragen Nachnamen, die in unserer Datei fehlen.
- Die Haushaltsregistrierung ist kein Zensus. 户籍 hinkt dem tatsächlichen Wohnsitz hinterher. Die Richtung des Fehlers ist bekannt, das Ausmaß nicht.
- Die Zusammenführung vereinfachter/varianter Formen folgt der MPS-Konvention. Wenn Sie die Konvention von 袁义达 brauchen, ist unsere die falsche Datei.
- Die Top-100-Konsistenzprüfung ist keine Verifikation. 83,4 % datei-intern × 100,7 % behauptete Abdeckung = 84,0 % gegen die veröffentlichten 84,77 % ist eine Selbstkonsistenzprüfung gegen dieselbe Quelle, aus der die Gewichte stammen. Sie zeigt, dass die Kurve jenseits des Kopfes arithmetisch kohärent ist. Sie kann nicht zeigen, dass sie wahr ist.
Daten mit Stand 2026-07-17
Register-Stichtag: April 2007. Datensatz neukalibriert: 17. Juli 2026 (Top-10-datei-intern 37,3 % → 42,3 %; behauptete Abdeckung 114 % → 100,7 %). Korpus: 460 Nachnamen, die ~91 % der Bevölkerung abdecken. Männer- und Frauendateien sind byteweise identisch — chinesische Nachnamen flektieren nicht nach Geschlecht.