Woher unsere Vietnam-Namensdaten stammen
Vietnam hat kein staatliches Nachnamenregister. Alles, was Sie je darüber gelesen haben, wie häufig Nguyễn ist — einschließlich der Zahl, die Ihnen gerade im Kopf steckt —, ist irgendjemandes Stichprobe. Das macht Vietnam zur am schwersten richtig zu erfassenden unserer ostasiatischen Sprachregionen und zu der Region, in der wir den größten einzelnen sachlichen Fehler in unseren eigenen Daten fanden.
Die verwendeten Quellen
Es gibt kein Register, daher benennt dieser Abschnitt stattdessen Stichproben.
| Feld | Wert |
|---|---|
| Staatliches Register | Keines. Vietnam veröffentlicht keine Nachnamenhäufigkeiten. |
| Primärstichprobe | VNTH01 — n = 1.682.729 |
| Sekundär | SG01 — n = ~241.000, Hồ-Chí-Minh-Stadt; veröffentlicht nur eine zusammengeführte Top 10 |
| Bekannte Schieflage | VNTH01 ist nordgewichtet, 63:37, und sagt das selbst |
| Ankerwert | Nguyễn = 30,492 % (VNTH01) |
Weil es keine Autorität gibt, an die man sich halten kann, ändert sich die Methode: statt einer Quelle zu vertrauen, suchen wir zwei große Stichproben, deren Verzerrungen in entgegengesetzte Richtungen zeigen, und sehen, ob sie am selben Ort landen.
Was wir gemessen und was wir geschätzt haben
Gemessen. Die Ränge 1–298, aus VNTH01, gespeichert als skalierte Registerzählungen:
weight = round(1000 × share%)
sodass Nguyễns 30,492 % zu 30492 wird und eine Gewichtseinheit 0,001 % der Bevölkerung wert ist. Die Datei läuft bis Rang 298 — der letzten Position, deren Zählung noch auf ein Gewicht von ≥1 rundet, also hinunter bis zu einem Anteil von etwa 0,0005 %. Darunter rundet die Häufigkeit eines Namens auf null: jedes Gewicht dort wäre ein Boden, den wir erfanden, keine Zählung, die wir maßen.
Geschätzt. Die regionale Korrektur — das heißt, es gibt keine. VNTH01 ist nordgewichtet, und wir wissen es. Sie zu korrigieren erforderte regionale Koeffizienten, die nicht existieren, und SG01 veröffentlicht nur seine Top 10. Die Richtung der Verzerrung ist bekannt; die Größe nicht, und wir haben nicht geraten.
Ungewöhnlicherweise ist die Abdeckung nahezu vollständig. 298 Nachnamen decken 99,4 % der Vietnamesen ab, was eine Warnung umkehrt, die für jede andere von uns dokumentierte Sprachregion gilt: hier ist der Anteil eines Nachnamens innerhalb der Datei sehr nahe an seinem Anteil in der Bevölkerung. Anderswo sind das verschiedene Zahlen mit verschiedenen Nennern. In Vietnam fallen sie nahezu zusammen.
Fallstricke speziell für Vietnam
„Nguyễn = 38 %" ist eine Zombie-Zahl
Alle zitieren sie: Enzyklopädien, Journalismus, Namensgenerierungs-Bibliotheken, wir — in unserer ersten Version.
Sie geht zurück auf Lê Trung Hoa, Họ và tên người Việt Nam (1992; Ausgabe 2005), das Nguyễn 38,4 %, Trần 12,1 %, Lê 9,5 %, Phạm 7 %, Hoàng/Huỳnh 5,1 %, Phan 4,5 %, Vũ/Võ 3,9 % gibt. Sie wird wiederholt, nicht weil sie bestätigt wurde, sondern weil sie lange die einzige veröffentlichte Zahl war. Unsere Arbeitsnotizen halten fest, dass sie auf einer Stichprobe von 1.941 Menschen ruht; wir konnten diesen Stichprobenumfang nicht verifizieren, und die Sekundärliteratur reproduziert die Prozentsätze, ohne überhaupt eine Methodik anzugeben. So oder so ist das Problem dasselbe: eine unreplizierte Einzelquelle ohne veröffentlichte Methode, wiederholt, bis sie die Textur einer Tatsache annahm.
Drei große Stichproben sagen anderes:
| Stichprobe | n | Regionaler Charakter | Nguyễn |
|---|---|---|---|
| VNTH01 | 1.682.729 | nordgewichtet 63:37 | 30,5 % |
| SG01 | ~241.000 | Hồ-Chí-Minh-Stadt | 31,5 % |
| Nguyen (2024), Genealogy 8(1) | 883.835 | nationale Zusammenstellung | 31,57 % |
Zwei davon haben entgegengesetzte regionale Verzerrungen und konvergieren trotzdem. Die dritte ist eine unabhängige, peer-reviewte Zusammenstellung, und sie landet am selben Ort — während sie zugleich 39,01 % in Hà Nội gegen 30,61 % in Hồ-Chí-Minh-Stadt meldet und so unabhängig sowohl die Existenz als auch die Richtung der Nord/Süd-Schieflage bestätigt, die VNTH01 über sich selbst erklärt.
Drei Stichproben, drei Methodiken, eine Antwort: Nguyễn ist etwa 31 %, nicht 38 %. Das ist echte unabhängige Bestätigung, nicht wir, die uns selbst zustimmen — die Arbeit von 2024 hatte keinen Kontakt mit unserer Kalibrierungsquelle.
Die Moral verallgemeinert sich: wenn eine Statistik überall zitiert wird und die Spur bei einer einzigen kleinen Studie endet, finden Sie eine große Stichprobe, bevor Sie darauf kalibrieren. Und die Zahl, an der Sie eine Kurve verankern, muss aus derselben Quelle stammen wie die Anteile, die sie skaliert — VNTH01s Anteile an Lês Nguyễn-Zahl von 38 statt an seine eigenen 30,492 zu heften hätte die ganze Kurve um etwa 20 % gestaucht.
„Top 10 = 85 %" ist derselbe Zombie mit einem zweiten Hut
Sie kommt aus demselben Buch und derselben Stichprobe — und sie beschreibt ein anderes Objekt. Lês Zahl führt regionale Varianten zusammen: Hoàng und Huỳnh als einen Nachnamen, Vũ und Võ als einen. Seine sieben zusammengeführten Namen summieren sich auf 80,5 %; SG01s zusammengeführte Top 10 ist 76,1 %.
Unser Korpus hält sie getrennt, weil sie getrennte Strings in einem vietnamesischen Formularfeld sind, sodass unser ehrliches Ziel ~71 % ist. Die Zahl 85 % ist nicht unerreichbar, weil unsere Kurve schlecht ist, sondern weil sie eine Zahl über etwas anderes ist.
Y ist kein Nachname — und die Quelle beweist es von innen
Auf Rang 55 in VNTH01, mit 0,092 %, sitzt Y. Wir haben es verworfen.
Y ist ein männliches Ehrentitel-Präfix bei den Völkern der Ê Đê und Gia Rai — ungefähr „Herr". Y Moan Enuôl, Y Jút. Die eigentlichen Klannamen folgen ihm und stammen matrilinear ab: Niê, Mlô, Ksơr, Kpă.
Der Beweis steckt in der Stichprobe. Wäre Y ein Nachname, würden die Klane nahe bei ihm rangieren. Tun sie nicht: Niê ist Rang 210 (0,005 %), Rơ ist 247. Y erscheint 18-mal häufiger als der Klan, zu dem es gehört — genau das, was Sie sähen, wenn ein Parser das erste Token jedes Namens nähme und die gesamte erwachsene männliche Ê-Đê- und Gia-Rai-Bevölkerung in ein „Nachnamen"-Feld fegte.
Dasselbe Artefakt erzeugte Thị auf Rang 149 — einen weiblichen Mittelnamen, möglicherweise das einzelne häufigste Namenselement des Landes — plus Ka auf 123 und A auf 129. Y hinzuzufügen hätte außerdem einen männlichen Ehrentitel in die weibliche Nachnamenliste geschrieben.
So sieht ein Fallstrick tatsächlich aus: keine falsche Zahl, sondern eine korrekt gezählte Zahl, die das Falsche beschreibt. Die Häufigkeit von Y in der Stichprobe ist akkurat. Y ist schlicht kein Nachname.
Thạch ist echt, und es ist nicht dieselbe Art von Artefakt
Oberflächlich sieht Thạch wie ein weiteres Minderheitensprachen-Token aus. Ist es nicht. Danh, Kiên, Kim, Sơn und Thạch sind Nachnamen, die den Khmer Krom vom Nguyễn-Hof verliehen wurden, als Nam Bộ annektiert wurde — derselbe Verwaltungsmechanismus wie das Clavería-Dekret auf den Philippinen. Khmer-Krom-Träger tragen gewöhnliche vietnamesische Vornamen: Thạch Kim Tuấn, Thạch Cương.
Der Test ist also nicht „sieht dieses Token fremd aus", sondern „gibt es einen dokumentierten Mechanismus, durch den dies ein Nachname ist". Für Y gibt es keinen. Für Thạch gibt es einen.
Văn ist unser schwächster Eintrag, und wir lassen ihn in Ruhe
Văn sitzt auf Rang 42 (0,187 %, ~180.000 Menschen) mit Gewicht 187. Der Nachname ist echt — Văn Như Cương, eine Linie aus Quỳnh Lưu —, aber die Literatur nennt ihn einen kleinen Klan, was schlecht zu 180.000 Trägern passt. Unser Verdacht ist, dass VNTH01 teilweise den Mittelnamen Văn (wie in Nguyễn Văn Nam) absorbierte, den häufigsten männlichen Infix des Landes. Wir haben ihn nicht still reduziert: das wäre ein Anpassen der Daten an eine Vermutung, und dieselbe Quelle reproduzierte den Rest der Kurve exakt (60 von 60 Treffern). Er bleibt, gekennzeichnet.
Warum die Datei bei 298 stoppt
Es gibt keinen geschmacksgetriebenen Grenzwert. Die Datei behält jeden Nachnamen, dessen skalierte Zählung noch auf ein Gewicht von ≥1 rundet — 298 Namen, hinunter bis zu einem Anteil von etwa 0,0005 % —, was bereits die volle messbare Registerscheibe ist. Weil das echte Zählungen statt erfundener Böden sind, bleibt die Masse unter 100 %, statt darüber hinauszuwuchern, und Tiefe kauft einfach immer weniger:
| Tiefe | Einträge | Abdeckung | Top-10 in Datei |
|---|---|---|---|
| bis Rang 66 | 66 | 96,64 % | 71,60 % |
| bis Rang 150 | 150 | 98,77 % | 70,05 % |
| alle | 298 | 99,44 % | 69,58 % |
Die 232 Namen in den Rängen 67–298 fügen kaum drei Punkte Abdeckung hinzu — jeder sitzt unter einem Anteil von 0,06 % —, und alles jenseits von Rang 298 rundet auf gar nichts. Es gibt keine Top-300 zu jagen: 298 ist, wo das messbare Signal des Registers endet.
Top 10
| Rang | Nachname | Gewicht | Bevölkerungsanteil | Anmerkung |
|---|---|---|---|---|
| 1 | Nguyễn | 30492 | 30,49 % | ~31 % über drei Stichproben; nicht 38 % |
| 2 | Trần | 9825 | ~9,83 % | |
| 3 | Lê | 7744 | ~7,74 % | |
| 4 | Phạm | 5932 | ~5,93 % | |
| 5 | Hoàng | 3316 | ~3,32 % | nördliche Variante von Huỳnh; getrennt gehalten |
| 6 | Vũ | 2735 | ~2,74 % | nördliche Variante von Võ; getrennt gehalten |
| 7 | Bùi | 2479 | ~2,48 % | |
| 8 | Phan | 2379 | ~2,38 % | |
| 9 | Đỗ | 2192 | ~2,19 % | |
| 10 | Võ | 2097 | ~2,10 % | südliche Variante von Vũ |
Top 10 wie gelistet: ~69,2 % der Bevölkerung, gegen eine erreichbare Obergrenze von ~71,4 %.
⚠ Keine Trägerzahlen, weil keine existieren. Vietnam veröffentlicht kein Nachnamenregister, es gibt also keine Zeile der Form „Nguyễn: N Menschen". Das sind Stichprobenhäufigkeiten, auf die Bevölkerung skaliert; ~ kennzeichnet Anteile, die aus dem gespeicherten ganzzahligen Gewicht rekonstruiert sind. Führen Sie Hoàng/Huỳnh und Vũ/Võ so zusammen, wie es die meisten veröffentlichten Zahlen tun, und diese Top 10 wird ~76 % — dieselbe Bevölkerung, andere Frage.
Bekannte Einschränkungen
- Es gibt kein Register, und diese Seite kann das nicht beheben. Jede Zahl hier ist eine Stichprobenschätzung — die einzige unserer vier ostasiatischen Sprachregionen, für die das gilt.
- VNTH01s 63:37-Nordschieflage ist unkorrigiert.
Nông(Rang 27) und andere nördliche Hochland-Nachnamen sind überzeichnet; südliche unterzeichnet. Die Hà-Nội/HCMC-Spaltung der Genealogy-Arbeit von 2024 (39,01 % vs. 30,61 %) zeigt, dass der Effekt groß ist. Wir haben keine Koeffizienten und erfanden keine. Vănkönnte durch den Mittelnamen-Parse kontaminiert sein. Oben dokumentiert. Unverändert belassen.- Der Schwanz unter einem Anteil von ~0,0005 % fehlt — Nachnamen, deren skalierte Zählung auf null rundet. Zusammen sind sie die ~0,56 % der Bevölkerung, die die Abdeckung nicht erreicht (sie stoppt bei 99,44 %).
- Minderheitensprachliche Namensgebung ist kaum vertreten. Nach Entfernung von
Y,Thị,KaundAbleibt von der Ê-Đê- und Gia-Rai-Namensgebung eine Handvoll sehr seltener Klannamen —Niê,Rơund dergleichen, jeder nahe dem Boden der Datei. Das spiegelt den Parser unserer Stichprobe wider, nicht Vietnam. - Keine Daten an den Stichproben. Weder VNTH01 noch SG01 trägt ein sauberes Referenzdatum, wie es ein Zensus tut.
Daten mit Stand 2026-07-17
Quellen: die hoten.org-Häufigkeitsdatensätze VNTH01 (n = 1.682.729) und SG01 (n ≈ 241.000) — CC BY 4.0, wie im Seitentext erklärt — gegengeprüft mit Nguyen (2024), Genealogy 8(1):16 (n = 883.835). Die Datei wurde direkt aus den hoten.org-Zählungen neu gebaut: was als kuratierte Liste von ~110 Einträgen auf einer internen 255-Punkte-Skala begann, ist nun die volle Registerscheibe von 298 Nachnamen, jeder als seine skalierte Häufigkeitszählung gespeichert (weight = share% × 1000). Abdeckung 99,44 %, Top-10-in-Datei 69,58 %. Männer- und Frauendateien sind byteweise identisch — vietnamesische Nachnamen flektieren nicht nach Geschlecht.