Warum eine „Liste von Nachnamen" nicht universell ist: Was als eine Zeile zählt
Bevor Sie eine Häufigkeitsliste laden, werden Sie fragen, ob die Quelle maßgeblich ist. Das ist die falsche erste Frage, und wir haben den Defekt, der es beweist.
Die richtige erste Frage lautet: Was ist die Einheit der Aufzeichnung — was zählt eine Zeile in dieser Datei tatsächlich? Einen Nachnamen? Ein Namenselement? Einen Ehrentitel? Eine Position in einer Namensformel? Eine Person, oder eine Stelle, die eine Person zweimal ausfüllt?
Wir haben das mit einer nationalen statistischen Quelle vor Augen falsch gemacht, unter Verwendung einer Fallenliste, die den genauen Fehler bereits benannte. So sieht das von innen aus.
Der Fehler: 300 Zeilen aus einer Häufigkeitsdatei, von denen vier keine Namen waren
Unser vietnamesischer Nachnamen-Korpus wurde am 18. Juli 2026 von 110 auf 303 Einträge erweitert, gespeist aus den Top 300 eines Häufigkeitsdatensatzes. Die Quelle ist eine echte mit echten Zählungen. Die Erweiterung tat, was eine gute Erweiterung tun sollte — sie vertiefte den Schwanz und hielt den Kopf stabil.
Sie importierte außerdem drei Einträge erneut, die ein früherer Durchgang absichtlich verworfen hatte:
| Eintrag | Gewicht | Was es tatsächlich ist |
|---|---|---|
Y | 92 | ein männlicher Ehrentitel bei Ê-đê und Jarai — „Herr" |
Ka | 17 | dieselbe Klasse von Ehrentitel |
A | 16 | dieselbe Klasse von Ehrentitel |
Y ist das Zeichen, das dem Namen eines Mannes bei den Völkern der Ê-đê und Jarai im Zentralen Hochland vorangeht — wie in Y Moan Enuôl, dem Sänger. Es ist nicht sein Familienname. Sein eigentlicher Klanname folgt danach, und Ê-đê-Klannamen sind matrilinear.
Beide dieser Klannamen stehen ebenfalls in unserem Korpus, und ihre Gewichte sind das, was uns hätte stoppen sollen:
| Eintrag | Rang | Gewicht | Was es ist |
|---|---|---|---|
Y | — | 92 | Ehrentitel (entfernt) |
Niê | 201 | 5 | ein echter matrilinearer Ê-đê-Klan |
Rơ | 248 | 3 | ein echter Ê-đê-/Jarai-Klan |
Die Datei behauptete, dass der Ehrentitel achtzehnmal häufiger sei als der Klan, an den er sich anfügt. Das ist arithmetisch das, was passiert, wenn man einen Titel als Namen zählt: jedes Mitglied jedes Klans trägt zu ihm bei. Die Zahl war kein Rauschen. Sie war die korrekte Zählung von etwas, das kein Nachname ist.
Die Häufigkeitsquelle war nicht falsch. Sie zählte die Strings, die an der ersten Position eines Namensfelds erscheinen, was etwas vollkommen Kohärentes zu zählen ist. Wir lasen das als „Nachnamenhäufigkeit", was es nicht ist.
Was unsere eigene Dokumentation sagte
Der Teil, der schmerzt: unsere interne Quellenreferenz hat einen Abschnitt über Datenfallen, und er enthält diese Zeile, geschrieben vor dem Defekt:
Ehrentitel als „Nachnamen".
Y(Vietnamesisch, Ê-đê),Thị,Ka,A; bangladeschisch weiblichবেগমBegum,আক্তারAkter,খাতুনKhatun,খানমKhanam;其他(Taiwan);기타(Korea);ALL OTHER NAMES(USA);AUTRES NOMS(INSEE). Ein einzeichiger „Nachname" verdient überall einen zweiten Blick.
Das Build-Skript für die Sprachregion trug außerdem einen wörtlichen Kommentar mit dem Wortlaut // Y (#55) deliberately REJECTED. Die Falle war dokumentiert, die Verwerfung war im Code festgehalten, und der Neuaufbau führte sie trotzdem wieder ein — weil die Aufgabe des Neuaufbaus war, die Top 300 zu importieren, und nichts in der Pipeline wusste, dass vier dieser 300 nicht für den Import zugelassen waren.
Eine Falle zu dokumentieren schützt nicht vor ihr. Nur eine Prüfung, die läuft, tut es.
Und die Behebung war unvollständig
Wir haben den ausgelieferten Korpus beim Schreiben dieses Artikels gemessen, und das ehrliche Ergebnis ist, dass die erste Bereinigung teilweise war.
Y, Ka und A verschwanden. Der Korpus fiel auf 299 Zeilen, die sich zu einem Gewicht von 99.454 summieren, mit Nguyễn bei 30.492 — 30,66 % des Korpus, was die Zahl ist, die die peer-reviewte Literatur stützt, und nicht die 38 %, die weithin aus einer Studie von 1992 an 1.941 Menschen zirkulieren.
Aber Thị war noch da, auf Rang 143, Gewicht 13.
Thị ist der bekannteste Nicht-Nachname in der vietnamesischen Namensgebung. Es ist die konventionelle Mittelnamen-Markierung für Frauen — Nguyễn Thị Hương — und es erscheint in der Mittelposition eines sehr großen Bruchteils vietnamesischer Frauennamen. Es ist in unserer eigenen Fallenliste ausdrücklich benannt, im selben Satz wie Y, Ka und A. Es überlebte die Behebung, die die anderen drei entfernte, und es brauchte einen separaten dritten Durchgang, um es herauszubekommen — diese Entfernung ist es, die die Datei von 299 Zeilen auf die 298 brachte, die sie heute ausliefert.
So auch Ô, ein einzeichiger Eintrag auf Rang 265 mit Gewicht 3, was genau der Fall ist, den die Fallenliste als einen zweiten Blick verdienend bezeichnet — und Ô ist immer noch in der Datei, nun auf Rang 264.
Wir veröffentlichen die Abfolge und nicht nur den ordentlichen Endzustand, weil die Gestalt des Versagens der nützliche Teil ist. Der erste Fehler war, eine Falle zu importieren, die wir dokumentiert hatten. Der zweite Fehler war, die drei Instanzen zu beheben, auf die wir gerade schauten, statt die Fallenliste erneut gegen das Ergebnis laufen zu lassen — weshalb die Datei einen dritten Durchgang brauchte und weshalb ein gekennzeichneter Eintrag noch immer darin ist. Eine teilweise Behebung liest sich in jedem Log, das sie hinterlässt, als eine vollständige.
Vier Arten, wie sich die Einheit der Aufzeichnung unterscheidet
Vietnam ist ein Fehlermodus. Es gibt mindestens vier verschiedene, und sie brauchen verschiedene Antworten.
1. Die Zeile ist überhaupt kein Name
Ehrentitel sind der Fall von oben. Aber jedes große Register veröffentlicht auch Aggregat-Behälter in derselben Spalte wie echte Namen:
| Quelle | Behälter-Zeile | Was es bedeutet |
|---|---|---|
| Taiwan (MOI) | 其他 | „andere" |
| Korea (KOSTAT) | 기타 | „andere" |
| US-Zensus | ALL OTHER NAMES | alles unterhalb der Schwelle |
| INSEE (Frankreich) | AUTRES NOMS | alles unterhalb der Schwelle |
Jeder davon wird nach Zählung nahe am Anfang der Datei stehen, weil er den gesamten Schwanz aggregiert. Importieren Sie ihn wörtlich, und Sie haben Ihrem Generator einen Nachnamen gegeben, der von mehreren Millionen Menschen getragen wird, mit dem aber nie ein Mensch benannt wurde.
2. Die Zeile ist eine Position, keine Person
In Spanien trägt jede Person zwei Nachnamen — den des Vaters zuerst, den der Mutter als zweiten. Also hat „wie häufig ist García?" zwei korrekte Antworten, die sich um den Faktor zwei unterscheiden:
| Maß | García |
|---|---|
| Als erster Nachname (ap1) | 1.446.937 |
| Über beide Positionen | 2.915.761 |
Keine Zahl ist falsch. Sie beantworten verschiedene Fragen, und eine Liste, die sie über Zeilen hinweg vermischt, ist stillschweigend inkohärent. Der portugiesische Fall macht den Einsatz sichtbar: die Top 10 der portugiesischen Nachnamen decken 45,7 % der Träger, aber nur 22,8 % der Positionen ab. Berichten Sie die falsche, und Ihre Konzentrationskurve ist um den Faktor zwei daneben.
Und die Regel verallgemeinert sich nicht einmal über die spanischsprachige Welt. Argentinien ist die Ausnahme: nur der väterliche Nachname wird verwendet, sodass Träger und Positionen dieselbe Zahl sind. Wendet man dort die „durch zwei teilen"-Korrektur an, verwandelt sie eine korrekte Abdeckung von 134 % in fiktive 67 %.
3. Die Zeile ist ein Patronym, kein Familienname
In Island haben die meisten Menschen überhaupt keinen Nachnamen im vererbten Sinne. Jónsson bedeutet „Jóns Sohn" und wird jede Generation neu aus dem Vornamen des Vaters erzeugt. Die Aufschlüsselung von Statistics Iceland von 2017 lautet 82 % Patronyme, 4 % vererbte Familiennamen (ættarnöfn) und 14 % andere — meist Einwanderer-Nachnamen.
Eine Häufigkeitsliste „isländischer Nachnamen" ist daher überwiegend eine Häufigkeitsliste von Männer-Vornamen, eine Generation zuvor, mit einem Suffix. Die 59 echt vererbten Familiennamen sind ein separates und viel kleineres Objekt. Wir behandeln diesen Fall ausführlich in Island: Patronyme und 59 Nachnamen, einschließlich der Gründe, warum die weithin wiederholte „etwa 10 % der Isländer haben einen Nachnamen" eine Zombie-Statistik ist, zusammengesetzt durch Addition der 4 % zu den 14 %.
4. Nicht jeder hat einen
Mononyme sind real. In Indonesien kann eine Person rechtlich genau einen Namen und keinen Familiennamen haben — die Praxis ist verbreitet genug, dass indonesische Passsysteme feste Konventionen dafür haben. Unser id_ID-Korpus führt 299 Nachnamen und ist intern mit einer offenen Frage gekennzeichnet, ob das Namensmodell der Sprachregion überhaupt richtig ist, weil eine Nachnamenliste für Indonesien eine Praxis beschreibt, der ein großer Anteil der Bevölkerung nicht folgt.
Ein Schema mit einer erforderlichen lastname-Spalte kann das nicht abbilden. Es wird einen Nachnamen für jemanden erzeugen, der keinen hat, und der erzeugte Wert wird von einem echten nicht zu unterscheiden sein.
Wo sich die Einheit der Aufzeichnung nach Geschlecht aufteilt
Die größte strukturelle Überraschung ist, dass in mehreren Sprachgemeinschaften die Menge der zugelassenen Nachnamen für Männer und Frauen verschieden ist — nicht flektiert, verschieden.
Indien. Sechs Einträge erscheinen nur in der weiblichen Datei: Devi, Kaur, Begum, Khatun, Bano, Parveen. Das sind keine femininen Formen von irgendetwas. In der Sikh-Namenspraxis ist Kaur der Name, den Frauen tragen; Devi ist unter Frauen in ganz Nordindien sehr verbreitet; Begum, Khatun, Bano und Parveen sind Frauennamen in muslimischen Gemeinschaften. Devi trägt Gewicht 75 — schwerer als der Großteil der Datei.
Beachten Sie, was die Daten nicht sagen. Singh steht in beiden Dateien, gewichtet mit 100 auf der männlichen und 55 auf der weiblichen Seite. Sikh-Frauen tragen ihn ebenfalls. Der Korpus kodiert eine Schieflage, keinen Ausschluss — eine Unterscheidung, die nur überlebt, wenn Ihr Schema „in beiden vorhanden, verschieden gewichtet" ausdrücken kann.
Bangladesch. Vier Einträge sind ausschließlich weiblich: বেগম (Begum), আক্তার (Akter), খাতুন (Khatun), খানম (Khanam). Das sind dieselben Ehrentitel aus der Fallenliste — aber hier gehören sie hin, weil sie in der bangladeschischen Praxis für viele Frauen echt die Nachnamen-Stelle einnehmen. Derselbe String ist in einem Korpus ein Defekt und im anderen korrekte Daten, und die einzige Möglichkeit zu wissen, welches, ist zu wissen, was das Namenssystem tut.
Georgien ist der Fall, der uns am meisten kostete. Georgische Nachnamen variieren nicht mit dem Geschlecht: ბერიძე ist ბერიძე für alle. Aber Georgien hat eine aserbaidschanische Minderheit von etwa 6,3 % der Bevölkerung, und aserbaidschanische Nachnamen flektieren sehr wohl: მამედოვი ♂ / მამედოვა ♀.
Solange wir eine Regel durchsetzten, dass die männliche und die weibliche Nachnamendatei byteweise identisch sein müssen, hatte diese ganze Schicht nirgends Platz — und die Sprachregion lieferte ohne den zweithäufigsten Nachnamen des Landes aus. Die geschlechtsgetrennten Zahlen des Registers sind ბერიძე 14.963 und მამედოვი 14.482 unter Männern; ბერიძე 15.059 und მამედოვა 13.487 unter Frauen. In einer zusammengeführten Spitzenliste teilen die beiden Formen die Zählung, und der Name versank vollständig aus dem Blick.
Die Lehre verallgemeinert sich über Georgien hinaus: prüfen Sie in jedem Land mit einer flektierenden Minderheitenschicht den Anfang der Liste getrennt nach Geschlecht. Ein zusammengeführtes Ranking verbirgt genau die Namen, die flektieren.
Unser Validator führt nun eine ausdrückliche Ausnahmeliste für diese drei Sprachregionen:
$SET_PER_GENDER = ['en_IN' => 1, 'ka_GE' => 1, 'bn_BD' => 1];
Für alles andere ist die Regel entweder „Dateien müssen identisch sein" oder „Dateien paaren sich nach Index". Für diese drei ist sie keines von beiden, und der Validator behauptet nur, dass sich die beiden Mengen echt unterscheiden — denn wenn sie identisch sind, wurde die Trennung nie vorgenommen. Die Mechanik der Paarungsfälle, einschließlich der Gründe, warum man eine feminine Form niemals aus einem String ableiten kann, wird separat in Nachnamen, die sich mit dem Geschlecht ändern behandelt.
Griechisch ist die Erinnerung, dass Flexion nicht immer das ist, wonach sie aussieht. Παπαδόπουλος ♂ / Παπαδοπούλου ♀ ist kein männlicher und ein weiblicher Nachname — die weibliche Form ist der Genitiv der männlichen, wörtlich „von Papadopoulos". Dieselbe String-Beziehung, gänzlich andere Grammatik, und es ändert, was ein „Paar" bedeutet.
Die Checkliste, die wir hätten laufen lassen sollen
- Fragen Sie, was eine Zeile zählt. Vor der Lizenz, vor der Autorität, vor der Abdeckung. Einen Nachnamen, ein Namenselement, eine Position, einen Titel, einen Aggregat-Behälter. Die Quelle wird es Ihnen meist sagen, wenn Sie ihre Spaltendefinitionen statt ihrer Spaltenüberschriften lesen.
- Sortieren Sie aufsteigend nach String-Länge und lesen Sie den Anfang. Jeder Ehrentitel, den wir importierten, war ein oder zwei Zeichen. Das kostet einen Befehl.
- Prüfen Sie auf Aggregat-Behälter nach Namen.
其他,기타,ALL OTHER NAMES,AUTRES NOMS,_PRENOMS_RARES. Sie sitzen nach Zählung nahe am Anfang. - Gleichen Sie einen verdächtigen Eintrag gegen seine eigenen Abhängigen ab.
Ybeanspruchte das 18-Fache des Gewichts des Klans, an den es sich anfügt. Die interne Inkonsistenz war ohne jede externe Quelle sichtbar. - Klären Sie Träger vs. Positionen, bevor Sie irgendeinen Prozentsatz berechnen. Zwei Nachnamen pro Person verdoppeln die Positionen und halbieren nichts — und Argentinien ist die Ausnahme, die beweist, dass man die Regel nicht nach Sprache anwenden kann.
- Prüfen Sie den Anfang der Liste getrennt nach Geschlecht. Georgiens Nachname Nr. 2 war in einem zusammengeführten Ranking unsichtbar.
- Lassen Sie die gesamte Fallenliste nach jeder Behebung erneut laufen. Wir entfernten drei Ehrentitel und ließen
ThịundÔin der Datei sitzen;Thịbrauchte einen dritten Durchgang, undÔist noch da. Die Behebung wurde gegen den Fehlerbericht geprüft, nicht gegen die Checkliste.
Die zugrundeliegende Disziplin besteht darin, eine Häufigkeitsliste nicht länger als eine Liste von Namen zu behandeln, die zufällig Zählungen angehängt hat, und stattdessen als eine Messung, vorgenommen von jemand anderem, einer Einheit, die dieser definierte und Sie nicht. Autorität sagt Ihnen, dass das Zählen sorgfältig gemacht wurde. Sie sagt Ihnen nichts darüber, was gezählt wurde.
Daten mit Stand 2026-07-18
Alle Korpuszahlen wurden am 18. Juli 2026 gegen die ausgelieferten Dateien lastname_male.tsv / lastname_female.tsv gemessen, nicht gegen Build-Eingaben oder Dokumentation.
In den ausgelieferten Daten verifiziert:
vi_VN— 298 Zeilen, Gewichtssumme 99.441.Nguyễn30.492 = 30,66 % des Korpusgewichts.Y,Ka,Afehlen (seit dem 303-Zeilen-Neuaufbau entfernt).Thịfehlt nun ebenfalls — es war die Mittelnamen-Markierung, kein Nachname, und seine Entfernung ist es, die die Datei von 299 Zeilen auf 298 brachte.Ôvorhanden auf Rang 264, Gewicht 3.NiêRang 200 Gewicht 5;RơRang 247 Gewicht 3.VănRang 42 Gewicht 187, beibehalten, aber gekennzeichnet — die Quelle hat womöglich teilweise die männliche Mittelnamen-Markierung gezählt.en_IN— 836 männliche / 842 weibliche Zeilen. Ausschließlich weiblich:Bano,Begum,Devi,Kaur,Khatun,Parveen. Ausschließlich männlich: keine.Singhmännlich 100 / weiblich 55;Deviweiblich 75;Kaurweiblich 60.bn_BD— 400 männliche / 404 weibliche Zeilen. Ausschließlich weiblich:বেগম,খাতুন,আক্তার,খানম.ka_GE— 492 Zeilen je Seite, identische Länge, 32 Zeilen, in denen sich der Nachname unterscheidet.მამედოვიGewicht 34 /მამედოვაGewicht 31, auf Rang 461 auf beiden Seiten.el_GR— 648 Zeilen je Seite; Rang 1 istΠαπαδόπουλος/Παπαδοπούλου.id_ID— 299 Nachnamen, kuratiert, mit einem offenen internen Fragezeichen gegen das Namensmodell der Sprachregion.is_IS— 343 Zeilen.es_ES— 2.522 Zeilen (300 hinzugefügt am 21. Juli 2026), Gewichtssumme 34.026.331.
Quellen:
- Vietnam — hoten.org VNTH01-Häufigkeitsdatensatz (CC BY 4.0 wie im Seitentext erklärt). Bestätigt durch Nguyen, Viet Khoa (2024), Toward an Onomastic Account of Vietnamese Surnames, Genealogy 8(1):16, n = 883.835, was
Nguyễn31,57 % ergibt. Die weithin zitierte Zahl von 38,4 % geht auf Lê Trung Hoa (1992) an einer Stichprobe von 1.941 Menschen zurück und sollte nicht als Divisor verwendet werden. <doi.org/10.3390/genealogy80100…; - Spanien — INE, Frecuencias de apellidos, Zensus vom 01.01.2025. 86.512 Datenzeilen über
Apellido 1º/Apellido 2º/Ambos apellidos. Positionen = ap1 + ap2; Träger = ap1 + ap2 − ambos.García1.446.937 als erster Nachname, 2.915.761 über beide. Beachten Sie, dass der Dateikopf eine Häufigkeitsschwelle von 100 angibt und die tatsächliche Schwelle 20 ist. <ine.es/daco/daco42/nombyapel/…; - Portugal — SPIE-Liste „100 apelidos" (96 Einträge), gegengeprüft mit IRN bei den Top 4. Top 10 = 45,7 % der Träger, 22,8 % der Positionen.
- Argentinien — RENAPER. Nur der väterliche Nachname wird verwendet; Träger gleich Positionen.
- Georgien — Public Service Development Agency, 2024, veröffentlicht getrennt nach Geschlecht. Männer:
ბერიძე14.963,მამედოვი14.482. Frauen:ბერიძე15.059,მამედოვა13.487. Aserbaidschanischer Bevölkerungsanteil ≈ 6,3 %. - Island — Hagstofa Íslands, 01.01.2017: Patronyme 82 %, ættarnöfn 4 %, andere 14 %. Gesetz Nr. 54/1925 untersagte die Schaffung neuer Familiennamen; es schaffte bestehende nicht ab. <hagstofa.is/>
- Taiwan — 內政部戶政司, OGDL Taiwan v1.0. Korea — KOSTAT. Vereinigte Staaten — US-Zensus 2010 Surnames, gemeinfrei. Frankreich — INSEE
noms2008nat, Licence Ouverte 2.0.