Gefälschte ID > Artikel > Vier Nachnamen decken die halbe Bevölkerung Vietnams ab. Die Ukraine braucht Hunderte. Die Konzentrationskurve erklärt

Vier Nachnamen decken die halbe Bevölkerung Vietnams ab. Die Ukraine braucht Hunderte. Die Konzentrationskurve erklärt

Vietnams vier häufigste Nachnamen — Nguyễn, Trần, Lê, Phạm — machen zusammen die halbe Bevölkerung des Landes aus. Um die Hälfte der Ukraine zu erreichen, braucht man mehrere Hundert verschiedene Nachnamen. Dieselbe Messung, dieselbe Methode, zwei Größenordnungen dazwischen.

Das ist eine andere Frage als „Wie viele Nachnamen hat ein Land?", die wir in Wie viele Nachnamen hat ein Land? behandelt haben. Die Repertoiregröße fragt, wie lang die Liste ist. Die Konzentration fragt, wie die Masse entlang der Liste verteilt ist — und die beiden können auseinanderfallen. Dänemark hat ein bescheidenes Korpus von 717 Namen, gehört aber zu den am stärksten konzentrierten Ländern Europas. Neuseeland hat ein riesiges Korpus und zählt zu den flachsten. Die Länge sagt fast nichts über die Form aus.

Unten steht die Form, für jedes Land, für das wir Daten halten, auf dieselbe Weise gemessen, dazu eine ehrliche Darstellung, welche Zahlen Registerfakten sind und welche unser Modell.

Die Messung

Für jedes Land ordnen wir die Nachnamen nach Häufigkeit, gehen die Rangliste hinunter und halten fest, wie weit man gehen muss, um 50 %, 80 % und 95 % der Bevölkerung zu akkumulieren. Drei Zahlen, eine Kurve. Eine steile Kurve bedeutet, dass wenige Namen das Land tragen; eine flache Kurve bedeutet, dass die Masse dünn verteilt ist.

LandTop 10Top 100Namen für 50%für 80%für 95%
Vietnam69,5%98,4%41645
Südkorea60,6%93,5%626120
Taiwan52,8%96,6%93384
Dänemark43,6%77,1%14130536
China42,3%83,4%1684283
Portugal31,4%82,8%2287215
Brasilien31,2%67,2%38192374
Bulgarien29,2%65,2%37247551
Armenien28,3%80,4%2698262
Island24,8%72,0%39135254
Spanien23,2%48,9%1099351.901
Schweden21,6%44,1%1511.0252.090
Norwegen19,9%54,0%81433824
Japan17,6%62,3%57252566
Ungarn17,2%44,9%128380620
Niederlande14,8%50,8%97318562
Russland12,1%50,7%98300753
Türkei11,2%38,4%1826261.087
Großbritannien10,9%35,8%2187321.294
Deutschland8,6%31,3%248640932
Finnland8,5%39,2%172414563
USA8,3%34,8%2258331.559
Italien6,9%22,9%3779331.239
Frankreich6,9%33,4%2126201.067
Polen6,4%25,2%3719121.182
Tschechien5,7%22,1%4341.0011.604
Ukraine5,5%16,7%8741.6742.074

Lesen Sie die erste und die letzte Zeile zusammen. Vietnam erreicht 50 % mit vier Namen und 95 % mit fünfundvierzig. Die Ukraine braucht 874 Namen für die erste Hälfte und steigt bei 2.074 noch immer an. Zwischen diesen beiden Polen liegt jedes andere Namenssystem der Erde.

Dieselbe Spalte als Form. Die Tabelle gibt Ihnen die Zahlen; die Balken geben Ihnen den Abfall — und der Abfall ist der Punkt. Es gibt kein Cluster und kein Plateau: Die Konzentration fällt von Vietnam bis zur Ukraine gleichmäßig ab, weshalb eine einzelne „typische" Nachnamenverteilung nicht existiert.

Anteil der Bevölkerung, den die zehn häufigsten Nachnamen tragen
Vietnam — 69.5%Vietnam69.5%Südkorea — 60.6%Südkorea60.6%Taiwan — 52.8%Taiwan52.8%Dänemark — 43.6%Dänemark43.6%China — 42.3%China42.3%Portugal — 31.4%Portugal31.4%Brasilien — 31.2%Brasilien31.2%Bulgarien — 29.2%Bulgarien29.2%Armenien — 28.3%Armenien28.3%Island — 24.8%Island24.8%Spanien — 23.2%Spanien23.2%Schweden — 21.6%Schweden21.6%Norwegen — 19.9%Norwegen19.9%Japan — 17.6%Japan17.6%Ungarn — 17.2%Ungarn17.2%Niederlande — 14.8%Niederlande14.8%Russland — 12.1%Russland12.1%Türkei — 11.2%Türkei11.2%Großbritannien — 10.9%Großbritannien10.9%Deutschland — 8.6%Deutschland8.6%Finnland — 8.5%Finnland8.5%USA — 8.3%USA8.3%Italien — 6.9%Italien6.9%Frankreich — 6.9%Frankreich6.9%Polen — 6.4%Polen6.4%Tschechien — 5.7%Tschechien5.7%Ukraine — 5.5%Ukraine5.5%

Bevor Sie weiterlesen, beachten Sie den Vorbehalt. Dies sind unsere Korpora, gemessen am 18. Juli 2026 gegen die Korpusversion share 1.1.7. Neun der obigen Zeilen — Dänemark, Spanien, Schweden, Norwegen, Großbritannien, die USA, Frankreich, Polen und die Ukraine — sind seither auf Register-Trägerzahlen neu aufgebaut worden und haben sich verschoben, zwei davon erheblich: Polens „Namen für 50 %" von 371 auf 1.989, die der Ukraine von 874 auf 201. Sofern eine Zahl nichts anderes sagt, ist alles Folgende die Julimessung. Bei dieser Messung waren die Häufigkeitsgewichte relativ, keine Trägerzahlen, für 61 der 63 Sprachregionen im Durchlauf. Die Top-10-Spalte ist gegen veröffentlichte Registerzahlen kalibriert und lässt sich an ihnen prüfen; die 50/80/95-Spalten sind unser Modell des Schwanzes und sollten als solches gelesen werden. Alle Einzelheiten im Methodikabschnitt — und der Grund, warum wir diese Warnung in die Mitte des Artikels statt ans Ende setzen, ist, dass der Vorbehalt verändert, was die Tabelle bedeutet.

Korrektur — die ukrainische Zeile wurde neu aufgebaut. Ein Audit fand, dass unsere ukrainischen Nachnamengewichte eine arithmetische Konsistenzprüfung nicht bestanden. Das Korpus wurde seither aus Registerzählungen neu aufgebaut, sodass jede ukrainische Zahl anderswo in diesem Artikel die Messung vor dem Neuaufbau ist. Die Prüfung: Der korpusinterne Top-10-Anteil eines Korpus, multipliziert mit seiner Bevölkerungsabdeckung, ergibt den Bevölkerungs-Top-10-Anteil. Das alte ukrainische Korpus meldete einen korpusinternen Top-10-Wert von 5,45 % gegen eine veröffentlichte Bevölkerungszahl von 5,45 % — was bedeutet, dass das Korpus 99,9 % der Ukrainer abdeckte. Es hielt 2.207 Nachnamen gegen ein nationales Repertoire von rund 707.685, seine wahre Abdeckung war also ein kleiner Bruchteil davon. Die beiden Zahlen haben verschiedene Nenner und können nicht legitim gleich sein; ein früherer Build desselben Korpus meldete 29,4 %, was mit einem dünnen Korpus eines sehr flachen Repertoires übereinstimmt. Die Folge war spezifisch und stand in der Überschrift: die Zahl „874 Namen, um die Hälfte der Ukraine zu erreichen" war aufgebläht durch eine abgeflachte Gewichtskurve (1.900 der 2.207 Einträge saßen beim Mindestgewicht und trugen 71 % der Korpusmasse). Neu angegeben aus dem neu aufgebauten Korpus — 2.562 Nachnamen auf Register-Trägerzahlen, gemessen am 22. Juli 2026: Top 10 = 8,42 %, Top 100 = 34,27 %, 201 Namen, um 50 % zu erreichen, 601, um 80 % zu erreichen, 1.062, um 95 % zu erreichen. Beachten Sie, was das die ursprünglich erzählte Geschichte kostet: Die Ukraine ist nicht das flache Extrem unserer Menge. Sie liegt nun im Mittelfeld, und das flachste Korpus, das wir halten, ist das polnische, das 1.989 Namen braucht, um die Hälfte zu erreichen. Die taiwanische und die vietnamesische Zeile bestehen dieselbe Prüfung (implizierte Abdeckung 100,0 % und 99,6 % gegen dokumentierte Abdeckung von ~99,6 % und ~97,5 %) und sind nicht betroffen.

Vier Mechanismen, nicht einer

Die Streuung ist kein einzelnes Kontinuum. Vier verschiedene historische Mechanismen erzeugen sie, und sie erzeugen unterschiedliche Kurven*formen*, nicht nur unterschiedliche Steilheiten.

1. Geschlossene Klan-Repertoires (Vietnam, Korea, Taiwan, China)

Ost- und südostasiatische Nachnamen stammen von einem alten, im Wesentlichen festen Bestand an Klannamen ab. Seit Jahrhunderten ist kein neuer entstanden. Das Ergebnis ist nicht bloß „wenige Nachnamen", sondern eine spezifische Form: eine Handvoll Riesen, dann eine Klippe.

Taiwan ist der klarste Fall, weil sein Innenministerium Rohzählungen ganz ohne Unterdrückungsschwelle veröffentlicht — Nachnamen mit einem einzigen Träger sind enthalten. Chen (陳) allein deckt 11,2 % von 23,4 Millionen Menschen ab. Neun Nachnamen erreichen die halbe Insel. Aber die Datei enthält auch 636 Nachnamen, die von genau einer Person getragen werden — 23,5 % aller verschiedenen Nachnamen, die zusammen 0,00 % der Bevölkerung tragen. Das ist die Form in einem Satz: ein Land der Riesen mit einem statistisch gewichtslosen Rand.

Vietnam ist das Extrem. Nguyễn allein wiegt 30,6 % in unserem Korpus, im Einklang mit den ~31 %, die aus großen Stichproben festgestellt wurden — und nachdrücklich nicht die Zahl von 38 %, die fast überall zirkuliert, die wir auf eine Stichprobe von 1.941 Menschen aus dem Jahr 1992 zurückverfolgt und in Sieben Arten, wie Namensdaten Sie belügen (Begleitartikel, noch nicht veröffentlicht) widerlegt haben. Vier Namen bringen Sie zur Hälfte. Unser vietnamesisches Korpus mit 298 Einträgen deckt etwa 97,5 % der Bevölkerung ab — die Datei ist nahezu vollständig, weil das Repertoire wirklich so klein ist.

2. Patronym-Einfrierung (Dänemark, Norwegen, Schweden, Island)

Skandinavien wirkt aus einem völlig anderen Grund konzentriert. Dänische Nachnamen sind eingefrorene Patronyme: Jensen, Nielsen, Hansen, Pedersen — „Sohn des Jens", „Sohn des Niels". Bis ins neunzehnte Jahrhundert waren das gar keine Nachnamen, sondern sich regenerierende Bezeichnungen, die sich mit jeder Generation änderten. Gesetze froren sie mitten im Fluss ein, und welches Patronym eine Familie zufällig an dem Tag trug, an dem das Gesetz griff, wurde dauerhaft.

Weil der Vorrat an männlichen Vornamen, die zum Zeitpunkt der Einfrierung in Gebrauch waren, klein war, war auch der Vorrat an eingefrorenen Patronymen klein. Dänemarks Top 10 deckt 43,6 % ab — Konzentration auf asiatischem Niveau, erzeugt durch ein administratives Ereignis des neunzehnten Jahrhunderts statt durch eine alte Klanstruktur.

Die Form verrät den Mechanismus. Vergleichen Sie Dänemark und Taiwan bei gleicher Top-10-Konzentration:

LandTop 10Top 100Namen für 95%
Taiwan52,8%96,6%84
Dänemark43,6%77,1%536

Ähnliche Köpfe, völlig verschiedene Schwänze. Taiwans Kurve bricht nach den ersten hundert zusammen; Dänemarks läuft noch weitere vierhundert Namen weiter. Dänemark hat einen echten Schwanz nicht-patronymischer Namen — Toponyme, deutsche Importe, Berufsnamen —, den Taiwan schlicht nicht hat. Zwei Systeme können eine Schlagzeilenzahl teilen und strukturell ungleich sein, weshalb die Top-10-Zahl, die jede Listicle zitiert, die am wenigsten informative Zahl in der Tabelle ist.

Island ist dieselbe Familie mit umgekehrtem Mechanismus: Island fror seine Patronyme nie ein, sodass die meisten Isländer im vererbbaren Sinne überhaupt keinen Nachnamen haben. Unser isländisches Korpus mit 343 Einträgen deckt nur die kleine Minderheit von Familien ab, die einen haben. Diese Geschichte haben wir separat in Islands Patronyme und seine 59 Nachnamen erzählt.

3. Offene produktive Repertoires (Ukraine, Tschechien, Polen, Italien)

Am flachen Ende sitzen die Systeme, die noch Nachnamen herstellten, als die Register sie einholten. Slawische und italienische Nachnamen wurden spät und aus produktivem Rohmaterial gebildet — Berufe, Spitznamen, Dörfer, Patronyme — und keine zentrale Autorität standardisierte je die Schreibweisen. Jede Pfarrei brachte ihre eigenen Varianten hervor.

Die Top 10 der Ukraine deckt 5,45 % ab. Das ist nicht einen Rundungsfehler von Vietnams 69,5 % entfernt; es ist eine andere Kategorie von Objekt. Die ukrainische Nachnamenbildung nutzte mindestens vier produktive Suffixfamilien (-enko, -uk/-yuk, -sky, -ych), die sich an nahezu jede Wurzel anhängen ließen, und die schreibklerikale Drift vervielfachte jede Wurzel weiter.

Italien ist der flachste westeuropäische Fall mit 6,9 % Top 10 und 377 Namen, um die Hälfte zu erreichen, und der Grund ist derselbe, den italienische Onomastik-Gelehrte dafür angeben, warum Italien seine Nachnamen überhaupt nicht zählen kann: Eine nationale Standardsprache kam spät, sodass jede Region ihre eigenen lexikalischen Formen versteinerte, und der Übergang vom Mündlichen zum Schriftlichen erzeugte Familien nahezu identischer Namen, die sich um einen einzigen Buchstaben unterscheiden.

4. Gesetzgeberische Neustarts (Türkei)

Die Türkei gehört zu keinem der obigen. Türken hatten keine erblichen Nachnamen, bis das Nachnamengesetz von 1934 jede Familie verpflichtete, innerhalb von zwei Jahren einen zu wählen. Ein ganzes Land wählte gleichzeitig Nachnamen, aus einem lebendigen Wortschatz, mit der Anweisung, türkische Wörter zu bevorzugen.

Das Ergebnis ist eine wahrhaft eigentümliche Kurve: Top 10 11,2 %, flacher als Japan oder Russland, aber mit einer Top 100 von nur 38,4 % — die Masse fließt nach den Anführern schnell ab. Yılmaz („unerschrocken"), Kaya („Fels"), Demir („Eisen"), Çelik („Stahl") führen, weil sie attraktive Wörter waren, nicht weil sie von vielen Menschen ererbt wurden. Dann streut sich der Schwanz über Tausende anderer attraktiver Wörter. Diese Geschichte wird vollständig in Das türkische Nachnamengesetz von 1934 erzählt.

Der eine Vergleich, der uns tatsächlich überraschte

Japan und Dänemark. Japan ist ein ostasiatisches Land mit einer Top 100 von 62,3 %; Dänemark ein skandinavisches mit 77,1 %. Dänemark ist stärker nachnamenkonzentriert als Japan, und es ist nicht knapp.

Das kehrt das übliche mentale Modell um, in dem „asiatisch = wenige Nachnamen, europäisch = viele" gilt. Japans Nachnamensystem ist überhaupt kein Klan-Repertoire. Japanische Bürgerliche mussten erst nach der Meiji-Restauration der 1870er Jahre Nachnamen registrieren, und sie erfanden sie größtenteils aus Landschaftsvokabular — 山本 (yamamoto, „Fuß des Bergs"), 田中 (tanaka, „Mitte des Felds"), 小林 (kobayashi, „kleiner Wald"). Das ist ein produktiver Mechanismus, strukturell viel näher an Italien oder Polen als am benachbarten Korea.

Die eigentliche Variable ist also nicht die Geografie und nicht die Sprachfamilie. Es ist, ob das Nachnamensystem offen oder geschlossen war, als der Staat begann, Namen aufzuschreiben — und Japans war 1875 weit offen. Koreas, dreihundert Kilometer entfernt, war seit tausend Jahren geschlossen. Korea erreicht 50 % mit sechs Nachnamen; Japan braucht 57.

Was das bedeutet, wenn Sie Namensdaten verwenden

Drei praktische Konsequenzen.

Die Korpusgröße misst nicht die Ländergröße. Unsere vietnamesische Nachnamendatei hat 298 Einträge und deckt ~97,5 % Vietnams ab. Unsere ukrainische Datei hat 2.562 Einträge und deckt eine dünne Scheibe eines Repertoires ab, das auf Hunderttausende geschätzt wird. Länder nach Dateigröße zu ordnen, würde unsere eigene Arbeit ordnen, nicht die Länder.

Eine Liste „Top 10 Nachnamen" bedeutet in verschiedenen Ländern Verschiedenes. In Vietnam beschreibt sie den Großteil der Bevölkerung. In der Ukraine beschreibt sie einen von achtzehn Menschen. Dieselbe Schlagzeile trägt einen 13-fachen Unterschied darin, wie viel eines Landes sie tatsächlich ausmacht.

Realistische Fake-Daten müssen zur Kurve passen, nicht nur zur Liste. Ein Generator, der vietnamesische Nachnamen gleichmäßig aus einer Liste von 298 Namen zieht, erzeugt eine Ausgabe, in der Nguyễn 0,34 % der Zeit statt ~30 % erscheint — erkennbar falsch für jeden vietnamesischen Leser, und falsch auf eine Weise, die kein Hinzufügen weiterer Namen behebt. Die Verteilung ist die Daten.

Fazit

Konzentration ist keine Kuriosität der asiatischen Namensgebung. Sie ist der Fingerabdruck davon, wann und wie ein Staat begann, Namen aufzuzeichnen, und sie trennt Länder, die oberflächlich ähnlich aussehen, während sie solche gruppiert, die unverwandt aussehen. Dänemark sitzt bei der Schlagzeilenzahl mit Taiwan und beim Schwanz mit Norwegen. Japan sitzt mit Italien. Die Türkei sitzt allein.

Die Zahl, die am weitesten reist — „die zehn häufigsten Nachnamen decken X % ab" —, ist auch die, die am meisten verbirgt, weil zwei Länder sie teilen und sonst nichts gemeinsam haben können. Wenn Sie nur eine Zahl aus diesem Artikel mitnehmen, nehmen Sie die dritte Spalte: wie viele Namen, um die Hälfte zu erreichen. Vier für Vietnam, Hunderte für die flachen slawischen Korpora. Das ist die echte Streuung.


Methodik und Quellen

Was berechnet wurde. Für jede der 63 Sprachregionen luden wir das Nachnamenkorpus, ordneten die Einträge nach Gewicht und berechneten den kumulativen Anteil bei den Rängen 10 und 100 sowie den Rang, bei dem der kumulative Anteil erstmals 50 %, 80 % und 95 % erreicht. Analyse durchgeführt am 2026-07-18 gegen die Korpusversion share 1.1.7. ⚠ Das Korpus hielt 63 Sprachregionen, als diese Zahlen gemessen wurden; en_IE wurde am 18. Juli 2026 hinzugefügt, und es hält heute 64. Die Aufteilung „61 von 63 sind relativ" unten hat sich ebenfalls verschoben: Mit Stand 22. Juli 2026 tragen 12 der 64 Nachnamenkorpora Register-Trägerzahlen und 52 sind relativ.

Die kritische Einschränkung, klar ausgesprochen. In dem Durchlauf hinter diesem Artikel waren die Häufigkeitsgewichte relativ (ganze Zahlen auf einer Skala von 1–255) für 61 der 63 Sprachregionen. Nur zwei trugen Roh-Trägerzahlen:

SprachregionSkalaBeleg
zh_TWechte ZählungenGewichte summieren sich zu 23.367.536 ≈ Taiwans registrierte Bevölkerung; 陳 = 2.618.994
vi_VNAnteileGewichte summieren sich zu 99.441 (Promille × 1.000), keine Trägerzahlen; max 30.492
alle 61 übrigenrelativ 1–255maximales Gewicht ≤ 255; Summen im niedrigen Tausenderbereich

Das bedeutet:

  • Top-10-Spalten sind kalibriert und prüfbar. Sie wurden während des Korpusbaus an veröffentlichte Registerzahlen angepasst. Zwei Verifikationen halten stand: Unsere Vietnam-Top-10 berechnet sich zu 69,58 % gegen veröffentlichte 69,2 %, und unsere Taiwan-Top-10 zu 52,81 % gegen die 52,79 % des Innenministeriums. Beide Korpora haben eine dokumentierte Abdeckung nahe 100 % (~97,5 % und ~99,6 %), sodass eine korpusinterne Zahl und eine Bevölkerungszahl für sie legitim vergleichbar sind.

Eine dritte scheinbare Verifikation — unsere Ukraine-Top-10 von 5,45 % gegen berichtete 5,45 %hält nicht stand, und ihre Exaktheit ist das Symptom statt der Bestätigung. Ein dünnes Korpus kann keinen korpusinternen Anteil gleich dem Bevölkerungsanteil haben; diese Identität erfordert ~100 % Abdeckung, und das ukrainische Korpus hält 2.207 von rund 707.685 Nachnamen. Siehe den Korrekturhinweis nahe dem Anfang des Artikels. Das ist dieselbe Nennerverwechslung, die in Wie man einen Namenshäufigkeits-Datensatz auditiert dokumentiert ist — die USA veranschaulichen die korrekte Form: Eine Top 10, die 4,90 % der Bevölkerung abdeckt, entspricht rund 11,59 % innerhalb eines Korpus, das 42,29 % der Amerikaner abdeckt.

  • Die 50/80/95-Spalten sind Modellausgabe, keine Registermessungen, für alle Länder außer Taiwan und Vietnam. Sie beschreiben die Verteilung, aus der wir generieren, die geformt wurde, um Register-Kopfzahlen und plausiblem Schwanzverhalten zu entsprechen. Behandeln Sie sie als die erklärte Struktur unseres Korpus. Sie sind intern konsistent und untereinander vergleichbar, weil jede Sprachregion identisch gemessen wurde — aber sie sind kein Ersatz für die Schwanzdaten eines nationalen statistischen Amtes, und wo ein Land eine veröffentlicht, gewinnt diese Zahl.
  • Die Korpustiefe variiert (184 Einträge für Korea, 2.707 für Taiwan). Ein flacheres Korpus erreicht mechanisch 95 % früher. Die 95-%-Spalte ist daher die am wenigsten vergleichbare der drei und sollte nicht allein für eine länderübergreifende Rangordnung verwendet werden.

Für die Validierung verwendete Register-Anker (hier nicht neu abgeleitet — siehe die verlinkten Artikel für vollständige Zitate):

AnkerWertQuelle
Vietnam Top-10-Nachnamen69,2%Lê Trung Hoa, Họ và tên người Việt Nam, 3. Aufl. 2005
Taiwan Top-10-Nachnamen52,79%Innenministerium, 全國姓名統計分析, 2023
Taiwan Top-100-Nachnamen96,62%Innenministerium, derselbe Bericht
Taiwan verschiedene Nachnamen1.785Innenministerium, derselbe Bericht
Ukraine Top-10-Nachnamen5,45%Bestand die Abdeckungsprüfung nicht; Korpus neu aufgebaut, nun 8,42 % — siehe den Hinweis.
Korea Top-10-Nachnamen63,9%KOSTAT 2015 Bevölkerungs- und Wohnungszensus

Beachten Sie die eine Abweichung: Unser koreanisches Korpus berechnet eine Top 10 von 60,6 % gegen KOSTATs 63,9 %, ein Fehlbetrag von 3,3 Punkten.

Die Ursache ist bekannt, und es ist eine Skalenbeschränkung statt eines Datenfehlers. Bis vor Kurzem waren unsere Häufigkeitsgewichte bei 255 gedeckelt. In Korea ist diese Decke katastrophal, weil die reale koreanische Nachnamenverteilung einen Bereich umspannt, den keine 8-Bit-Skala halten kann: 김 (Kim) hat rund 1.527.138 Träger gegen 1 für die seltensten Nachnamen — ein Verhältnis von über einer Million zu eins, komprimiert auf 255:1. Die Komprimierung berührt den Kopf kaum; sie zerstört den Boden. Rund 130 ultraseltene Nachnamen saßen an einem überbewerteten Mindestgewicht festgenagelt und trugen in der Größenordnung von 8 % Phantommasse bei, die niemandem gehört — und diese Phantommasse verdünnt den Top-10-Anteil, weshalb unserer niedrig ausfällt.

Die Decke wurde seither angehoben, und zwölf Nachnamenkorpora — zh_TW und vi_VN darunter — tragen nun echte Registerzählungen. Genau deshalb stimmen diese beiden mit ihren Registern auf zwei Dezimalstellen überein, während Korea es nicht tut: Korea wurde noch nicht neu aufgebaut. Die 3,3-Punkte-Lücke ist der sichtbare Rückstand einer 8-Bit-Skala, die auf eine millionenfache Verteilung trifft.

Die allgemeine Lehre ist es wert, ausgesprochen zu werden, weil sie für jedes gewichtete Korpus gilt: Eine komprimierte Skala verzerrt den Schwanz weit stärker als den Kopf, und der Schaden tritt als Defizit im Anteil des Kopfes zutage. Wenn Ihre Top 10 gegen ein Register niedrig ausfällt, verdächtigen Sie Ihren Boden, bevor Sie Ihre Anführer verdächtigen. Die koreanische Zeile in der Haupttabelle sollte als Skalenartefakt gelesen werden, das auf einen Neuaufbau wartet, nicht als Messung Koreas.

Verwandte Lektüre: Wie viele Nachnamen hat ein Land? behandelt die Repertoiregröße und Zählschwellen; Top 10 Nachnamen nach Land behandelt die führenden Namen selbst.

← Artikel