Wie man einen Datensatz von Namenshäufigkeiten prüft
Jeder gewichtete Namensdatensatz erhebt einen Anspruch über ein Land, ob seine Autoren sich dessen bewusst sind oder nicht. Irgendwo in der Datei ist ein Nachname der häufigste und einer der seltenste, und das Verhältnis zwischen ihren Gewichten behauptet etwas darüber, wie diese Bevölkerung tatsächlich geformt ist.
Der schwierige Teil beim Prüfen einer solchen Datei ist nicht, Fehler zu finden. Es ist, den Unterschied zu erkennen zwischen „diese Daten sind kaputt" und „dieses Land ist tatsächlich so." Von innerhalb der Datei sehen die beiden identisch aus. Norwegens zehn häufigste Nachnamen decken 6,0 % der Bevölkerung ab; Vietnams etwa 71 %. Eine flache Kurve ist an einem Ort eine Tatsache und am anderen ein Defekt, und noch so langes Starren auf die Gewichte wird Ihnen nicht sagen, welche von beiden Sie in Händen halten.
Was folgt, ist die Sammlung von Werkzeugen, die wir bauten, während wir am 17. Juli 2026 Namenskorpora für 63 Sprachregionen gegen nationale Register prüften. Zwei davon sind Arithmetik und beantworten die Frage direkt. Der Großteil der übrigen handelt davon, was sie nicht beantwortet — denn die intuitiven Signale, jene, nach denen jeder zuerst greift, sind allesamt falsch, und jedes kostete uns echte Arbeit, bevor wir es bemerkten.
Der Aufbau
Nehmen Sie einen Datensatz von Wert → ganzzahliges Gewicht an, wobei das Gewicht aus einer echten Häufigkeitsquelle zugewiesen wird durch
w = round(255 × c / c_top1) // auf ein Minimum von 1 begrenzt
c ist die Trägerzahl des Eintrags, c_top1 die Zählung des häufigsten Eintrags, und 255 ist die Skalenobergrenze (ein vorzeichenloses Byte). Setzen Sie Ihre eigenen Konstanten ein — die Algebra überlebt es. Was zählt, ist, dass das Gewicht ein Verhältnis zum obersten Eintrag ist und dass es einen Boden gibt, unter den die Skala nicht gehen kann. Dieser Boden ist der Ort, an dem nahezu jeder Defekt in diesem Artikel wohnt.
Werkzeug 1: beanspruchte Abdeckung
Gewicht 1 ist keine vage Bezeichnung, die „selten" bedeutet. Es ist ein quantitativer Anspruch. Wenn das Gewicht des obersten Eintrags seinem echten Bevölkerungsanteil entspricht, ist eine Gewichtseinheit genau share_top1 / max_weight dieser Bevölkerung wert — also gibt die Datei, indem sie ihre eigenen Gewichte summiert, an, wie viel des Landes sie zu beschreiben glaubt:
beanspruchte Abdeckung = Σ(Gewichte) × real_share_of_top1 / max_weight
Vergleichen Sie das mit der echten Abdeckung des Korpus — den summierten echten Anteilen der tatsächlich vorhandenen Einträge. Dies ist das einzige Diagnosemittel hier, das durch Arithmetik allein falsifizierbar ist: eine Datei kann nicht 114 % eines Landes beschreiben.
| Datensatz | Beanspruchte Abdeckung | Echte Abdeckung | Verhältnis | Was es bedeutete |
|---|---|---|---|---|
zh_CN (vorher) | 114 % Chinas | ~91 % | — | Schwanz objektiv überzeichnet. Arithmetisch unmöglich |
es_ES (vorher) | 200 % Spaniens | — | — | Schwanz doppelt überzeichnet; 53 % der Einträge leichter als Gewicht 1 |
fr_FR (vorher) | 54,2 % | 25,6 % | 2,11× | Um mehr als das Doppelte überhöht |
fr_FR (nachher) | — | — | 1,001× | Korrigiert |
no_NO | 29,2 % | 30,1 % | 0,97× | Gesund — nie angerührt |
lv_LV | 27,03 % | ~27,3 % | ~0,99× | Gesund trotz 57 % der Einträge bei Gewicht 1 |
sv_SE Nachnamen | 57,29 % | 53,17 % | 1,077× | Gesund |
zh_TW (nachher) | 109,8 % | 99,61 % | 1,10× | Gesund für eine konzentrierte Sprachregion |
⚠ Die zh_TW-Zeile ist eine Messung des 8-Bit-Builds und beschreibt die ausgelieferte Datei nicht mehr. Am 18. Juli 2026 wechselte diese Sprachregion zu wortgetreuen Registerzählungen: 2.707 Nachnamen, beanspruchte Abdeckung 99,98 %, Verhältnis 1,00×. Der gesamte Effekt der „Phantom-Bodenmasse" weiter unten ist eine Eigenschaft relativer Skalen, gilt also nicht für ein Korpus, das echte Zählungen speichert — das Verhältnis ist dort konstruktionsbedingt 1,00×, und ein Wert über 1,0 wäre ein echter Defekt statt eines normalen Überhangs. Lesen Sie diesen Abschnitt als die Methode zum Prüfen obergrenzenskalierter Korpora, was immer noch 52 von unseren 64 Nachnamendateien und 56 von 64 auf der Vornamen-Seite sind.
Das gesunde Band liegt bei etwa 1,0–1,1×. Zwei Dinge sind daran zu verstehen.
Über 100 % zu liegen ist nicht automatisch ein Defekt. Einträge, deren echter Anteil unter den Wert einer Gewichtseinheit fällt, wiegen dennoch 1 — die Skala hat keine kleinere Zahl. Dieser Überschuss ist Phantom-Bodenmasse, und bei einer konzentrierten Sprachregion fügt er legitim ein paar Prozent hinzu: nach Korrektur sitzt zh_CN bei 100,7 %, vi_VN bei 103,2 %, ko_KR bei 108,4 %, zh_TW bei 109,8 %. Rund 110 % bei einer konzentrierten Datei sind normal. 114 % unter einer Skalenobergrenze von 100 waren es nicht — das war der Schwanz, der ein Land beanspruchte, das nicht existiert.
Es ist ein Test, keine Plausibilitätsprüfung. Führen Sie ihn als Reductio aus, und er produziert Absurditäten auf Abruf. Schwedens gesamtes Nachnamenregister — alle 411.798 Einträge — würde eine Datei ergeben, die 3.360 %: fünfunddreißig Schweden beansprucht. Taiwans vollständiges Register mit 2.730 Einträgen würde 212 %: zwei Taiwans beanspruchen. Vietnams vollständige Top-300 würde 125,4 % beanspruchen. Das sind keine „verdächtigen" Zahlen; es sind unmögliche, und Unmöglichkeit ist genau das, was Sie von einem Prüfwerkzeug wollen.
Fallstrick: Positionen gegen Träger
In Ländern, in denen eine Person zwei Nachnamen trägt, summieren sich die Anteile aller Nachnamen auf ~200 %, nicht 100 %. Füttern Sie die Formel mit einem Träger-Anteil, und sie schreit über einen Defekt, den es gar nicht gibt.
pt_PT mit Silva bei 9,44 % der Träger ergibt eine beanspruchte Abdeckung von 145,4 % — ein Alarm. Mit demselben Nachnamen bei 4,72 % der Positionen ergibt es 72,7 %, völlig plausibel für ein Korpus mit 411 Nachnamen. Dieselbe Datei, dieselbe Formel, entgegengesetzte Urteile. Spanische Sprachregionen tragen dieselbe Gefahr, obwohl das Register dort die Spalten für ersten Nachnamen, zweiten Nachnamen und beide Nachnamen getrennt veröffentlicht: GARCÍA ist 1.446.937 als erster Nachname und 2.915.761 über beide Positionen.
Fallstrick: beanspruchte Abdeckung wählt nicht Ihre Tiefe
Bei einer hyperkonzentrierten Sprachregion entscheidet die beanspruchte Abdeckung die Tiefenfrage geradewegs: Vietnams Top-300 erreicht 125,4 % und ist damit ausgeschlossen. Daher ist es verlockend, sie überall als Tiefenkriterium zu verwenden.
Bei einer flachen Sprachregion funktioniert das nicht, aus einem arithmetischen Grund: ein ehrlicher Eintrag ist verhältnisneutral. Er fügt der beanspruchten Seite w × share_top1 / max_weight hinzu und der echten Seite c / POP — dieselbe Zahl — und verschiebt das Verhältnis daher nur durch Rundung nahe dem Boden. Für schwedische Nachnamen hielt sich das Verhältnis bei 1,055× auf 1.150 Einträgen und 1,051× auf 1.261, und brach erst bei Top-3000 (1,139×). Es beantwortet schlicht nicht „welche Tiefe ist besser."
Beanspruchte Abdeckung ist eine Obergrenze, kein Ziel. Für die Tiefe brauchen Sie ein anderes Werkzeug.
Werkzeug 2: die Tiefenschwelle — durch 510 teilen, nicht durch 255
Wie tief sollte ein Korpus gehen? Nicht „so tief, wie wir Daten haben," und definitiv nicht nach Augenmaß. Berechnen Sie den Rang, an dem Gewicht 1 aufhört, ehrlich zu sein:
threshold = count_of_top1 / 510 ← nicht /255
Das /510 ist der ganze Punkt und der Fehler, den wir zuerst machten. Da w = round(255 × c / c_top1), greift die Begrenzung dort, wo round() eine 0 zurückgibt — wo 255 × c / c_top1 < 0.5, also c < c_top1 / 510. Die /255-Formel liefert stattdessen den Punkt, an dem das ehrliche Gewicht gleich 1,0 ist, was nicht der Punkt ist, an dem es verschwindet. Sie beschneidet das Korpus doppelt zu früh; in Spanien hätte uns dieser Fehler 320 echte Nachnamen gekostet.
Jeder Eintrag unter der Schwelle wird durch die Begrenzung überhöht. Was darunter liegt, ist keine Kurve; es ist ein erfundener Boden.
| Datensatz | Eine Gewichtseinheit ist wert | Schwelle | Verhalten an der Grenze |
|---|---|---|---|
vi_VN | 0,0598 % der Bevölkerung | Rang 66 | Lường bei 0,061 % — der letzte ehrliche Eintrag |
sv_SE Nachnamen | 424,5 Träger | Rang 2130 | Snygg 425; als Nächstes Abdulkadir 424 → ehrliches Gewicht genau 0,50 |
es_ES | 5.717,2 Positionen | Rang 1743 | Victoria 5.720; als Nächstes Fabregas 5.714 → genau 0,500 |
sv_SE Namen ♂ | 160,3 Träger | Rang 2008 | WASSIM 161 → 0,502; als Nächstes BASIL 160 → 0,499 |
sv_SE Namen ♀ | 189,1 Träger | Rang 1850 | WINNIE 190 → 0,502; als Nächstes AIKATERINI 189 → 0,500 |
Fünfmal landete die Grenze genau auf der Rundungsstufe — ein bemerkenswerter Zufall, es sei denn, die Regel rechnet, statt zu raten.
Der stärkere Beleg ist die Streuung. Ein Kriterium lieferte Rang 66 für Vietnam und Rang 2.130 für Schweden. Eine Regel, die überall ähnliche Tiefen produziert, wäre verdächtig; eine Regel, die einen 32-fachen Unterschied zwischen einem hyperkonzentrierten Land (Nguyễn ≈ 31 %) und einem flachen (Andersson 2,06 %) liefert, verfolgt etwas Echtes. Eine Regel, verschiedene Antworten.
Was nichts beweist
Das ist der Abschnitt, der am meisten zählt, denn jedes Signal unten ist intuitiv, weit verbreitet und für sich allein wertlos.
„Ein riesiger Anteil der Einträge sitzt beim Mindestgewicht"
Das verführerischste. Es sieht genau wie ein gestauchter Schwanz aus, und manchmal ist es das auch. Aber uk_UA hat 80 % seines Korpus bei Gewicht 1, während sein Top-10-Anteil völlig normal ist — 29,4 %, innerhalb des 20–35-%-Bandes. Lettische Nachnamen haben 57 % bei Gewicht 1, und die Abdeckungsformel gibt die Datei bei ~0,99× frei.
Masse am Boden ist eine Tatsache über die Gewichtskurve, nicht über die Zusammensetzung der Liste. Unser eigenes Backlog verlangte einst, „~1.900 künstliche ukrainische Nachnamen" zu bereinigen, eine Zahl, abgeleitet aus „1.902 Einträgen bei Gewicht 2." Eine Zufallsstichprobe von 25 fand null künstliche Einträge; die nachweislich künstliche Zahl in der ganzen Datei lag bei etwa 2 bis 10, von 2.209. Raten Sie nicht — berechnen Sie die beanspruchte Abdeckung.
„Der Kopf klebt an der Skalenobergrenze"
Ebenfalls verführerisch, ebenfalls allein wertlos. no_NO hatte unter der alten Obergrenze von 100 ein Spitzengewicht von genau 100 — und war korrekt: Top-10 bei 19,87 % gegen ein ehrliches Ziel von 20,03 %, beanspruchte/echte Abdeckung 0,97×. Norwegens natürliches Verhältnis von Kopf zu Boden ist 87:1, was mit Spielraum unter 100 passt. Die Spitze saß durch Zufall an der Obergrenze, nicht durch Stauchung.
lv_LV macht denselben Punkt spiegelbildlich mit einer Spitze von 40, die ebenfalls nichts beweist: Lettland ist schlicht flach, sein häufigster Nachname deckt 0,60 % der Bevölkerung ab. Eine Spitze von 40 ist genauso richtig, wie eine Spitze von 100 in Norwegen richtig ist.
Was diagnostisch ist, ist die Konjunktion: eine Spitze an der Obergrenze und mehr als 25 % des Korpus bei Gewicht 1. Dieses Paar identifizierte 52 Datensätze, denen echt die Skala ausgegangen war. Jede Hälfte allein identifizierte nichts.
Zirkuläre Verifikation
Der schwerste Fallstrick in diesem Artikel, und wir tappten an einem einzigen Tag zweimal unabhängig hinein. Die Versuchung ist unwiderstehlich: unsere Zahl stimmte mit einer unabhängigen Quelle überein, also haben wir sie nicht angepasst. Bevor Sie das akzeptieren, prüfen Sie, ob die Quelle unabhängig ist.
Unsere ungarischen Ethnonym-Nachnamen machen 8,20 % des Gewichts der Datei aus. Die akademische Schätzung — Farkas — beziffert den Ethnonym-Bestand auf „7–8 %." Das liest sich wie eine lehrbuchmäßige externe Validierung. Es ist nichts dergleichen. Unsere Gewichte wurden auf Registeranteile kalibriert (Tóth bei 2,192 % gegen die 2,19 % des Registers), und Farkas zieht seine Zahlen aus demselben Register. Ein Datensatz, zweimal gezählt, nicht zwei Messungen.
Eine zweite Spielart: die Prüfung „Top-10-Anteil × beanspruchte Abdeckung = Bevölkerungsanteil." Bei spanischen Daten konvergiert sie auf 0,00 Prozentpunkte genau. Sie ist auch, für den Kopf der Verteilung, nahezu eine Tautologie — alles, was sie zeigt, ist, dass der Rundungsfehler vernachlässigbar ist. Der substanzielle Vergleich in jener Datei war beanspruchte Abdeckung (73,2 %) gegen echte (67,55 %), und der zeigte ein Problem.
Die Regel: Wenn Ihre Gewichte aus Quelle X kalibriert wurden, dann ist jeder Vergleich gegen X — oder gegen ein Paper, das X zitiert — eine Konsistenzprüfung, keine Bestätigung. Konsistenzprüfungen sind nützlich; sie fangen arithmetische Ausrutscher. Nennen Sie sie nur, was sie sind.
Wie eine echte unabhängige Prüfung aussieht. Vietnam hat kein staatliches Nachnamenregister, aber es hat zwei große Stichproben mit entgegengesetzten regionalen Verzerrungen: VNTH01 (n = 1.682.729, nordgewichtet 63:37) und SG01 (n = 241.000, Hồ-Chí-Minh-Stadt). Sie konvergieren bei Nguyễn ≈ 31 % — 30,5 % beziehungsweise 31,5 %. Eine dritte, peer-reviewte Stichprobe (Nguyen Viet Khoa, Genealogy 8(1):16, 2024, n = 883.835) landet bei 31,57 % und bestätigt unabhängig die Richtung der nördlichen Schieflage von VNTH01. Andere Methodik, andere Bevölkerungen, in entgegengesetzte Richtungen zeigende Verzerrungen, dieselbe Antwort. Das ist Bestätigung — und sie zertrümmerte die Zahl, die jeder zitiert, denn Nguyễn = 38 % geht auf eine einzige Stichprobe von 1992 zurück, überall wiederholt, nicht weil sie gut ist, sondern weil sie die einzige veröffentlichte war.
Die andere Gestalt einer echten Prüfung ist eine Vorhersage, die hätte fehlschlagen können. Unser isländisches Korpus wurde von Menschen gebaut, die glaubten, ~10 % der Isländer trügen einen vererbten Familiennamen statt eines Patronyms; sie erwarteten, dass die Datei um die Hälfte zu wenig liefern würde. Die Datei misst 4,15 % (97 von 2.335), und das nationale Statistikamt misst 4 %. Die Übereinstimmung ist gerade deshalb echt, weil die Ersteller ihr Fehlschlagen erwarteten.
Der Defekt, den nur zwei Metriken zusammen sehen können
Vor der Korrektur überschritt unsere schwedische männliche Vornamendatei ihr ehrliches Top-10-Ziel — 22,02 % gegen 18,31 % — und unterbeanspruchte zugleich die Abdeckung bei 0,874×.
Lesen Sie eine der Metriken allein, und Sie schließen, die Datei sei in Ordnung, oder schlimmstenfalls, dass die Spitze ein wenig niedrig ist. Lesen Sie sie zusammen, und die Diagnose ist eindeutig: das ist kein Skalenproblem, es ist ein Kopf, der getrennt von der Mitte gebaut wurde. Die Top 10 waren zu spitz, und die Ränge 11–317 waren zu leicht. Nichts außer dem Paar von Metriken enthüllt es.
Das Ziel bewegt sich
Das letzte Werkzeug, und dasjenige, das am häufigsten dazu führt, dass eine korrekte Korrektur rückgängig gemacht wird.
Nachdem wir das schwedische Nachnamenkorpus von 1.150 auf 2.445 Einträge vertieft hatten, fiel sein Top-10-Anteil von 28,83 % auf 21,62 % — dem Anschein nach eine katastrophale Regression. Ist sie nicht. Das ehrliche Ziel ist real_top10 / real_coverage, und die Abdeckung ging von 40,73 % auf 53,17 %, also bewegte sich das Ziel selbst von 30,40 % auf 23,28 %:
| Metrik | Vorher | Nachher |
|---|---|---|
| Einträge | 1.150 | 2.445 |
| Top-10 in Datei | 28,83 % | 21,62 % |
| Ehrliches Ziel | 30,40 % | 23,28 % |
| Fehlbetrag | 1,57 pp | 1,66 pp |
| Echte Abdeckung | 40,73 % | 53,17 % |
| Beansprucht / echt | 1,055× | 1,077× |
| Fehlend aus Top-300 | 44 | 0 |
Der Fehlbetrag ist bei beiden Tiefen identisch. Tiefe kostete nichts an Genauigkeit und kaufte +12,4 Punkte echter Abdeckung. Der Fall des Top-10-Anteils ist Nenner-Mechanik, keine Regression — der Schwanz fügt dem Nenner Masse hinzu. Derselbe Effekt, Gewichte durchgängig unangetastet: italienische Nachnamen 556 → 1.340 Einträge bewegten die Top 10 von 12,2 % auf 6,9 %; russische 701 → 1.303 bewegten 10,08 % → 6,36 %; polnische 689 → 1.272 bewegten 9,50 % → 6,43 %.
Der verwandte Fehler ist, einen Anteil innerhalb der Datei mit einem Anteil in der Bevölkerung zu vergleichen. Die zehn häufigsten US-Nachnamen decken 4,90 % der Amerikaner ab; unser Korpus mit 1.864 Nachnamen deckt 42,29 % der Amerikaner ab; innerhalb dieser Datei messen die Top 10 daher 4.90 / 42.29 = 11,59 %, und das ist korrekt. Dieselbe Realität, verschiedene Nenner. „Reparieren" Sie es nicht.
Und manche Fehlbeträge sollten niemals geschlossen werden. Koreanische Nachnamen reichen von 김 bei 21,5 % der Bevölkerung hinunter bis zu 다 mit 7 Trägern — 1.527.138:1 gegen eine Skala, die 255:1 bietet. Eine Gewichtseinheit ist dort 41.921 Menschen wert, also sitzen ~130 ultraseltene Nachnamen auf einem um drei Größenordnungen überhöhten Boden und fügen dem Nenner ~8 % Phantommasse hinzu. Die Datei erreicht als Maximum 60,6 % gegen echte 65,8 %, und diese Lücke zu schließen würde bedeuten, 65 echte Nachnamen zu löschen. Ein Fehlbetrag von ein paar Punkten bei einer solchen Sprachregion ist die korrekte Antwort, kein Defekt.
Die Checkliste
- Berechnen Sie die beanspruchte Abdeckung, bevor Sie sich eine Meinung bilden.
Σ(w) × share_top1 / max_weight. Über ~110 % bei einer konzentrierten Sprachregion oder ~100 % bei einer flachen ist der Schwanz überzeichnet — objektiv, nicht strittig. - Prüfen Sie zuerst Ihre Einheit. Positionen gegen Träger, Geburten gegen lebende Träger, ein Schriftsystem gegen ein anderes. Die falsche Einheit fabriziert Defekte und verbirgt echte.
- Berechnen Sie die Tiefenschwelle als
count_of_top1 / 510. Nicht/255. Verifizieren Sie, dass die Grenze auf der Rundungsstufe landet; tut sie es nicht, sind Ihre Quelle und Ihr Divisor uneins. - Verwenden Sie die beanspruchte Abdeckung als Obergrenze, nicht als Ziel. Sie wählt bei einer flachen Sprachregion nicht Ihre Tiefe — ehrliche Einträge sind verhältnisneutral.
- Schließen Sie nie aus der Bodenmasse allein. 80 % bei Gewicht 1 sind mit einer vollkommen gesunden Datei vereinbar.
- Schließen Sie nie aus einer Spitze an der Obergrenze allein. Verlangen Sie die Konjunktion: Spitze an der Obergrenze und >25 % am Boden.
- Lesen Sie zwei Metriken zusammen. Eine Datei über ihrem Ziel und mit unterbeanspruchter Abdeckung hat einen von seiner Mitte losgelösten Kopf — unsichtbar für jede allein.
- Hinterfragen Sie jede Übereinstimmung. Wenn die Gewichte aus X kamen, ist Übereinstimmung mit X Konsistenz, keine Bestätigung. Fragen Sie, welches Ergebnis die Prüfung falsifiziert hätte.
- Berechnen Sie das Ziel nach einer Tiefenänderung neu. Ein fallender Top-10-Anteil nach dem Vertiefen ist Arithmetik, keine Regression.
- Akzeptieren Sie Fehlbeträge, die die Skala auferlegt. Ein Ziel durch Löschen echter Einträge zu erreichen ist Anpassen — genau das, wonach Sie geprüft haben.
Daten mit Stand 2026-07-17
Alle Zahlen wurden am 17. Juli 2026 gemessen, während gewichtete Namenskorpora für 63 Sprachregionen gegen nationale Register gebaut und geprüft wurden. ⚠ Das Korpus hielt 63 Sprachregionen, als diese Zahlen gemessen wurden; en_IE wurde am 18. Juli 2026 hinzugefügt, und heute hält es 64. Anteile beschreiben die Bevölkerung, sofern der Text nicht „in Datei" oder „Positionen" sagt; wo Zahlen aus einer Stichprobe statt aus einem Register stammen, sagt der Text es. Die ungarischen, spanischen und isländischen Beispiele sind so berichtet, wie wir sie vorfanden, einschließlich der Fälle, in denen unsere eigene Argumentation falsch war.
Quellen:
- Taiwan, Ministry of the Interior — Nachnamen-Rangfolgen und -Zählungen, 30. Juni 2023: data.gov.tw/dataset/126774
- Spanien, INE — Nachnamen mit ≥20 Trägern, Zensus vom 1. Januar 2025: ine.es/dyngs/INEbase/operacio…?…
- Frankreich, INSEE — Fichier des noms de famille, Geburten 1891–2000: insee.fr/fr/statistiques/353663…
- Schweden, SCB — Nachnamen (411.798 Einträge, 96,1 % der Bevölkerung) und tilltalsnamn-Vornamen, 31. Dezember 2022: scb.se
- Norwegen, SSB — Nachnamenstatistik, StatBank-Tabelle 12891: ssb.no/statbank/table/12891
- Dänemark, Danmarks Statistik — Namensstatistik: dst.dk/da/Statistik/emner/bor…
- Lettland, CSP — Zensus 2021, Nachnamen von 1.893.223 ständigen Einwohnern: stat.gov.lv
- Südkorea, KOSTAT — Bevölkerungs- und Wohnungszensus 2015, Nachnamenstatistik: kostat.go.kr
- China, Ministry of Public Security — Top-100-Nachnamentabelle 2007
- Vietnam — hoten.org-Häufigkeitsdatensätze VNTH01 (n = 1.682.729) und SG01 (n = 241.000), CC BY 4.0 wie im Seitentext erklärt; Nguyen Viet Khoa, „Vietnamese Family Names", Genealogy 8(1):16 (2024): doi.org/10.3390/genealogy80100…
- Island, Hagstofa Íslands — Nachnamen und Patronyme, 1. Januar 2017: hagstofa.is