Woher unsere Südkorea-Namensdaten stammen
Südkorea hat einen echten Zensus der Nachnamen, was es in einen kleinen Klub versetzt. Es hat auch ein Schriftsystem-Problem, das die meisten aus diesem Zensus gebauten Datensätze still zerbricht — darunter, eine Zeit lang, auch unseren. Nimmt man die veröffentlichte koreanische Nachnamentabelle für bare Münze, bekommt man den vierthäufigsten Nachnamen des Landes falsch. Nicht ein bisschen falsch: falscher Rang, falsche Zahl, falscher Name.
Diese Seite dokumentiert die von uns verwendete Quelle, wo die Messung endet und die Schätzung beginnt, die Hanja/Hangul-Falle und ihre Verwandten sowie die Obergrenze, an die wir stießen und die wir ehrlich nicht überwinden konnten.
Das verwendete Register
| Feld | Wert |
|---|---|
| Quelle | 인구주택총조사 — Volks- und Wohnungszählung, Nachnamenstatistik |
| Herausgeber | KOSTAT / Statistics Korea (통계청) |
| Stichtag | 1. November 2015 (veröffentlicht 7. September 2016) |
| Portal | https://kostat.go.kr |
| Veröffentlichte Tiefe | 5.582 verschiedene Nachnamen; 36.744 Klane (본관) |
| Grenzwert | Nachnamen mit 5 oder mehr Trägern; seltenere zu 기타 gebündelt |
| Bevölkerungsbasis | ~49,7 Millionen koreanische Staatsangehörige |
Der Zensus von 2015 ist die jüngste vollständige Nachnamenerhebung; für dieses Modul läuft der Zensus in einem 15-Jahres-Zyklus, sodass es Stand 2026 nichts Neueres gibt.
Was wir gemessen und was wir geschätzt haben
Gemessen. Der Kopf. Die Gewichte sind eine Umskalierung der Zensuszählungen gegen 김:
weight = round(255 × share / share(김))
mit 김 = 21,5 %. Die Reihenfolge und die Abstände in den oberen Rängen stammen vom Zensus, nicht von uns.
Geschätzt. Der Schwanz und die Hangul-Aggregation.
Die Hangul-Aggregation ist wichtig, und wir wollen dabei ausdrücklich sein: KOSTATs Kopftabelle ist um hanja-identifizierte Nachnamen herum organisiert. Unser Korpus speichert Hangul. 鄭 und 丁 zu einem einzigen Eintrag 정 zusammenzuführen ist Arithmetik auf veröffentlichten Zahlen, also Messung — aber alles korrekt zusammenzuführen erfordert die Kenntnis der Hanja-Zusammensetzung jeder Hangul-Silbe, und für den Schwanz haben wir sie nicht. Unterhalb von etwa Rang 30 behandeln Sie unsere Hangul-Aggregation als nach bestem Wissen, nicht geprüft.
Gar nicht gemessen: Klane. Dazu unten mehr.
Fallstricke speziell für Südkorea
Hanja vs. Hangul — 정 ist 鄭 und 丁 zugleich
Das ist das zentrale Problem, und alles andere ist ihm nachgelagert.
Ein koreanischer Nachname ist historisch ein Hanja-Zeichen. Moderne Aufzeichnungen, und unser Korpus, speichern Hangul. Die Zuordnung ist nicht eins-zu-eins: eine Hangul-Silbe kann mehrere unverwandte Nachnamen tragen.
| Hangul | Hanja dahinter | Hanja-Tabellenanteil | Hangul-Anteil |
|---|---|---|---|
| 정 | 鄭 + 丁 (+ 程) | 4,33 % (nur 鄭) | 4,84 % |
| 조 | 趙 + 曺 | 2,12 % (nur 趙) | 2,93 % |
| 임 | 林 + 任 | 1,66 % (nur 林) | 2,04 % |
Die Folge ist eine Rang-Inversion, kein Rundungsunterschied. In der veröffentlichten Hanja-Tabelle steht 최 (4,70 %) über 정(鄭) (4,33 %), und 정 sitzt auf Rang 5. In Hangul — was ein koreanisches Formularfeld tatsächlich enthält — ist 정 4,84 % und schlägt 최. Es ist Rang 4.
Dieselbe Verschiebung bewegt die Aggregatzahl: die Top 10 sind 63,9 % nach Hanja und 65,8 % nach Hangul. Die Zahl 63,9 % ist die, die KOSTAT in seine Pressemitteilung setzte und die alle zitieren. Sie ist richtig — und sie ist die falsche Zahl für einen Hangul-Datensatz. Unserer verwendet 65,8 %.
본관 ist kein Nachname — nicht aufsummieren
Die benachbarte Falle. 김해 김씨 — Gimhae Kim — ist ein Klan (본관), eine Ahnensitz-Linie, kein eigener Nachname. Korea hat 36.744 davon; 김해 김 allein sind 4,457 Millionen Menschen (9 % der Bevölkerung), 밀양 박 sind 6,2 %, 전주 이 sind 5,3 %.
Wer eine Klantabelle abgreift und Zeilen als Nachnamen behandelt, erzeugt einen wunderschön detaillierten Datensatz, der etwas beschreibt, das keine Nachnamenverteilung ist. KOSTATs Nachnamentabelle hat bereits über Klane hinweg summiert. Was aufgeteilt werden muss, sind Hanja-Homographen. Was in Ruhe gelassen werden muss, sind Klane. Sie ziehen in entgegengesetzte Richtungen, und beide sehen aus wie „derselbe Name, der zweimal erscheint".
Es gibt eine Datenschutzschwelle — Abwesenheit beweist nichts
Das ist klar zu sagen wert, denn es ist das genaue Gegenteil von Taiwan. Der Zensus von 2015 veröffentlicht Nachnamen, die von fünf oder mehr Personen getragen werden, und bündelt den Rest zu 기타. Ein koreanischer Nachname, der in den Zensusdaten fehlt, könnte also vier Träger haben oder null, und die veröffentlichte Tabelle kann Ihnen nicht sagen, welches von beiden.
Das bedeutet, dass die Löschlogik, die wir auf taiwanische Daten anwandten — nicht im Register, also null Träger, also löschen — für Korea ungültig ist. Anderes Land, andere Offenlegungsregel, gegenteilige Schlussfolgerung aus gleich aussehendem Beweismaterial.
Wie viele Nachnamen hat Korea? Niemand ist sich einig
Ein weit wiederholter Satz sagt, Korea sei von 286 Nachnamen im Jahr 2000 auf 5.582 im Jahr 2015 gegangen — eine zwanzigfache Explosion in fünfzehn Jahren, angetrieben von eingebürgerten Bürgern, die ausländische Nachnamen in Hangul schreiben.
Beide Zahlen sind veröffentlicht und beide sind echt, aber sie zählen nicht dasselbe Objekt, und das Verhältnis zwischen ihnen ist nicht aussagekräftig:
- 286 ist die Zahl der traditionellen, hanja-abgeleiteten koreanischen Nachnamen, erfasst um den Zensus 2000 (neben 4.179 Klanen).
- 5.582 ist jede verschiedene Hangul-Zeichenkette, die 2015 erhoben wurde, 73 % davon ohne jedes entsprechende Hanja — d. h. überwiegend Namen ausländischen Ursprungs.
- KOSTATs eigene Formulierung spricht von „mehr als 4.800 neuen Nachnamen seit 2000", was eine Basislinie von 2000 nahe 780 impliziert, nicht 286.
- Eine separate Lesart desselben Zensus meldet 1.507 Nachnamen und 36.744 Klane.
- Wikipedias Zählung der Daten von 2015, beschränkt auf Namen mit fünf oder mehr Trägern, ergibt 191 verschiedene Hangul-Nachnamen und 514 verschiedene Hanja-Nachnamen.
Die veröffentlichten Zählungen für einen Zensus reichen also von 191 bis 5.582, je nachdem, ob man Hangul-Zeichenketten oder Hanja-Zeichen zählt und ob man die Fünf-Träger-Schwelle anwendet. Wir wissen nicht, wie viele Nachnamen Korea hat — und in einer einzigen Zahl weiß es auch sonst niemand. Klar ist die Richtung: die Einbürgerung fügt rasch reine Hangul-Nachnamen hinzu, und die Konzentration an der Spitze hat sich überhaupt nicht bewegt (63,9 % im Jahr 2015 gegenüber 64,1 % im Jahr 2000).
Unser Korpus enthält 184 Hangul-Nachnamen, was sich eher an jener Zahl von 191 Hangul-Namen mit 5+ Trägern misst als an 5.582.
Die uint8-Obergrenze — warum unsere Top 10 bei 60,6 % stehen bleiben
Das Nützlichste, was wir über den koreanischen Datensatz sagen können, ist, wo er versagt.
Die Gewichte sind 8-Bit: 1 bis 255. Koreas realer Bereich passt nicht hinein. 김 sind 21,5 % der Bevölkerung; der Nachname 다 hat sieben Träger. Das ist ein Verhältnis von etwa 1.527.138 : 1. Die Skala bietet 255 : 1.
Die arithmetische Folge ist direkt. Eine Gewichtseinheit ist ~41.921 Menschen wert, sodass rund 130 ultraseltene Nachnamen auf einem Boden sitzen, der sie um drei Größenordnungen überzeichnet, und dem Nenner etwa 8 % Phantommasse hinzufügt. Der Top-10-Anteil der Datei landet daher bei 60,6 %, wo die Realität 65,8 % beträgt.
Diese Lücke ist kein Kalibrierungsfehler. Sie zu schließen erforderte das Löschen von ~65 echten koreanischen Nachnamen aus dem Korpus — was ein Anpassen der Daten an das Ziel wäre, und das Ziel ist nicht das, worüber wir recht haben wollen. Ein paar Punkte Rückstand in einer so konzentrierten Sprachregion sind die richtige Antwort, kein Mangel.
Top 10
| Rang | Hangul | Hanja | Zensus-Träger | Gewicht | Hangul-Anteil |
|---|---|---|---|---|---|
| 1 | 김 | 金 | 10.689.959 | 255 | 21,50 % |
| 2 | 이 | 李 | 7.306.828 | 174 | 14,67 % |
| 3 | 박 | 朴 | 4.192.074 | 100 | 8,43 % |
| 4 | 정 | 鄭+丁 | ~2.152.000 (鄭) | 57 | 4,84 % |
| 5 | 최 | 崔 | ~2.334.000 | 56 | 4,72 % |
| 6 | 조 | 趙+曺 | ~1.056.000 (趙) | 35 | 2,95 % |
| 7 | 강 | 姜+康 | ~1.177.000 (姜) | 30 | 2,53 % |
| 8 | 장 | 張 | ~993.000 | 24 | 2,02 % |
| 9 | 윤 | 尹 | ~1.021.000 | 24 | 2,02 % |
| 10 | 임 | 林+任 | ~824.000 (林) | 24 | 2,04 % |
⚠ Drei Dinge, die diese Tabelle Ihnen sagt. Erstens sind die Ränge 4 und 5 gegenüber jeder veröffentlichten koreanischen Top-10-Liste vertauscht, und das ist Absicht — siehe den Hanja/Hangul-Abschnitt. Zweitens sind die Trägerzahlen für die Ränge 4–10 die Hanja-Zählungen aus KOSTATs Veröffentlichung, gerundet wie veröffentlicht; für die zusammengeführten Zeilen sind sie daher niedriger, als der Hangul-Anteil nahelegt, weil das zweite Hanja nicht enthalten ist. Drittens tragen die Ränge 8, 9 und 10 alle Gewicht 24 — und so auch 신 auf Rang 11. Bei dieser Auflösung kann die Datei sie nicht unterscheiden. Der veröffentlichte Zensus kann es. Wir können es nicht, auf einer ganzzahligen Skala, die so steil ist.
Bekannte Einschränkungen
- Der Top-10-Anteil ist 60,6 % gegen reale 65,8 %. Strukturell, oben dokumentiert, innerhalb einer 8-Bit-Skala nicht behebbar.
- Der Schwanz ist um bis zu ~1000× überbewertet. ~130 Nachnamen sitzen auf einem Boden im Wert von ~41.921 Menschen.
- Die Ränge 8–11 sind in unserer Datei gleichauf und ungeordnet. Der Zensus ordnet sie; unsere Skala kann es nicht.
- Die Hangul-Aggregation unterhalb von ~Rang 30 ist ungeprüft. Wir führten die Homographen zusammen, die wir dokumentieren konnten. Wir haben nicht jeden einzelnen verifiziert.
- Die Daten stammen von 2015. Das Nachnamenmodul läuft in einem 15-Jahres-Zensuszyklus. Der nächste ist 2030. Einbürgerungsgetriebene Nachnamen — der sich am schnellsten bewegende Teil dieser Verteilung — sind elf Jahre veraltet und untererfasst.
- Keine Klandimension. Unsere Daten können einen Gimhae Kim nicht von einem Gyeongju Kim unterscheiden. Diese Unterscheidung ist gesellschaftlich real und 36.744 Zeilen tief, und wir führen sie nicht.
- Unser Top-10-datei-interner Anteil und der Bevölkerungsanteil sind verschiedene Zahlen mit verschiedenen Nennern. Die eine nicht gegen die andere „korrigieren".
Daten mit Stand 2026-07-17
Zensus-Stichtag: 1. November 2015. Datensatz neukalibriert: 17. Juli 2026 (Top-10-Anteil 53,0 % → 60,6 %). Korpus: 184 Hangul-Nachnamen. Männer- und Frauendateien sind byteweise identisch — koreanische Nachnamen flektieren nicht nach Geschlecht.