Gefälschte ID > Artikel > Serbisch erreicht 0,0000 gegen sich selbst: Vier Arten, wie der länderübergreifende Namensvergleich scheitert

Serbisch erreicht 0,0000 gegen sich selbst: Vier Arten, wie der länderübergreifende Namensvergleich scheitert

Wir halten serbische Namen zweifach — einmal in kyrillischer Schrift (sr_RS), einmal in lateinischer (sr_Latn_RS). Dasselbe Land, dieselbe Sprache, dieselben Namen, dieselben 1.143 Vorname-Einträge und 958 Nachname-Einträge, identische Gewichtssummen. Die eine Datei ist eine Transliteration der anderen.

Gemessene Ähnlichkeit zwischen ihnen:

MetrikWert
Vorname-Jaccard0,0000
Vorname-Kosinus0,0000
Nachname-Jaccard0,0000
Nachname-Kosinus0,0000
Gemeinsame Einträge0

Perfekte Unähnlichkeit zwischen einem Datensatz und einer Kopie seiner selbst. Wenn eine Vergleichsmethode Serbisch nicht als Serbisch erkennen kann, ist nichts anderes, was sie über Griechisch und Koreanisch aussagt, lesenswert.

Wir haben jedes Paar der 63 Sprachregionen berechnet, die der Korpus zum Zeitpunkt des Laufs enthielt — 1.953 Vergleiche —, und dieser Artikel ist der Fehlerkatalog, der dabei herauskam. Die Befunde selbst stehen in Welche Länder teilen sich Namen?; dies ist der Teil darüber, warum der größte Teil der Matrix unbrauchbar ist und wie man erkennt, welcher Teil.

Die vier Fehlermodi, geordnet danach, wie schlimm sie uns getroffen haben:

  1. Unterschiedliche Schriften zerstören die Überschneidung — die halbe Matrix besteht aus Nullen, die nichts bedeuten
  2. Gemeinsame Schriften blähen die Überschneidung auf — Han-Zeichen lassen Japan taiwanisch aussehen
  3. Überschneidung ist gerichtet — ein Vergleich, zwei korrekte und widersprüchliche Antworten
  4. Gewichtsskalen sind nicht kommensurabel — 52 unserer 64 Sprachregionen verwenden noch relative Nachname-Gewichte

Fehler 1: die Schriftbarriere

Von 1.953 Sprachregion-Paaren teilen sich 981 null Vornamen und 1.287 null Nachnamen. Die Hälfte bis zwei Drittel der gesamten Matrix bestehen aus Nullen.

Fast keine davon sind Befunde.

Sieben Sprachregionen in unserem Satz sind der alleinige Bewohner ihres Schriftsystems und teilen sich folglich mit niemandem etwas: Bengalisch, Griechisch, Hebräisch, Armenisch, Georgisch, Koreanisch und Nepalesisch. Jede liefert 0,0 % Überschneidung gegen alle 62 anderen. Wörtlich gelesen, ähneln griechische Namen ukrainischen Namen genau so wenig, wie sie japanischen Namen ähneln — was Unsinn ist, denn die griechische und die ukrainische Namensgebung teilen Jahrhunderte orthodox-christlicher Onomastik und einen großen Bestand derselben Heiligennamen in verschiedenen Alphabeten.

Das Zerstörerische daran ist, dass dieser Fehler still und in seinem Schaden asymmetrisch ist. Er bläht einen Wert nie auf, sondern drückt ihn nur, also sieht er wie Vorsicht aus. Und eine Null ist von einem echten Befund nicht zu unterscheiden, sofern man die beteiligten Schriftsysteme nicht bereits kennt.

Die Konsequenz für die Veröffentlichung ist unmittelbar: Man kann aus einem rohen String-Vergleich keine Rangliste der „entferntesten Paare" veröffentlichen. Wir haben es nicht getan. Die Distanz-Rangliste, die unsere Matrix erzeugt, ist eine Rangliste von Alphabeten, die eine Rangliste von Namenssystemen als Kostüm trägt.

Die Kontrolle, die ihn fängt. Legen Sie ein bekannt-identisches Paar in Ihre Daten und prüfen Sie, dass Ihre Methode es als identisch bewertet. Serbisch in zwei Schriften war unseres, aus Zufall. Ohne es hätten wir angenommen, die Nullen seien bedeutsam, denn jede einzelne Null sah vertretbar aus.

Teillösungen, alle unvollkommen. Unicode-Normalisierung und das Zusammenlegen von Diakritika helfen innerhalb einer Schrift (Müller/Mueller, Yılmaz/Yilmaz). Transliteration in eine gemeinsame Schrift hilft zwischen verwandten Schriften, ist aber verlustbehaftet und nicht umkehrbar: Serbisch Kyrillisch ↔ Lateinisch ist einer der wenigen wirklich bijektiven Fälle, während Griechisch, Arabisch und Han es nicht sind. Phonetische Schlüssel (Soundex, Metaphone) sind auf das Englische zugeschnitten und führen anderswo in die Irre. Wir haben uns entschieden, strikten String-Abgleich durchzuführen und die resultierenden Nullen als unbrauchbar zu kennzeichnen, statt eine Transliterationsschicht laufen zu lassen und still andere, schwerer prüfbare Fehler zu erzeugen.

Fehler 2: gemeinsame Schriften blähen die Überschneidung auf

Das umgekehrte Problem, und das gefährlichere, weil es beeindruckende Zahlen statt leerer erzeugt.

Japans Nachname-Korpus teilt sich 339 Einträge mit dem Taiwans — die 75,4 % der japanischen Nachnamenmasse abdecken. Für bare Münze genommen: Japan und Taiwan haben zu drei Vierteln dieselben Nachnamen.

Haben sie nicht. Hier ist, was diese gemeinsamen Einträge tatsächlich wiegen:

NachnameAnteil an TaiwanAnteil an Japan
佐藤 Satō0,0003 %2,609 %
鈴木 Suzuki0,0002 %2,426 %
高橋 Takahashi0,0002 %1,905 %
田中 Tanaka0,0001 %1,826 %
陳 Chen11,208 %fehlt

佐藤 taucht tatsächlich in Taiwans Register auf. Taiwans Innenministerium veröffentlicht ohne Unterdrückungsschwelle — jeder Nachname mit mindestens einem Träger ist gelistet —, und Taiwan hat Einwohner mit japanischen Nachnamen aus der Kolonialzeit 1895–1945 und aus späterer Einbürgerung. Der Eintrag ist echt. Er ist auch 0,0003 % von Taiwan.

Die 75,4 % sind arithmetisch korrekt und inhaltlich wertlos. Sie besagen: Die meisten Japaner haben einen Nachnamen, den auch mindestens eine Person in Taiwan hat. Das ist eine Aussage über die Größe von Taiwans nicht unterdrücktem langem Schwanz, nicht über die japanische und taiwanische Namensgebung.

Die beiden Schriftsysteme teilen ein Zeicheninventar, das aus dem klassischen Chinesisch ererbt ist. Zwei beliebige Korpora in Han-Schrift überschneiden sich schon allein aus diesem Grund, und einzeichige Nachnamen wie 林 und 王 sind in beiden Sprachen unabhängig voneinander häufig.

Die Prüfung. Wenn eine Überschneidung hoch aussieht, prüfen Sie die Gewichte auf beiden Seiten, nicht die Zahl der gemeinsamen Einträge. Wenn die gemeinsamen Namen auf der einen Seite schwer und auf der anderen nahezu null wiegen, haben Sie einen Schrift-Zufall gefunden.

Fehler 3: Überschneidung ist gerichtet

Ähnlichkeit ist symmetrisch; Überschneidung nicht. Sie zu vermengen ist der häufigste Fehler in der Literatur zum Namensvergleich, und es ist derjenige, der selbstsicher falsche Sätze hervorbringt.

„Welcher Anteil der Namensmasse von A besteht aus Namen, die auch in B existieren" hat zwei Antworten:

PaarA → BB → AGemeinsame Einträge
Japan → Taiwan (Nachnamen)75,4 %8,4 %339
Türkei → Deutschland (Nachnamen)17,1 %2,0 %24
Vietnam → Tschechien (Vornamen)18,1 %0,5 %21
Dänemark → Schweden (Nachnamen)63,2 %18,3 %
Spanien → Portugal (Nachnamen)9,2 %65,9 %
Kanada-fr → Kanada-en86,0 %47,5 %358
Portugal → Brasilien90,3 %73,0 %198

Die Türkei und Deutschland teilen sich 24 Nachnamen. In türkischer Richtung tragen diese 24 17,1 % der Masse, weil sie die größten Namen der Türkei sind — Yılmaz, Kaya, Demir, Çelik, Yıldız, Şahin, Öztürk. In deutscher Richtung tragen dieselben 24 Namen 2,0 %. Beide Zahlen beschreiben dieselbe Realität — türkische Nachnamen gelangten nach dem Anwerbeabkommen von 1961 mit prozentualer Häufigkeit in deutsche Register, ohne etwas zu verdrängen — und jede Zahl allein stellt sie falsch dar.

Spanien und Portugal ist das Paar, bei dem die Richtung die Schlagzeile umkehrt. Die portugiesische Nachnamenmasse ist zu 65,9 % in Spanien vorhanden; die spanische Masse ist zu 9,2 % in Portugal vorhanden. Portugals Repertoire ist klein und konzentriert und größtenteils eine Teilmenge des größeren iberischen Pools; das spanische ist riesig und liegt größtenteils außerhalb des portugiesischen. „Spanien und Portugal sind zu 65,9 % ähnlich" und „Spanien und Portugal sind zu 9,2 % ähnlich" sind beide vertretbare Sätze aus derselben Berechnung.

Die Regel. Geben Sie beide Richtungen an oder geben Sie eine symmetrische Metrik an. Geben Sie niemals eine Richtung so an, als wäre sie die Beziehung.

Fehler 4: Gewichte sind über Sprachregionen hinweg nicht kommensurabel

Unsere Korpora tragen Häufigkeitsgewichte, und es ist verlockend, sie zu vergleichen. Tun Sie es nicht.

Die Prüfung der Nachname-Datei jeder Sprachregion, wie der Korpus am 18. Juli 2026 stand:

SkalentypSprachregionenMax. GewichtGewichtssumme
Echte Trägerzahlen22.618.994 (zh_TW)23.367.536
Relative Ganzzahlen 1–2556120 bis 255~1.000 bis ~19.000

Zu diesem Zeitpunkt trugen nur zh_TW und vi_VN rohe Zählungen. Taiwans Gewichte summieren sich auf 23.367.536 — Taiwans registrierte Bevölkerung — und 陳 wiegt 2.618.994. Jede andere Sprachregion verwendete eine relative Skala, deren Obergrenze variierte: 20 für Indonesien, 24 für belgisches Niederländisch, 40 für Deutschland, Tschechien und Polen, 100 für Großbritannien und Japan, 255 für Spanien, Frankreich, Russland und Schweden.

Zehn weitere Nachname-Korpora wurden seither aus Registern neu aufgebaut. Neu gezählt am 22. Juli 2026, enthält der Korpus 64 Sprachregionen, 12 davon registerabgeleitet und 52 noch auf relativen Skalen — der untenstehende Fehler betrifft also nun 52 Sprachregionen statt 61. Er ist geschrumpft; er ist nicht verschwunden, und er hat eine zweite Schneide bekommen, beschrieben in der Methodikanmerkung am Ende.

Konsequenzen:

  • Rohe Gewichte sind über Sprachregionen hinweg bedeutungslos. Gewicht 40 ist die Spitze der deutschen Skala und unauffällig in der spanischen. Jede sprachregionübergreifende Berechnung muss zuerst normalisieren — wir verwenden L1-Normalisierung, sodass sich jeder Korpus vor jedem Vergleich zu 1 summiert.
  • Normalisierung beseitigt die Skala, aber nicht die Tiefe. Ein Korpus mit einer Obergrenze von 255 kann einen steileren Kopf ausdrücken als einer, der bei 20 gedeckelt ist. Ein Teil des verbleibenden Unterschieds zwischen Sprachregionen nach der Normalisierung ist Kalibrierungstiefe, nicht Namensrealität.
  • Jaccard ist immun, hat aber seine eigene Schieflage. Da mengenbasiert, ignoriert es Gewichte völlig — und bestraft stattdessen die Tiefenasymmetrie. Unsere Korpora reichen von 184 Einträgen (koreanische Nachnamen) bis 3.830 (schwedische Vornamen). Ein tiefer Korpus, gepaart mit einem flachen, erzielt einen niedrigen Wert, weil die Vereinigungsmenge groß ist, unabhängig davon, wie gut sie übereinstimmen.

Die beiden Schieflagen ziehen in entgegengesetzte Richtungen, was der einzige Grund ist, warum es die Mühe wert ist, beide Metriken zu berechnen. Das französischsprachige Cluster erzielt in unserer Matrix so saubere Werte, teils weil, als die Matrix berechnet wurde, alle vier französischen Korpora genau 798 Vorname-Einträge hatten — von Konstruktion her tiefenangeglichen, sodass Jaccard nichts zu bestrafen hatte. (fr_FR wurde seither auf 30.594 Vornamen neu aufgebaut; fr_CA, fr_BE und fr_CH halten weiterhin 798.)

Der eine, der kein Fehler ist

Ein niedriger Wert in unserer Matrix sah genau wie die Schriftbarriere aus und erwies sich als echt.

Russland und die Ukraine teilen sich 16 Nachnamen. Jaccard 0,0041. Gerichtete Überschneidung 0,2 % und 3,8 %. Zwei benachbarte slawische Länder, und sie messen sich als nahezu vollständig unverwandt.

Aber beide schreiben kyrillisch. Die Schriftbarriere gilt nicht, und die Nullen sind keine Nullen — es gibt 16 gemeinsame Namen, also stimmen die Kodierungen überein und der Vergleich ist lebendig. Der Befund überlebt.

Er ist auch strukturell korrekt. Russische Nachnamen sind überwiegend adjektivische Possessive auf -ov/-ev/-in. Ukrainische Nachnamen werden vom patronymischen -enko und der -uk/-yuk-Familie beherrscht, mit -sky und -ych dahinter. Die produktiven Suffixsysteme überschneiden sich kaum, also überschneiden sich die Nachnamenrepertoires kaum. Nach dieser Messung liegen die Ukraine und Russland weiter auseinander als Großbritannien und Indien.

Die Lehre ist die nützliche Umkehrung von Fehler 1: Ein niedriger Wert zwischen Sprachregionen gleicher Schrift ist aufschlussreich auf eine Weise, wie es ein niedriger Wert über Schriften hinweg nie ist. Paare gleicher Schrift sind dort, wo die Methode tatsächlich funktioniert. Es gibt weit weniger davon, als die 1.953 Zellen der Matrix vermuten lassen.

Die Checkliste

Bevor Sie irgendeinem korpusübergreifenden Namensvergleich glauben, einschließlich unseres:

PrüfungWieWie der Fehler aussieht
IdentitätskontrolleEin bekannt-identisches Paar aufnehmen; bestätigen, dass es als identisch bewertet wirdSerbisch ↔ Serbisch bei 0,0000
Schrift-ZensusSprachregionen nach Schriftsystem gruppieren, bevor irgendein Wert gelesen wird7 Isolate, die sich mit niemandem etwas teilen
Null-TriageBei jeder Null fragen: verschiedene Alphabete oder verschiedene Namen?981 von 1.953 Vorname-Paaren
Gewichtsprüfung auf beiden SeitenBei hoher Überschneidung das Gewicht der gemeinsamen Namen in jedem Korpus prüfen佐藤 bei 2,6 % vs. 0,0003 %
Beide RichtungenA→B und B→A berechnen; beide veröffentlichen75,4 % vs. 8,4 %
SkalenprüfungMax. und Summe je Sprachregion ausgeben; herausfinden, welche echte Zählungen sind10 von 63
TiefenprüfungEintragszahlen ausgeben; Paare mit großer Tiefenabweichung markieren184 vs. 3.830 Einträge
Zwei MetrikenMengenbasiert und gewichtsbasiert; untersuchen, wo sie sich widersprechenPortugal–Brasilien: Jaccard 0,294, Kosinus 0,845

Die letzte Zeile hat sich ihren Platz verdient. Portugal und Brasilien erzielen bei der Mengenüberschneidung bescheidene Werte und den dritthöchsten Wert der gesamten Matrix bei der gewichteten Überschneidung — wenige gemeinsame Nachnamenformen, aber die gemeinsamen sind in beiden die dominanten. Das ist eine echte strukturelle Tatsache über eine koloniale Namensbeziehung, und sie ist nur in der Lücke zwischen den beiden Metriken sichtbar. Jede Metrik allein berichtet ein anderes, unvollständiges Land.

Fazit

Der sprachregionübergreifende Namensvergleich ist fragiler als die Prüfung eines einzelnen Korpus, weil sich jeder Fehlermodus verstärkt: eine Schriftabweichung nullt ein Paar, eine Schriftübereinstimmung bläht eines auf, die Richtung verdoppelt die Antworten, und nicht kommensurable Gewichte verderben, was auch immer übrig bleibt.

Die Disziplin, die er verlangt, ist glanzlos. Zählen Sie Ihre Schriften. Triagieren Sie Ihre Nullen. Geben Sie beide Richtungen aus. Prüfen Sie, was Ihre Gewichte tatsächlich sind. Und legen Sie etwas in Ihre Daten, dessen Antwort Sie bereits kennen, damit, wenn die Methode bricht, sie dort bricht, wo Sie hinsehen.

Unsere brach an Serbisch, indem sie eine Datei mit null gegen eine Transliteration ihrer selbst bewertete. Das war die nützlichste Zahl, die die ganze Übung hervorbrachte.


Methodik und Quellen

Was berechnet wurde. Alle 63 Sprachregionen in Korpus-Version share 1.1.7, alle 1.953 ungeordneten Paare. Vorname-Vektoren führen die Männer- und Frauendateien zusammen; Nachname-Vektoren verwenden lastname_male (die Männer- und Frauen-Nachnamendateien sind in den meisten Sprachregionen identisch, sodass das Zusammenführen beider jedes Gewicht verdoppeln würde, ohne ein Verhältnis zu ändern). Je Paar: Jaccard auf Schlüsselmengen, Kosinus auf L1-normalisierten Gewichtsvektoren und gerichtete gewichtete Überschneidung in beide Richtungen. Der Abgleich ist exakte String-Gleichheit auf den rohen Dateiwerten, ohne Normalisierung, Zusammenlegung oder Transliteration. Analyse durchgeführt am 2026-07-18. ⚠ Der Korpus enthielt 63 Sprachregionen, als diese Zahlen gemessen wurden; en_IE wurde am 18. Juli 2026 hinzugefügt, und er enthält heute 64. Die 1.953 Paare sind alle ungeordneten Paare dieser 63; ein erneuter Lauf gegen 64 ergäbe 2.016.

Ergebnisse der Skalenprüfung. Maximalgewicht und Gewichtssumme wurden je Sprachregion berechnet, um den Skalentyp zu klassifizieren:

SprachregionMax. GewichtGewichtssummeKlassifikation
zh_TW2.618.99423.367.536echte Trägerzahlen
en_US2.369.644129.931.469echte Trägerzahlen
es_ES1.446.93734.026.331echte Trägerzahlen
en_GB652.56327.125.558echte Trägerzahlen
fr_FR250.01320.114.307echte Trägerzahlen
da_DK222.3552.984.886echte Trägerzahlen
sv_SE216.4885.594.332echte Trägerzahlen
uk_UA107.8789.752.950Hybrid — siehe unten
no_NO47.8792.854.195echte Trägerzahlen
vi_VN30.49299.441Anteile, keine Zählungen
id_ID202.378relativ
de_DE401.946relativ
(51 weitere)20–255~970–14.500relativ

„Registerabgeleitet" ist keine einheitliche Kategorie, und diese zehn als „Sprachregionen mit echten Daten" zusammenzuzählen überzeichnet ihre Vergleichbarkeit. Drei der obigen Zeilen sind überhaupt keine Trägerzahlen:

  • vi_VN hält Anteile, keine Zählungen. Die Gewichte sind Promille × 1.000, weshalb sie sich auf ~100.000 statt auf Vietnams Bevölkerung summieren. Nguyễn 30.492 bedeutet 30,5 % der Bevölkerung, nicht 30.492 Menschen.
  • uk_UA ist ein Hybrid aus drei verschiedenen Dingen in einer Spalte: ~71 echte Registerzählungen am Kopf, 28 Einträge, die auf einem glatten Wert von 20.000 festgesetzt sind (ein veröffentlichtes „≥20.000"-Band, keine Messung), und 2.123 Einträge, die auf einem ehrlichen Bodenwert von 1.000 sitzen. Zwei Drittel der Datei sind ein Platzhalter, der dieselben Einheiten wie der Kopf trägt.
  • en_IE wurde nach diesem Analyselauf aus echten Zählungen neu aufgebaut und fehlt aus diesem Grund in der Tabelle.

Der Korpus enthält heute also 64 Sprachregionen, 12 registerabgeleitet und 52 relativ (neu gezählt am 22. Juli 2026) — aber nicht alle zwölf sind unkomplizierte Trägerzahlen. Das Kommensurabilitätsproblem, das dieser Abschnitt beschreibt, ist kleiner als es war und nicht verschwunden; es hat sich teilweise in ein subtileres Problem verwandelt, bei dem zwei Sprachregionen echt aussehende große Ganzzahlen tragen, die Verschiedenes bedeuten.

Tiefenspanne des Korpus. Nachnamen: 184 (ko_KR) bis 2.707 (zh_TW). Vornamen: 484 (vi_VN) bis 3.830 (sv_SE).

Zählungen der Null-Überschneidungen. Vornamen: 981 von 1.953 Paaren (50,2 %). Nachnamen: 1.287 von 1.953 (65,9 %). Schrift-Isolate im Satz (alleiniger Bewohner ihres Schriftsystems, daher null Überschneidung mit allen 62 anderen): bn_BD, el_GR, he_IL, hy_AM, ka_GE, ko_KR, ne_NP.

Identitätskontrolle. sr_RS und sr_Latn_RS halten übereinstimmende Eintragszahlen (1.143 Vornamen, 958 Nachnamen) und übereinstimmende Gewichtssummen, konsistent damit, dass die eine eine Transliteration der anderen ist. Die gemessene Ähnlichkeit zwischen ihnen beträgt 0,0000 bei allen vier Metriken mit 0 gemeinsamen Einträgen.

Was dieser Artikel nicht tut. Er schlägt keine Lösung per Transliteration oder phonetischem Abgleich vor. Jede solche Schicht, die wir erwogen haben, führt ihre eigene Fehlerklasse ein — verlustbehaftet bei nicht-bijektiven Schriften, auf das Englische zugeschnitten bei phonetischen Schlüsseln — und würde die hier dokumentierten sichtbaren Fehler durch schwerer prüfbare ersetzen. Strikter Abgleich mit gekennzeichneten Fehlern war die bewusste Wahl. Wer einen schriftübergreifenden Vergleich baut, sollte dies als Beschreibung des Problems behandeln, nicht als dessen Lösung.

Weiterführende Lektüre: Welche Länder teilen sich Namen? berichtet die Befunde, die diese Methode erzeugt hat, und nennt diese Einschränkungen daneben; Wie man einen Namenshäufigkeits-Datensatz prüft behandelt die Prüfung eines einzelnen Korpus, einschließlich der oben erwähnten Themen der 255er-Obergrenze und der behaupteten Abdeckung; Sieben Arten, wie Namensdaten Sie belügen (Begleitartikel, noch nicht veröffentlicht) behandelt inhaltliche statt methodischer Fallstricke.

← Artikel