Warum Adressgeneratoren unplausible Städte erzeugen
Bis zum 18. Juli 2026 wählte unser Adressgenerator ukrainische Städte gleichverteilt. Die ukrainische Sprachregion-Liste enthält 54 Städte, sodass jede — Kyjiw, und auch Kamjanez-Podilskyj — eine Chance von 1 zu 54 hatte, auf einer generierten Karte zu erscheinen. Kyjiw hält etwa 16,4 % der von dieser Liste abgedeckten Bevölkerung. Es wurde in 1,9 % der Fälle gezogen.
An keiner einzelnen Karte sah irgendetwas falsch aus. Jede Stadt war real, korrekt geschrieben, korrekt mit ihrer Oblast und einer gültigen Postleitzahl gepaart. Der Mangel war nur im Aggregat sichtbar, und im Aggregat war er gewaltig.
Was Gleichverteilungsauswahl tatsächlich tut
Die Messung ist einfach. Nimm die Städteliste der Sprachregion, berechne den Anteil der Top-10-Städte am Gesamten unter Gleichverteilungsauswahl (das ist einfach 10/N) und vergleiche ihn mit ihrem Anteil an der tatsächlichen, von der Liste abgedeckten Bevölkerung.
| Region | Städte | Top-10-Anteil, gleichverteilt | Top-10-Anteil, bevölkerungsgewichtet |
|---|---|---|---|
uk_UA | 54 | 18,5 % | 56,5 % |
ja_JP | 60 | 16,7 % | 54,0 % |
de_DE | 57 | 17,5 % | 49,8 % |
Die Gleichverteilungsauswahl untertreibt die Spitze jeder einzelnen dieser Verteilungen um etwa den Faktor drei. Andersherum: unter Gleichverteilungsauswahl landen mehr als 80 % der generierten Adressen außerhalb der zehn Städte, in denen rund die Hälfte der gelisteten Bevölkerung lebt.
Auf der Ebene einer einzelnen Stadt ist die Verzerrung noch größer. In 300 generierten Karten, gezogen aus der ukrainischen Liste:
| Stadt | Bevölkerung | Beobachtet, gleichverteilt | Beobachtet, gewichtet | Gewichtete Erwartung |
|---|---|---|---|---|
| Kyjiw | 2.952.301 | 12 | 46 | 49,1 |
| Charkiw | 1.421.125 | 12 | 31 | 23,6 |
| Odessa | 1.010.537 | 11 | 14 | 16,8 |
Unter Gleichverteilungsauswahl kommt jede der 54 Städte im Schnitt auf 5,6 Ziehungen pro 300 Karten, und Kyjiw bekam pflichtgemäß 12 — nicht weil es die Hauptstadt ist, sondern weil irgendetwas an der Spitze von 54 verrauschten Zellen herauskommen muss, und 12 ist ungefähr, wie die Spitze dieses Haufens aussieht. Nach der Gewichtung bekommt Kyjiw 46 gegen eine Erwartung von 49,1, und alle drei Städte landen innerhalb von 1,6 Standardabweichungen ihrer gewichteten Erwartungen.
Eine Vorsicht, in die wir selbst hineingelaufen sind. Unsere erste Lesart des Gleichverteilungslaufs war, dass 12/12/11 zu hoch sei, um Zufall zu sein — jede Zelle erwartet 5,6 mit einer Standardabweichung von 2,3, sodass 12 wie ein +2,8σ-Ergebnis aussieht, dreimal hintereinander. Diese Argumentation ist falsch, und sie ist auf lehrreiche Weise falsch: 12 ist keine zufällig gewählte Zelle, es ist das Größte von 54, und das Maximum vieler Zellen sitzt konstruktionsbedingt im Randbereich. Simuliert man 200.000 Gleichverteilungsläufe von 300 Ziehungen über 54 Städte, ergibt das ein mittleres Maximum von 11,58, einen Median von 11 und ein 95. Perzentil von 14. Die Wahrscheinlichkeit, dass die obersten drei Zellen mindestens 12, 12 und 11 erreichen, ist 0,060 — ungewöhnlich, aber bei Weitem nicht unmöglich, und genau die Gestalt, die eine Gleichverteilungsziehung erzeugt. Bevor Sie eine beobachtete Zahl unmöglich nennen, prüfen Sie, dass Sie sie mit der richtigen Verteilung vergleichen. Wir verglichen eine Ordnungsstatistik mit der Verteilung einer einzelnen Zelle.
Das bedeutet auch, dass eine 300-Karten-Zählung nicht direkt aus den 18,5 % in der Tabelle oben abgelesen werden kann. Diese 18,5 % sind die Auswahlwahrscheinlichkeit einer festen Menge von zehn Städten; die zehn Städte, die zufällig an der Spitze eines verrauschten Laufs herauskommen, decken immer mehr als das ab — empirisch etwa 30 %. Die zwei Spalten in der vorigen Tabelle sind beide Wahrscheinlichkeiten und miteinander vergleichbar; eine Zählung beobachteter Gewinner ist eine dritte Sache.
Das schwierigere Problem: was ist eine Stadt?
Die Gewichtung nach Bevölkerung erfordert eine Bevölkerung. Das erweist sich als der schwierige Teil, denn „die Bevölkerung einer Stadt" ist nicht eine einzige Größe.
| Stadt | Kleine Definition | Große Definition | Verhältnis |
|---|---|---|---|
| Sydney | ~200.000 (City of Sydney LGA) | 5,3 Mio. (Greater Sydney) | ~26× |
| Chongqing | ~9 Mio. (urbaner Kern) | 32 Mio. (Munizipalität) | ~3,5× |
| Tokio | 9.733.276 (23 Sonderbezirke) | ~14 Mio. (Präfektur Tokio) | ~1,4× |
| Frankfurt | 760.656 (Gemeinde) | ~2,3 Mio. (Rhein-Main) | ~3× |
Sydney ist der Extremfall: das Kommunalgebiet City of Sydney ist ein kleiner zentraler Rat, der einen Bruchteil dessen abdeckt, was irgendjemand mit „Sydney" meint. Chongqings Munizipalität ist eine Verwaltungsregion von der Größe Österreichs, größtenteils ländlich. Und Tokio hat überhaupt keine rechtliche Stadt — die City of Tokyo wurde 1943 abgeschafft. Was existiert, sind 23 Sonderbezirke, jeder eine Gemeinde für sich, innerhalb der Präfektur Tokio. Wir verwenden die 23-Bezirke-Zahl, 9.733.276, weil sie das Nächste an der Einheit ist, die die Leute meinen.
Keine dieser Wahlen ist im Abstrakten korrekt. Was zählt, ist, dass die Wahl innerhalb einer Sprachregion konsistent getroffen wird, denn die Gewichte sind relativ. Eine Metropolzahl für eine Stadt mit einer Gemeindezahl für eine andere zu mischen multipliziert still die Ziehungswahrscheinlichkeit einer Stadt um das Drei- oder Mehrfache gegen ihre Nachbarin — derselbe Mangel, der für Argentinien in Vier Nachnamen, die nicht existieren beschrieben ist, wo municipio- und localidad-Zahlen in einer Spalte sitzen.
Die Sprachregion, die wir ungewichtet ließen
Saudi-Arabiens ar_SA-Liste hat 39 Städte, und sie wird immer noch ohne Bevölkerungsgewichte ausgeliefert.
GASTAT, die saudische Statistikbehörde, veröffentlicht die Bevölkerung nach Gouvernement. Für 25 der 39 Städte lässt sich eine vertretbare Stadtzahl zusammensetzen; für die verbleibenden 14 nicht — die Zahl auf Stadtebene existiert in der veröffentlichten Statistik schlicht nicht. Die Optionen waren, 25 Städte zu gewichten und 14 auf einem willkürlichen Standardwert zu lassen, Gouvernementbevölkerungen für Stadtbevölkerungen einzusetzen (was kleine Städte in großen Gouvernements stark überzeichnen würde) oder die Sprachregion gleichverteilt zu lassen.
Wir ließen sie gleichverteilt. Eine gleichverteilt gezogene saudische Adresse ist eine bekannte, dokumentierte Näherung; eine Liste, in der zwei Drittel der Städte aus einer Art Einheit und ein Drittel aus einer anderen gewichtet sind, ist ein Mangel, der für alle, uns eingeschlossen, unsichtbar wäre. Wo die Quelle die Metrik nicht stützt, ist es die richtige Antwort, sie nicht zu berechnen — ein Argument, das ausführlich in Wie man einen Namenshäufigkeits-Datensatz prüft entwickelt wird.
Von 64 Ortschaftsdateien sind zum Zeitpunkt des Schreibens 44 bevölkerungsgewichtet und 20 bleiben gleichverteilt. Die gleichverteilten 20 sind kein Rückstand, zu dem wir nicht gekommen sind; jede ist ein Fall, in dem die Quelle die Metrik nicht stützt, wobei ar_SA oben das durchgearbeitete Beispiel ist. Sie bleiben gleichverteilt, bis sich die zugrunde liegende Statistik ändert, und die dokumentierte Näherung ist in der Zwischenzeit die richtige Ausgabe.
Das andere Verräterzeichen: Postleitzahlen, die nicht stimmen können
Städtehäufigkeit ist die Verzerrung, die den Leuten am wenigsten auffällt. Postleitzahlen sind die, die ihnen zuerst auffällt, und Irland ist der Ort, an dem naive Generatoren am sichtbarsten versagen.
Ein irischer Eircode besteht aus sieben Zeichen in zwei Teilen:
A65 F4E2
└┬┘ └─┬─┘
│ └── eindeutiger Bezeichner für EINE Immobilie
└─────── Routing-Schlüssel (geografisches Gebiet)
Die ersten drei Zeichen sind ein Routing-Schlüssel, der ein breites Gebiet abdeckt. Die letzten vier identifizieren ein einzelnes Gebäude. Zwei benachbarte Häuser an derselben Straße haben verschiedene Eircodes; so etwas wie „der Eircode für Galway" gibt es nicht.
Ein Generator, der jeder Karte in einer Stadt dieselbe Postleitzahl zuweist, erzeugt etwas, das für Irland keine leicht falsche Adresse ist, sondern eine strukturell unmögliche — und es wird sofort von jedem bemerkt, der dort lebt. Dieselbe Klasse von Problem tritt überall dort auf, wo Postleitzahlen feiner werden als die Siedlung: britische Postcodes reichen an rund 15 Adressen, und niederländische Postleitzahlen plus Hausnummer identifizieren eine einzelne Adresse.
Unsere irische Liste trägt 72 Einträge gegen ein 3-Spalten-Schema, die größte aller Sprachregionen relativ zur Landesgröße, gerade weil Routing-Schlüssel nicht eins-zu-eins auf Städte abbilden.
Was in jedem Adressgenerator zu prüfen ist
- Vergleichen Sie den Top-10-Städteanteil mit dem realen Bevölkerungsanteil. Ist der Generator gleichverteilt, ist die erste Zahl
10/Nund wird ungefähr ein Drittel der zweiten sein. Das ist eine Zeile Arithmetik und die ganze Diagnose. - Fragen Sie, welche Bevölkerungszahl jede Stadt verwendet. Kommunal, städtische Agglomeration, Metropolregion, Verwaltungsregion. Konsistenz innerhalb einer Sprachregion zählt mehr als welche Sie wählen.
- Prüfen Sie, ob das Statistikamt des Landes überhaupt Zahlen auf Stadtebene veröffentlicht. Mehrere tun es nicht. Das ist ein Grund, eine Sprachregion ungewichtet zu lassen, kein Grund zu improvisieren.
- Prüfen Sie die Granularität der Postleitzahl. Identifiziert der Code des Landes ein Gebäude oder ein kleines Cluster, ist ein Code pro Stadt ein sichtbarer Mangel.
- Generieren Sie ein paar hundert Karten und zählen Sie. Nahezu jeder Mangel in diesem Artikel ist auf einer einzelnen Karte unsichtbar und in einer Zählung von 300 offensichtlich.
Der zugrunde liegende Punkt ist, dass Plausibilität in generierten Daten eine verteilungsbezogene Eigenschaft ist. Jede einzelne ukrainische Karte war makellos. Die Menge von ihnen beschrieb ein Land, in dem die Hauptstadt nicht wahrscheinlicher ist als eine Bezirksstadt, und keine noch so genaue Prüfung einzelner Datensätze hätte es je enthüllt.
Daten mit Stand 2026-07-18
Die Städteanteile wurden am 18. Juli 2026 direkt aus den ausgelieferten Ortschaftsdateien berechnet. Gleichverteilungsanteile sind 10/N auf derselben Datei, sodass beide Spalten dieselbe Städteliste beschreiben und sich nur in der Auswahlregel unterscheiden. Die Bevölkerungszahlen sind die in die Ortschaftsdateien eingebetteten; wo eine Zahl eine Grenzwahl erforderte, ist die Wahl im Text angegeben.
Quellen und Anmerkungen:
- Ortschaftsdateien — 64 Sprachregionen, davon 44 mit Bevölkerungsgewichten und 20 gleichverteilt, neu gezählt am 22. Juli 2026. Die drei oben durchgearbeiteten:
uk_UA(54 Städte, 18.033.518 abgedeckte Bevölkerung),de_DE(57 Städte, 23.909.828),ja_JP(60 Städte, 51.046.822). Die abgedeckte Bevölkerung ist die Summe über die gelisteten Städte, nicht die Landesbevölkerung. - Japan — Statistics Bureau. Tokio ist durch die 23 Sonderbezirke repräsentiert, 9.733.276. Die City of Tokyo wurde 1943 abgeschafft und hat keinen rechtlichen Nachfolger als einzelne Gemeinde. <stat.go.jp/english/>
- Deutschland — Destatis / statistische Landesämter. Gemeindebevölkerungen; Frankfurt am Main 760.656. <destatis.de/>
- Ukraine — Derzhstat. Stadtbevölkerungen; Kyjiw 2.952.301. Die Zahlen liegen vor der aktuellen administrativen Störung und werden als Listengewichte verwendet, nicht als aktuelle demografische Schätzungen. <ukrstat.gov.ua/>
- Saudi-Arabien — GASTAT. Veröffentlicht nach Gouvernement; städtische Zahlen auf Stadtebene sind für 14 unserer 39 gelisteten Städte nicht verfügbar, sodass
ar_SAungewichtet bleibt. <stats.gov.sa/> - Irland — Eircode. Sieben-Zeichen-Code: 3-Zeichen-Routing-Schlüssel plus 4-Zeichen-Eindeutigkeitsbezeichner der Immobilie. <eircode.ie/>
- Australien — ABS; City of Sydney LGA gegen Greater Sydney GCCSA. <abs.gov.au/>
Zu den Ziehungszählungen. Die gleichverteilten (12/12/11) und die bevölkerungsgewichteten (46/31/14) Zählungen sind beide aus 300-Karten-Läufen gegen die ausgelieferte 54-Städte-Ukraine-Datei gemessen. Die zu ihrer Deutung verwendeten Extremwert-Zahlen — mittleres Maximum 11,58, Median 11, 95. Perzentil 14 und P(oberste drei ≥ 12, 12, 11) = 0,060 — stammen aus 200.000 simulierten Gleichverteilungsläufen von 300 Ziehungen über 54 gleichwahrscheinliche Städte.