Welchen Anteil eines Landes sollten sechzig Städte halten? Über die Wahl einer Schwelle, die Sie verteidigen können
Die billigste Datenprüfung, die wir durchführen, ist eine einzige Zeile Arithmetik: Man addiert die Einwohnerzahlen der Städte in einer Ortsdatei, teilt durch die Bevölkerung des Landes und betrachtet das Verhältnis. Sie fing einmal eine taiwanische Liste ab, die sich auf 106,9 % von Taiwan summierte — was physisch unmöglich ist und in einer Sekunde zu erkennen war.
Dann sagten wir, die Schwelle solle nicht 100 % sein, sondern „ein plausibler urbaner Anteil für dieses spezielle Land", und machten weiter, als wäre das eine Antwort. Es ist keine Antwort. Es ist der Name einer Frage.
Dieser Artikel ist unser Versuch, sie über 39 Sprachregionen hinweg tatsächlich zu beantworten, und der Befund ist nicht der, den wir erwartet hatten. Der Anteil eines Landes, den unsere Städteliste hält, wird größtenteils durch Entscheidungen bestimmt, die wir über die Liste getroffen haben, nicht durch Fakten über das Land — was bedeutet, dass die Zahl für sich genommen nahezu uninterpretierbar ist und eine universelle Schwelle nicht einmal im Prinzip existieren kann. Was wir stattdessen anbieten können, ist ein Verfahren, das eine unbeantwortbare Frage durch zwei beantwortbare ersetzt, samt einer Warnung über die Benennung Ihrer Metriken, die wir uns beim Schreiben dieses Textes auf die harte Tour verdient haben.
Zwei Zahlen, benannt
Vor allen Zahlen ein Stück Vokabular, das uns einen Nachmittag der Verwirrung kostete. Es gibt zwei völlig verschiedene Prozentsätze, die sich aus einer gewichteten Städteliste berechnen lassen, beide natürlich, beide für kleine Länder grob im Bereich von 50–80 %, und beide leicht als „der Anteil" niederzuschreiben:
| Name | Definition | Beantwortet |
|---|---|---|
| Abdeckung | Summe der gesamten Liste ÷ nationale Bevölkerung | Wie viel des Landes erreicht diese Liste? |
| Kopf-Anteil | Summe der obersten zehn Zeilen ÷ Summe der gesamten Liste | Wie kopflastig ist diese Liste intern? |
Georgien liegt bei 86,8 % Kopf-Anteil und 64,4 % Abdeckung. Beide sind korrekt; sie sind keine Versionen einer einzigen Zahl. Unbeschriftet verschmelzen die zwei Reihen zu einer und erzeugen eine Tabelle, in der nichts irgendetwas bedeutet. Jeder Prozentsatz weiter unten sagt, welcher von beiden er ist.
Die Abdeckung ist die Größe, die die klassische Summe-gegen-das-Ganze-Prüfung erzeugt, also ist sie diejenige, um die es in diesem Artikel hauptsächlich geht. Der Kopf-Anteil taucht später auf als das, wonach man greifen könnte, um die Prüfung zu retten — und tut es nicht.
Die tatsächliche Spanne
Unser Ortsdatensatz umfasst 64 Dateien. Davon tragen 44 Bevölkerungsgewichte und 20 werden mit gleichförmiger Gewichtung ausgeliefert. Die Abdeckungstabelle unten wurde berechnet, als 39 gewichtet waren; bn_BD, en_AU, no_NO, tr_TR und zh_TW wurden seither gewichtet und sind nicht darin. Die Summierung jeder gewichteten Datei gegen die Bevölkerung ihres Landes ergibt die Abdeckung:
| Sprachregion | Städte | Abdeckung | Sprachregion | Städte | Abdeckung |
|---|---|---|---|---|---|
en_NZ | 60 | 70,4 % | ro_RO | 60 | 37,0 % |
fi_FI | 60 | 70,1 % | vi_VN | 60 | 33,0 % |
he_IL | 55 | 67,0 % | pl_PL | 55 | 32,3 % |
fr_CA | 60 | 66,4 % | el_GR | 60 | 31,9 % |
hy_AM | 41 | 66,0 % | pt_BR | 58 | 31,0 % |
lv_LV | 58 | 66,0 % | de_DE | 57 | 28,5 % |
ka_GE | 45 | 64,4 % | en_PH | 60 | 27,6 % |
bg_BG | 60 | 61,3 % | it_IT | 58 | 25,9 % |
hr_HR | 60 | 60,4 % | zh_CN | 60 | 21,9 % |
kk_KZ | 52 | 58,3 % | ne_NP | 51 | 21,1 % |
en_CA | 60 | 48,5 % | id_ID | 60 | 18,6 % |
ro_MD | 43 | 47,1 % | fr_BE | 60 | 16,7 % |
hu_HU | 60 | 46,5 % | fr_FR | 56 | 16,2 % |
uk_UA | 54 | 44,0 % | en_US | 54 | 15,3 % |
sv_SE | 58 | 43,6 % | en_ZA | 60 | 14,9 % |
de_AT | 60 | 42,9 % | en_IN | 60 | 9,0 % |
(Sprachregionen zwischen 40 % und 42 % — sk_SK, ja_JP, sl_SI, cs_CZ, fa_IR, ru_RU, es_ES — aus Platzgründen aus der Tabelle weggelassen; alle fallen in die Mitte der Spanne.)
Die Abdeckung reicht von 9,0 % bis 70,4 %, ein Faktor von nahezu acht. Keine einzelne Zahl trennt die guten Dateien von den schlechten, denn 9,0 % und 70,4 % sind beide korrekt.
Beachten Sie auch, was hier nicht steht. Der 100-%-Test hatte über den gesamten Satz genau eine Datei zurückgewiesen: Taiwan mit 106,9 %. Die andere Sprachregion, aus der wir Gewichte zogen, Australien mit 84,7 %, bestand den 100-%-Test bequem und wurde von einem Menschen zurückgewiesen, der bemerkte, dass Sydneys Zeile die Zahl für Greater Sydney trug. Ein Test, der einmal über 64 Dateien auslöst und die zweite Instanz genau des Defekts verfehlt, auf den er zielt, trägt nicht viel Gewicht. (Beide Dateien wurden danach repariert und beide werden nun gewichtet ausgeliefert — was den Test nicht rettet, da es in keinem der beiden Fälle der Test war, der den Defekt fand.)
Warum die Zahl so wenig bedeutet
Der Anteil ist ein Verhältnis, und wir kontrollierten den Zähler. Zwei Entscheidungen, die wir trafen, dominieren ihn, und keine hat irgendetwas damit zu tun, ob die Daten richtig sind.
Erstens: wie tief die Liste reicht. Jede Liste ist auf ungefähr 60 Städte gedeckelt. Was diese Deckelung bedeutet, hängt völlig vom Land ab. Hier ist die kleinste Stadt in jeder Liste — der Punkt, an dem die Liste aufhört:
| Sprachregion | Abdeckung | Kleinste Stadt auf der Liste | Median-Stadt |
|---|---|---|---|
lv_LV | 66,0 % | 753 | 6.410 |
ka_GE | 64,4 % | 899 | 10.747 |
hy_AM | 66,0 % | 1.010 | 13.133 |
en_NZ | 70,4 % | 2.316 | 18.447 |
sl_SI | 41,3 % | 1.519 | 6.037 |
en_ZA | 14,9 % | 12.790 | 87.348 |
ja_JP | 41,5 % | 189.591 | 474.592 |
en_US | 15,3 % | 199.723 | 639.111 |
pt_BR | 31,0 % | 302.692 | 698.642 |
zh_CN | 21,9 % | 547.879 | 3.608.835 |
en_IN | 9,0 % | 644.406 | 1.162.472 |
Die kleinste Stadt in der lettischen Datei hat 753 Einwohner. Die kleinste Stadt in der indischen Datei hat 644.406. Das ist ein Faktor von 856 darin, wo die beiden Listen aufhören.
Diese einzelne Tatsache erklärt den größten Teil der Spanne. Sechzig lettische Einträge reichen hinunter bis in Dörfer, und Lettland hat nicht viele Siedlungen darunter, sodass die Liste den größten Teil des urbanen Systems des Landes einfängt und bei 66 % landet. Sechzig indische Einträge hören bei „Städten über 644.000" auf, unterhalb derer Indien mehrere Tausend weitere Städte hat, sodass die Liste einen Splitter einfängt und bei 9,0 % landet. Beide Listen verhalten sich genau so, wie eine Deckelung auf 60 Zeilen sie zu verhalten zwingt.
Zweitens: wie groß das Land ist. Eine Deckelung auf 60 Städte in einer Nation von 1,4 Milliarden und eine Deckelung auf 60 Städte in einer Nation von 1,9 Millionen sind nicht dasselbe Instrument. Indien bräuchte Zehntausende von Zeilen, um die Tiefe zu erreichen, die Lettland mit 58 erreicht. Keine auf beide angewandte Schwelle kann dasselbe bedeuten.
Zusammengenommen: die erwartete Abdeckung wird durch die Deckelung und die Größe des Landes festgelegt, und die tatsächliche urbane Struktur moduliert sie nur. Zu fragen, ob 31,0 % Abdeckung für Brasilien plausibel sind, ohne zu wissen, dass Brasiliens Liste bei 302.692 Einwohnern aufhört, heißt, nach einem Verhältnis zu fragen und dabei die Definition seines Zählers zu ignorieren.
Die Tiefenzahl erklärt auch den Kopf-Anteil, weshalb sie ins Zentrum dieses Artikels gehört und nicht einer der beiden Prozentsätze. Indiens Kopf-Anteil ist niedrig (51,9 %), weil seine Liste sechzig große Städte vergleichbarer Größe enthält — ein Artefakt des Aufhörens bei 644.406. Lettlands ist hoch (78,2 %), weil seine Liste von Riga hinunter bis zu einem Dorf von 753 reicht, sodass die obersten zehn unweigerlich dominieren. Beide Prozentsätze sind Schatten derselben Entscheidung darüber, wo aufzuhören ist.
Der Kopf-Anteil rettet die Abdeckung nicht
Der naheliegende nächste Schritt ist, die Abdeckung mit etwas zu korrigieren, das sich aus der Datei selbst berechnen lässt. Wird ein Land von einer einzigen riesigen Stadt dominiert, würde man hohe Abdeckung aus wenigen Zeilen erwarten; sind seine Städte gleichmäßig groß, würde man das Gegenteil erwarten. Der Kopf-Anteil misst genau das. Sagt er also die Abdeckung voraus?
Tut er nicht. Die beiden sind nahezu unkorreliert, und zwei Sprachregionen demonstrieren es, indem sie in entgegengesetzte Richtungen versagen:
| Sprachregion | Kopf-Anteil | Abdeckung | Kleinste Stadt | Lesart |
|---|---|---|---|---|
fi_FI | 55,4 % | 70,1 % | 7.766 | Flache Liste, erreicht dennoch den Großteil des Landes |
de_AT | 77,3 % | 42,9 % | 7.349 | Kopflastige Liste, erreicht dennoch unter der Hälfte |
Finnlands Liste ist die am wenigsten kopflastige des Paares und hat die höchste Abdeckung. Österreichs ist stark auf ihre obersten zehn konzentriert und deckt kaum halb so viel ab. Welche Korrektur Sie auch aus dem Kopf-Anteil bauen, eine dieser beiden kommt verkehrt heraus.
Der gesamte Satz verhält sich genauso. Georgien hat den höchsten Kopf-Anteil, den wir maßen, 86,8 %, bei 64,4 % Abdeckung. Lettland liegt bei 78,2 % Kopf-Anteil bei 66,0 % Abdeckung. Neuseeland liegt bei 74,3 % bei 70,4 %. Indien hat 51,9 % Kopf-Anteil — eine wirklich flache, gleichmäßig große Liste großer Städte — bei 9,0 % Abdeckung. Israel liegt bei 53,0 % Kopf-Anteil bei 67,0 % Abdeckung, fast genau Indiens Kopf-Anteil bei siebenmal der Abdeckung.
Beachten Sie, was dieses letzte Paar bedeutet. en_IN und he_IL haben nahezu identische interne Form — 51,9 % und 53,0 % jeder Liste sitzen in ihren obersten zehn — und Abdeckungen von 9,0 % und 67,0 %. Die interne Form der Liste trägt im Wesentlichen keine Information darüber, wie viel des Landes sie erreicht.
Die beiden Metriken beantworten also wirklich verschiedene Fragen, und keine kann für die andere einspringen. Der Kopf-Anteil sagt Ihnen etwas über die Form der Liste; die Abdeckung über ihre Reichweite. Wir suchten nach einem internen Signal, das die erwartete Abdeckung vorhersagt, und fanden keines, das diese Fälle übersteht.
Es gibt eine weitere Falle im Vokabular selbst. Beide Größen liegen für kleine Länder im selben Zahlenbereich — Lettland ist 78,2 % und 66,0 %, Armenien 81,8 % und 66,0 % —, sodass eine Tabelle, die den Metriknamen weglässt, zwei Reihen erzeugt, die wie eine einzige verrauschte Reihe aussehen. Wir verbrachten in dieser Sitzung echte Zeit damit, „78,2 %" gegen „66,0 %" für Lettland abzugleichen, bevor wir bemerkten, dass es Antworten auf verschiedene Fragen waren. Keine der Zahlen war falsch. Die Beschriftung fehlte, was ein Datendefekt für sich ist und einer, den keine arithmetische Prüfung abfangen kann.
Die Schranke, die wirklich besser ist als 100 %
Es gibt eine verfügbare Verbesserung, und es lohnt sich, sie genau zu benennen, weil sie real, aber begrenzt ist.
Die Summe der städtischen Einwohnerzahlen eines Landes kann die urbane Bevölkerung des Landes nicht überschreiten. Das ist eine physische Beschränkung und sie ist strikt enger als 100 %, weil kein Land zu 100 % urban ist. Angewandt auf Australiens zurückgewiesene Datei: 84,7 % der Australier in 60 Städten, gegen eine australische Urbanisierungsrate irgendwo um 86 %, impliziert, dass diese 60 Städte grob 98 % jedes urbanen Australiers hielten — was für ein Land mit Hunderten von urbanen Zentren absurd ist, und es ist auf eine Weise absurd, die eine 100-%-Schwelle nicht ausdrücken kann und ein Mensch nur zufällig bemerkte.
Die verbesserte Prüfung lautet also: vergleichen Sie die Summe gegen die urbane Bevölkerung, nicht gegen die Gesamtbevölkerung. Sie kostet eine zusätzliche externe Zahl pro Land und hätte Australien maschinell abgefangen.
Aber sie muss ehrlich beschriftet werden, denn sie erbt genau die Krankheit, die sie diagnostizieren soll. Eine nationale Urbanisierungsrate ist selbst das Ergebnis von jemandem, der entscheidet, was als Stadt zählt — dieselbe definitorische Wahl, die den Defekt überhaupt erst erzeugte. Länder klassifizieren Siedlungen nach wild unterschiedlichen Regeln als urban: nach Bevölkerungsschwelle, nach Verwaltungsstatus, nach Dichte, nach wirtschaftlicher Aktivität. Eine auf dieser Zahl gebaute Schranke ist indikativ, nicht entscheidend. Sie engt die Verdächtigenliste ein; sie überführt nicht.
Wir ließen diese Schranke über unseren Satz laufen, und sie bringt drei Sprachregionen nah genug an ihre geschätzten urbanen Bevölkerungen, um einen Blick wert zu sein — ka_GE, hy_AM und ro_MD, jede ein kleines Land, in dem unsere Liste hinunter bis zu rund tausend Einwohnern reicht. Wir melden diese nicht als Defekte. Die bekannten Einheitenfallen in Georgien und Armenien — Kaspis drei verschachtelte Zahlen, Chambaraks Paar aus քաղաք gegen համայնք — sind in den ausgelieferten Dateien bereits korrekt aufgelöst, was wir überprüften. Was die Schranke erzeugte, ist eine Warteschlange für die menschliche Prüfung, was das Meiste ist, das eine Schwelle dieser Art erzeugen kann.
Also: gibt es eine Formel?
Nein. Wir suchten nach einer und melden ihre Abwesenheit als das Ergebnis.
Es gibt keine Funktion vom Inhalt einer Ortsdatei zu einer verteidigbaren erwarteten Abdeckung, denn der dominante Term ist eine Deckelung, die wir auferlegten, der zweite Term ist die Landesgröße, und der dritte — die tatsächliche urbane Struktur — ist der einzige, der Signal über Korrektheit trägt, und er ist der kleinste der drei. Jede Schwelle, die auf der Ausgabezahl auslöst, löst in Wahrheit auf unserer eigenen Zeilenbegrenzung aus. Und das vielversprechendste interne Korrektiv, der Kopf-Anteil, erweist sich als Messung von etwas Orthogonalem.
Was es ersetzt, ist keine Formel, sondern eine Neurahmung. Die unbeantwortbare Frage „ist diese Abdeckung plausibel?" spaltet sich in zwei beantwortbare auf:
- Ist der Kopf der Liste die richtige Einheit? Hier leben die echten Defekte. Taiwans Liste vermischte Municipalities mit ihren eigenen Bezirken; Australiens ersetzte lokale Verwaltungseinheiten durch Ballungsräume. Beide sind sichtbar, indem man die drei oder vier größten Einträge nimmt und jeden gegen eine unabhängig bekannte Zahl für diese spezielle Stadt prüft. Sydney mit 5.219.674 gegen eine City of Sydney von rund 200.000 ist eine Ein-Minuten-Prüfung, die überhaupt keine Schwelle braucht.
- Wo hört die Liste auf, und war das Absicht? Halten Sie den kleinsten Eintrag als eine erklärte Tiefenregel fest — „diese Datei enthält Siedlungen über N Einwohnern." Sobald das niedergeschrieben ist, hört niedrige Abdeckung auf, verdächtig zu sein, und wird zu Arithmetik. Indien mit 9,0 % braucht keine Verteidigung, sobald die Datei sagt, dass sie bei 644.406 aufhört.
Und eine dritte, kostenlose: beschriften Sie jeden Prozentsatz mit seiner Metrik. Abdeckung und Kopf-Anteil kosteten uns in dieser Sitzung mehr Verwirrung als jede falsche Zahl.
Die Abdeckungsprüfung behält ihren Platz, aber herabgestuft: sie ist ein Detektor der Unmöglichkeit, nicht der Unplausibilität. Über 100 % ist definitiv etwas falsch. Unter 100 % sagt sie nichts, worauf Sie ohne die zwei obigen Prüfungen handeln können. Das ist ein viel kleinerer Anspruch als der, den wir implizit erhoben, und es ist der, den die Daten stützen.
Wenn das nach einem Eingeständnis klingt, dass diese Prüfung menschliches Urteil pro Land erfordert, dann ist es das. Zwanzig unserer 64 Dateien werden ohne Gewichte ausgeliefert, genau weil dieses Urteil „wir können das nicht konsistent machen" zurückkam, und wir liefern lieber eine dokumentierte Näherung aus als einen unsichtbaren Defekt. Die ehrliche Version eines Datenqualitätsprozesses enthält eine Spalte für unentschieden.
Für die Defektklasse, für deren Erfassung diese Prüfung gebaut wurde, siehe Sechzig Städte, 106,9 % eines Landes. Für das, was stromabwärts geschieht, wenn Gewichte fehlen, siehe Warum Adressgeneratoren unplausible Städte erzeugen. Für das allgemeine Problem von Prüfungen, die nicht fehlschlagen können, siehe Ein Test, der nicht fehlschlagen kann.
Daten mit Stand 2026-07-18
Jeder Anteil, jede Städtezahl, jede Kleinste-Stadt- und Median-Zahl in diesem Artikel wurde am 18. Juli 2026 direkt aus den ausgelieferten Ortsdateien berechnet, durch Summieren der vierten Spalte jeder .tsv und Teilen durch die Bevölkerungstabelle, die in unserer Regressionssuite verwendet wird. Nichts hier ist aus Arbeitsnotizen zitiert.
Quellen und Anmerkungen:
- Ortsdateien — 64 Dateien in
share/name_gen/locality/. 44 tragen eine vierte Bevölkerungsspalte und 20 sind dreispaltig und werden gleichförmig ausgeliefert, neu gezählt am 22. Juli 2026; der gleichförmige Satz umfasstar_SA,en_GB,en_IE,ko_KR,nl_NL,pt_PTundes_AR. Als die obigen Abdeckungszahlen berechnet wurden, betrug die Aufteilung 39/25;bn_BD,en_AU,no_NO,tr_TRundzh_TWerhielten danach Gewichte. - Bevölkerungsnenner — die in
ng_regression_tests.phpeingebettete Tabelle, die gerundete nationale Bevölkerungen trägt (Lettland 1.870.000; Indien 1.430.000.000; und so weiter). Die Anteile sind daher etwa auf die Rundung dieser Tabelle genau, was bei der Auflösung, die dieser Artikel verwendet, ausreicht und für alles Feinere unzureichend ist. - Extreme —
en_IN127.990.788 über 60 Städte = 9,0 %;en_NZ3.658.551 über 60 Städte = 70,4 %. Kleinste Einträge:lv_LV753,en_IN644.406, ein Verhältnis von 856. - Beide Metriken, Seite an Seite berechnet am 18. Juli 2026. Der Kopf-Anteil ist die Summe der zehn größten Zeilen über der Summe aller Zeilen; die Abdeckung ist die Summe aller Zeilen über der nationalen Bevölkerung.
| Sprachregion | Kopf-Anteil | Abdeckung | Kleinste Stadt |
|---|---|---|---|
ka_GE | 86,8 % | 64,4 % | 899 |
hy_AM | 81,8 % | 66,0 % | 1.010 |
lv_LV | 78,2 % | 66,0 % | 753 |
de_AT | 77,3 % | 42,9 % | 7.349 |
en_NZ | 74,3 % | 70,4 % | 2.316 |
ro_MD | 74,1 % | 47,1 % | 2.655 |
en_ZA | 57,8 % | 14,9 % | 12.790 |
fi_FI | 55,4 % | 70,1 % | 7.766 |
he_IL | 53,0 % | 67,0 % | 22.896 |
en_IN | 51,9 % | 9,0 % | 644.406 |
en_US | 50,9 % | 15,3 % | 199.723 |
zh_CN | 45,2 % | 21,9 % | 547.879 |
fi_FI summiert sich auf 3.927.865 und hy_AM auf 1.848.547. Die fi_FI / de_AT-Umkehrung und das en_IN / he_IL-Paar sind die zwei Fälle, die eine Vorhersage der Abdeckung aus dem Kopf-Anteil ausschließen.
- Australiens 84,7 % — eine Erinnerung, keine Neuherleitung.
en_AUwird ohne Gewichte ausgeliefert, es gibt also keine vierte Spalte mehr zum Summieren; was auf der Platte bestätigt ist, ist die Konsequenz. Behandeln Sie die Zahl als indikativ und siehe Was als Stadt zählt für denselben Vorbehalt an seiner Quelle. - Urbanisierungsraten — extern, näherungsweise und bewusst hier nicht tabelliert. Sie werden in diesem Artikel nur verwendet, um einen qualitativen Punkt über Australien zu machen und zu erklären, warum die verbesserte Schranke weich ist. Jede spezifische nationale Urbanisierungszahl sollte dem zuständigen Statistikamt entnommen werden, mit Aufmerksamkeit darauf, wie dieses Amt „urban" definiert.
- Georgien- und Armenien-Stichproben —
ka_GEliefert Kaspi mit 12.911 (die Stadtzahl, nicht die 41.841-Municipality oder die 13.729-Verwaltungseinheit) undhy_AMliefert Chambarak mit 5.468 (die քաղաք-Zahl, nicht die 12.416-համայնք). Beide bekannten Fallen sind in den ausgelieferten Dateien korrekt aufgelöst; dies wurde durch Lesen der Zeilen verifiziert, nicht angenommen.