Gefälschte ID > Artikel > Autorität ist keine Eigenschaft von Zeilen

Autorität ist keine Eigenschaft von Zeilen

Es gibt einen Gemeinderat in Uganda namens MASAKA TOWN COUNCIL. Er hat 5.731 Einwohner und liegt im Manafwa District, im äußersten Osten des Landes, an der Grenze zu Kenia.

Es gibt außerdem einen Ort namens Masaka. Das ist eine Stadt mit 294.166 Menschen im Südwesten, rund 400 km entfernt. Die beiden haben nichts miteinander zu tun außer einem gemeinsamen Namen.

Beide Zeilen stammen aus derselben Datei: dem Zensus des Uganda Bureau of Statistics. Beide sind korrekt. Eine Pipeline, die geografische Daten über den String MASAKA verknüpft, führt sie trotzdem zusammen, und nichts in beiden Quellen wird sich beschweren.

Dieser Artikel handelt von Defekten dieser Form — wo jede einzelne von einer autoritativen Stelle veröffentlichte Zahl richtig ist und der daraus gebaute Datensatz dennoch falsch. Über rundheraus fehlerhafte Zeilen in amtlichen Statistiken haben wir separat geschrieben, einschließlich eines Zeichenersetzungsfehlers im US-Zensus, der vier Nachnamen erfand. Dies hier ist der schwierigere Fall, weil es nichts zu korrigieren gibt. Die Quelle ist in Ordnung. Die Annahme ist falsch.

Die Annahme: Ein Name identifiziert einen Ort

Tut er nicht. Im geparsten Uganda-Zensus — 2.669 Verwaltungszeilen, davon 577 Gemeinderäte — werden fünf Gemeinderatsnamen von je zwei verschiedenen Räten getragen:

GemeinderatsnameDistrict ADistrict B
MAYUGEBUGIRI — 12.481MAYUGE — 20.197
KINONILWENGO — 17.137RWAMPARA — 16.502
KIBALENAMUTUMBA — 11.886PALLISA — 15.743
KIBAALEKIBAALE — 9.157RAKAI — 12.104
KAKINDOKAKUMIRO — 14.745SHEEMA — 12.372

Das MAYUGE-Paar ist das lehrreiche, weil einer der beiden im Mayuge District liegt und der andere nicht. Ein Deduplizierungsschritt, der „die Zeile behält, deren District mit ihrem eigenen Namen übereinstimmt", bekäme dieses Paar durch Glück richtig und KINONI — wo keiner der Räte in einem District dieses Namens liegt — still falsch.

Und MASAKA ist schlimmer als ein Duplikat, weil die beiden Zeilen nicht einmal dieselbe Art von Ding sind: ein 5.731-Personen-Gemeinderat in einem District und eine 294.166-Personen-Stadt, die ihr eigener District ist. Verknüpfen Sie über den Namen, und Sie verlieren entweder 98 % von Masaka oder gewinnen 5.731 Menschen in der falschen Provinz — je nachdem, welche Zeile Ihr GROUP BY zufällig behält.

Die Prüfung, die das fängt, ist überhaupt keine Prüfung von Werten. Sie lautet: Ist das Feld, über das Sie verknüpfen, in der Quelle tatsächlich eindeutig? Ein COUNT() ... GROUP BY name HAVING COUNT() > 1 über die 577 Zeilen liefert fünf, und fünf ist nicht null.

Dasselbe Versagen bei einer anderen Autorität: Wikidata

Wir stießen aus der anderen Richtung auf dasselbe Problem, während wir Bevölkerungsgewichte für Städte zusammenstellten. Die Methode bestand darin, jeden Städtenamen zu einer Wikidata-Entität aufzulösen und die Bevölkerungsangabe daraus abzulesen. Wikidata ist eine kuratierte, strukturierte, maschinenlesbare Wissensdatenbank — ungefähr so autoritativ, wie eine automatisierte Verknüpfung nur hoffen kann.

Die Namen, die daran zerbrachen, waren gewöhnliche Wörter:

StädtenameLandWas der Name außerdem bedeutet
MostTschechien„Brücke"
KotkaFinnland„Adler"
LeónSpanien„Löwe"
NokiaFinnlanddas Telekommunikationsunternehmen
ВладимирRusslandder Vorname Wladimir
HullGroßbritannienlöst ohne Kingston upon Hull nicht auf

Keiner davon ist ein Fehler in Wikidata. Jede Zielentität ist korrekt beschrieben. Der Fehler liegt ganz bei uns, im Glauben, ein Name plus ein Land reiche aus, um eine Siedlung zu identifizieren.

Der Rückstand ist eine Datei von über 60 manuellen Korrekturen über 17 Sprachregionen hinweg — Bulgarisch, Tschechisch, österreichisches Deutsch, Griechisch, Spanisch, Finnisch, belgisches und kanadisches Französisch, Französisch, Kroatisch, Ungarisch, Italienisch, Norwegisch, Polnisch, Rumänisch, moldauisches Rumänisch, Russisch, Slowakisch. Diese Datei lässt sich aus keiner Quelle ableiten. Sie ist das angesammelte Protokoll jeder Stelle, an der die automatische Methode falschlag, und würde sie gelöscht, bestünde die einzige Möglichkeit, sie wieder aufzubauen, darin, alle 60 Fehler erneut zu machen.

Die eine automatisierte Absicherung, die tatsächlich funktioniert, ist billig und wert, kopiert zu werden: Wenn die Ländereigenschaft der aufgelösten Entität nicht mit dem Land der Sprachregion übereinstimmt, gib eine Warnung aus. Treffer im falschen Land sind die lauteste Teilmenge der Homonymfehler, und sie zu finden kostet einen Vergleich.

Eine Zahl, die zweimal auftaucht, ist eine Abschrift

Die enge Fassung der Eindeutigkeitsprüfung gilt für Werte, nicht nur für Schlüssel. Wikipedia hat für die ugandische Stadt Mbarara eine Bevölkerung von 195.531 geführt. In der UBOS-Zensusdatei ist 195.531 die Bevölkerung von Kyengera Town Council, einem Vorort von Kampala rund 260 km entfernt. Der Gesamtwert des Mbarara District selbst beträgt 472.629.

Jemand, der ein langes tabelliertes PDF las, nahm den Wert aus der falschen Zeile. Das ist der gewöhnlichste vorstellbare Fehler und wahrscheinlich der am weitesten verbreitete in diesem Artikel, weil eine Wikipedia-Bevölkerungszahl weit häufiger weiterkopiert wird, als ein Zensus-PDF geöffnet wird. Die Regel lautet: Eine Zahl sollte an genau einer Stelle auftauchen. Wenn die Zahl von Stadt A byteweise identisch mit der Zahl von Stadt B im Quelldokument ist, ist eine von beiden eine Abschrift, kein Zufall.

Wenn die Quelle Ihnen nichts sagen will

Ein anderer Versagensmodus ist eine Quelle, die autoritativ klingt und schlicht nicht überprüfbar ist.

forebears.io ist das kanonische Beispiel. Es ist ein proprietärer Aggregator: Er veröffentlicht keine Methodik pro Land, kein Quellregister und kein Erhebungsdatum. ridni.org und stats.ridni.org sind dieselbe Art von Quelle: Eine Zahl erscheint, und nichts dahinter tut es.

Wir wollen präzise sein, was wir hier behaupten können und was nicht. Wir können sagen, dass die Daten nicht verifizierbar sind: Es gibt keine Methodik zu lesen und keine Möglichkeit, eine Zahl neu herzuleiten. Wir können nicht sagen — und haben keinen Beleg dafür gesehen — die stärkere Behauptung, die Seite liefere automatisierten Clients absichtlich verzerrte Zahlen; das wurde in ererbten Arbeitsnotizen behauptet und wird von nichts gestützt, das wir reproduzieren können. Eine unveröffentlichte Methode ist kein Beweis für eine unehrliche.

Die vertretbare Position ist enger und dennoch ausreichend: Eine Zahl, die Sie nicht zu einem Register zurückverfolgen und nicht neu herleiten können, ist bestenfalls ein Hinweis auf die Reihenfolge, niemals ein Gewicht, und jede Zeile, die auf einer solchen ruht, sollte im Datensatz gekennzeichnet werden, damit ein künftiger Leser weiß, um welche Zeilen es sich handelt.

Der Teil, in dem es um uns geht

Es wäre bequem, hier zu enden, mit einer Liste der Fehler anderer Leute. Der teuerste Defekt dieser Art im Projekt war unser eigener, und er überlebte gerade deshalb, weil er wie eine Bestätigung aussah.

Ukrainische Nachnamengewichte (uk_UA) erzeugten einst einen Top-10-Anteil von 5,45 % innerhalb des Korpus. Wir hatten eine Zahl von 5,45 % als den realen Top-10-Anteil der Ukraine auf Bevölkerungsebene festgehalten. Die beiden stimmten exakt überein, und die Übereinstimmung wurde als Validierung gelesen.

Es war das Gegenteil. Die Beziehung

top-10 share in corpus  ×  coverage  =  top-10 share in population

ist eine Identität, keine Hypothese. Sind die beiden Anteile gleich, sagt die Identität, dass die Abdeckung 100 % beträgt — dass der Korpus jeden Nachnamen des Landes enthält. Der Korpus hielt 2.207 Nachnamen. Die Ukraine hat ungefähr 707.685. Eine Abdeckung von 100 % war unmöglich, also musste eine der beiden Zahlen falsch sein.

Beide waren es. Die Korpuszahl war durch einen flachen Schwanz aufgebläht: 1.900 von 2.207 Einträgen (86 %) saßen beim Mindestgewicht von 2 und trugen zusammen 71 % der Gesamtmasse. Und die „realen" 5,45 % waren selbst falsch — neu berechnet aus Yu. Pradids Zählungen decken die Top-10-Nachnamen der Ukraine 821.657 Träger von rund 45 Millionen ab, was 1,83 % sind; Мельник ist 0,24 %, nicht die ~1 %, die wir geführt hatten.

GrößeVorherNachher
Summe der Gewichte5.329.785
Top-10-Anteil im Korpus5,45 %15,41 %
Implizierte Abdeckung100 % (absurd)~11 %
Gewichtsspanne (oben : unten)20 : 1108 : 1

„Nachher" ist der Stand vom 18. Juli 2026, unmittelbar nach der Korrektur. Der Korpus wurde seither erneut neu gebaut: Mit Stand 22. Juli 2026 hält er 2.376 Nachnamen auf Basis von Register-Kopfzahlen, einen Top-10-Anteil von 9,4 % und, gegen die Bevölkerungszahl von 1,83 %, eine implizierte Abdeckung von rund 19 % — was die Form ist, die ein dünner Korpus eines sehr flachen Repertoires haben sollte.

Eine perfekte Übereinstimmung zwischen zwei unabhängig gewonnenen Zahlen ist eine Tatsache, die erklärt werden muss, kein Ergebnis, das gefeiert werden muss. Diese hier war ein doppeltes Versagen im Kostüm einer Bestätigung.

Die verwandte Falle ist die zirkuläre Verifikation. Wenn Ihre Gewichte aus Register X kalibriert wurden, dann misst deren Prüfung gegen Register X — oder gegen eine veröffentlichte Arbeit, die ihre Zahlen aus Register X nahm — Ihre Arithmetik, nicht die Welt. Wir fingen dies zweimal an einem Tag: eine ungarische Ethnonym-Schätzung, die unsere 8,20 % zu bestätigen schien, aber auf dasselbe Register zurückgriff, und eine spanische Prüfung, bei der der Top-10-Anteil multipliziert mit der Abdeckung den Bevölkerungsanteil fast tautologisch reproduzierte. Unsere taiwanesische Selbstprüfung stimmt bis auf 0,03 Prozentpunkte überein, und wir kennzeichnen sie im Text als Selbstkonsistenzprüfung statt als Verifikation, weil sie genau das ist. Das Gegenmittel besteht darin, die Vergleichsliste von Hand aus einer nicht verwandten Quelle einzutippen, und unsere Top-Listen-Prüfer tun genau das.

Was tatsächlich zu tun ist

  1. Prüfen Sie den Verknüpfungsschlüssel auf Eindeutigkeit, bevor Sie verknüpfen. Nicht die Werte — den Schlüssel. Fünf duplizierte Namen unter 577 ugandischen Gemeinderäten sind ein GROUP BY entfernt.
  2. Prüfen Sie, ob zwei Zeilen mit gemeinsamem Namen dieselbe Art von Objekt sind. MASAKA TOWN COUNCIL und MASAKA CITY unterscheiden sich um den Faktor 51, weil das eine ein Gemeinderat und das andere eine Stadt auf District-Ebene ist.
  3. Prüfen Sie, ob ein Wert einmal auftaucht. Identische Zahlen bei zwei Entitäten bedeuten eine Abschrift.
  4. Warnen Sie, wenn eine aufgelöste Entität das erwartete Land verlässt. Die billigstmögliche Absicherung gegen Homonyme, und sie fing Nokia und León.
  5. Halten Sie das Register der manuellen Korrekturen in der Versionsverwaltung und behandeln Sie es als Primärdaten. Sechzig Korrekturen, die keine Quelle regenerieren kann, sind pro Byte mehr wert als alles andere in der Pipeline.
  6. Misstrauen Sie der Übereinstimmung. Wo zwei Zahlen exakt übereinstimmen, finden Sie heraus, ob sie unabhängig sind. Wo sie es nicht sind, bedeutet die Übereinstimmung nichts.
  7. Kennzeichnen Sie Zeilen, die auf nicht verifizierbaren Quellen ruhen, damit ein künftiger Betreuer sie finden kann, ohne die Herkunft neu herzuleiten.

Autorität ist eine Eigenschaft von Institutionen. Korrektheit ist eine Eigenschaft von Zeilen. Das Uganda Bureau of Statistics ist autoritativ, und seine Datei enthält zwei verschiedene Orte namens Masaka, weil Uganda zwei verschiedene Orte namens Masaka enthält. Der Defekt lag nie im Zensus. Er lag in der Verknüpfung.


Daten mit Stand 2026-07-18

Alle Zahlen wurden am 18. Juli 2026 aus den unten aufgeführten Primär- und Staging-Dateien neu berechnet. Wo unsere früheren Arbeitsnotizen mit den Dateien nicht übereinstimmten, gewinnen die Dateien, und die Abweichung wird im Text angegeben.

Quellen:

  • Uganda — UBOS, National Population and Housing Census 2014, regionale gebietsspezifische Profile, geparst zu einer Verwaltungshierarchie (2.669 Zeilen auf District-/County-/Sub-County-Ebene; 577 Gemeinderäte). MASAKA TOWN COUNCIL 5.731 im Manafwa District, Bubulo West County; MASAKA CITY 294.166; die zwei MAYUGE TOWN COUNCIL-Zeilen mit 12.481 (Bugiri) und 20.197 (Mayuge). <ubos.org/&gt;
  • Wikipedia, Artikel über Mbarara, Bevölkerung 195.531 — übereinstimmend mit Kyengera Town Council in derselben UBOS-Datei. Gesamtwert Mbarara District 472.629.
  • Wikidata — verwendet, um Städtenamen zu Bevölkerungsangaben aufzulösen; Homonymfehler korrigiert in einem manuellen Patch-Register von über 60 Einträgen über 17 Sprachregionen.
  • Ukraine — Korpus von 2.207 Nachnamen (wie er damals stand) gegen ungefähr 707.685 Nachnamen im Land; Top-10-Bevölkerungsanteil neu berechnet aus Yu. Pradids Zählungen mit 821.657 Trägern, was 1,83 % ergibt.
  • forebears.io — proprietärer Aggregator, keine veröffentlichte Methodik pro Land, kein Quellregister, kein Erhebungsdatum; Zahlen lassen sich nicht zu einem Register zurückverfolgen oder neu herleiten.

Zur forebears.io-Behauptung. Ererbte Arbeitsnotizen behaupteten, die Seite gebe automatisierten Clients absichtlich verzerrte Daten zurück. Wir konnten das nicht reproduzieren oder anderweitig erhärten, daher wird es in diesem Artikel nicht behauptet; behauptet wird, dass die Daten nicht zurückverfolgbar sind, was verifizierbar und ausreichend ist.

Zur Abdeckungs-Identität. top-10 share in corpus × coverage = top-10 share in population ist bei konsistenten Definitionen eine algebraische Identität. Sie ist nützlich, weil sie Zufall bestraft, und gefährlich, weil sie trivial erfüllt ist, wenn beide Seiten aus demselben Register stammen. Siehe Wie man einen Namenshäufigkeits-Datensatz prüft und Was wir über Namensdaten falsch verstanden haben.

← Artikel