Identificación falsa > Artículos > Por qué los generadores de direcciones producen ciudades implausibles

Por qué los generadores de direcciones producen ciudades implausibles

Hasta el 18 de julio de 2026, nuestro generador de direcciones elegía las ciudades ucranianas de forma uniforme. La lista del locale ucraniano contiene 54 ciudades, de modo que cada una — Kyiv, pero también Kamianets-Podilskyi — tenía 1 probabilidad entre 54 de aparecer en una tarjeta generada. Kyiv concentra alrededor del 16,4 % de la población cubierta por esa lista. Salía elegida en el 1,9 % de los casos.

Nada en una tarjeta tomada por separado parecía erróneo. Todas las ciudades eran reales, estaban bien escritas y aparecían correctamente asociadas a su óblast y a un código postal válido. El defecto solo era visible en el agregado, y en el agregado era enorme.

Lo que hace realmente la selección uniforme

La medición es sencilla. Tome la lista de ciudades del locale, calcule la proporción que representan las diez ciudades principales sobre el total bajo selección uniforme (que no es más que 10/N) y compárela con su proporción de la población real cubierta por la lista.

LocaleCiudadesProporción del top 10, uniformeProporción del top 10, ponderada por población
uk_UA5418,5 %56,5 %
ja_JP6016,7 %54,0 %
de_DE5717,5 %49,8 %

La selección uniforme subestima la cabeza de todas y cada una de estas distribuciones en un factor de aproximadamente tres. Dicho de otro modo: bajo selección uniforme, más del 80 % de las direcciones generadas caen fuera de las diez ciudades donde vive aproximadamente la mitad de la población listada.

A escala de una sola ciudad la distorsión es aún mayor. En 300 tarjetas generadas a partir de la lista ucraniana:

CiudadPoblaciónObservado, uniformeObservado, ponderadoEsperanza ponderada
Kyiv2.952.301124649,1
Kharkiv1.421.125123123,6
Odesa1.010.537111416,8

Bajo selección uniforme, cada una de las 54 ciudades obtiene de media 5,6 extracciones por cada 300 tarjetas, y Kyiv obtuvo, en efecto, 12 — no porque sea la capital, sino porque algo tiene que quedar en cabeza de 54 celdas ruidosas, y 12 es más o menos lo que se observa en lo alto de ese montón. Tras la ponderación, Kyiv obtiene 46 frente a una esperanza de 49,1, y las tres ciudades se sitúan a menos de 1,6 desviaciones típicas de sus esperanzas ponderadas.

Una advertencia en la que caímos nosotros mismos. Nuestra primera lectura de la serie uniforme fue que 12/12/11 resultaba demasiado alto para deberse al azar — cada celda tiene una esperanza de 5,6 con una desviación típica de 2,3, así que 12 parece un resultado de +2,8σ, y eso tres veces seguidas. Ese razonamiento es falso, y lo es de una manera instructiva: 12 no es una celda elegida al azar, es la mayor de 54, y el máximo de un gran número de celdas se sitúa en la cola por construcción. Al simular 200.000 series uniformes de 300 extracciones sobre 54 ciudades se obtiene un máximo medio de 11,58, una mediana de 11 y un percentil 95 de 14. La probabilidad de que las tres primeras celdas alcancen al menos 12, 12 y 11 es de 0,060 — poco frecuente, pero ni mucho menos imposible, y exactamente la forma que produce una extracción uniforme. Antes de declarar imposible un número observado, compruebe que lo está comparando con la distribución correcta. Nosotros comparábamos un estadístico de orden con la distribución de una celda aislada.

Esto significa también que un recuento sobre 300 tarjetas no puede leerse directamente a partir del 18,5 % de la tabla anterior. Ese 18,5 % es la probabilidad de selección de un conjunto fijo de diez ciudades; las diez ciudades que resultan quedar en cabeza en una serie ruidosa siempre cubrirán más que eso — en torno al 30 % empíricamente. Las dos columnas de la tabla anterior son ambas probabilidades y comparables entre sí; un recuento de las ganadoras observadas es una tercera cosa.

El problema más difícil: ¿qué es una ciudad?

Ponderar por población exige disponer de una población. Y ahí es donde está la dificultad, porque « la población de una ciudad » no es una única magnitud.

CiudadDefinición estrechaDefinición ampliaRelación
Sydney~200.000 (City of Sydney LGA)5,3 millones (Greater Sydney)~26×
Chongqing~9 millones (núcleo urbano)32 millones (municipalidad)~3,5×
Tokio9.733.276 (23 distritos especiales)~14 millones (metrópolis de Tokio)~1,4×
Frankfurt760.656 (Gemeinde)~2,3 millones (Rhein-Main)~3×

Sydney es el caso extremo: el área de gobierno local City of Sydney es un pequeño ayuntamiento central que cubre una fracción de lo que cualquiera entiende por « Sydney ». La municipalidad de Chongqing es una región administrativa del tamaño de Austria, rural en su mayor parte. Y Tokio no tiene ninguna ciudad en sentido jurídico — la City of Tokyo fue suprimida en 1943. Lo que existe son 23 distritos especiales, cada uno un municipio de pleno derecho, dentro de la metrópolis de Tokio. Nosotros usamos la cifra de los 23 distritos, 9.733.276, porque es lo más parecido a la entidad que la gente tiene en mente.

Ninguna de estas decisiones es correcta en abstracto. Lo que importa es que la decisión se tome de forma coherente dentro de un mismo locale, porque los pesos son relativos. Mezclar una cifra metropolitana para una ciudad con una cifra municipal para otra multiplica silenciosamente por tres o más la probabilidad de que salga la primera frente a su vecina — el mismo defecto que se describe para Argentina en Cuatro apellidos que no existen, donde cifras de municipio y de localidad conviven en una misma columna.

El locale que dejamos sin ponderar

La lista ar_SA de Arabia Saudí tiene 39 ciudades y sigue distribuyéndose sin pesos de población.

GASTAT, la autoridad estadística saudí, publica la población por gobernación. Para 25 de las 39 ciudades puede reconstruirse una cifra urbana defendible; para las 14 restantes, no — el número a nivel de ciudad sencillamente no existe en las estadísticas publicadas. Las opciones eran ponderar 25 ciudades y dejar las otras 14 en un valor por defecto arbitrario, sustituir las poblaciones de ciudad por las de gobernación (lo que sobrestimaría gravemente las ciudades pequeñas situadas en gobernaciones grandes), o dejar el locale uniforme.

Lo dejamos uniforme. Una dirección saudí extraída de forma uniforme es una aproximación conocida y documentada; una lista en la que dos tercios de las ciudades se ponderan a partir de un tipo de unidad y un tercio a partir de otro es un defecto que resultaría invisible para todo el mundo, nosotros incluidos. Allí donde la fuente no permite establecer la métrica, no calcularla es la respuesta correcta — un argumento desarrollado con detalle en Cómo auditar un conjunto de datos de frecuencia de nombres.

De 64 ficheros de localidades, 44 están ponderados por población en el momento de escribir esto y 20 siguen siendo uniformes. Esos 20 uniformes no son una lista de pendientes que no hayamos abordado; cada uno es un caso en el que la fuente no permite establecer la métrica, siendo ar_SA el ejemplo desarrollado más arriba. Seguirán siendo uniformes mientras no cambien las estadísticas subyacentes, y entretanto la aproximación documentada es la salida correcta.

La otra señal reveladora: códigos postales que no pueden ser correctos

La frecuencia de las ciudades es la distorsión que menos se nota. Los códigos postales son la que se nota primero, y es en Irlanda donde los generadores ingenuos fallan de la forma más visible.

Un Eircode irlandés tiene siete caracteres en dos partes:

A65 F4E2
└┬┘ └─┬─┘
 │    └── identificador único de UNA propiedad
 └─────── clave de enrutamiento (zona geográfica)

Los tres primeros caracteres forman una clave de enrutamiento que cubre una zona amplia. Los cuatro últimos identifican un edificio concreto. Dos casas vecinas de una misma calle tienen Eircodes distintos; « el Eircode de Galway » no existe.

Un generador que asigna el mismo código postal a todas las tarjetas de una ciudad produce, en el caso de Irlanda, no una dirección ligeramente equivocada sino una estructuralmente imposible — y cualquiera que viva allí lo detecta al instante. La misma clase de problema aparece allí donde los códigos postales bajan a un nivel más fino que el de la localidad: los códigos postales británicos abarcan unas 15 direcciones, y los neerlandeses, sumados al número de portal, identifican una única dirección.

Nuestra lista irlandesa contiene 72 entradas frente a un esquema de 3 columnas, la más extensa de todos los locales en relación con el tamaño del país, precisamente porque las claves de enrutamiento no se corresponden una a una con las ciudades.

Qué comprobar en cualquier generador de direcciones

  1. Compare la proporción del top 10 de ciudades con la proporción real de población. Si el generador es uniforme, el primer número vale 10/N y será aproximadamente un tercio del segundo. Es una línea de aritmética, y ahí está todo el diagnóstico.
  2. Pregunte qué cifra de población usa cada ciudad. Municipal, aglomeración urbana, área metropolitana, región administrativa. La coherencia dentro de un mismo locale importa más que cuál de ellas se elija.
  3. Compruebe si la oficina estadística del país publica siquiera cifras a nivel de ciudad. Varias no lo hacen. Eso es una razón para dejar un locale sin ponderar, no una razón para improvisar.
  4. Compruebe la granularidad del código postal. Si el código del país identifica un edificio o un pequeño grupo de direcciones, un único código por ciudad es un defecto visible.
  5. Genere unos cientos de tarjetas y cuente. Casi todos los defectos de este artículo son invisibles en una tarjeta aislada y evidentes en un recuento de 300.

El fondo del asunto es que la plausibilidad de los datos generados es una propiedad distribucional. Cada tarjeta ucraniana tomada por separado era impecable. El conjunto describía un país donde la capital no es más probable que una capital de distrito, y ninguna inspección de entradas individuales lo habría revelado jamás.


Datos actualizados a 2026-07-18

Las proporciones de las ciudades se calcularon el 18 de julio de 2026 directamente a partir de los ficheros de localidades distribuidos. Las proporciones uniformes son 10/N sobre el mismo fichero, de modo que ambas columnas describen la misma lista de ciudades y solo difieren en la regla de selección. Las cifras de población son las incorporadas en los ficheros de localidades; allí donde una cifra exigía elegir una delimitación, la elección se indica en el texto.

Fuentes y notas:

  • Ficheros de localidades — 64 locales, de los cuales 44 llevan pesos de población y 20 son uniformes, recontados el 22 de julio de 2026. Los tres casos desarrollados más arriba: uk_UA (54 ciudades, 18.033.518 habitantes cubiertos), de_DE (57 ciudades, 23.909.828), ja_JP (60 ciudades, 51.046.822). La población cubierta es la suma sobre las ciudades listadas, no la población nacional.
  • Japón — Statistics Bureau. Tokio está representada por los 23 distritos especiales, 9.733.276. La City of Tokyo fue suprimida en 1943 y no tiene sucesor jurídico como municipio único. <stat.go.jp/english/&gt;
  • Alemania — Destatis / oficinas estadísticas de los Länder. Poblaciones municipales (Gemeinde); Frankfurt am Main 760.656. <destatis.de/&gt;
  • Ucrania — Derzhstat. Poblaciones de las ciudades; Kyiv 2.952.301. Las cifras son anteriores a las perturbaciones administrativas actuales y se usan como pesos de lista, no como estimaciones demográficas actuales. <ukrstat.gov.ua/&gt;
  • Arabia Saudí — GASTAT. Publica por gobernación; las cifras urbanas a nivel de ciudad no están disponibles para 14 de las 39 ciudades de nuestra lista, por lo que ar_SA sigue sin ponderar. <stats.gov.sa/&gt;
  • Irlanda — Eircode. Código de siete caracteres: clave de enrutamiento de 3 caracteres más identificador único de propiedad de 4 caracteres. <eircode.ie/&gt;
  • Australia — ABS; City of Sydney LGA frente a Greater Sydney GCCSA. <abs.gov.au/&gt;

Sobre los recuentos de extracciones. El recuento uniforme (12/12/11) y el ponderado por población (46/31/14) están medidos ambos sobre series de 300 tarjetas contra el fichero ucraniano distribuido, que contiene 54 ciudades. Las cifras de valores extremos que sirven para interpretarlos — máximo medio 11,58, mediana 11, percentil 95 de 14 y P(tres primeras ≥ 12, 12, 11) = 0,060 — proceden de 200.000 series uniformes simuladas de 300 extracciones sobre 54 ciudades equiprobables.

← Artículos