¿Qué proporción de un país deberían representar sesenta ciudades? Sobre cómo elegir un umbral que se pueda defender
La comprobación de datos más barata que ejecutamos cabe en una línea de aritmética: sumar las poblaciones de las ciudades de un fichero de localidades, dividir por la población del país y mirar el cociente. Una vez atrapó una lista taiwanesa cuya suma alcanzaba el 106,9 % de Taiwán, algo físicamente imposible que saltaba a la vista en un segundo.
Después dijimos que el umbral no debía ser el 100 % sino «una proporción urbana plausible para ese país concreto», y seguimos adelante como si eso fuera una respuesta. No es una respuesta. Es el nombre de una pregunta.
Este artículo es nuestro intento de responderla de verdad en 39 locales, y el hallazgo no es el que esperábamos. La proporción de un país que representa nuestra lista de ciudades viene determinada sobre todo por decisiones que tomamos nosotros sobre la lista, no por hechos relativos al país — lo que significa que el número es casi ininterpretable por sí solo y que un umbral universal no puede existir ni siquiera en principio. Lo que sí podemos ofrecer en su lugar es un procedimiento que sustituye una pregunta sin respuesta por dos preguntas que sí la tienen, más una advertencia sobre cómo nombrar las métricas que aprendimos por las malas mientras redactábamos este texto.
Dos números, con nombre
Antes de cualquier cifra, una cuestión de vocabulario que nos costó una tarde de confusión. Hay dos porcentajes completamente distintos que pueden calcularse a partir de una lista de ciudades ponderada, ambos naturales, ambos situados grosso modo en la franja del 50–80 % para los países pequeños, y ambos fáciles de anotar como «la proporción»:
| Nombre | Definición | Responde a |
|---|---|---|
| Cobertura | suma de la lista entera ÷ población nacional | ¿Qué parte del país alcanza esta lista? |
| Proporción de cabeza | suma de las diez primeras filas ÷ suma de la lista entera | ¿Hasta qué punto está concentrada en cabeza esta lista? |
Georgia está en el 86,8 % de proporción de cabeza y en el 64,4 % de cobertura. Ambas son correctas; no son dos versiones de un mismo número. Sin etiqueta, las dos series se funden en una sola y producen una tabla donde ya nada significa nada. Cada porcentaje de más abajo indica de cuál se trata.
La cobertura es la magnitud que produce la comprobación clásica de la suma frente al total, así que es de ella de la que trata sobre todo este artículo. La proporción de cabeza reaparece más adelante como aquello a lo que uno podría recurrir para salvar la comprobación — y no la salva.
La amplitud real
Nuestro conjunto de localidades consta de 64 ficheros. De ellos, 44 llevan pesos de población y 20 se entregan con ponderación uniforme. La tabla de cobertura de más abajo se calculó cuando había 39 ponderados; bn_BD, en_AU, no_NO, tr_TR y zh_TW lo están desde entonces y no figuran en ella. Sumar cada fichero ponderado y dividir el resultado por la población de su país da la cobertura:
| Locale | Ciudades | Cobertura | Locale | Ciudades | Cobertura |
|---|---|---|---|---|---|
en_NZ | 60 | 70,4 % | ro_RO | 60 | 37,0 % |
fi_FI | 60 | 70,1 % | vi_VN | 60 | 33,0 % |
he_IL | 55 | 67,0 % | pl_PL | 55 | 32,3 % |
fr_CA | 60 | 66,4 % | el_GR | 60 | 31,9 % |
hy_AM | 41 | 66,0 % | pt_BR | 58 | 31,0 % |
lv_LV | 58 | 66,0 % | de_DE | 57 | 28,5 % |
ka_GE | 45 | 64,4 % | en_PH | 60 | 27,6 % |
bg_BG | 60 | 61,3 % | it_IT | 58 | 25,9 % |
hr_HR | 60 | 60,4 % | zh_CN | 60 | 21,9 % |
kk_KZ | 52 | 58,3 % | ne_NP | 51 | 21,1 % |
en_CA | 60 | 48,5 % | id_ID | 60 | 18,6 % |
ro_MD | 43 | 47,1 % | fr_BE | 60 | 16,7 % |
hu_HU | 60 | 46,5 % | fr_FR | 56 | 16,2 % |
uk_UA | 54 | 44,0 % | en_US | 54 | 15,3 % |
sv_SE | 58 | 43,6 % | en_ZA | 60 | 14,9 % |
de_AT | 60 | 42,9 % | en_IN | 60 | 9,0 % |
(Los locales situados entre el 40 % y el 42 % — sk_SK, ja_JP, sl_SI, cs_CZ, fa_IR, ru_RU, es_ES — se han omitido de la tabla por razones de extensión; todos caen en mitad de la franja.)
La cobertura va del 9,0 % al 70,4 %, un factor de casi ocho. Ningún número único separa los ficheros buenos de los malos, porque el 9,0 % y el 70,4 % son ambos correctos.
Fíjese también en lo que no está aquí. La prueba del 100 % había rechazado, sobre el conjunto entero, exactamente un fichero: Taiwán, con el 106,9 %. El otro locale del que sacamos pesos, Australia con el 84,7 %, pasaba la prueba del 100 % con holgura y fue rechazado por un humano que se dio cuenta de que la fila de Sydney llevaba la cifra del Greater Sydney. Una prueba que se dispara una sola vez en 64 ficheros, y que pasa por alto la segunda aparición del mismísimo defecto al que apunta, no pesa gran cosa. (Ambos ficheros se repararon después y los dos se entregan ya ponderados — lo que no salva la prueba, puesto que en ninguno de los dos casos fue la prueba la que encontró el defecto.)
Por qué ese número significa tan poco
La proporción es un cociente, y el numerador lo controlamos nosotros. Dos decisiones nuestras lo dominan, y ninguna de las dos tiene nada que ver con que los datos sean correctos.
Primero: hasta dónde baja la lista. Toda lista está limitada a unas 60 ciudades. Lo que significa ese tope depende por completo del país. Esta es la ciudad más pequeña de cada lista — el punto donde la lista se detiene:
| Locale | Cobertura | Ciudad más pequeña de la lista | Ciudad mediana |
|---|---|---|---|
lv_LV | 66,0 % | 753 | 6.410 |
ka_GE | 64,4 % | 899 | 10.747 |
hy_AM | 66,0 % | 1.010 | 13.133 |
en_NZ | 70,4 % | 2.316 | 18.447 |
sl_SI | 41,3 % | 1.519 | 6.037 |
en_ZA | 14,9 % | 12.790 | 87.348 |
ja_JP | 41,5 % | 189.591 | 474.592 |
en_US | 15,3 % | 199.723 | 639.111 |
pt_BR | 31,0 % | 302.692 | 698.642 |
zh_CN | 21,9 % | 547.879 | 3.608.835 |
en_IN | 9,0 % | 644.406 | 1.162.472 |
La ciudad más pequeña del fichero letón tiene 753 habitantes. La ciudad más pequeña del fichero indio tiene 644.406. Es un factor de 856 entre los puntos donde se detienen ambas listas.
Este solo hecho explica la mayor parte de la amplitud. Sesenta entradas letonas descienden hasta el nivel de las aldeas, y Letonia no tiene muchas localidades por debajo de ahí, de modo que la lista capta la mayor parte del sistema urbano del país y aterriza en el 66 %. Sesenta entradas indias se detienen en las «ciudades de más de 644.000 habitantes», por debajo de las cuales la India cuenta con varios miles de poblaciones más, de modo que la lista capta apenas una franja mínima y aterriza en el 9,0 %. Ambas listas se comportan exactamente como un tope de 60 filas las obliga a comportarse.
Segundo: el tamaño del país. Un tope de 60 ciudades en una nación de 1.400 millones de habitantes y un tope de 60 ciudades en una nación de 1,9 millones no son el mismo instrumento. La India necesitaría decenas de miles de filas para alcanzar la profundidad que Letonia alcanza con 58. Ningún umbral aplicado a ambas puede significar lo mismo.
En conjunto: la cobertura esperada la fijan el tope y el tamaño del país, y la estructura urbana real solo la modula. Preguntar si una cobertura del 31,0 % es plausible para Brasil sin saber que la lista brasileña se detiene en 302.692 habitantes es preguntarse por un cociente ignorando la definición de su numerador.
La cifra de profundidad explica también la proporción de cabeza, y por eso es ella la que merece ocupar el centro de este artículo, y no ninguno de los dos porcentajes. La proporción de cabeza de la India es baja (51,9 %) porque su lista contiene sesenta ciudades grandes de tamaño comparable — un artefacto de haberse detenido en 644.406. La de Letonia es alta (78,2 %) porque su lista va desde Riga hasta una aldea de 753 habitantes, de modo que las diez primeras dominan inevitablemente. Ambos porcentajes son sombras de una misma decisión sobre dónde parar.
La proporción de cabeza no salva a la cobertura
El paso siguiente evidente consiste en corregir la cobertura con algo calculable a partir del propio fichero. Si un país está dominado por una única ciudad enorme, cabría esperar una cobertura alta a partir de pocas filas; si sus ciudades son de tamaño homogéneo, cabría esperar lo contrario. La proporción de cabeza mide exactamente eso. Entonces, ¿predice la cobertura?
No. Las dos magnitudes son casi independientes entre sí, y dos locales lo demuestran fallando en direcciones opuestas:
| Locale | Proporción de cabeza | Cobertura | Ciudad más pequeña | Lectura |
|---|---|---|---|---|
fi_FI | 55,4 % | 70,1 % | 7.766 | Lista plana y, aun así, alcanza la mayor parte del país |
de_AT | 77,3 % | 42,9 % | 7.349 | Lista concentrada en cabeza y, aun así, alcanza menos de la mitad |
La lista finlandesa es la menos concentrada en cabeza de las dos y tiene la cobertura más alta. La austriaca está fuertemente concentrada en sus diez primeras filas y cubre apenas la mitad de lo que cubre la finlandesa. Sea cual sea la corrección que se construya a partir de la proporción de cabeza, una de estas dos sale al revés.
El conjunto completo se comporta igual. Georgia tiene la proporción de cabeza más alta que hemos medido, el 86,8 %, con un 64,4 % de cobertura. Letonia está en el 78,2 % de proporción de cabeza con un 66,0 % de cobertura. Nueva Zelanda, en el 74,3 % con un 70,4 %. La India está en el 51,9 % de proporción de cabeza — una lista realmente plana, de ciudades grandes y de tamaño homogéneo — con un 9,0 % de cobertura. Israel está en el 53,0 % de proporción de cabeza con un 67,0 % de cobertura: casi exactamente la proporción de cabeza de la India con siete veces su cobertura.
Fíjese en lo que significa esa última pareja. en_IN y he_IL tienen una forma interna casi idéntica — el 51,9 % y el 53,0 % de cada lista está en sus diez primeras filas — y coberturas del 9,0 % y del 67,0 %. La forma interna de la lista no aporta prácticamente ninguna información sobre qué parte del país alcanza.
Así pues, las dos métricas responden a preguntas realmente distintas, y ninguna puede sustituir a la otra. La proporción de cabeza informa sobre la forma de la lista; la cobertura, sobre su alcance. Buscamos una señal interna que predijera la cobertura esperada y no encontramos ninguna que sobreviva a estos casos.
Hay una trampa más en el propio vocabulario. Ambas magnitudes se sitúan en la misma franja numérica en los países pequeños — Letonia está en el 78,2 % y el 66,0 %; Armenia, en el 81,8 % y el 66,0 % — de modo que una tabla que omita el nombre de la métrica produce dos series que parecen una sola serie ruidosa. En esta sesión dedicamos un tiempo nada despreciable a conciliar el «78,2 %» con el «66,0 %» de Letonia antes de darnos cuenta de que eran respuestas a preguntas distintas. Ninguna de las dos cifras era errónea. Lo que faltaba era la etiqueta, que es un defecto de datos por derecho propio y un defecto que ninguna comprobación aritmética puede atrapar.
La cota que sí es mejor que el 100 %
Hay una mejora disponible, y merece la pena enunciarla con precisión porque es real pero limitada.
La suma de las poblaciones de las ciudades de un país no puede superar la población urbana de ese país. Es una restricción física y es estrictamente más estrecha que el 100 %, porque ningún país es urbano al 100 %. Aplicada al fichero australiano rechazado: un 84,7 % de los australianos en 60 ciudades, frente a una tasa de urbanización australiana situada en torno al 86 %, implica que esas 60 ciudades albergaban aproximadamente el 98 % de todos los australianos urbanos — algo absurdo para un país con centenares de núcleos urbanos, y absurdo de una manera que un umbral del 100 % no puede expresar y que un humano solo advirtió por accidente.
Así que la comprobación mejorada es esta: comparar la suma con la población urbana, no con la población total. Cuesta un número externo adicional por país y habría atrapado a Australia de forma mecánica.
Pero hay que etiquetarla con honestidad, porque hereda exactamente la enfermedad que pretende diagnosticar. Una tasa de urbanización nacional es ella misma el producto de alguien que decide qué cuenta como ciudad — la misma elección de definición que produjo el defecto en primer lugar. Los países clasifican las localidades como urbanas con reglas radicalmente distintas: por umbral de población, por estatus administrativo, por densidad, por actividad económica. Una cota construida sobre ese número es indicativa, no decisiva. Estrecha la lista de sospechosos; no condena.
Aplicamos esta cota a nuestro conjunto y el resultado sitúa tres locales lo bastante cerca de su población urbana estimada como para merecer un vistazo — ka_GE, hy_AM y ro_MD, cada uno un país pequeño donde nuestra lista desciende hasta el millar de habitantes aproximadamente. No los damos por defectos. Las trampas de unidad conocidas en Georgia y Armenia — las tres cifras anidadas de Kaspi, la pareja քաղաք frente a համայնք de Chambarak — ya están correctamente resueltas en los ficheros entregados, cosa que comprobamos. Lo que la cota produjo es una cola de revisión humana, que es lo máximo que puede producir un umbral de este tipo.
Entonces: ¿existe una fórmula?
No. Buscamos una y comunicamos su ausencia como resultado.
No existe ninguna función que lleve del contenido de un fichero de localidades a una cobertura esperada defendible, porque el término dominante es un tope que impusimos nosotros, el segundo término es el tamaño del país y el tercero — la estructura urbana real — es el único que porta señal sobre la corrección de los datos y es el más pequeño de los tres. Todo umbral que se dispare sobre el número resultante se está disparando en realidad sobre nuestro propio límite de filas. Y el corrector interno más prometedor, la proporción de cabeza, resulta medir algo ortogonal.
Lo que la sustituye no es una fórmula, sino un replanteamiento. La pregunta sin respuesta «¿es plausible esta cobertura?» se escinde en dos preguntas que sí la tienen:
- ¿Es la cabeza de la lista la unidad correcta? Aquí es donde viven los defectos de verdad. La lista taiwanesa mezclaba municipios con sus propios distritos; la australiana sustituía las áreas de gobierno local por aglomeraciones. Ambos casos se ven tomando las tres o cuatro entradas mayores y contrastando cada una con una cifra conocida de forma independiente para esa ciudad concreta. Sydney con 5.219.674 frente a una City of Sydney de unos 200.000 habitantes es una comprobación de un minuto que no necesita umbral alguno.
- ¿Dónde se detiene la lista, y fue eso intencionado? Deje constancia de la entrada más pequeña como regla de profundidad explícita: «este fichero contiene localidades de más de N habitantes». Una vez escrito eso, una cobertura baja deja de ser sospechosa y pasa a ser aritmética. La India con un 9,0 % no necesita defensa alguna en cuanto el fichero dice que se detiene en 644.406.
Y una tercera, gratis: etiquete cada porcentaje con su métrica. La cobertura y la proporción de cabeza nos costaron más confusión en esta sesión que ninguna cifra equivocada.
La comprobación de cobertura conserva su sitio, pero degradada: es un detector de imposibilidad, no de implausibilidad. Por encima del 100 %, algo está sin duda mal. Por debajo del 100 %, no dice nada sobre lo que se pueda actuar sin las dos comprobaciones anteriores. Es una afirmación mucho más modesta que la que veníamos haciendo de forma implícita, y es la que los datos sostienen.
Si eso suena a admitir que esta comprobación exige un juicio humano país por país, lo es. Veinte de nuestros 64 ficheros se entregan sin pesos precisamente porque ese juicio volvió con un «no podemos hacer esto coherente», y preferimos entregar una aproximación documentada antes que un defecto invisible. La versión honesta de un proceso de calidad de datos incluye una columna para lo no decidido.
Para la clase de defectos que esta comprobación se construyó para atrapar, véase Sesenta ciudades, el 106,9 % de un país. Para lo que ocurre aguas abajo cuando faltan los pesos, véase Por qué los generadores de direcciones producen ciudades implausibles. Para el problema general de las comprobaciones que no pueden fallar, véase Una prueba que no puede fallar.
Datos actualizados a 2026-07-18
Todas las proporciones, recuentos de ciudades, ciudades más pequeñas y medianas que figuran en este artículo se calcularon el 18 de julio de 2026 directamente a partir de los ficheros de localidades entregados, sumando la cuarta columna de cada .tsv y dividiendo por la tabla de poblaciones que usa nuestra suite de regresión. Aquí no hay nada tomado de notas de trabajo.
Fuentes y notas:
- Ficheros de localidades — 64 ficheros en
share/name_gen/locality/. 44 llevan una cuarta columna de población y 20 son de tres columnas y se entregan con ponderación uniforme, recontados el 22 de julio de 2026; el conjunto uniforme incluyear_SA,en_GB,en_IE,ko_KR,nl_NL,pt_PTyes_AR. Cuando se calcularon las cifras de cobertura de más arriba, el reparto era de 39/25;bn_BD,en_AU,no_NO,tr_TRyzh_TWrecibieron pesos después. - Denominadores de población — la tabla incrustada en
ng_regression_tests.php, que lleva poblaciones nacionales redondeadas (Letonia 1.870.000; India 1.430.000.000; y así sucesivamente). Las proporciones son, por tanto, exactas hasta aproximadamente el redondeo de esa tabla, lo que resulta adecuado a la resolución que emplea este artículo e inadecuado para cualquier cosa más fina. - Extremos —
en_IN127.990.788 sobre 60 ciudades = 9,0 %;en_NZ3.658.551 sobre 60 ciudades = 70,4 %. Entradas más pequeñas:lv_LV753,en_IN644.406, un cociente de 856. - Ambas métricas, calculadas en paralelo el 18 de julio de 2026. La proporción de cabeza es la suma de las diez filas mayores dividida por la suma de todas las filas; la cobertura es la suma de todas las filas dividida por la población nacional.
| Locale | Proporción de cabeza | Cobertura | Ciudad más pequeña |
|---|---|---|---|
ka_GE | 86,8 % | 64,4 % | 899 |
hy_AM | 81,8 % | 66,0 % | 1.010 |
lv_LV | 78,2 % | 66,0 % | 753 |
de_AT | 77,3 % | 42,9 % | 7.349 |
en_NZ | 74,3 % | 70,4 % | 2.316 |
ro_MD | 74,1 % | 47,1 % | 2.655 |
en_ZA | 57,8 % | 14,9 % | 12.790 |
fi_FI | 55,4 % | 70,1 % | 7.766 |
he_IL | 53,0 % | 67,0 % | 22.896 |
en_IN | 51,9 % | 9,0 % | 644.406 |
en_US | 50,9 % | 15,3 % | 199.723 |
zh_CN | 45,2 % | 21,9 % | 547.879 |
fi_FI suma 3.927.865 y hy_AM, 1.848.547. La inversión fi_FI / de_AT y la pareja en_IN / he_IL son los dos casos que descartan predecir la cobertura a partir de la proporción de cabeza.
- El 84,7 % de Australia — un recuerdo, no una rederivación.
en_AUse entrega sin pesos, así que ya no queda ninguna cuarta columna que sumar; lo que está confirmado en disco es la consecuencia. Trate la cifra como indicativa y véase Qué cuenta como una ciudad para la misma reserva en su origen. - Tasas de urbanización — externas, aproximadas y deliberadamente no tabuladas aquí. En este artículo solo sirven para sostener un argumento cualitativo sobre Australia y para explicar por qué la cota mejorada es blanda. Cualquier cifra nacional concreta de urbanización debería tomarse de la oficina estadística competente, prestando atención a cómo define esa oficina lo «urbano».
- Comprobaciones puntuales de Georgia y Armenia —
ka_GEentrega Kaspi con 12.911 (la cifra de la ciudad, no el municipio de 41.841 ni la unidad administrativa de 13.729) yhy_AMentrega Chambarak con 5.468 (la cifra քաղաք, no los 12.416 համայնք). Ambas trampas conocidas están resueltas correctamente en los ficheros entregados; esto se verificó leyendo las filas, no se dio por supuesto.