Cuatro apellidos que no existen: encontrar errores en las estadísticas públicas oficiales
El fichero de apellidos del censo de 2010 de la US Census Bureau indica que HALL lo llevan 407.076 estadounidenses. El fichero de 2000 decía 473.568. Entre ambos censos la población de Estados Unidos creció alrededor de un 9,7 %, y HALL aparentemente retrocedió un 14,0 %.
Dos filas más abajo, en ese mismo fichero, está HAIL, con 86.240 portadores. En 2000, HAIL tenía 2.860.
Un apellido no se multiplica por treinta en diez años. Lo que ocurrió es que, en algún punto de la cadena de procesamiento de 2010, la tercera letra de HALL se leyó como una I, y un apellido quedó escindido en dos. Este artículo trata de cómo se encuentran defectos así: no conociendo los apellidos estadounidenses, cosa que no habría servido de nada, sino confrontando un fichero consigo mismo.
Todos los casos que siguen son reales, se descubrieron el 18 de julio de 2026 mientras se construían datos de direcciones y de nombres para 64 locales, y se descubrieron por aritmética.
El defecto de sustitución de letra del censo estadounidense
El patrón HALL/HAIL no está aislado. La misma sustitución L→I en la tercera posición aparece cuatro veces, y los cuatro casos se comportan de forma idéntica:
| Apellido | Portadores en 2000 | 2010 tal como se publicó | Gemelo corrompido | Fusionado | Crecimiento si se fusionan | Crecimiento tal como se publicó |
|---|---|---|---|---|---|---|
HALL | 473.568 | 407.076 | HAIL 86.240 | 493.316 | +4,2 % | −14,0 % |
BELL | 264.752 | 220.599 | BEIL 59.463 | 280.062 | +5,8 % | −16,7 % |
WALTERS | 104.281 | 89.376 | WAITERS 19.853 | 109.229 | +4,7 % | −14,3 % |
BALL | 77.561 | 66.059 | BAIL 14.957 | 81.016 | +4,5 % | −14,8 % |
Lea solo la columna «tal como se publicó» y tendrá cuatro apellidos bien asentados que se hunden cada uno por su lado entre un 14 y un 17 % en una década en la que el país, en cambio, creció. Fusione cada uno con su gemelo y los cuatro aterrizan en una franja de 1,6 puntos comprendida entre el +4,2 % y el +5,8 %: modesta, mutuamente coherente, sin nada destacable.
La prueba más fuerte, y aquella por la que hoy empezaríamos, es la historia propia de los gemelos:
| Apellido | 2000 | 2010 | Factor | Puesto 2010 |
|---|---|---|---|---|
HAIL | 2.860 | 86.240 | ×30 | 364 |
BEIL | 2.308 | 59.463 | ×26 | 565 |
BAIL | 1.155 | 14.957 | ×13 | 2.421 |
WAITERS | 2.038 | 19.853 | ×9,7 | 1.809 |
Todos son apellidos reales y raros: ya existían en 2000 con un par de miles de portadores cada uno. Los apellidos raros no crecen nueve veces en una década, y mucho menos treinta. Cada gemelo absorbió una porción de su progenitor.
Una tercera comprobación, independiente, lo confirma. El fichero del censo publica, para cada apellido, la distribución porcentual de los portadores entre categorías autodeclaradas. Si HAIL fuera realmente un apellido distinto al que le hubiera dado por crecer, su distribución sería la suya propia. En cambio:
| Apellido | % A | % B | Apellido | % A | % B |
|---|---|---|---|---|---|
HALL | 72,65 | 21,59 | BELL | 61,11 | 32,35 |
HAIL | 73,14 | 21,60 | BEIL | 62,10 | 32,08 |
Dos decimales de diferencia. HAIL es una muestra aleatoria de HALL, que es exactamente lo que produce una sustitución de caracteres de tipo OCR. (BAIL/BALL concuerdan igual; WAITERS/WALTERS no: 74,5/20,0 frente a 82,9/11,3, muy probablemente porque WAITERS es además un apellido de oficio genuino, de modo que esa fila es una mezcla y no una escisión limpia. Que falle una de las cuatro huellas es en sí mismo informativo.)
Usamos aquí esas distribuciones únicamente como huella forense para detectar una fila duplicada. No portan significado alguno sobre nombres y poblaciones, y nosotros no extraemos ninguno.
Uganda: un censo en el que todo un bloque lleva la etiqueta equivocada
La Uganda Bureau of Statistics publica los resultados del censo de 2014 como PDF regionales, tabulados en jerarquía: district, luego sub-county, luego parish. Una vez analizados, eso son 9.040 filas.
El defecto no está en ningún número aislado. Consiste en que los encabezados de district se desplazan: allí donde falta una fila de encabezado de district, cada sub-county posterior hereda el nombre del district anterior, y una larga serie de localidades acaba archivada bajo un district del que no está ni cerca.
No necesita conocer la geografía de Uganda para detectarlo. El total declarado de un district y la suma de sus propios hijos son dos números que deben concordar a grandes rasgos. Calcule el cociente:
| District | Total declarado | Suma de sus hijos | Cociente |
|---|---|---|---|
Koome Island | 18.778 | 532.952 | 28,4× |
Ishaka Division | 16.439 | 201.391 | 12,3× |
Kayunga District | 368.062 | 2.341.327 | 6,4× |
Kanungu District | 252.144 | 674.348 | 2,7× |
Kyankwanzi District | 214.693 | 489.646 | 2,3× |
Mityana District | 328.964 | 336.093 | 1,02× |
Siete districts de 126 superan su total declarado en más de 1,5×. El resto se agrupa cerca de 1,0, y es justamente eso lo que le dice que los siete son defectos y no una peculiaridad de cómo cuenta el censo.
Kayunga es el caso más claro. Entre sus hijos figuran Kyengera Town Council, Nansana Division, Kasangati Town Council, Bweyogerere Division, Nabweru Division y Katabi Town Council, todos ellos en el Wakiso District, el anillo de suburbios densos alrededor de Kampala. El bloque entero de Wakiso está archivado bajo Kayunga. De igual modo, Kyazanga Town Council y Lwengo Town Council aparecen bajo Kyankwanzi; ambos están en el Lwengo District.
Quien construya una lista de ciudades a partir de este fichero fiándose de la columna del district se encuentra con los mayores suburbios de Uganda asignados al district equivocado, y le ocurre en silencio, porque cada cifra de población tomada por separado es correcta. Solo se movieron las etiquetas.
Una corrección a nuestra propia nota anterior. Habíamos consignado que el bloque etiquetado como Kiboga contenía en realidad los subdistritos de Kyankwanzi, y que los datos propios de Kiboga faltaban. Al volver a comprobarlo contra el fichero analizado, no es eso lo que muestra: Kiboga District está presente con un total plausible de 148.218, y sus hijos (Kiboga Town Council 19.338, Bukomero Town Council 14.182) suman menos que eso. El desplazamiento es real, pero va de Wakiso→Kayunga y de Lwengo→Kyankwanzi, no de Kyankwanzi→Kiboga. La nota anterior era errónea y queda sustituida por esta.
Wikipedia: la fila equivocada, copiada
Para la ciudad ugandesa de Mbarara, Wikipedia ha venido dando una población de 195.531.
En el fichero del censo de la UBOS, 195.531 es la población de Kyengera Town Council, un suburbio de Kampala situado a unos 260 km de allí. El total propio del Mbarara District es de 472.629, y la cifra del municipio de Mbarara es otro número distinto todavía.
No hay ambigüedad alguna sobre lo que pasó: alguien que leía un PDF tabulado y largo tomó el valor de la línea equivocada. Es el error más corriente de este artículo y probablemente el más propagado, porque una cifra de población de Wikipedia se copia mucho más a menudo de lo que se abre un PDF censal.
La comprobación que lo atrapa es la misma de principio a fin: un número debería aparecer en un solo sitio. Si una cifra de la ciudad A es idéntica byte a byte a una cifra de la ciudad B en el documento fuente, una de las dos es una transcripción.
Argentina: dos cosas distintas que llevan el mismo nombre
El último caso no tiene caracteres corrompidos ni etiquetas desplazadas. Todos los números son correctos. El defecto es que se publican dos cosas incompatibles en la misma columna.
Las tablas de población argentinas mezclan niveles administrativos. Para San Carlos de Bariloche, el municipio tiene 112.887 habitantes y la localidad, 109.305. Para Trelew, 99.430 frente a 97.915. Agregue una lista nacional de ciudades sin comprobar qué unidad usa cada fila y obtendrá una tabla incoherente consigo misma en un pequeño porcentaje en la mayoría de las filas y, en las ciudades donde el municipio engloba el poblamiento circundante, en muchísimo más.
Este es el único caso del artículo que no hemos podido reconstruir a partir de un fichero primario de nuestros propios datos de trabajo, así que lo señalamos como tal: el mecanismo está bien documentado, y los pares concretos de arriba proceden de nuestras notas de sesión y no de un fichero fuente que podamos volver a ejecutar. Tome las cifras individuales como indicativas y el mecanismo como lo esencial.
Ese mecanismo se generaliza mucho más allá de Argentina, y es el objeto de un artículo complementario sobre qué cuenta como «ciudad»: véase Por qué los generadores de direcciones producen ciudades implausibles, donde la misma ambigüedad convierte a Sídney en 200.000 habitantes o en 5,3 millones según qué límite se acepte.
El método
Ninguno de estos defectos se encontró mirando los datos y notando que algo no encajaba. Todos salieron de una comprobación que podría haber respondido «todo bien» y no lo hizo:
- Compruebe la dinámica entre censos. Una cifra que se aparta de la tendencia nacional por un margen amplio es o bien un acontecimiento, o bien un defecto. Ambas cosas merecen conocerse.
HALLal −14,0 % frente al +9,7 % fue la puerta de entrada a todo lo demás en el fichero estadounidense. - Compruebe los factores de crecimiento en las entradas pequeñas. Lo raro no se vuelve común deprisa. Un ×30 sobre un apellido de 2.860 portadores es una señal más fuerte que cualquier cosa que le ocurra a
HALLmismo, porque las entradas raras no tienen ninguna vía legítima de moverse tanto. - Compruebe que las partes suman el todo. Total declarado de un district frente a la suma de sus hijos. Esta sola prueba encontró los siete bloques ugandeses mal etiquetados y no exige conocimiento alguno del país.
- Compruebe que un número aparece una sola vez. Valores idénticos en dos entidades distintas significan una transcripción, no una coincidencia.
- Compruebe la unidad antes que el valor. Municipio o localidad, portadores o posiciones, ciudad propiamente dicha o área metropolitana. Un número correcto bajo la unidad equivocada es el defecto más difícil de ver, porque nada en él parece erróneo.
- Busque una segunda huella. Allí donde un fichero lleva columnas auxiliares, una fila duplicada suele duplicarlas también. Cuando tres huellas concuerdan y una cuarta no, es esa cuarta la que le está diciendo algo, como hizo
WAITERS.
La lección general es incómoda. Las cuatro fuentes reunidas aquí son, en el sentido corriente del término, autorizadas: dos agencias estadísticas nacionales, una oficina nacional del censo y la obra de referencia más leída del mundo. La autoridad no es una propiedad que se transmita a las filas tomadas una a una. Las filas hay que comprobarlas, y pueden comprobarse de forma barata, desde dentro del propio fichero, sin ninguna experiencia en la materia.
Y una consecuencia concreta para quien use datos de apellidos estadounidenses: si su cadena de procesamiento lee el fichero del censo de 2010 tal como se publicó, su conjunto de datos contiene cuatro apellidos que no existen, dos de ellos situados dentro de los 600 primeros puestos. Nosotros los teníamos. Así fue como descubrimos esto.
Datos actualizados a 2026-07-18
Toda la aritmética se recalculó el 18 de julio de 2026 a partir de los ficheros primarios enumerados más abajo, salvo allí donde el texto indica lo contrario (las cifras argentinas). Allí donde nuestras notas de sesión anteriores discrepaban de los ficheros, mandan los ficheros y la corrección queda declarada en el texto.
Fuentes:
- Estados Unidos — US Census Bureau, Frequently Occurring Surnames in the 2010 Census (162.254 filas) y el fichero de apellidos del Census 2000 (151.671 filas). Totales de portadores contabilizados: 242.121.073 en 2000 y 294.979.229 en 2010; la diferencia entre esos totales de fichero refleja umbrales de cobertura distintos, no un cambio de población: el +9,7 % empleado en el texto es el crecimiento de la población residente de Estados Unidos, de 281,4 millones (2000) a 308,7 millones (2010). <census.gov/topics/population/gene…;
- Uganda — UBOS, National Population and Housing Census 2014, perfiles regionales específicos por zona (analizados en 9.040 filas de district / sub-county / parish). <ubos.org/>
- Wikipedia, artículo sobre Mbarara, cifra de población de 195.531, coincidente con
Kyengera Town Councilen el fichero de la UBOS. - Argentina — cifras de población del municipio y de la localidad tal como quedaron consignadas en nuestras notas de trabajo; no reconstruidas a partir de un fichero primario, señaladas como tales en el texto. <indec.gob.ar/>
Sobre las columnas de porcentajes del censo. El fichero de apellidos del censo estadounidense publica, para cada apellido, las proporciones de categorías autodeclaradas. Se usan en este artículo únicamente como huella forense para identificar una fila de datos duplicada, y no respaldan inferencia alguna sobre nombres y poblaciones.