En qué nos equivocamos con los datos de nombres
Mantenemos corpus de nombres ponderados para 64 locales — nombres de pila, apellidos y las curvas de frecuencia que deciden cada cuánto aparece cada uno. Casi todo lo que se publica sobre este tipo de trabajo describe el producto acabado: aquí está el método, aquí están las fuentes, aquí está el resultado.
Este es el otro artículo. Ocho errores que cometimos de verdad, todos detectados durante una sola auditoría, el 17 de julio de 2026. Varios los detectaron revisores que nos llevaban la contraria, y al menos dos los defendimos antes de ceder.
Los publicamos porque los modos de fallo resultaron ser estructurales y no fruto del descuido. Todos nacieron de una cifra que parecía autorizada y que en realidad medía un objeto distinto del que creíamos. Si trabaja con datos de frecuencia de cualquier tipo, la mayoría de estas trampas le esperan también a usted.
(Un artículo complementario, Siete formas en que los datos de nombres le mienten, cubre la taxonomía general. Esta es la confesión.)
1. La estadística zombi: calibramos Vietnam con una muestra de 1992
Lo que creíamos. Nguyễn lo lleva el 38 % de los vietnamitas. No lo tratamos como una afirmación que exigiera verificación, porque no parecía una afirmación — parecía un conocimiento de fondo. Lo dice Wikipedia. Lo dice la prensa. Lo codifican las bibliotecas Faker. Un consenso tan amplio se lee como una prueba.
Lo que es cierto. Es una sola cifra, repetida. Siga la cadena de citas y desembocará en una única muestra de Lê Trung Hoa de 1992 — pequeña, de hace décadas, y reproducida aguas abajo no porque sea buena, sino porque es la única cifra publicada que alguien puede citar.
Tres muestras grandes la contradicen, y además con sesgos regionales opuestos:
| Fuente | n | Nguyễn | Sesgo |
|---|---|---|---|
| VNTH01 | 1.682.729 | 30,5 % | del norte (63:37) |
| SG01 (Ciudad Ho Chi Minh) | ~241.000 | 31,5 % | del sur |
| Nguyen Viet Khoa (2024), Genealogy 8(1):16 | 883.835 | 31,57 % | revisado por pares; Hanói 39,01 % frente a HCMC 30,61 % |
Que dos muestras sesgadas en sentidos contrarios queden a menos de un punto porcentual la una de la otra es casi decisivo. La cifra real es de aproximadamente el 31 %.
El daño no fue cosmético. Una curva de frecuencias se calibra contra la proporción de su entrada de cabeza, de modo que un divisor inflado comprime toda la distribución — todos los puestos del país, mal, por culpa de una sola cifra que nadie pensó en cuestionar.
La lección. Si una proporción la cita todo el mundo y se remonta a una única fuente primaria pequeña, eso no es corroboración — es un punto único de fallo con buen SEO.
2. «~10 % de los islandeses tienen apellido heredado» — y estuvo a punto de romper un fichero correcto
Esta es la que escuece, porque la cifra era errónea y nuestros datos eran correctos y nos disponíamos a romper nuestros datos para ajustarlos a la cifra.
Lo que creíamos. Islandia usa patronímicos, pero alrededor del 10 % de los islandeses llevan apellidos heredados (ættarnöfn) — Blöndal, Briem, Thorlacius, Möller, Zoëga. Nuestro fichero contenía un 4,15 % de ellos. Es un déficit de un factor dos. Parecía una laguna evidente que había que cerrar.
Lo que es cierto. Hagstofa Íslands (1 de enero de 2017) desglosa la población así:
| Categoría | Proporción |
|---|---|
| Patronímicos | 82 % |
ættarnöfn (apellidos heredados islandeses) | 4 % |
| Otros apellidos, en su mayoría de origen extranjero | 14 % |
El «10 %» no es una medición. Son 4 % + 14 %, fusionados — alguien sumó dos filas que significan cosas distintas. Ese 14 % son apellidos que llevan inmigrantes y sus descendientes. No son ættarnöfn, que constituyen una categoría jurídica precisa: la ley nr. 54/1925 prohibió crear nuevos y dejó los existentes válidos y transmisibles por herencia hasta el día de hoy.
Nuestro fichero estaba en el 4,15 % frente a un valor real del 4 %. Era exacto, y estábamos a punto de «corregirlo» hasta convertirlo en una sobrestimación de 2,4×.
La lección. Verificar una cifra no basta. Hay que verificar qué cuenta la cifra. «El 10 % tiene apellido heredado» y «el 4 % tiene ættarnöfn» son dos frases verdaderas sobre Islandia, y solo una de ellas habla de lo que hay en su fichero.
(Una trampa emparentada que sí esquivamos: la ley nr. 54/1925 es la que prohibió los nuevos apellidos heredados. La 41/1913 es la ley contraria — la que los permitió. Las cifras se parecen lo bastante como para intercambiarlas por descuido, y el sentido se invierte.)
3. Verificación circular: un conjunto de datos, contado dos veces
Lo que creíamos. Nuestro fichero de apellidos húngaros asigna a los apellidos derivados de etnónimos — Tóth, Horváth, Németh, Oláh y similares — el 8,20 % del peso total. La estimación académica, de Farkas, es «el 7–8 % del acervo de apellidos». Nuestra cifra, obtenida de forma independiente, quedaba a una quinta parte de punto de una cifra publicada por la investigación.
Lo consignamos como una confirmación independiente. Nos parecía la prueba más sólida de toda la auditoría.
Lo que es cierto. No es la confirmación de nada. Nuestros pesos están calibrados contra proporciones del registro — nuestro Tóth se sitúa en el 2,192 % frente a un valor de registro del 2,19 %. Farkas saca sus cifras del mismo registro.
Así que no hay dos mediciones que coincidan. Hay un solo conjunto de datos, contado dos veces, que vuelve al punto de partida. La coincidencia estaba garantizada antes de que mirásemos: si nuestra cifra hubiera salido en el 8,20 % frente a una verdad del 3 %, la comprobación habría pasado igualmente. No tiene ninguna capacidad de fallar.
Es el error más seductor de la lista, porque el resultado es indistinguible de un éxito. Detectamos el mismo patrón una segunda vez, de forma independiente, en la misma auditoría.
La lección. Si sus cifras están calibradas a partir de la fuente X, comprobarlas contra X — o contra cualquier trabajo que cite X — es una comprobación de coherencia, no una verificación. Llámela así. La independencia de verdad se parece al punto 1: fuentes con sesgos opuestos que aun así convergen. Dos punteros a un mismo conjunto de datos son un solo conjunto de datos.
4. Portadores frente a posiciones: erróneo por un factor de exactamente dos
Lo que creíamos. García lo llevan 2.915.761 personas en España. Los diez apellidos más frecuentes de Portugal suman el 45,7 %. Ambas cifras vienen directamente de registros. Las usamos como objetivos.
Lo que es cierto. Los españoles y los portugueses llevan dos apellidos, de modo que las proporciones de toda la lista suman aproximadamente el 200 %, no el 100 — y bajo la palabra «frecuencia» se esconden dos magnitudes distintas.
En el caso de García, las propias columnas del INE lo zanjan: 1.446.937 como primer apellido y 2.915.761 en ambas posiciones. No son estimaciones rivales, sino objetos diferentes, y cuál de ellos necesita usted depende de si su entrada lleva un apellido o dos.
Portugal muestra la misma división: top 10 = 45,7 % de los portadores, pero 22,8 % de las posiciones.
Confundirlos no produce un error de redondeo. Produce un objetivo del doble de tamaño que la realidad, y a partir de ahí todo lo que viene aguas abajo se retuerce para alcanzar una cifra que nunca fue alcanzable. Nuestro propio instrumental de diagnóstico picó: alimentado con una proporción de portadores, señaló en el fichero portugués un defecto que no existía.
La lección. Antes de usar cualquier frecuencia de apellidos procedente de un país con dos apellidos, establezca el denominador. Si la fuente no lo dice y las proporciones tienden al 200 %, lo que tiene delante son portadores.
5. Hanja frente a hangul: 정 es 鄭 y 丁
Lo que creíamos. Los apellidos coreanos forman un conjunto reducido y bien documentado. Nuestras entradas están en hangul, las tablas de proporciones en hanja son fáciles de encontrar y las dos describen a todas luces la misma distribución.
Lo que es cierto. El hangul es fonético; el hanja no. La sílaba 정 corresponde a dos apellidos distintos — 鄭 y 丁 — de linajes diferentes, fundidos en una sola forma escrita.
Las consecuencias no son sutiles:
| Contado en | Proporción del top 10 |
|---|---|
| hanja | 63,9 % |
| hangul | 65,8 % |
Esa brecha de 1,9 puntos no es ruido. Es la fusión. Y mueve la clasificación, no solo los totales: en hangul, 정 = 4,84 % (鄭 + 丁 juntos), lo que lo sitúa por encima de 최, con un 4,7 %. Tome la tabla en hanja — la que más se publica — y 鄭 por sí solo parece más pequeño, el orden se invierte y acaba con un fichero que ordena mal los apellidos de Corea de una forma que ningún validador señalará.
La lección. Cuando dos sistemas de escritura fusionan las distinciones de manera distinta, «la frecuencia de X» queda indefinida mientras no diga en qué escritura ha contado. Elija aquella en la que sus datos están realmente escritos y no repare nunca una discrepancia que no es más que la otra escritura hablando.
6. «El top 1.500 del país» no es «nuestra lista de 1.500»
Lo que creíamos. Nuestro fichero de apellidos franceses tenía una curva de pesos comprimida. La referencia a la que recurrimos: un top 1.500 real de Francia se extiende unos 50:1 desde el apellido más común hasta el más raro. Nuestro fichero tiene alrededor de 1.500 entradas. Luego 50:1 es nuestro objetivo.
Lo que es cierto. Las dos cosas comparten un número y nada más.
El verdadero top 1.500 de Francia es un bloque contiguo: los puestos 1 a 1.500, y el puesto 1.500 sigue siendo un apellido razonablemente común. Nuestro fichero es una lista seleccionada a mano de 1.500 entradas repartidas entre los puestos 1 y 126.772 — los muy comunes, más una incursión deliberada en la cola profunda, donde un apellido puede tener unas pocas decenas de portadores en todo el país. Su propio ratio real es de 3.351:1.
Estábamos a punto de comprimir una curva unas 70× porque dos listas sin relación entre sí resultaban tener la misma longitud.
La lección. Mida el ratio entre la entrada de cabeza y la más rara en su propio fichero, nunca en un top N imaginario del país. Una lista seleccionada a mano y una lista contigua en puestos son animales distintos que llevan la misma etiqueta de talla.
7. «Extraño» no es «inventado» — y viceversa
En realidad, esto son dos errores que apuntan en direcciones opuestas, cometidos la misma semana.
En Ucrania estuvimos a punto de borrar personas reales. Nuestra lista de tareas pendientes decía que el fichero de apellidos ucranianos estaba lleno de entradas artificiales, generadas a partir de patrones productivos de formación de palabras en lugar de a partir de un registro, y que había que limpiarlo. La sospecha era razonable — la historia de origen del fichero era exactamente esa.
Entonces lo muestreamos. Una extracción aleatoria de n = 25 de la cola devolvió 0 apellidos artificiales. Соловʼяненко es un cantante de ópera. Хомчак es un antiguo comandante en jefe de las Fuerzas Armadas de Ucrania. Están en la misma cola y resultan exactamente tan raros como las entradas que queríamos eliminar. Probado sobre candidatos deliberadamente sospechosos, el criterio «suena extraño» produjo una tasa de falsos positivos del 21 %.
El contexto lo zanja: Ucrania tiene 707.685 apellidos únicos, con una media de unos 64 portadores cada uno. Raro-y-extraño no es allí una anomalía — es la forma misma del país.
En Taiwán, lo contrario. Nuestra lista de apellidos chinos arrastraba apellidos compuestos arcaicos sacados directamente del 百家姓, un texto del siglo XI — un poema, no un censo. Cotejados con el registro del Ministerio del Interior de Taiwán, 33 de ellos tenían cero portadores. Eliminados, con razón.
Y luego la trampa dentro de la trampa: 澹臺 parece idéntico en su especie — arcaico, compuesto, del mismo texto de origen. Lo pusimos en la lista de eliminación por su aspecto. El registro lo recoge con 2 portadores. Se quedó.
La lección. La variable no es lo evidente que parezca el defecto — en ambos países parecía evidente. Lo que separa limpiar una base de datos de arruinarla es si existe o no un registro nombre por nombre. Taiwán publica recuentos sin umbral de privacidad, así que allí la ausencia significa realmente cero y eliminar es medir. Ucrania no tiene un registro semejante a esa profundidad, con lo que eliminar se reduce a eliminar de oído — y una vez de cada cinco elimina usted uno real. Cuando dispone de un contador, fíese de él antes que de su intuición. Cuando no tiene ninguno, no ponga su oído en su lugar.
8. El defecto espejo: arreglamos un lado y lo empeoramos
Lo que hicimos. Al fichero de apellidos de Suecia le faltaba su capa migratoria — una laguna real y verificable frente al registro del SCB, que incluía nombres situados dentro del top 100 del país. Los añadimos. Un trabajo correcto y sin vueltas.
Lo que pasó. La salida empeoró. Las entradas empezaron a emparejar nombres de pila suecos con los apellidos recién añadidos — la clásica mezcla implausible — y se notaba más que antes de empezar.
Por qué. Los nombres de pila tenían la misma laguna y no habíamos mirado. Una sonda de 40 marcadores contra el fichero de nombres masculinos encontró tres coincidencias — 0,22 % — y el fichero femenino tenía cero. Ahmed sencillamente no existía como nombre de pila en nuestros datos.
Así que los emparejamientos implausibles no los provocó añadir apellidos. Los provocó que esos apellidos no tuvieran ningún nombre de pila con el que emparejarse. Antes de la corrección, ambos lados tenían la laguna y la laguna era invisible por simetría. Arreglar un lado no introdujo el problema; lo reveló — y revelarlo se parecía exactamente a causarlo.
(Cerrado por los dos lados el mismo día: la capa de nombres masculinos pasó del 0,22 % al 2,98 %, y la femenina del 0 % al 0,93 %.)
La lección. Cuando se unen dos conjuntos de datos, un defecto presente en ambos puede quedar invisible, y una corrección acertada en uno de ellos puede parecer una regresión. Corrija los dos lados o ninguno — y, antes de concluir que su corrección ha roto algo, compruebe si simplemente ha dejado algo al descubierto.
El hilo que recorre los ocho
Póngalos uno al lado del otro y son el mismo error:
- El 38 % y el 31 % son ambos «la frecuencia de
Nguyễn» — sobre muestras diferentes. - El 10 % y el 4 % son ambos «los islandeses con apellido heredado» — sobre categorías diferentes.
- El 8,20 % y el 7–8 % son ambos «los apellidos etnónimos húngaros» — sobre el mismo conjunto de datos, contado dos veces.
- 2.915.761 y 1.446.937 son ambos «
Garcíaen España» — sobre posiciones frente a portadores. - El 63,9 % y el 65,8 % son ambos «el top 10 de Corea» — sobre escrituras diferentes.
- 50:1 y 3.351:1 son ambos «el ratio de una lista de 1.500 entradas» — sobre listas diferentes.
- «Extraño» significa artificial en Taiwán y normal en Ucrania — sobre registros diferentes.
- El 0,22 % es a la vez una corrección y un defecto — según el otro lado de la unión.
Ninguna de estas cifras es una cifra equivocada. Todos los valores de este artículo son correctos respecto de algo. Solo son erróneos respecto de aquello que creíamos que medían — y el error es silencioso siempre, porque una cifra llega sin su definición adjunta.
Que es la lección de verdad, más gris que cualquiera de las ocho historias: un valor sin denominador, muestra, categoría y alcance explícitos no es un dato. Es un guarismo. El trabajo no consiste en encontrar números — los números son abundantes y gratuitos. El trabajo consiste en establecer qué cuenta cada uno y luego negarse a comparar dos de ellos hasta haberlo hecho.
En estos ocho puntos nos equivocamos primero y acertamos después. También nos equivocaremos en el noveno. La única defensa que conocemos es escribir la definición al lado de la cifra, cada vez, para que la siguiente persona tenga algo con lo que discrepar.
Datos actualizados a 2026-07-17
Todas las cifras se verificaron durante una auditoría de los corpus de nombres ponderados de 63 locales. ⚠ El corpus contenía 63 locales cuando se midieron estas cifras; en_IE se añadió el 18 de julio de 2026 y hoy contiene 64. Cada error descrito aquí es uno que cometimos y corregimos en esa fecha.
- Vietnam: hoten.org VNTH01 (n = 1.682.729) y SG01 (n ≈ 241.000, Ciudad Ho Chi Minh), CC BY 4.0 según se declara en el texto de la página; Nguyen Viet Khoa (2024), «Vietnamese Surnames», Genealogy 8(1):16, n = 883.835 → 31,57 %, Hanói 39,01 % frente a HCMC 30,61 %. <doi.org/10.3390/genealogy80100…; — Comparado con la muestra de Lê Trung Hoa de 1992. ⚠ El tamaño de esa muestra que suele citarse (n = 1.941) procede de nuestras notas de trabajo y no pudimos confirmarlo: la literatura secundaria reproduce su 38,4 % sin indicar ni el tamaño de la muestra ni la metodología. La conclusión de que el 38 % es una cifra zombi se apoya en las tres muestras grandes de arriba, no en ese número.
- Islandia: Hagstofa Íslands, 1 de enero de 2017 — 4 % de
ættarnöfn, 82 % de patronímicos, 14 % de otros (en gran parte de origen extranjero). Contexto jurídico: ley nr. 54/1925 (prohibió los nuevos apellidos heredados), 41/1913 (los permitió), después 37/1991 y 45/1996. <statice.is/> - Hungría: proporción de etnónimos 8,20 % del peso del fichero; calibrado con el registro (
Tóth2,192 % frente a 2,19 % del registro); el «7–8 % del acervo de apellidos» de Farkas procede del mismo registro. Se presenta aquí como una comprobación de coherencia, no como una verificación. - España: INE, Frecuencias de apellidos, Censo a 01/01/2025 —
García1.446.937 como primer apellido; 2.915.761 en ambas posiciones. <ine.es/daco/daco42/nombyapel/…; - Portugal: top 10 = 45,7 % de los portadores / 22,8 % de las posiciones.
- Corea: top 10 = 63,9 % en hanja, 65,8 % en hangul; 정 = 4,84 % (鄭 + 丁) frente a 최 = 4,7 %. Proporciones calculadas sobre ~49,7 millones de ciudadanos, no sobre la población total.
- Francia: fichero seleccionado a mano que abarca los puestos 1–126.772; ratio interno 3.351:1 frente a ~50:1 de un top 1.500 contiguo en puestos.
- Ucrania: muestra aleatoria reproducible n = 25 (extracción 20260717) de la cola de bajo peso de un fichero de apellidos de 2.209 entradas; 0 artificiales. Entradas demostrablemente artificiales en todo el fichero: ~2–10. El corpus ucraniano se ha reconstruido desde entonces y ahora contiene 2.562 entradas ponderadas con el registro. Contexto del país: 707.685 apellidos únicos, ~64 portadores cada uno. No se publica ningún registro nombre por nombre a esa profundidad (
ridni.org,forebears.ioystats.ridni.orgno ofrecen ningún conjunto de datos descargable; la literatura solo publica el top 100). - Taiwán: registro de apellidos del Ministerio del Interior (2.731 apellidos con recuentos nombre por nombre) — 33 entradas sin portadores eliminadas;
澹臺conservado con 2 portadores. <data.gov.tw/dataset/126774> - Suecia: registro del SCB — apellidos (411.798 entradas, que cubren el 96,1 % de la población) y nombres de pila
tilltalsnamna 31 de diciembre de 2022. Capa migratoria en los nombres masculinos 0,22 % → 2,98 %; femeninos 0 % → 0,93 %. <scb.se/en/finding-statistics/…;
Cuando una cifra es un objetivo, una estimación o no está confirmada, se indica como tal más arriba.