Identificación falsa > Artículos > Cómo auditar un conjunto de datos de frecuencias de nombres

Cómo auditar un conjunto de datos de frecuencias de nombres

Todo conjunto de datos de nombres ponderado formula una afirmación sobre un país, lo sepan o no sus autores. En algún punto del fichero hay un apellido que es el más común y otro que es el más raro, y la relación entre sus pesos afirma algo sobre la forma real de esa población.

Lo difícil al auditar un fichero así no es encontrar errores. Es distinguir entre «estos datos están rotos» y «este país es realmente así». Vistos desde dentro del fichero, ambos casos parecen idénticos. Los diez apellidos más frecuentes de Noruega cubren el 6,0 % de la población; los de Vietnam cubren alrededor del 71 %. Una curva plana es un hecho en un sitio y un defecto en el otro, y por mucho que se miren los pesos, estos no dirán cuál de los dos se tiene entre manos.

Lo que sigue es el conjunto de herramientas que construimos el 17 de julio de 2026, mientras auditábamos corpus de nombres de 63 locales frente a los registros nacionales. Dos son aritméticas y responden a la pregunta directamente. La mayoría de las demás tratan de lo que no la responde — porque las señales intuitivas, aquellas a las que todo el mundo recurre primero, son todas falsas, y cada una nos costó trabajo real antes de que lo advirtiéramos.

El planteamiento

Supongamos un conjunto de datos de la forma value → integer weight, con el peso asignado a partir de una fuente de frecuencias real mediante

w = round(255 × c / c_top1)      // clamped to a minimum of 1

c es el número de portadores de la entrada, c_top1 el recuento de la entrada más común y 255 el techo de la escala (un byte sin signo). Sustituya las constantes por las suyas — el álgebra sobrevive. Lo que importa es que el peso sea una relación con la entrada de cabeza y que exista un suelo por debajo del cual la escala no puede bajar. En ese suelo vive casi la totalidad de los defectos que describe este artículo.

Herramienta 1: la cobertura declarada

El peso 1 no es una etiqueta vaga que signifique «raro». Es una afirmación cuantitativa. Si el peso de la entrada de cabeza se corresponde con su proporción real de la población, una unidad de peso vale exactamente share_top1 / max_weight de esa población — de modo que el fichero, al sumar sus propios pesos, declara qué parte del país cree describir:

claimed coverage = Σ(weights) × real_share_of_top1 / max_weight

Compárela con la cobertura real del corpus — la suma de las proporciones reales de las entradas efectivamente presentes. Es el único diagnóstico de esta página falsable solo con aritmética: un fichero no puede describir el 114 % de un país.

Conjunto de datosCobertura declaradaCobertura realRelaciónQué significaba
zh_CN (antes)114 % de China~91 %Cola objetivamente sobreponderada. Aritméticamente imposible
es_ES (antes)200 % de EspañaCola sobreponderada al doble; 53 % de las entradas más ligeras que el peso 1
fr_FR (antes)54,2 %25,6 %2,11×Sobrestimada en más del doble
fr_FR (después)1,001×Corregida
no_NO29,2 %30,1 %0,97×Sana — nunca retocada
lv_LV27,03 %~27,3 %~0,99×Sana pese a que el 57 % de las entradas está en el peso 1
sv_SE apellidos57,29 %53,17 %1,077×Sana
zh_TW (después)109,8 %99,61 %1,10×Sana para un locale concentrado

La fila zh_TW es una medición de la versión de 8 bits y ya no describe el fichero entregado. El 18 de julio de 2026 ese locale pasó a los recuentos del registro tomados literalmente: 2.707 apellidos, cobertura declarada del 99,98 %, relación 1,00×. Todo el efecto de «masa fantasma del suelo» que se describe más abajo es una propiedad de las escalas relativas, de modo que no se aplica a un corpus que almacena recuentos reales — allí la relación vale 1,00× por construcción, y una lectura por encima de 1,0 sería un defecto genuino y no un excedente normal. Lea esta sección como el método para auditar corpus escalados bajo techo, que siguen siendo 52 de nuestros 64 ficheros de apellidos y 56 de 64 en el lado de los nombres de pila.

La banda sana se sitúa aproximadamente en 1,0–1,1×. Hay dos cosas que entender al respecto.

Superar el 100 % no es automáticamente un defecto. Las entradas cuya proporción real cae por debajo del valor de una unidad de peso siguen pesando 1 — la escala no dispone de un número menor. Ese excedente es la masa fantasma del suelo y, en un locale concentrado, añade legítimamente unos pocos puntos porcentuales: tras la corrección, zh_CN se sitúa en el 100,7 %, vi_VN en el 103,2 %, ko_KR en el 108,4 % y zh_TW en el 109,8 %. Rondar el 110 % en un fichero concentrado es normal. El 114 % bajo un techo de escala de 100 no lo era — allí era la cola la que reivindicaba un país que no existe.

Es una prueba, no una comprobación de plausibilidad. Aplíquela como una reducción al absurdo y producirá absurdos a demanda. El registro sueco de apellidos completo — sus 411.798 entradas — daría un fichero que declararía el 3.360 %: treinta y cinco Suecias. El registro taiwanés íntegro, con sus 2.730 entradas, declararía el 212 %: dos Taiwanes. El top 300 vietnamita completo declararía el 125,4 %. No son cifras «sospechosas»; son cifras imposibles, y la imposibilidad es justo lo que se le pide a una herramienta de auditoría.

Trampa: posiciones frente a portadores

En los países donde una persona lleva dos apellidos, las proporciones de todos los apellidos suman ~200 %, no 100 %. Dé a la fórmula una proporción de portadores y gritará por un defecto que no existe.

pt_PT, con Silva en el 9,44 % de los portadores, arroja una cobertura declarada del 145,4 % — una alarma. Con el mismo apellido en el 4,72 % de las posiciones, arroja el 72,7 %, del todo plausible para un corpus de 411 apellidos. Mismo fichero, misma fórmula, veredictos opuestos. Los locales españoles entrañan el mismo peligro, aunque allí el registro publica por separado las columnas de primer apellido, segundo apellido y ambas posiciones reunidas: GARCÍA suma 1.446.937 como primer apellido y 2.915.761 en las dos posiciones.

Trampa: la cobertura declarada no elige la profundidad

En un locale hiperconcentrado, la cobertura declarada zanja de una vez la cuestión de la profundidad: el top 300 de Vietnam alcanza el 125,4 % y queda por ello excluido. Resulta tentador, pues, usarla como criterio de profundidad en todas partes.

No funciona en un locale plano, y por una razón aritmética: una entrada honesta es neutra para la relación. Añade w × share_top1 / max_weight al lado declarado y c / POP al lado real — el mismo número — de modo que solo desplaza la relación por el redondeo, cerca del suelo. En los apellidos suecos la relación se mantuvo en 1,055× con 1.150 entradas y en 1,051× con 1.261, y solo cedió en el top 3000 (1,139×). Sencillamente, no responde a «qué profundidad es mejor».

La cobertura declarada es un techo, no un objetivo. Para la profundidad hace falta otra herramienta.

Herramienta 2: el umbral de profundidad — dividir entre 510, no entre 255

¿Hasta dónde debe llegar un corpus? No «hasta donde tengamos datos» y, desde luego, no a ojo. Calcule el puesto en el que el peso 1 deja de ser honesto:

threshold = count_of_top1 / 510        ← not /255

El /510 es la clave del asunto, y el error que cometimos primero. Puesto que w = round(255 × c / c_top1), el recorte entra en juego allí donde round() devuelve 0 — donde 255 × c / c_top1 < 0.5, es decir, c < c_top1 / 510. La fórmula con /255, en cambio, da el punto en el que el peso honesto vale 1,0, que no es el punto en el que desaparece. Trunca el corpus el doble de pronto; en España, ese error nos habría costado 320 apellidos reales.

Toda entrada por debajo del umbral queda sobrestimada por el recorte. Lo que hay por debajo no es una curva; es un suelo inventado.

Conjunto de datosUna unidad de peso valeUmbralComportamiento en la frontera
vi_VN0,0598 % de la poblaciónpuesto 66Lường en el 0,061 % — la última entrada honesta
sv_SE apellidos424,5 portadorespuesto 2130Snygg 425; le sigue Abdulkadir 424 → peso honesto exactamente 0,50
es_ES5.717,2 posicionespuesto 1743Victoria 5.720; le sigue Fabregas 5.714 → exactamente 0,500
sv_SE nombres ♂160,3 portadorespuesto 2008WASSIM 161 → 0,502; después BASIL 160 → 0,499
sv_SE nombres ♀189,1 portadorespuesto 1850WINNIE 190 → 0,502; después AIKATERINI 189 → 0,500

Cinco veces la frontera cayó exactamente en el paso de redondeo — una coincidencia notable, a menos que la regla esté calculando en lugar de adivinar.

La prueba más fuerte es la dispersión. Un mismo criterio devolvió el puesto 66 para Vietnam y el puesto 2.130 para Suecia. Una regla que produjera profundidades parecidas en todas partes sería sospechosa; una regla que devuelve una diferencia de factor 32 entre un país hiperconcentrado (Nguyễn ≈31 %) y uno plano (Andersson 2,06 %) está siguiendo algo real. Una sola regla, respuestas distintas.

Lo que no demuestra nada

Esta es la sección que más importa, porque cada una de las señales que siguen es intuitiva, está muy extendida y no vale nada por sí sola.

«Una enorme proporción de las entradas está en el peso mínimo»

La más seductora. Se parece exactamente a una cola aplastada, y a veces lo es. Pero uk_UA tiene el 80 % de su corpus en el peso 1 mientras que su proporción del top 10 es del todo normal — 29,4 %, dentro de la banda del 20–35 %. Los apellidos letones tienen el 57 % de sus entradas en el peso 1, y la fórmula de cobertura da por bueno el fichero con ~0,99×.

La masa en el suelo es un hecho relativo a la curva de pesos, no a la composición de la lista. Nuestra propia lista de tareas exigió en su día limpiar «~1.900 apellidos ucranianos artificiales», cifra derivada de «1.902 entradas en el peso 2». Una muestra aleatoria de 25 entradas no encontró ninguna entrada artificial; en todo el fichero, el número de entradas demostrablemente artificiales rondaba entre 2 y 10, de un total de 2.209. No adivine — calcule la cobertura declarada.

«La cabeza está clavada en el techo de la escala»

También seductora, también inútil por sí sola. no_NO tenía un peso máximo de exactamente 100 bajo el antiguo techo de 100 — y era correcto: top 10 en el 19,87 % frente a un objetivo honesto del 20,03 %, cobertura declarada/real 0,97×. La relación natural entre cabeza y suelo en Noruega es de 87:1, que cabe bajo 100 con margen de sobra. El máximo se situaba en el techo por coincidencia, no por compresión.

lv_LV ilustra el caso inverso con un máximo de 40, que tampoco demuestra nada: Letonia es sencillamente plana, y su apellido de cabeza cubre el 0,60 % de la población. Un máximo de 40 es allí tan correcto como lo es un máximo de 100 en Noruega.

Lo que es diagnóstico es la conjunción: un máximo en el techo y más del 25 % del corpus en el peso 1. Esa pareja identificó 52 conjuntos de datos que se habían quedado realmente sin escala. Cada una de las dos mitades, por separado, no identificó nada.

Verificación circular

La trampa más dura de este artículo, y caímos en ella dos veces de forma independiente en un solo día. La tentación es irresistible: nuestra cifra coincidía con una fuente independiente, luego no la ajustamos a medida. Antes de aceptar eso, compruebe si la fuente es realmente independiente.

Nuestros apellidos etnónimos húngaros representan el 8,20 % del peso del fichero. La estimación académica — Farkas — sitúa el acervo de etnónimos en «7–8 %». Eso parece un caso de manual de validación externa. No lo es en absoluto. Nuestros pesos se calibraron con las proporciones del registro (Tóth en el 2,192 % frente al 2,19 % del registro), y Farkas extrae sus cifras del mismo registro. Un solo conjunto de datos contado dos veces, no dos mediciones.

Una segunda variante: la comprobación «proporción del top 10 × cobertura declarada = proporción de la población». Con los datos españoles converge hasta 0,00 puntos porcentuales. Y es también, para la cabeza de la distribución, casi exactamente una tautología — todo lo que demuestra es que el error de redondeo es insignificante. La comparación sustantiva en ese fichero era la cobertura declarada (73,2 %) frente a la real (67,55 %), y esa sí mostraba un problema.

La regla: si sus pesos se calibraron a partir de la fuente X, entonces cualquier comparación con X — o con un artículo que cite a X — es una comprobación de coherencia, no una confirmación. Las comprobaciones de coherencia son útiles; detectan deslices aritméticos. Basta con llamarlas por su nombre.

Qué aspecto tiene una comprobación independiente de verdad. En Vietnam no hay registro estatal de apellidos, pero sí dos grandes muestras con sesgos regionales opuestos: VNTH01 (n = 1.682.729, ponderada hacia el norte 63:37) y SG01 (n = 241.000, Ciudad Ho Chi Minh). Convergen en Nguyễn ≈ 31 % — 30,5 % y 31,5 %, respectivamente. Una tercera muestra, revisada por pares (Nguyen Viet Khoa, Genealogy 8(1):16, 2024, n = 883.835), se sitúa en el 31,57 % y confirma de forma independiente el sentido del sesgo norteño de VNTH01. Metodología distinta, poblaciones distintas, sesgos que apuntan en direcciones contrarias, misma respuesta. Eso sí es una confirmación — y demolió la cifra que todo el mundo cita, porque Nguyễn = 38 % procede de una única muestra de 1992, repetida en todas partes no por ser buena, sino por ser la única publicada.

La otra forma que adopta una comprobación auténtica es una predicción que podría haber fallado. Nuestro corpus islandés lo construyeron personas convencidas de que alrededor del 10 % de los islandeses lleva un apellido heredado en lugar de un patronímico; esperaban que el fichero se quedara corto a la mitad. El fichero mide el 4,15 % (97 de 2.335) y la oficina nacional de estadística mide el 4 %. La concordancia es real precisamente porque quienes lo construyeron esperaban que fallara.

El defecto que solo dos métricas ven juntas

Antes de la corrección, nuestro fichero sueco de nombres de pila masculinos superaba su objetivo honesto de top 10 — 22,02 % frente a 18,31 % — mientras que, al mismo tiempo, declaraba de menos su cobertura, con 0,874×.

Lea cualquiera de las dos métricas por separado y concluirá que el fichero está bien o, como mucho, que el máximo se queda algo bajo. Léalas juntas y el diagnóstico es inequívoco: no es un problema de escala, es una cabeza construida por separado del medio. El top 10 estaba demasiado apuntado y los puestos 11–317 eran demasiado ligeros. Nada salvo el par de métricas lo revela.

El objetivo se mueve

La última herramienta, y la que más a menudo hace que se revierta una corrección acertada.

Cuando profundizamos el corpus sueco de apellidos de 1.150 a 2.445 entradas, su proporción del top 10 cayó del 28,83 % al 21,62 % — en apariencia, una regresión catastrófica. No lo es. El objetivo honesto es real_top10 / real_coverage, y la cobertura pasó del 40,73 % al 53,17 %, de modo que el propio objetivo se desplazó del 30,40 % al 23,28 %:

MétricaAntesDespués
Entradas1.1502.445
Top 10 en el fichero28,83 %21,62 %
Objetivo honesto30,40 %23,28 %
Déficit1,57 pp1,66 pp
Cobertura real40,73 %53,17 %
Declarada / real1,055×1,077×
Ausentes del top 300440

El déficit es idéntico a ambas profundidades. La profundidad no costó nada en exactitud y aportó +12,4 puntos de cobertura real. La caída de la proporción del top 10 es mecánica del denominador, no una regresión — la cola añade masa al denominador. El mismo efecto, con los pesos intactos de principio a fin: los apellidos italianos, de 556 → 1.340 entradas, llevaron el top 10 del 12,2 % al 6,9 %; los rusos, de 701 → 1.303, del 10,08 % → 6,36 %; los polacos, de 689 → 1.272, del 9,50 % → 6,43 %.

El error emparentado consiste en comparar una proporción dentro del fichero con una proporción en la población. Los diez apellidos más frecuentes de EE. UU. cubren el 4,90 % de los estadounidenses; nuestro corpus de 1.864 apellidos cubre el 42,29 % de los estadounidenses; dentro de ese fichero, por tanto, el top 10 mide 4.90 / 42.29 = 11,59 %, y eso es correcto. La misma realidad, denominadores distintos. No lo «corrija».

Y algunos déficits no deberían cerrarse nunca. Los apellidos coreanos van desde , con el 21,5 % de la población, hasta , con 7 portadores — 1.527.138:1 frente a una escala que ofrece 255:1. Allí una unidad de peso vale 41.921 personas, de modo que unos 130 apellidos ultrarraros descansan sobre un suelo que los sobrestima en tres órdenes de magnitud, lo que añade ~8 % de masa fantasma al denominador. El fichero se queda en el 60,6 % frente a un 65,8 % real, y cerrar esa brecha significaría borrar 65 apellidos reales. Un déficit de unos pocos puntos en un locale así es la respuesta correcta, no un defecto.

La lista de comprobación

  1. Calcule la cobertura declarada antes de formarse opinión alguna. Σ(w) × share_top1 / max_weight. Por encima de ~110 % en un locale concentrado, o de ~100 % en uno plano, la cola está sobreponderada — objetivamente, no de forma discutible.
  2. Compruebe primero la unidad. Posiciones frente a portadores, nacimientos frente a portadores vivos, una escritura frente a otra. La unidad equivocada fabrica defectos y oculta los reales.
  3. Calcule el umbral de profundidad como count_of_top1 / 510. No /255. Verifique que la frontera cae en el paso de redondeo; si no lo hace, su fuente y su divisor no concuerdan.
  4. Use la cobertura declarada como techo, no como objetivo. No elegirá la profundidad en un locale plano — las entradas honestas son neutras para la relación.
  5. No concluya nunca a partir de la masa en el suelo por sí sola. Un 80 % en el peso 1 es compatible con un fichero perfectamente sano.
  6. No concluya nunca a partir de un máximo en el techo por sí solo. Exija la conjunción: máximo en el techo y >25 % en el suelo.
  7. Lea dos métricas juntas. Un fichero por encima de su objetivo y que declara de menos su cobertura tiene una cabeza desprendida de su medio — invisible para cada una de ellas por separado.
  8. Interrogue cada coincidencia. Si los pesos vienen de X, coincidir con X es coherencia, no confirmación. Pregúntese qué resultado habría falsado la comprobación.
  9. Recalcule el objetivo tras cambiar la profundidad. Una proporción del top 10 que baja tras profundizar es aritmética, no una regresión.
  10. Acepte los déficits que impone la escala. Alcanzar un objetivo borrando entradas reales es ajustar los datos a la medida — justo aquello que la auditoría buscaba detectar.

Datos actualizados a 2026-07-17

Todas las cifras se midieron el 17 de julio de 2026 durante la construcción y la auditoría de corpus de nombres ponderados de 63 locales frente a los registros nacionales. ⚠ El corpus contenía 63 locales cuando se midieron estas cifras; en_IE se añadió el 18 de julio de 2026 y hoy contiene 64. Las proporciones describen la población salvo que el texto diga «en el fichero» o «posiciones»; cuando las cifras proceden de una muestra y no de un registro, el texto lo indica. Los ejemplos húngaro, español e islandés se recogen tal como los encontramos, incluidos los casos en que nuestro propio razonamiento era erróneo.

Fuentes:

  • Taiwán, Ministry of the Interior — clasificaciones y recuentos de apellidos, 30 de junio de 2023: data.gov.tw/dataset/126774
  • España, INE — apellidos con ≥20 portadores, censo del 1 de enero de 2025: ine.es/dyngs/INEbase/operacio…?…
  • Francia, INSEE — Fichier des noms de famille, nacimientos 1891–2000: insee.fr/fr/statistiques/353663…
  • Suecia, SCB — apellidos (411.798 entradas, 96,1 % de la población) y nombres de pila tilltalsnamn, 31 de diciembre de 2022: scb.se
  • Noruega, SSB — estadísticas de apellidos, tabla StatBank 12891: ssb.no/statbank/table/12891
  • Dinamarca, Danmarks Statistik — estadísticas de nombres: dst.dk/da/Statistik/emner/bor…
  • Letonia, CSP — censo de 2021, apellidos de 1.893.223 residentes permanentes: stat.gov.lv
  • Corea del Sur, KOSTAT — censo de población y vivienda de 2015, estadísticas de apellidos: kostat.go.kr
  • China, Ministry of Public Security — tabulación de los 100 apellidos más frecuentes, 2007
  • Vietnam — conjuntos de datos de frecuencias hoten.org VNTH01 (n = 1.682.729) y SG01 (n = 241.000), CC BY 4.0 según se declara en el texto de la página; Nguyen Viet Khoa, «Vietnamese Family Names», Genealogy 8(1):16 (2024): doi.org/10.3390/genealogy80100…
  • Islandia, Hagstofa Íslands — apellidos y patronímicos, 1 de enero de 2017: hagstofa.is

← Artículos