Identificación falsa > Artículos > Por qué una «lista de apellidos» no es universal: qué cuenta como una fila

Por qué una «lista de apellidos» no es universal: qué cuenta como una fila

Antes de cargar una lista de frecuencias, usted se preguntará si la fuente tiene autoridad. Esa es la primera pregunta equivocada, y tenemos el defecto que lo demuestra.

La primera pregunta correcta es cuál es la unidad de registro — ¿qué cuenta realmente una fila de este fichero? ¿Un apellido? ¿Un elemento de nombre? ¿Un tratamiento honorífico? ¿Una posición dentro de una fórmula de nombres? ¿Una persona, o una casilla que una persona rellena dos veces?

Nos equivocamos en esto teniendo delante una fuente estadística nacional y usando una lista de trampas que ya nombraba el error exacto. Así se ve esto desde dentro.

El error: 300 filas de un fichero de frecuencias, cuatro de las cuales no eran nombres

Nuestro corpus de apellidos vietnamitas pasó de 110 a 303 entradas el 18 de julio de 2026, alimentado por las 300 primeras entradas de un conjunto de datos de frecuencias. La fuente es real y sus recuentos también. La ampliación hizo lo que debe hacer una buena ampliación — profundizó la cola y mantuvo estable la cabeza.

También reimportó tres entradas que una pasada anterior había rechazado deliberadamente:

EntradaPesoQué es en realidad
Y92un tratamiento honorífico masculino en Ê-đê y Jarai — «Sr.»
Ka17la misma clase de tratamiento honorífico
A16la misma clase de tratamiento honorífico

Y es la marca que precede al nombre de un hombre entre los pueblos Ê-đê y Jarai de las Tierras Altas Centrales — como en Y Moan Enuôl, el cantante. No es su apellido. Su verdadero nombre de clan viene después, y los nombres de clan Ê-đê son matrilineales.

Esos dos nombres de clan también están en nuestro corpus, y sus pesos son justo lo que debería habernos detenido:

EntradaPuestoPesoQué es
Y92tratamiento honorífico (retirado)
Niê2015un clan matrilineal Ê-đê real
2483un clan Ê-đê/Jarai real

El fichero afirmaba que el tratamiento honorífico era dieciocho veces más frecuente que el clan al que se antepone. Eso es, aritméticamente, lo que ocurre cuando se cuenta un título como si fuera un nombre: cada miembro de cada clan contribuye a su recuento. La cifra no era ruido. Era el recuento correcto de algo que no es un apellido.

La fuente de frecuencias no se equivocaba. Contaba las cadenas que aparecen en la primera posición de un campo de nombre, algo perfectamente coherente que contar. Nosotros lo leímos como «frecuencia de apellidos», que es otra cosa.

Lo que decía nuestra propia documentación

Lo que escuece: nuestra referencia interna de fuentes tiene una sección sobre trampas de los datos, y contiene esta línea, escrita antes del defecto:

Tratamientos honoríficos como «apellidos». Y (vietnamita, Ê-đê), Thị, Ka, A; femeninos bangladesíes বেগম Begum, আক্তার Akter, খাতুন Khatun, খানম Khanam; 其他 (Taiwán); 기타 (Corea); ALL OTHER NAMES (Estados Unidos); AUTRES NOMS (INSEE). Un «apellido» de un solo carácter merece una segunda mirada en cualquier parte.

El script de construcción del locale llevaba además un comentario literal que decía // Y (#55) deliberately REJECTED. La trampa estaba documentada, el rechazo estaba consignado en el código, y aun así la reconstrucción lo reintrodujo — porque el trabajo de la reconstrucción era importar las 300 primeras entradas, y nada en la cadena de procesamiento sabía que cuatro de esas 300 no eran aptas para la importación.

Documentar una trampa no protege contra ella. Solo lo hace una comprobación que se ejecuta.

Y la corrección fue incompleta

Medimos el corpus entregado mientras escribíamos este artículo, y el resultado honesto es que la primera limpieza fue parcial.

Y, Ka y A desaparecieron. El corpus bajó a 299 filas con un peso total de 99.454, y Nguyễn en 30.492 — el 30,66 % del corpus, que es la cifra que respalda la literatura revisada por pares, y no el 38 % que circula ampliamente a partir de un estudio de 1992 sobre 1.941 personas.

Pero Thị seguía ahí, en el puesto 143, con peso 13.

Thị es, con diferencia, el no-apellido más famoso de la onomástica vietnamita. Es la marca convencional del nombre intermedio de las mujeres — Nguyễn Thị Hương — y aparece en la posición intermedia de una fracción muy grande de los nombres de mujer vietnamitas. Figura explícitamente en nuestra propia lista de trampas, en la misma frase que Y, Ka y A. Sobrevivió a la corrección que retiró a los otros tres, e hizo falta una tercera pasada aparte para sacarlo — esa retirada es lo que llevó el fichero de 299 filas a las 298 que se entregan hoy.

También sobrevivió Ô, una entrada de un solo carácter en el puesto 265 con peso 3, que es exactamente el caso del que la lista de trampas dice que merece una segunda mirada — y Ô sigue en el fichero, ahora en el puesto 264.

Publicamos la secuencia y no solo el estado final bien ordenado, porque la forma del fallo es la parte útil. El primer error fue importar una trampa que nosotros mismos habíamos documentado. El segundo fue corregir las tres apariciones que teníamos justo delante en lugar de volver a pasar la lista de trampas sobre el resultado — por eso el fichero necesitó una tercera pasada, y por eso todavía hoy hay en él una entrada señalada. Una corrección parcial se lee como una corrección completa en todos los rastros que deja tras de sí.

Cuatro maneras en que difiere la unidad de registro

Vietnam es un modo de fallo. Hay al menos cuatro distintos, y exigen respuestas diferentes.

1. La fila no es un nombre en absoluto

Los tratamientos honoríficos son el caso anterior. Pero todo registro grande publica además filas de agregado en la misma columna que los nombres reales:

FuenteFila de agregadoQué significa
Taiwán (MOI)其他«otros»
Corea (KOSTAT)기타«otros»
Censo de Estados UnidosALL OTHER NAMEStodo lo que queda bajo el umbral
INSEE (Francia)AUTRES NOMStodo lo que queda bajo el umbral

Todas ellas quedarán cerca de la cabeza del fichero por recuento, porque agregan la cola entera. Impórtela tal cual y le habrá dado a su generador un apellido con varios millones de portadores por el que jamás se ha llamado a ningún ser humano.

2. La fila es una posición, no una persona

En España cada persona lleva dos apellidos — el del padre primero, el de la madre después. Así que «¿qué frecuencia tiene García?» tiene dos respuestas correctas que difieren en un factor de dos:

MedidaGarcía
Como primer apellido (ap1)1.446.937
En ambas posiciones2.915.761

Ninguna de las dos cifras es errónea. Responden a preguntas distintas, y una lista que las mezcla de una fila a otra es silenciosamente incoherente. El caso portugués deja ver lo que está en juego: los 10 primeros apellidos portugueses cubren el 45,7 % de los portadores, pero solo el 22,8 % de las posiciones. Informe de la cifra equivocada y su curva de concentración se desviará en un factor de dos.

Y la regla ni siquiera se generaliza al conjunto del mundo hispanohablante. Argentina es la excepción: solo se usa el apellido del padre, de modo que portadores y posiciones dan el mismo número. Aplicar allí la corrección de «dividir por dos» convierte una cobertura correcta del 134 % en un 67 % ficticio.

3. La fila es un patronímico, no un apellido

En Islandia la mayoría de la gente no tiene apellido en el sentido heredado. Jónsson significa «hijo de Jón» y se regenera en cada generación a partir del nombre de pila del padre. El desglose de 2017 de Statistics Iceland da un 82 % de patronímicos, un 4 % de apellidos heredados (ættarnöfn) y un 14 % de otros — sobre todo apellidos de inmigrantes.

Por tanto, una lista de frecuencias de «apellidos islandeses» es sobre todo una lista de frecuencias de nombres de pila masculinos de hace una generación, con un sufijo. Los 59 apellidos genuinamente heredados son un objeto distinto y mucho más pequeño. Tratamos ese caso con detalle en Islandia: patronímicos y 59 apellidos, incluido el motivo por el que el repetidísimo «alrededor del 10 % de los islandeses tiene apellido» es una estadística zombi montada sumando el 4 % al 14 %.

4. No todo el mundo tiene uno

Los mononímicos existen. En Indonesia una persona puede tener legalmente exactamente un nombre y ningún apellido — la práctica es lo bastante común como para que los sistemas de pasaportes indonesios tengan convenciones establecidas para ella. Nuestro corpus id_ID contiene 299 apellidos y lleva marcada internamente una pregunta abierta sobre si el modelo de nombres del locale es siquiera correcto, porque una lista de apellidos para Indonesia describe una práctica que una gran parte de la población no sigue.

Un esquema con una columna lastname obligatoria no puede representar esto. Fabricará un apellido para alguien que no lo tiene, y el valor fabricado será indistinguible de uno real.

Donde la unidad de registro se divide según el género

La mayor sorpresa estructural es que, en varias comunidades lingüísticas, el conjunto de apellidos admisibles es distinto para los hombres y para las mujeres — no flexionado, distinto.

India. Seis entradas aparecen solo en el fichero femenino: Devi, Kaur, Begum, Khatun, Bano, Parveen. No son formas femeninas de nada. En la práctica onomástica sij, Kaur es el nombre que llevan las mujeres; Devi está muy extendido entre las mujeres de todo el norte de la India; Begum, Khatun, Bano y Parveen son nombres de mujer en las comunidades musulmanas. Devi tiene un peso de 75 — más alto que el de la mayor parte del fichero.

Fíjese en lo que los datos no dicen. Singh está en ambos ficheros, ponderado con 100 en el lado masculino y con 55 en el femenino. Las mujeres sij también lo llevan. El corpus codifica un sesgo, no una exclusión — una distinción que solo sobrevive si su esquema sabe expresar «presente en ambos, ponderado de forma distinta».

Bangladés. Cuatro entradas son exclusivamente femeninas: বেগম (Begum), আক্তার (Akter), খাতুন (Khatun), খানম (Khanam). Son los mismos tratamientos honoríficos de la lista de trampas — pero aquí están en su sitio, porque en la práctica bangladesí ocupan realmente la casilla del apellido para muchas mujeres. La misma cadena es un defecto en un corpus y un dato correcto en otro, y la única manera de distinguir un caso del otro es saber qué hace el sistema de nombres.

Georgia es el caso que más caro nos ha salido. Los apellidos georgianos no varían con el género: ბერიძე es ბერიძე para todo el mundo. Pero Georgia tiene una minoría azerbaiyana de aproximadamente el 6,3 % de la población, y los apellidos azerbaiyanos flexionan: მამედოვი ♂ / მამედოვა ♀.

Mientras impusimos la regla de que los ficheros de apellidos masculinos y femeninos debían ser idénticos byte a byte, esa capa entera no tuvo dónde existir — y el locale se entregó sin el segundo apellido más frecuente del país. Las cifras del registro desglosadas por sexo son ბერიძე 14.963 y მამედოვი 14.482 entre los hombres; ბერიძე 15.059 y მამედოვა 13.487 entre las mujeres. En una lista de cabeza fusionada, las dos formas se reparten el recuento y el nombre desaparece por completo de la vista.

La lección se generaliza más allá de Georgia: en cualquier país con una capa minoritaria que flexiona, revise la cabeza de la lista por separado para cada género. Una clasificación fusionada oculta precisamente los nombres que flexionan.

Nuestro validador lleva ahora una lista de excepciones explícita para estos tres locales:

$SET_PER_GENDER = ['en_IN' => 1, 'ka_GE' => 1, 'bn_BD' => 1];

Para todo lo demás, la regla es «los ficheros deben ser idénticos» o «los ficheros se emparejan por índice». Para estos tres no es ni lo uno ni lo otro, y el validador solo afirma que los dos conjuntos difieren de verdad — porque si son idénticos, la separación nunca se hizo. La mecánica de los casos de emparejamiento, incluido por qué nunca se puede derivar una forma femenina a partir de una cadena, se trata aparte en Apellidos que cambian con el género.

El griego recuerda que la flexión no siempre es lo que parece. Παπαδόπουλος ♂ / Παπαδοπούλου ♀ no son un apellido masculino y otro femenino — la forma femenina es el genitivo de la masculina, literalmente «de Papadopoulos». La misma relación entre cadenas, una gramática completamente distinta, y eso cambia lo que significa un «par».

La lista de comprobación que deberíamos haber estado ejecutando

  1. Pregunte qué cuenta una fila. Antes que la licencia, antes que la autoridad, antes que la cobertura. Un apellido, un elemento de nombre, una posición, un título, una fila de agregado. La fuente suele decírselo, si lee sus definiciones de columnas en lugar de sus encabezados de columna.
  2. Ordene por longitud de cadena ascendente y lea la cabeza. Todos los tratamientos honoríficos que importamos tenían uno o dos caracteres. Esto cuesta un solo comando.
  3. Busque las filas de agregado por su nombre. 其他, 기타, ALL OTHER NAMES, AUTRES NOMS, _PRENOMS_RARES. Se sitúan cerca de la cabeza por recuento.
  4. Contraste una entrada sospechosa con sus propios dependientes. Y reclamaba 18 veces el peso del clan al que se antepone. La incoherencia interna era visible sin ninguna fuente externa.
  5. Establezca portadores frente a posiciones antes de calcular ningún porcentaje. Dos apellidos por persona duplican las posiciones y no dividen nada por la mitad — y Argentina es la excepción que demuestra que no se puede aplicar la regla por idioma.
  6. Revise la cabeza de la lista por separado para cada género. El apellido n.º 2 de Georgia era invisible en una clasificación fusionada.
  7. Vuelva a pasar toda la lista de trampas después de cada corrección. Retiramos tres tratamientos honoríficos y dejamos Thị y Ô en el fichero; Thị necesitó una tercera pasada y Ô sigue ahí. La corrección se verificó frente al informe de error, no frente a la lista de comprobación.

La disciplina de fondo consiste en dejar de tratar una lista de frecuencias como una lista de nombres a la que resulta que van adjuntos unos recuentos, y empezar a tratarla como una medición, hecha por otra persona, de una unidad que ella definió y usted no. La autoridad le dice que el recuento se hizo con cuidado. No le dice nada sobre qué se contó.


Datos actualizados a 2026-07-18

Todas las cifras del corpus se midieron el 18 de julio de 2026 sobre los ficheros entregados lastname_male.tsv / lastname_female.tsv, y no sobre los datos de entrada de la construcción ni la documentación.

Verificado en los datos entregados:

  • vi_VN — 298 filas, suma de pesos 99.441. Nguyễn 30.492 = 30,66 % del peso del corpus. Y, Ka, A ausentes (retirados desde la reconstrucción de 303 filas). Thị también está ausente ahora — era la marca del nombre intermedio, no un apellido, y su retirada es lo que llevó el fichero de 299 filas a 298. Ô presente en el puesto 264, peso 3. Niê puesto 200 peso 5; puesto 247 peso 3. Văn puesto 42 peso 187, conservado pero señalado — puede que la fuente contara en parte la marca masculina del nombre intermedio.
  • en_IN — 836 filas masculinas / 842 femeninas. Solo femeninos: Bano, Begum, Devi, Kaur, Khatun, Parveen. Solo masculinos: ninguno. Singh masculino 100 / femenino 55; Devi femenino 75; Kaur femenino 60.
  • bn_BD — 400 filas masculinas / 404 femeninas. Solo femeninos: বেগম, খাতুন, আক্তার, খানম.
  • ka_GE — 492 filas por cada lado, longitud idéntica, 32 filas en las que el apellido difiere. მამედოვი peso 34 / მამედოვა peso 31, en el puesto 461 en ambos lados.
  • el_GR — 648 filas por cada lado; el puesto 1 es Παπαδόπουλος / Παπαδοπούλου.
  • id_ID — 299 apellidos, seleccionados manualmente, con un interrogante interno abierto sobre el modelo de nombres del locale.
  • is_IS — 343 filas.
  • es_ES — 2.522 filas (300 añadidas el 21 de julio de 2026), suma de pesos 34.026.331.

Fuentes:

  • Vietnam — conjunto de datos de frecuencias VNTH01 de hoten.org (CC BY 4.0 según se declara en el texto de la página). Corroborado por Nguyen, Viet Khoa (2024), Toward an Onomastic Account of Vietnamese Surnames, Genealogy 8(1):16, n = 883.835, que da Nguyễn 31,57 %. La cifra ampliamente citada del 38,4 % procede de Lê Trung Hoa (1992) sobre una muestra de 1.941 personas y no debe usarse como divisor. <doi.org/10.3390/genealogy80100…;
  • España — INE, Frecuencias de apellidos, censo de 01.01.2025. 86.512 filas de datos repartidas entre Apellido 1º / Apellido 2º / Ambos apellidos. Posiciones = ap1 + ap2; portadores = ap1 + ap2 − ambos. García 1.446.937 como primer apellido, 2.915.761 en ambas posiciones. Tenga en cuenta que la cabecera del fichero declara un umbral de frecuencia de 100 y el umbral real es 20. <ine.es/daco/daco42/nombyapel/…;
  • Portugal — lista SPIE «100 apelidos» (96 entradas), contrastada con el IRN en las 4 primeras. Top 10 = 45,7 % de los portadores, 22,8 % de las posiciones.
  • Argentina — RENAPER. Solo se usa el apellido paterno; los portadores igualan a las posiciones.
  • Georgia — Public Service Development Agency, 2024, publicación desglosada por sexo. Hombres: ბერიძე 14.963, მამედოვი 14.482. Mujeres: ბერიძე 15.059, მამედოვა 13.487. Proporción azerbaiyana de la población ≈ 6,3 %.
  • Islandia — Hagstofa Íslands, 01.01.2017: patronímicos 82 %, ættarnöfn 4 %, otros 14 %. La ley n.º 54/1925 prohibió la creación de nuevos apellidos; no abolió los ya existentes. <hagstofa.is/&gt;
  • Taiwán — 內政部戶政司, OGDL Taiwan v1.0. Corea — KOSTAT. Estados Unidos — US Census 2010 Surnames, dominio público. Francia — INSEE noms2008nat, Licence Ouverte 2.0.

← Artículos