El serbio obtiene 0,0000 frente a sí mismo: cuatro formas en que falla la comparación de nombres entre países
Conservamos los nombres serbios por duplicado — una vez en cirílico (sr_RS), otra en alfabeto latino (sr_Latn_RS). Mismo país, misma lengua, mismos nombres, las mismas 1.143 entradas de nombres de pila y 958 entradas de apellidos, totales de pesos idénticos. Uno de los ficheros es una transliteración del otro.
Similitud medida entre ambos:
| Métrica | Puntuación |
|---|---|
| Jaccard de nombres de pila | 0,0000 |
| Coseno de nombres de pila | 0,0000 |
| Jaccard de apellidos | 0,0000 |
| Coseno de apellidos | 0,0000 |
| Entradas compartidas | 0 |
Disimilitud perfecta entre un conjunto de datos y una copia de sí mismo. Si un método de comparación no es capaz de reconocer el serbio como serbio, nada de lo que diga sobre el griego y el coreano merece ser leído.
Calculamos todos los pares de los 63 locales que contenía el corpus en el momento de la ejecución — 1.953 comparaciones — y este artículo es el catálogo de fallos que salió de ahí. Los resultados en sí están en ¿Qué países comparten nombres?; esto es la parte que explica por qué la mayor parte de la matriz es inutilizable y cómo saber qué parte lo es.
Los cuatro modos de fallo, ordenados según la gravedad con la que nos afectaron:
- Escrituras distintas destruyen el solapamiento — la mitad de la matriz son ceros que no significan nada
- Las escrituras compartidas inflan el solapamiento — los caracteres han hacen que Japón parezca taiwanés
- El solapamiento es direccional — una comparación, dos respuestas correctas y contradictorias
- Las escalas de pesos no son conmensurables — 52 de nuestros 64 locales siguen usando pesos relativos para los apellidos
Fallo 1: la barrera de las escrituras
De los 1.953 pares de locales, 981 no comparten ningún nombre de pila y 1.287 no comparten ningún apellido. Entre la mitad y dos tercios de la matriz entera son ceros.
Casi ninguno de ellos es un resultado.
Siete locales de nuestro conjunto son los únicos ocupantes de su sistema de escritura y, en consecuencia, no comparten nada con nadie: el bengalí, el griego, el hebreo, el armenio, el georgiano, el coreano y el nepalí. Cada uno arroja un 0,0 % de solapamiento frente a los otros 62. Leído al pie de la letra, los nombres griegos se parecen exactamente tan poco a los nombres ucranianos como a los japoneses — lo cual es un disparate, puesto que la denominación griega y la ucraniana comparten siglos de onomástica cristiana ortodoxa y un amplio fondo de los mismos nombres de santos en alfabetos distintos.
Lo corrosivo es que este fallo resulta silencioso y asimétrico en sus daños. Nunca infla una puntuación, solo la rebaja, de modo que parece prudencia. Y un cero es indistinguible de un resultado real salvo que ya se conozcan los sistemas de escritura implicados.
La consecuencia para la publicación es directa: no se puede publicar una clasificación de «los pares más distantes» a partir de una comparación bruta de cadenas. Nosotros no lo hicimos. La clasificación de distancias que produce nuestra matriz es una clasificación de alfabetos que lleva puesta, a modo de disfraz, una clasificación de sistemas de denominación.
El control que lo detecta. Introduzca en sus datos un par que se sepa idéntico y compruebe que su método lo puntúa como idéntico. El serbio en dos escrituras fue el nuestro, por accidente. Sin él habríamos supuesto que los ceros tenían sentido, porque cada cero tomado por separado parecía defendible.
Remedios parciales, todos imperfectos. La normalización Unicode y el plegado de diacríticos ayudan dentro de una misma escritura (Müller/Mueller, Yılmaz/Yilmaz). La transliteración a una escritura común ayuda entre escrituras emparentadas, pero es una operación con pérdida y no reversible: el paso del serbio cirílico ↔ latino es uno de los pocos casos genuinamente biyectivos, mientras que el griego, el árabe y el han no lo son. Las claves fonéticas (Soundex, Metaphone) están hechas a la medida del inglés e inducen a error en cualquier otro sitio. Optamos por aplicar una correspondencia estricta de cadenas y etiquetar como inutilizables los ceros resultantes, en vez de ejecutar una capa de transliteración y generar en silencio otros errores, más difíciles de auditar.
Fallo 2: las escrituras compartidas inflan el solapamiento
El problema inverso, y el más peligroso, porque produce cifras impresionantes en lugar de cifras vacías.
El corpus de apellidos de Japón comparte 339 entradas con el de Taiwán — que cubren el 75,4 % de la masa de apellidos japoneses. Tomado al pie de la letra: Japón y Taiwán tienen en tres cuartas partes los mismos apellidos.
No es así. Esto es lo que pesan realmente esas entradas compartidas:
| Apellido | Proporción de Taiwán | Proporción de Japón |
|---|---|---|
| 佐藤 Satō | 0,0003 % | 2,609 % |
| 鈴木 Suzuki | 0,0002 % | 2,426 % |
| 高橋 Takahashi | 0,0002 % | 1,905 % |
| 田中 Tanaka | 0,0001 % | 1,826 % |
| 陳 Chen | 11,208 % | ausente |
佐藤 aparece realmente en el registro de Taiwán. El Ministerio del Interior de Taiwán publica sin umbral de supresión — se lista todo apellido con al menos un portador — y Taiwán tiene residentes con apellidos japoneses procedentes del periodo colonial 1895–1945 y de naturalizaciones posteriores. La entrada es real. También es el 0,0003 % de Taiwán.
El 75,4 % es aritméticamente correcto y, en el fondo, no vale nada. Dice: la mayoría de los japoneses tiene un apellido que al menos una persona de Taiwán también tiene. Eso es una afirmación sobre el tamaño de la cola larga no suprimida de Taiwán, no sobre la denominación japonesa y taiwanesa.
Los dos sistemas de escritura comparten un inventario de caracteres heredado del chino clásico. Dos corpus cualesquiera en escritura han se solaparán solo por esa razón, y apellidos de un solo carácter como 林 y 王 son frecuentes en ambas lenguas de forma independiente.
La comprobación. Cuando el solapamiento parezca alto, examine los pesos de ambos lados, no el número de entradas compartidas. Si los nombres compartidos pesan mucho en un lado y casi nada en el otro, lo que ha encontrado es una coincidencia de escritura.
Fallo 3: el solapamiento es direccional
La similitud es simétrica; el solapamiento no lo es. Confundirlos es el error más frecuente en la literatura sobre comparación de nombres, y es el que produce frases falsas enunciadas con total seguridad.
«¿Qué proporción de la masa de nombres de A está formada por nombres que existen también en B?» tiene dos respuestas:
| Par | A → B | B → A | Entradas compartidas |
|---|---|---|---|
| Japón → Taiwán (apellidos) | 75,4 % | 8,4 % | 339 |
| Turquía → Alemania (apellidos) | 17,1 % | 2,0 % | 24 |
| Vietnam → Chequia (nombres de pila) | 18,1 % | 0,5 % | 21 |
| Dinamarca → Suecia (apellidos) | 63,2 % | 18,3 % | — |
| España → Portugal (apellidos) | 9,2 % | 65,9 % | — |
| Canadá-fr → Canadá-en | 86,0 % | 47,5 % | 358 |
| Portugal → Brasil | 90,3 % | 73,0 % | 198 |
Turquía y Alemania comparten 24 apellidos. En el sentido turco, esos 24 llevan el 17,1 % de la masa, porque son los apellidos más extendidos de Turquía — Yılmaz, Kaya, Demir, Çelik, Yıldız, Şahin, Öztürk. En el sentido alemán, esos mismos 24 apellidos llevan el 2,0 %. Ambas cifras describen la misma realidad — los apellidos turcos entraron en los registros alemanes con frecuencias del orden del punto porcentual tras el acuerdo de reclutamiento de 1961, sin desplazar nada — y cualquiera de ellas por separado la tergiversa.
España y Portugal son el par en el que el sentido invierte el titular. La masa de apellidos portugueses está presente en un 65,9 % en España; la masa española está presente en un 9,2 % en Portugal. El repertorio de Portugal es pequeño, concentrado y en gran parte un subconjunto del fondo ibérico más amplio; el de España es enorme y queda mayoritariamente fuera de Portugal. «España y Portugal se parecen en un 65,9 %» y «España y Portugal se parecen en un 9,2 %» son dos frases igualmente defendibles salidas del mismo cálculo.
La regla. Publique los dos sentidos o publique una métrica simétrica. Nunca presente un solo sentido como si fuera la relación.
Fallo 4: los pesos no son conmensurables de un locale a otro
Nuestros corpus llevan pesos de frecuencia, y resulta tentador compararlos. No lo haga.
Auditoría del fichero de apellidos de cada locale, tal como estaba el corpus el 18 de julio de 2026:
| Tipo de escala | Locales | Peso máximo | Suma de pesos |
|---|---|---|---|
| Recuentos reales de portadores | 2 | 2.618.994 (zh_TW) | 23.367.536 |
| Enteros relativos 1–255 | 61 | de 20 a 255 | ~1.000 a ~19.000 |
En ese momento, solo zh_TW y vi_VN llevaban recuentos brutos. Los pesos de Taiwán suman 23.367.536 — la población registrada de Taiwán — y 陳 pesa 2.618.994. Todos los demás locales usaban una escala relativa cuyo techo variaba: 20 para Indonesia, 24 para el neerlandés de Bélgica, 40 para Alemania, Chequia y Polonia, 100 para Gran Bretaña y Japón, 255 para España, Francia, Rusia y Suecia.
Desde entonces se han reconstruido otros diez corpus de apellidos a partir de registros. Recontado el 22 de julio de 2026, el corpus contiene 64 locales, 12 de ellos derivados de registros y 52 todavía en escalas relativas — de modo que el fallo descrito a continuación afecta ahora a 52 locales y no a 61. Ha menguado; no ha desaparecido, y le ha salido un segundo filo, descrito en la nota metodológica del final.
Consecuencias:
- Los pesos brutos no significan nada de un locale a otro. El peso 40 es lo más alto de la escala alemana y no tiene nada de destacable en la española. Todo cálculo entre locales debe normalizar primero — usamos normalización L1, de modo que cada corpus suma 1 antes de cualquier comparación.
- La normalización elimina la escala, pero no la profundidad. Un corpus con un techo de 255 puede expresar una cabeza más pronunciada que uno limitado a 20. Parte de la diferencia residual entre locales tras normalizar es profundidad de calibrado, no realidad de la denominación.
- Jaccard es inmune, pero tiene su propio sesgo. Al basarse en conjuntos, ignora por completo los pesos — y por eso penaliza, en cambio, la asimetría de profundidad. Nuestros corpus van de 184 entradas (apellidos coreanos) a 3.830 (nombres de pila suecos). Un corpus profundo emparejado con uno poco profundo obtiene una puntuación baja porque la unión es grande, por bien que se correspondan entre sí.
Los dos sesgos tiran en sentidos opuestos, que es la única razón por la que merece la pena calcular ambas métricas. El grupo de lengua francesa obtiene puntuaciones tan limpias en nuestra matriz en parte porque, cuando se calculó la matriz, los cuatro corpus franceses tenían exactamente 798 entradas de nombres de pila — igualados en profundidad por construcción, de modo que Jaccard no tenía nada que penalizar. (fr_FR se ha reconstruido desde entonces con 30.594 nombres de pila; fr_CA, fr_BE y fr_CH siguen con 798.)
El que no es un fallo
Una puntuación baja de nuestra matriz se parecía exactamente a la barrera de las escrituras y resultó ser auténtica.
Rusia y Ucrania comparten 16 apellidos. Jaccard 0,0041. Solapamiento direccional del 0,2 % y del 3,8 %. Dos países eslavos vecinos, y la medición los da como casi totalmente ajenos entre sí.
Pero ambos escriben en cirílico. La barrera de las escrituras no se aplica, y los ceros no son ceros — hay 16 nombres compartidos, así que las codificaciones concuerdan y la comparación es efectiva. El resultado se sostiene.
Además es estructuralmente correcto. Los apellidos rusos son en su inmensa mayoría posesivos adjetivales en -ov/-ev/-in. Los apellidos ucranianos están dominados por el patronímico -enko y por la familia -uk/-yuk, con -sky y -ych por detrás. Los sistemas de sufijos productivos apenas se cruzan, así que los repertorios de apellidos apenas se cruzan. Según esta medición, Ucrania y Rusia están más alejadas entre sí que Gran Bretaña y la India.
La lección es el inverso útil del fallo 1: una puntuación baja entre locales de la misma escritura es informativa de un modo en que una puntuación baja entre escrituras distintas nunca lo es. Los pares de la misma escritura son el terreno donde el método funciona de verdad. Son muchos menos de lo que sugieren las 1.953 celdas de la matriz.
La lista de comprobación
Antes de dar crédito a cualquier comparación de nombres entre corpus, incluida la nuestra:
| Comprobación | Cómo | Qué aspecto tiene el fallo |
|---|---|---|
| Control de identidad | Incluir un par que se sepa idéntico; confirmar que se puntúa como idéntico | Serbio ↔ serbio a 0,0000 |
| Censo de escrituras | Agrupar los locales por sistema de escritura antes de leer ninguna puntuación | 7 aislados que no comparten nada con nadie |
| Triaje de ceros | Para cada cero, preguntarse: ¿alfabetos distintos o nombres distintos? | 981 de 1.953 pares de nombres de pila |
| Examen de pesos en ambos lados | Si el solapamiento es alto, comprobar el peso de los nombres compartidos en cada corpus | 佐藤 al 2,6 % frente al 0,0003 % |
| Los dos sentidos | Calcular A→B y B→A; publicar ambos | 75,4 % frente a 8,4 % |
| Auditoría de escalas | Imprimir el máximo y la suma por locale; averiguar cuáles son recuentos reales | 10 de 63 |
| Auditoría de profundidad | Imprimir el número de entradas; señalar los pares con gran desajuste de profundidad | 184 frente a 3.830 entradas |
| Dos métricas | Basada en conjuntos y basada en pesos; investigar dónde discrepan | Portugal–Brasil: Jaccard 0,294, coseno 0,845 |
La última fila se ganó su sitio. Portugal y Brasil obtienen una puntuación modesta en el solapamiento de conjuntos y la tercera más alta de toda la matriz en el solapamiento ponderado — pocas formas de apellido compartidas, pero las compartidas son las dominantes en ambos lados. Ese es un hecho estructural real sobre una relación colonial de denominación, y resulta visible solo en la brecha entre las dos métricas. Cada métrica por separado describe un país distinto e incompleto.
Conclusión
La comparación de nombres entre locales es más frágil que la auditoría de un corpus aislado, porque cada modo de fallo se suma a los demás: un desajuste de escritura pone un par a cero, una coincidencia de escritura infla otro, el sentido duplica las respuestas y unos pesos no conmensurables corrompen lo que sobreviva.
La disciplina que exige no tiene nada de glamuroso. Cuente sus escrituras. Cribe sus ceros. Imprima los dos sentidos. Compruebe qué son realmente sus pesos. Y ponga en sus datos algo cuya respuesta ya conozca, para que, cuando el método se rompa, se rompa en un punto que esté mirando.
El nuestro se rompió con el serbio, al puntuar un fichero a cero frente a una transliteración de sí mismo. Fue la cifra más útil que produjo todo el ejercicio.
Metodología y fuentes
Qué se calculó. Los 63 locales de la versión de corpus share 1.1.7, la totalidad de los 1.953 pares no ordenados. Los vectores de nombres de pila fusionan los ficheros masculino y femenino; los vectores de apellidos usan lastname_male (los ficheros de apellidos masculinos y femeninos son idénticos en la mayoría de los locales, de modo que fusionar ambos duplicaría cada peso sin modificar ningún cociente). Por par: Jaccard sobre los conjuntos de claves, coseno sobre los vectores de pesos normalizados en L1 y solapamiento ponderado direccional en los dos sentidos. La correspondencia es una igualdad exacta de cadenas sobre los valores brutos de los ficheros, sin normalización, ni plegado, ni transliteración. Análisis ejecutado el 2026-07-18. ⚠ El corpus contenía 63 locales cuando se midieron estas cifras; en_IE se añadió el 18 de julio de 2026 y hoy contiene 64. Los 1.953 pares son todos los pares no ordenados de esos 63; volver a ejecutarlo sobre 64 daría 2.016.
Resultados de la auditoría de escalas. Se calcularon el peso máximo y la suma de pesos por locale para clasificar el tipo de escala:
| Locale | Peso máximo | Suma de pesos | Clasificación |
|---|---|---|---|
| zh_TW | 2.618.994 | 23.367.536 | recuentos reales de portadores |
| en_US | 2.369.644 | 129.931.469 | recuentos reales de portadores |
| es_ES | 1.446.937 | 34.026.331 | recuentos reales de portadores |
| en_GB | 652.563 | 27.125.558 | recuentos reales de portadores |
| fr_FR | 250.013 | 20.114.307 | recuentos reales de portadores |
| da_DK | 222.355 | 2.984.886 | recuentos reales de portadores |
| sv_SE | 216.488 | 5.594.332 | recuentos reales de portadores |
| uk_UA | 107.878 | 9.752.950 | híbrido — véase más abajo |
| no_NO | 47.879 | 2.854.195 | recuentos reales de portadores |
| vi_VN | 30.492 | 99.441 | proporciones, no recuentos |
| id_ID | 20 | 2.378 | relativa |
| de_DE | 40 | 1.946 | relativa |
| (otros 51) | 20–255 | ~970–14.500 | relativa |
⚠ «Derivado de registro» no es una categoría única, y sumar estos diez locales como «locales con datos reales» sobrestima su comparabilidad. Tres de las filas anteriores no son en absoluto recuentos de portadores:
vi_VNcontiene proporciones, no recuentos. Los pesos son partes por mil × 1.000, razón por la cual suman ~100.000 y no la población de Vietnam.Nguyễn30.492 significa el 30,5 % de la población, no 30.492 personas.uk_UAes un híbrido de tres cosas distintas reunidas en una misma columna: ~71 recuentos de registro auténticos en la cabeza, 28 entradas fijadas en un valor plano de 20.000 (una franja publicada de «≥20.000», no una medición) y 2.123 entradas apoyadas en un valor suelo honesto de 1.000. Dos tercios del fichero son un valor de relleno con las mismas unidades que la cabeza.en_IEse reconstruyó a partir de recuentos reales después de ejecutarse este análisis y por esa razón no figura en la tabla.
Así pues, el corpus contiene hoy 64 locales, 12 derivados de registros y 52 relativos (recontados el 22 de julio de 2026) — pero no todos los doce son simples recuentos de portadores. El problema de conmensurabilidad que describe esta sección es menor de lo que era y no ha desaparecido; en parte se ha convertido en un problema más sutil, en el que dos locales llevan enteros grandes de apariencia real que significan cosas distintas.
Amplitud de profundidad del corpus. Apellidos: de 184 (ko_KR) a 2.707 (zh_TW). Nombres de pila: de 484 (vi_VN) a 3.830 (sv_SE).
Recuentos de solapamiento nulo. Nombres de pila: 981 de 1.953 pares (50,2 %). Apellidos: 1.287 de 1.953 (65,9 %). Aislados de escritura en el conjunto (únicos ocupantes de su sistema de escritura y, por tanto, con solapamiento nulo frente a los otros 62): bn_BD, el_GR, he_IL, hy_AM, ka_GE, ko_KR, ne_NP.
Control de identidad. sr_RS y sr_Latn_RS contienen números de entradas coincidentes (1.143 nombres de pila, 958 apellidos) y totales de pesos coincidentes, lo que concuerda con que uno sea una transliteración del otro. La similitud medida entre ambos es de 0,0000 en las cuatro métricas, con 0 entradas compartidas.
Lo que este artículo no hace. No propone ninguna solución por transliteración ni por correspondencia fonética. Cada capa de ese tipo que consideramos introduce su propia clase de errores — con pérdida en el caso de las escrituras no biyectivas, hecha a la medida del inglés en el de las claves fonéticas — y sustituiría los errores visibles documentados aquí por otros más difíciles de auditar. La correspondencia estricta con los fallos etiquetados fue la elección deliberada. Quien construya una comparación entre escrituras debería tratar este texto como un enunciado del problema, no como su solución.
Lecturas relacionadas: ¿Qué países comparten nombres? expone los resultados que produjo este método y enuncia estas limitaciones junto a ellos; Cómo auditar un conjunto de datos de frecuencia de nombres trata la auditoría de un corpus aislado, incluidas las cuestiones del techo de 255 y de la cobertura declarada mencionadas más arriba; Siete formas en que los datos de nombres le mienten (artículo complementario, aún no publicado) trata de las trampas de fondo más que de las metodológicas.