Identificación falsa > Artículos > El problema del umbral de privacidad en los registros de nombres

El problema del umbral de privacidad en los registros de nombres

Usted busca un apellido en un registro nacional y no está.

¿Qué ha aprendido? Según el país cuyo registro haya consultado, una de estas tres cosas completamente distintas: que el apellido tiene cero portadores, que tiene un número de portadores que el organismo no le va a revelar, o nada en absoluto. La celda vacía tiene exactamente el mismo aspecto en los tres casos. Solo la regla de divulgación del registro los distingue, y esa regla reside en un sitio que no es el fichero de datos.

Esto pasa a ser determinante en el momento en que usted actúa sobre esa ausencia. Si la ausencia significa cero, borrar la entrada es correcto. Si la ausencia significa «por debajo del umbral», borrarla destruye datos reales. Las mismas pruebas, la misma acción, el veredicto opuesto — decidido por completo por una nota al pie de un documento de política.

Nos topamos con esto mientras auditábamos los corpus de apellidos de 63 locales el 17 de julio de 2026 (64 hoy), y estuvimos a punto de trasladar una decisión correcta de un país a otro donde habría sido un error grave. Aquí está la tabla comparativa que nos habría gustado tener de antemano.

La comparación

RegistroUmbralLa ausencia significa¿Se puede limpiar con eso?
Taiwán, MOINinguno — publica apellidos con 1 portador (643 de ellos)Cero de verdad
Dinamarca, DST<3 suprimido, pero el cero se comunica por separadoDepende del mensajePor nombre
Corea del Sur, KOSTAT≥5 portadores; el resto agrupado en 기타 («otros»)DesconocidoNo
España, INE≥20 portadores (regla de confidencialidad estadística)DesconocidoNo
Francia, INSEE≥30 nacimientos 1891–2000; el resto agrupado como AUTRES NOMSDesconocidoNo
UcraniaNo existe ningún registroNadaNo
LetoniaNo existe ningún registro por apellidoNadaNo

Siete registros, cuatro significados distintos para la misma casilla en blanco.

Dinamarca: el registro que responde directamente a la pregunta

Dinamarca merece la sección más larga porque hace algo que ninguna otra fuente de esta lista hace — distingue los dos estados de forma explícita, con palabras. Danmarks Statistik opera un oráculo de nombres: usted pregunta por un apellido concreto y obtiene una de dos respuestas posibles.

Respuesta de DSTQué significaAcción correcta
Der er færre end 3 personer med efternavnet XExisten 1–2 portadores; la cifra queda ocultaConservarlo, peso 1
Der er ingen personer med efternavnet XCero portadoresBorrarlo

«Hay menos de 3 personas con el apellido X» y «no hay ninguna persona con el apellido X» son frases distintas, y Dinamarca está dispuesta a decir ambas. Esa sola decisión de diseño convierte un umbral de privacidad, de obstáculo que era, en un árbitro nombre por nombre.

Por eso conservamos Thurah y Vagn — ambos caen dentro de la banda de privacidad, ambos son apellidos daneses reales portados por una o dos personas — y por eso borramos Pedersgaard. El registro no se limita a no incluir Pedersgaard; afirma expresamente que nadie lo lleva. Eso lo convierte en un fantasma, ensamblado a partir de un modelo plausible (Peders- + -gaard) en lugar de observado en una población.

El argumento descansa por entero en la existencia de dos mensajes. Si DST respondiera færre end 3 también para el cero — como daría a entender una lectura ingenua de «suprimir los recuentos inferiores a 3» —, Pedersgaard sería indistinguible de Thurah y habríamos tenido que conservarlo. El umbral se habría tragado la prueba. Es la política de divulgación, y no el valor del umbral, lo que hace que los datos daneses sean utilizables de esta manera.

Taiwán y Corea del Sur: imágenes especulares

Estos dos países son la razón de ser de este artículo. Vecinos, ambos de Asia Oriental, ambos con distribuciones de apellidos concentradas, ambos con estadísticas oficiales detalladas publicadas — y en lados opuestos de este problema, sin que nada en el aspecto de los datos se lo indique.

Taiwán: sin suelo alguno

El Ministerio del Interior de Taiwán publica 643 apellidos con exactamente un portador y 406 con dos — hasta nombres de origen japonés como 八谷 y 大久保, portados por una sola persona entre 23 millones. No existe ningún suelo de privacidad.

Esa propiedad convierte el registro en un instrumento de falsación. La ausencia significa cero portadores, punto. Así que, cuando encontramos en nuestro corpus taiwanés 33 apellidos que el registro no contiene — 亓官, 漆雕, 巫馬, 段干, 百里, 東郭, 南門, 子車, 梁丘, 左丘, 東門, 西門, 南宮, 長孫, 宇文, 公孫, 萬俟, 聞人, 鍾離, 仲孫, 拓跋 y otros —, borrarlos era correcto. Se habían tomado del 百家姓, un texto clásico del siglo XI, y arrastrado a un conjunto de datos destinado a describir personas vivas. Nadie en Taiwán los lleva.

Corea del Sur: un suelo en cinco

El censo de KOSTAT solo publica apellidos con cinco o más portadores. Todo lo que sea más raro se agrupa en 기타 — «otros». De modo que un apellido ausente de la tabla publicada puede tener cuatro portadores, o dos, o ninguno, y la tabla no puede decirle cuál de esos casos se aplica.

La lógica de borrado taiwanesa es, por tanto, inválida en Corea. No «menos fiable» — inválida. Razona a partir de una ausencia que no contiene información alguna. Estuvimos a punto de aplicarla igualmente, con el fundamento, en apariencia del todo razonable, de que acabábamos de hacer exactamente eso, con éxito, en un país vecino con un conjunto de datos de aspecto muy parecido. La diferencia no está en los datos. Está en una regla de divulgación publicada en otro sitio.

Y aun en Taiwán, la apariencia no decide nada

La lección más incisiva vino de dentro del país donde la limpieza estaba permitida. 澹臺 se parece exactamente a los 33 fantasmas: un apellido compuesto arcaico salido directamente del 百家姓 — justo el perfil por el que acabábamos de borrar 33 entradas. Fue a parar a la lista de borrado por ese motivo.

Tiene 2 portadores. Está en el registro. Se quedó.

También se quedaron 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) y 呼延 (1) — todos de aspecto arcaico, todos reales. Mientras tanto, 歐陽 tiene 7.653 portadores y 東郭 tiene cero, y ninguna pericia filológica, por grande que sea, los separa a simple vista.

Solo el contador los distingue. Nunca la apariencia. Un registro sin suelo de privacidad no autoriza el juicio a ojo; autoriza las consultas.

Donde no existe nada: Ucrania y Letonia

El tercer estado — la ausencia no significa nada — es el más incómodo de asumir.

Ucrania no dispone de ningún registro de apellidos consultable para verificación. Ni siquiera uno con umbral; ninguno. Los trabajos académicos publican un top 100 y ahí se detienen. Así que limpiar la cola de apellidos ucranianos se reduce a borrar entradas según cómo suenan, y medimos esa heurística: aplicada a candidatos deliberadamente seleccionados como «los más sospechosos», «suena raro» produjo una tasa de falsos positivos del 21 % — apellidos reales portados por personas identificables (un cantante de ópera, un antiguo comandante en jefe de las Fuerzas Armadas, una familia de compositores) situados en la misma cola que las fabricaciones auténticas. El contexto lo hace inevitable: Ucrania tiene 707.685 apellidos únicos, con una media de 64 portadores cada uno. En una distribución con esa forma, raro y extraño es la norma, no una señal de defecto.

Letonia añade una variante que conviene señalar, porque parece el caso contrario. Letonia publica un oráculo por nombre consultable — activo, actualizado, exactamente con la forma de la herramienta danesa. Consulte un apellido y obtendrá una cifra.

Salvo que se trata de una base de datos solo de nombres de pila. Consulte Ozoliņš, uno de los apellidos más comunes del país, y obtendrá cero filas. Consulte Ivanovs y obtendrá tres personas que llevan Ivanovs como nombre de pila. El oráculo responde a otra pregunta, con soltura y sin inmutarse — y un registro que parece la herramienta que usted necesita es más peligroso que una ausencia evidente, porque devuelve un número y ese número carece de sentido para su propósito.

Así que Letonia se suma a Ucrania: no hay registro por apellido, la ausencia no significa nada, limpieza prohibida.

Categorías de servicio que se hacen pasar por nombres

Un umbral tiene que poner en algún sitio el resto suprimido, y el lugar donde va a parar suele ser una fila que parece exactamente un nombre.

RegistroLa categoríaQué esDónde se sitúa
Taiwán, MOI其他«Otros» — el resto agrupadoPuesto #147, recuento 5.174
Corea del Sur기타«Otros» — todo lo que baja de 5 portadoresEn la tabla de apellidos
Francia, INSEEAUTRES NOMSTodo lo que baja de 30 nacimientos, 1891–2000En el fichero nacional

其他, en el puesto #147, es la que hay que tener presente. No está enterrada en una cola donde usted nunca iría a mirar. Se acomoda sin problema dentro de cualquier corte mecánico del tipo «tomar los 200 primeros», en una posición plausible, con el mismo formato que todos los apellidos reales que la rodean. Haga un corte top-N sin una exclusión explícita y «otros» se convierte, en su conjunto de datos, en el 147.º apellido más común de Taiwán.

Suecia aporta la variante más extraña. Su registro de nombres de pila lleva el alfabeto entero como nombres: M (305 portadores), A (120), S (65), I (22), K (17), B (5), Z (3). No son una práctica de denominación sueca; son entradas en las que solo sobrevivió una inicial. La prueba es estructural, no estética — están presentes las 26 letras, y así no se comporta una distribución de nombres.

Pero fíjese en lo que ese argumento no autoriza. Md (1.361 portadores) no es una letra del alfabeto; es la abreviatura bangladesí de Muhammad en los pasaportes, y 1.361 residentes en Suecia lo han inscrito como su nombre de uso legal. Se quedó. Lo mismo con Thi (3.717) — en un corpus vietnamita analizado automáticamente esa cadena es un artefacto notorio, pero en el registro sueco es una inscripción deliberada. La regla que atrapa a M no debe atrapar a Md, y «parece un artefacto» no permite distinguirlos.

Tales artefactos se propagan en los corpus analizados automáticamente, no en los registros legales. En los datos de frecuencia vietnamitas, Y ocupa el puesto 55 con un 0,092 % — y no es en absoluto un apellido. Es un tratamiento honorífico masculino de los pueblos Ê Đê y Gia Rai, algo así como «Sr.». La prueba es interna a la fuente: si Y fuera un apellido, los nombres de clan reales de esos pueblos estarían cerca de él. En cambio, Niê está en el #210 (0,005 %) y en el #247. Y es dieciocho veces «más frecuente» que el clan al que supuestamente pertenece, porque un analizador tomó el primer segmento del nombre de cada varón Ê Đê y Gia Rai y lo archivó bajo «apellido». La misma fuente sitúa Thị en el #149 — un nombre intermedio femenino — junto con Ka en el #123 y A en el #129.

Los registros legales son estructuralmente inmunes a esa clase de artefactos: el campo es «el apellido que figura en el documento», de modo que no puede contener un tratamiento honorífico. Los corpus analizados automáticamente, en cambio, no lo son. Saber qué tipo de fuente tiene usted entre manos le indica qué artefactos esperar.

Los umbrales también ocultan cosas que no son umbrales

Algunos registros excluyen poblaciones enteras, y esa exclusión no se declara como un umbral porque no lo es.

El fichero del INSEE francés excluye a las personas nacidas en el extranjero — en torno al 10,7 % de la población francesa. No es una regla de privacidad; es un recorte sistemático de la población de referencia, y actúa casi por entero sobre una sola capa. Apellidos como Cissé o Benali solo se cuentan a través de los hijos de esos portadores nacidos en Francia. El fichero cuenta además nacimientos, no portadores vivos — un segundo cambio de unidad encima del primero. La dirección del error se conoce; su magnitud no, y multiplicar por un coeficiente adivinado sería ajustar, no corregir.

El propio registro muestra la llegada de esa capa, por cohorte de nacimiento, por cada 100.000:

Apellido1941–19501991–2000Variación
TRAORE0,1035,76×358
DIALLO0,3735,59×96
NGUYEN3,7655,35×15
MARTIN359,65280,93−22 %

El registro sueco de nombres de pila ofrece una segunda variedad: cuenta portadores vivos de todas las edades, sin ningún desglose por edad disponible. En torno al 20 % de su masa son niños de 0 a 17 años, de modo que los nombres de moda desde la década de 2010 quedan sobreestimados para cualquier aplicación restringida a adultos, y los nombres cuyos portadores han muerto en su mayoría quedan subestimados. Dirección conocida, magnitud desconocida, ninguna corrección honesta disponible.

Ninguno de los dos es un umbral de privacidad. Ambos son el mismo modo de fallo: la población publicada no es la población que usted supuso, y nada en el fichero lo dice.

Qué hacer con todo esto

  • Encuentre la regla de divulgación antes de tocar los datos. Está en una nota metodológica, no en el fichero de datos, y determina qué significa una celda vacía.
  • Establezca en cuál de los tres estados se encuentra. Ausencia = cero (actúe en consecuencia), ausencia = dato suprimido (no actúe), ninguna fuente en absoluto (no actúe, y dígalo).
  • Prefiera los registros que comunican el cero por separado. El diseño danés de dos mensajes vale más de lo que valdría un umbral más bajo. El valor de un umbral no está en su número; está en si el cero puede distinguirse de la supresión.
  • Nunca traslade una decisión de limpieza de un país a otro. Taiwán y Corea se parecen y son opuestos. La decisión pertenece al registro, no al aspecto de los datos.
  • Excluya explícitamente las categorías de servicio. 其他, 기타, AUTRES NOMS y las iniciales sueltas parecen nombres y sobreviven a cualquier corte mecánico top-N.
  • Compruebe la unidad y la población de referencia, no solo el umbral. Nacimientos ≠ portadores. Ciudadanos ≠ residentes. Todas las edades ≠ adultos. Posiciones ≠ personas.
  • Cuando no existe nada, «no hay datos» es el resultado. Limpiar una cola según cómo suena tiene una tasa de falsos positivos medida del 21 %. Eso no es una heurística; es destrucción de datos con una tapadera plausible.

Datos actualizados a 2026-07-17

Todos los comportamientos de registro descritos aquí se observaron el 17 de julio de 2026 durante la construcción de corpus ponderados de apellidos para los 63 locales que el corpus contenía en esa fecha; en_IE se añadió el 18 de julio de 2026, con lo que el conjunto pasó a 64. Los umbrales son los publicados por cada organismo en esa fecha. El comportamiento danés de dos mensajes, las entradas taiwanesas con un solo portador, el oráculo letón limitado a nombres de pila y el artefacto vietnamita del tratamiento honorífico se verificaron uno a uno contra la fuente, en lugar de deducirse. Las filas de Ucrania y Letonia son resultados negativos — los intentos repetidos de localizar una fuente nacional de apellidos consultable nombre por nombre no encontraron ninguna disponible.

Fuentes:

  • Taiwán, Ministerio del Interior — clasificaciones y recuentos de apellidos por franja de edad, 30 de junio de 2023 (OGDL 1.0): data.gov.tw/dataset/126774
  • Dinamarca, Danmarks Statistik — estadísticas de nombres y consulta nombre por nombre: dst.dk/da/Statistik/emner/bor… · conjunto de datos abierto de nombres de pila y apellidos de la población de Dinamarca: sprogteknologi.dk/dataset/fornavne-og-ef…
  • Corea del Sur, KOSTAT — Censo de Población y Vivienda de 2015, estadísticas de apellidos (인구주택총조사 성씨 통계): kostat.go.kr
  • España, INE — apellidos con ≥20 portadores, censo a 1 de enero de 2025; nota metodológica sobre la regla de confidencialidad: ine.es/daco/daco42/nombyapel/…
  • Francia, INSEE — Fichier des noms de famille 1891–2000 (≥30 nacimientos a escala nacional; el resto agrupado como AUTRES NOMS): insee.fr/fr/statistiques/353663…
  • Suecia, SCB — apellidos y nombres de uso tilltalsnamn, 31 de diciembre de 2022: scb.se
  • Letonia, PMLP — base de datos de nombres de pila (los apellidos no están cubiertos): personvardi.pmlp.gov.lv · Letonia, CSP — censo de 2021: stat.gov.lv
  • Ucrania — no hay registro nombre por nombre disponible; solo listas académicas del top 100
  • Vietnam — conjuntos de datos de frecuencia hoten.org VNTH01 (n = 1.682.729) y SG01 (n = 241.000), CC BY 4.0 según se declara en el texto de la página; no es un registro estatal

← Artículos