El registro que no existe
Durante años, nuestras notas sobre Italia decían lo mismo: no existe ningún registro de nombres. Ninguna tabla de frecuencia de apellidos italianos, ninguna tabla de frecuencia de nombres de pila italianos, nada utilizable. Italia acabó en la columna «modelizado», junto a un puñado de países que efectivamente no publican nada.
La mitad de esa nota era correcta, de forma rigurosa y demostrable. La otra mitad era falsa, y lo había sido desde el principio. Los datos existían, los publicaba el instituto nacional de estadística, eran gratuitos, cubrían de 1999 a 2024 y 10,6 millones de nacimientos — y resultaban invisibles para todas las búsquedas que se habían hecho, porque no viven en un catálogo de datos. Viven detrás de un widget interactivo en una página web, y llevan un nombre de producto en lugar de uno descriptivo.
Este artículo trata de ese modo de fallo, porque no es un problema italiano. «No hay ninguna fuente para el país X» casi siempre se descompone en una de tres afirmaciones muy distintas, y solo una de ellas es un hecho.
Primero, demostrar correctamente el negativo
Antes de afirmar que una fuente no existe, hay que haber buscado en el único lugar donde su ausencia significa algo. Para un instituto nacional de estadística, ese lugar es el catálogo legible por máquina, no un buscador.
El ISTAT publica sus fondos estadísticos en formato SDMX. La lista completa de dataflows cabe en una sola petición HTTP:
https://esploradati.istat.it/SDMXWS/rest/dataflow/IT1
Eso devuelve 13,6 MB de XML que enumeran 4.887 dataflows — el inventario completo publicado de lo que el ISTAT difunde como datos estructurados. Descargado de nuevo el 21 de julio de 2026 y rastreado:
| Término buscado | Apariciones en el catálogo completo |
|---|---|
cognom (apellido) | 0 |
surname | 0 |
nome / nomi (nombre) | 3, ninguna de ellas estadística de nombres |
Eso es un hallazgo negativo de verdad, y vale mucho más que «no he conseguido encontrarlo». Dice lo siguiente: en toda la producción estructurada del instituto nacional de estadística italiano, la frecuencia de apellidos no es un producto publicado. Ni sometida a umbral, ni restringida, ni detrás de un inicio de sesión — ausente.
El motivo está documentado y es estructural. Los microdatos censales italianos sobre apellidos se tratan como dati sensibili: un apellido raro identifica por sí solo a una persona, así que el ISTAT no difunde la distribución. La onomástica italiana sorteó históricamente el obstáculo explotando la guía telefónica SEAT, que es una muestra de abonados, no un registro.
Así que, para los apellidos, la nota original tenía razón, y ahora la tiene por un motivo que podemos mostrar en lugar de afirmar. La formulación correcta es más acotada que la nuestra: no existe un registro nacional de apellidos. Los municipales sí existen, y llegaremos a ellos.
Después, fijarse en lo que el negativo no cubría
La misma consulta al catálogo que demuestra la ausencia de los apellidos no demuestra absolutamente nada sobre los nombres de pila — y ahí es donde la nota se torció. «Ninguna tabla de apellidos en el catálogo SDMX» quedó grabado como «ningún dato italiano de nombres», que es otra frase.
Los datos de nombres de pila sí están publicados. Se llaman Contanomi — literalmente «cuenta-nombres» — y se presentan como un juguete interactivo en el sitio del ISTAT: elija un nombre, vea su curva. Debajo hay un punto de acceso JSONP que devuelve recuentos absolutos de nacimientos. Admite dos tipos de petición — una que informa de qué años están disponibles y otra que devuelve una lista para un año dado hasta un límite de filas — y responde con un callback que envuelve un objeto JSON por nombre: el año, el nombre, el recuento, el sexo y la proporción en porcentaje de ese nombre en ese año. Aquí no se reproduce ninguna URL; lo que importa es la forma, y es la forma de cualquier backend de widget.
Comprobado de nuevo el 21 de julio de 2026: sigue activo y sigue devolviendo de 1999 a 2024.
Lo que vuelve no es un índice, ni un porcentaje, ni un modelo. Es el número de niños inscritos con ese nombre en ese año, por sexo, procedente de la encuesta Iscritti in anagrafe per nascita — alimentada desde 2020 a través del ANPR, el registro nacional de población residente.
Extraído a lo largo de los 26 años y agregado:
| Magnitud | Masculino | Femenino | Total |
|---|---|---|---|
| Nombres distintos | 2.278 | 2.051 | 4.329 |
| Nacimientos que los llevan | 5.489.051 | 5.123.931 | 10.612.982 |
| Años cubiertos | 1999–2024 | 1999–2024 | 26 |
Diez millones y medio de nacimientos, nombre por nombre, año por año, con el sexo, de un país que las notas habían archivado bajo «sin datos».
Y como están desglosados por año en lugar de acumulados en un total único, muestran cosas que una sola tabla de frecuencia no puede mostrar. El nombre de cabeza cambia por completo de un extremo a otro de la ventana:
| Año | Nombre masculino de cabeza | Nombre femenino de cabeza |
|---|---|---|
| 1999 | Andrea (10.336) | Martina (8.773) |
| 2024 | Leonardo (6.580) | Sofia (4.636) |
Agregados sobre toda la ventana 1999–2024, los que encabezan son Francesco (217.368) y Giulia (196.243) — y ninguno de los dos ocupa el primer lugar en ninguno de los dos años extremos. Una lista de frecuencia ciega a las generaciones habría dado esos dos nombres y no habría descrito a nadie.
Por qué nadie lo encontró
Seis motivos, y todos ellos se generalizan a otros países:
1. No está en el catálogo. El inventario SDMX es donde mira un profesional de los datos, y Contanomi no está ahí. Es una funcionalidad de sitio web, mantenida por quien mantenga el sitio web.
2. Tiene nombre de marca, no nombre descriptivo. Buscar nomi, anagrafe, frequenza nomi en el sitio de una administración no hace aflorar una página llamada «Contanomi» con la misma fiabilidad con la que buscar cognomi no hace aflorar nada en absoluto. Las administraciones bautizan sus herramientas interactivas como bautizan las cosas los departamentos de marketing.
3. La palabra es genérica. Filtrar un catálogo por nome en italiano, o por voornaam en neerlandés, devuelve decenas de falsos positivos — nome aparece dentro de denominazione, y en el catálogo estadístico neerlandés voornaam significa además «principal», como en voornaamste bron van inkomen, «principal fuente de ingresos». Una búsqueda de subcadena sobre una palabra común no es una búsqueda; es una generación de ruido.
4. El punto de acceso no está documentado. No hay diccionario de datos, ni fichero de licencia en la URL, ni versionado. Su forma se descubre leyendo el JavaScript de la página.
5. Es inestable de una manera que oculta su propia profundidad. Pídale demasiadas filas y devuelve un callback vacío en lugar de un error. Nuestra extracción obtuvo 2.000 filas para la mayoría de los años — y 600 para 1999, 400 para 2018 y 2019, y 240 para 2021. La profundidad por año es una propiedad de lo que el punto de acceso toleró ese día, no de los datos. Eso es normal en un backend de interfaz y descalificante para cualquier cosa que deba ser reproducible.
6. El negativo se recordó de forma más amplia de lo que se había establecido. Este es el caro, y es nuestro, no de Italia. Alguien comprobó los apellidos, no encontró nada, y la nota que sobrevivió decía «Italia». Los hallazgos negativos exigen la misma precisión que los positivos: qué se comprobó exactamente y qué cubría exactamente la ausencia.
Una lista de comprobación para dar caza a un registro nacional
Ordenada según la frecuencia con la que cada punto ha funcionado de verdad:
- Consulte el catálogo legible por máquina de la administración, no su sitio web. SDMX (
/rest/dataflow/), OData o un punto de acceso CKANpackage_search. Es la única búsqueda cuyo resultado negativo significa algo, porque enumera todo en lugar de ordenarlo por relevancia. - Busque en el catálogo en la lengua local y compruebe con qué más encaja su subcadena. Después busque también el término inglés — las administraciones traducen de forma incoherente.
- Abra las páginas interactivas de la administración y lea su tráfico de red. Exploradores de nombres, pirámides de población, juguetes del tipo «¿cómo de popular es su nombre?». Cada uno de ellos es una API pública a la que le han quitado la documentación. Contanomi se encontró exactamente así.
- Consulte por separado el portal nacional de datos abiertos. Agrega ministerios, regiones y municipios que nunca aparecen en el catálogo propio del instituto de estadística.
- Después baje un nivel: los municipios. En varios países un registro nacional es jurídicamente imposible mientras que los municipales son cosa de rutina — más abajo se ve para qué sirven y para qué no.
- Compruebe si el negativo es estructural o circunstancial. «Ningún dataflow contiene esta palabra», junto con un motivo jurídico documentado (dati sensibili), es un negativo duradero que puede dejar de revisar. «El sitio estaba caído» no lo es.
- Anote el hallazgo negativo con su alcance adjunto. Qué consulta, qué catálogo, qué fecha y — esto es decisivo — qué entidad cubría. Apellidos, no nombres. Todo nuestro error italiano vive en esa distinción que faltaba.
El desvío municipal, y la cifra que lo remata
El portal nacional italiano de datos abiertos, dati.gov.it, responde a una consulta CKAN por cognomi con 95 conjuntos de datos — verificados de nuevo el 21 de julio de 2026. Son auténticas tablas de frecuencia de apellidos procedentes de registros municipales de población, varias de ellas bajo CC0, una licencia más limpia que la que ofrecen la mayoría de los registros nacionales.
También son, como distribución nacional, inservibles. Aquí está la prueba, medida en lugar de afirmada.
| Ciudad | Editor | Licencia | Filas | Suelo | Apellidos de cabeza |
|---|---|---|---|---|---|
| Bergamo | Regione Lombardia | CC0 1.0 | 1.750 (2021) | ≥11 | ROTA 845, LOCATELLI 744, ROSSI 407 |
| Brescia | Regione Lombardia | CC0 1.0 | 545 | ≥50 | SINGH 1.420, FERRARI 1.032, KAUR 877 |
| Pescara | Comune di Pescara | CC BY 4.0 | 2.077 | ≥11 | DI GIOVANNI 426, SPINELLI 400, MANCINI 396 |
Tres ciudades italianas. Tres países completamente distintos, en lo que a la distribución de apellidos se refiere. Los apellidos de cabeza de Bergamo (ROTA, LOCATELLI, CATTANEO, MAZZOLENI) son bergamascos y se diluyen en menos de cien kilómetros. Los de Pescara (DI GIOVANNI, CAMPLONE, RENZETTI) son abruceses. El apellido número uno de Brescia es SINGH y el número tres es KAUR, porque Brescia tiene una amplia comunidad punyabí — un hecho sobre una sola provincia que no dice absolutamente nada de Italia.
Y ahora la cifra que zanja el asunto. Tome los 200 primeros apellidos de cada una de las tres ciudades e interséquelos:
| Par | En común en el top 200 |
|---|---|
| Bergamo ∩ Brescia | 49 |
| Brescia ∩ Pescara | 13 |
| Bergamo ∩ Pescara | 11 |
| Las tres | 7 |
Siete. ROSSI, ROMANO, MARTINELLI, CONTI, RUSSO, ESPOSITO, PELLEGRINI. Bergamo y Brescia están a 50 km una de otra dentro de la misma región y comparten una cuarta parte de su top 200. Añada una tercera ciudad 600 km más al sur y el núcleo común se desploma hasta siete apellidos.
Así que una lista nacional no se puede montar apilando listas municipales, a menos que se tengan todas, ponderadas por población, en las veinte regiones. La cobertura disponible es una dispersión de voluntarios sesgada hacia el norte. Estos ficheros son excelentes para validar un corpus que ya se tiene, y quedan descalificados para construir uno.
En el fichero de Brescia se esconde un extra, y es la columna más interesante de todo este artículo. Brescia reparte cada recuento entre italiani y stranieri — ciudadanos y no ciudadanos:
| Apellido | Total | Ciudadanos | No ciudadanos | Proporción de no ciudadanos |
|---|---|---|---|---|
SINGH | 1.420 | 359 | 1.061 | 75 % |
KAUR | 877 | 142 | 735 | 84 % |
HU | 360 | 32 | 328 | 91 % |
FERRARI | 1.032 | 1.032 | 0 | 0 % |
ROSSI | 525 | 525 | 0 | 0 % |
SAVOLDI | 334 | 334 | 0 | 0 % |
Esa columna mide, desde dentro de una hoja de cálculo municipal, exactamente lo mismo que mide un registro mucho más famoso mediante un mecanismo completamente distinto — cuánto tiempo lleva un apellido en el país. El registro español lo hace con la columna del segundo apellido; Brescia lo hace con un indicador de ciudadanía. Ninguna de las dos administraciones creó la columna con ese fin. La versión española la examinamos en detalle en ¿Arraigado o importado?.
Encontrarlo no es lo mismo que poder usarlo
Dos cosas impiden que esto acabe bien, y ambas merecen decirse, porque son la forma habitual del problema.
La licencia. Los datos abiertos del ISTAT están bajo CC BY — reutilización comercial explícitamente permitida, atribución obligatoria. Es una licencia generosa y es también una restricción: la atribución no es opcional, y hay que satisfacerla en algún lugar donde una persona razonable la buscaría. Aquí es donde se atasca un número sorprendente de proyectos de datos. La atribución es una decisión editorial, no técnica, y choca con hábitos de producto que nada tienen que ver con las licencias — un libro de estilo que mantiene las fuentes fuera de la superficie visible para el usuario, un diseño sin sitio para una línea de créditos, el miedo a que nombrar a un instituto nacional de estadística implique su respaldo. La licencia no reconoce ninguno de esos motivos. Cuando el resultado de un proyecto realmente no tiene dónde alojar una mención de la fuente, la restricción hay que resolverla antes de usar el fichero, no después. Encontrar datos no crea el derecho a usarlos en silencio.
La cohorte. Contanomi son los nacimientos de 1999 a 2024. Todo el que figura en él tiene menos de 27 años. Italia tiene una de las poblaciones más envejecidas de Europa, así que una lista de nombres construida sobre esa ventana describe una porción pequeña y poco representativa de los italianos vivos. Leonardo y Mattia encabezan los años recientes; los hombres que hoy tienen cincuenta y sesenta y tantos se llaman Giuseppe, Giovanni y Antonio, y Contanomi apenas los ve. Cambiar una lista de toda la población por una lista de cohorte de nacimiento porque esta última es más grande y de mejor procedencia sería una regresión pura y dura.
El uso correcto es el que sugiere la forma de los datos: los datos anuales se convierten en cohortes decenales, y el agregado se convierte en una fuente para los nombres que le faltan a la lista existente, no en un sustituto de ella. Una tabla de frecuencia sin fecha es una fotografía sin pie, y el pie es lo que le dice quién sale en ella.
Lo que la nota debería haber dicho
La entrada original decía: «no hay registro de nombres para Italia.»
Lo que debería haber dicho, y ahora dice:
Apellidos. No existe ningún registro nacional. Verificado contra el catálogo completo de dataflows SDMX del ISTAT (4.887 flujos, cero coincidencias para
cognom/surname), con un motivo jurídico documentado. Sí existen registros municipales — 95 conjuntos de datos endati.gov.it, varios en CC0 — pero las tres ciudades muestreadas solo comparten 7 apellidos en sus respectivos top 200, de modo que no pueden agregarse en una distribución nacional. Útiles para validar, no para construir. Nombres de pila. Sí existe un registro. ISTAT Contanomi, 1999–2024, recuentos absolutos de nacimientos por nombre, año y sexo; 2.278 nombres masculinos y 2.051 femeninos sobre 10.612.982 nacimientos. Servido por un punto de acceso JSONP no documentado detrás de un widget interactivo, no a través del catálogo de datos. Con licencia CC BY (atribución obligatoria). Cubre una cohorte de nacimiento, no la población viva.
La segunda versión es cuatro veces más larga y cada una de sus cláusulas es portante. Esa es la lección de verdad. «No hay fuente» no es un hallazgo. Es el resumen de un hallazgo, y es al resumir donde se perdió la información.
Datos actualizados a 2026-07-21
Todas las cifras de este artículo se midieron el 21 de julio de 2026 a partir de los ficheros y los puntos de acceso que se nombran más abajo. Las dos comprobaciones en vivo — el catálogo SDMX del ISTAT y el recuento de conjuntos de datos de dati.gov.it — se volvieron a lanzar el día de la redacción, en lugar de tomarse de notas anteriores.
Fuentes:
- Italia — ISTAT, catálogo de dataflows SDMX para la agencia
IT1. Descargado el 21 de julio de 2026: 13.597.821 caracteres, 4.887 entradas de dataflow, cero coincidencias paracognomosurname. <esploradati.istat.it/SDMXWS/rest/dataflow/I…; - Italia — ISTAT, Contanomi, basado en la encuesta Iscritti in anagrafe per nascita (alimentada vía ANPR a partir de 2020). Años 1999–2024. Nuestra extracción: 2.278 nombres masculinos y 2.051 femeninos distintos, 10.612.982 nacimientos en total; el recuento más pequeño presente en las porciones recuperadas es 8. Con licencia CC BY — la licencia exige el reconocimiento de la fuente, y aquí se da. <istat.it/it/dati/contenuti-inte…; · términos de la licencia: <istat.it/note-legali/> ⚠ La profundidad por año es desigual porque el punto de acceso devuelve una respuesta vacía por encima de un límite de filas que depende del año: 2.000 filas para la mayoría de los años, 600 para 1999, 400 para 2018 y 2019, 240 para 2021. La cifra de 10,6 millones es, por tanto, un suelo de los nacimientos cubiertos, no un total censal.
- Italia —
dati.gov.it, CKANpackage_search?q=cognomi. Consultado de nuevo el 21 de julio de 2026: 95 conjuntos de datos. <dati.gov.it/> - Bergamo — Regione Lombardia, frecuencias municipales de apellidos, serie 1987–2021 (65.565 filas en total; 1.750 filas y 59.652 portadores para 2021; suelo de supresión 11). CC0 1.0.
- Brescia — Regione Lombardia, graduatoria cognomi (545 filas, 58.181 portadores, suelo 50, repartidos en ciudadanos 89,4 % / no ciudadanos 10,6 %). CC0 1.0.
- Pescara — Comune di Pescara, cognomi più diffusi 2025 (2.077 filas, 73.839 portadores, suelo 11). CC BY 4.0.
- Treccani, Perché non possiamo contare i cognomi italiani — el relato documentado de la negativa del ISTAT a difundir los datos censales de apellidos por tratarse de dati sensibili. Citado como fuente del motivo jurídico, no de cifra alguna.
Sobre las cifras municipales. Los apellidos de cabeza de lista se citan como hechos relativos a tres conjuntos de datos publicados concretos, junto con sus editores y sus licencias. Aquí no se reproduce ninguna parte sustancial de ningún registro, y el estadístico de solapamiento se calculó localmente en lugar de transcribirse.
Lo que no hay en este artículo. No se afirma nada sobre lo que ningún proyecto debería cargar en ningún corpus. La discusión sobre licencias describe una restricción, no una decisión.