La capa que se desprende: por qué los corpus de apellidos pasan por alto sistemáticamente los últimos cincuenta años
En el registro nacional noruego de apellidos, Mohamed lo llevan 3.885 personas. Eso lo sitúa en el puesto 99 — por delante de muchísimos nombres que la mayoría de la gente calificaría de anodinamente noruegos. Nuestro corpus noruego de apellidos, construido a partir de listas de «apellidos noruegos», no lo contenía. Tampoco Khan (3.505, puesto 106), ni Hassan (3.495, puesto 107), ni Tran (3.253, puesto 120).
No es un hecho interesante por sí solo. A todo corpus le falta algo. Lo que merece dejarse por escrito es que hicimos la misma comprobación en cinco países más el 18 de julio de 2026, y que la misma forma reapareció todas las veces — y que, cuando miramos de cerca qué más faltaba, la historia resultó ser más complicada, y más útil, que «los datos se olvidaron de los inmigrantes».
Este artículo trata de un punto ciego en la forma en que se construyen los conjuntos de datos de nombres. Un artículo complementario, Capas migratorias en las cohortes de nacimiento, aborda lo que ocurre en el eje del tiempo — cómo dos generaciones de una misma comunidad producen curvas opuestas en el mismo registro. Este se ocupa de la instantánea: de lo que sencillamente no está en la lista.
La medición
Para cada locale tomamos el fichero del registro nacional, lo ordenamos por número de portadores y planteamos una pregunta mecánica: de los N primeros apellidos del registro, ¿cuántos no contiene nuestro corpus? Sin juicios, sin clasificación, solo una diferencia de conjuntos.
| Locale | Fuente del registro | Entradas del registro | Entradas del corpus | Ausentes del top-1000 del registro |
|---|---|---|---|---|
en_GB | ONS | 58.242 | 1.517 | 305 |
fr_FR | INSEE | 218.983 | 1.731 | 233 |
en_US | US Census 2010 | 162.254 | 2.064 | 193 |
no_NO | SSB | 3.620 | 993 | 23 (del top-200) |
sv_SE | SCB | 411.798 | 2.445 | 0 |
El cero de Suecia no es un error ni un golpe de suerte — es la misma medición aplicada a un corpus que ya había pasado por exactamente esta reparación. Figura en la tabla a modo de control.
Lo que falta realmente
Aquí es donde la historia intuitiva empieza a resquebrajarse, y vale la pena resquebrajarla como es debido.
Tomemos la lista estadounidense de 193 nombres. Agrupados según la tradición lingüística de la que procede el apellido:
| Grupo | Número | Ejemplos |
|---|---|---|
| De lengua española | 50 | Bonilla, Cisneros, Guevara, Villalobos |
| Del sur/este de Asia y árabes | 15 | Yu, Choi, Kaur, Vang, Phan, Ahmed |
| Anglosajones y otros europeos | 128 | Brennan, Koch, Nolan, Kline, Nielsen |
Dos tercios de lo que faltaba en el corpus estadounidense eran Brennan y Koch. La capa migratoria es una parte real y sustancial de la brecha — una cuarta parte corresponde solo a la lengua española — pero no es la brecha entera, y un corpus que solo hubiera parcheado los nombres de la migración habría seguido sin 128 apellidos que nadie describiría como llegadas recientes.
Noruega muestra las mismas proporciones en miniatura. De los 23 apellidos del top-200 del registro ausentes del corpus, 9 son de origen migratorio — Mohamed, Khan, Hassan, Tran, Ibrahim, Mohammed, Ahmad, Abdi, Hussein — y 14 son Hanssen (5.434, puesto 68), Eliassen (4.141, puesto 94), Hoel, Rønningen, Samuelsen, Solbakken, Aase, Sand, Bø, Syversen, Berger, Øien, Enger y — significativamente — Andersson, la grafía sueca, instalada en Noruega con 2.538 portadores.
Así que la versión honesta del hallazgo es más estrecha que el titular, y es esta: un corpus ensamblado a partir de «nombres del país X» es poco profundo, y esa falta de profundidad no está repartida de manera uniforme. Se le escapan nombres corrientes porque es corto. Se le escapan nombres de la capa migratoria porque a nadie se le ocurre ponerlos en una lista de apellidos noruegos — y esos dos fallos se acumulan justo en los puestos donde resultan más visibles.
El caso individual más claro es Gran Bretaña. Miah es el apellido mejor clasificado de cuantos faltan en el corpus británico, en el puesto 254 con 26.765 portadores. Detrás de él, Uddin (13.620, puesto 537) y Li (8.643, puesto 898). En cambio, Patel (137.088, puesto 24), Begum (78.156, puesto 65), Singh (69.574, puesto 78) y Kaur (48.488, puesto 121) estaban todos presentes. El corpus no era ciego a los apellidos surasiáticos en general — solo a los que quedan justo por debajo del nivel de familiaridad cotidiana.
El caso francés no es lo que parece
Francia arrojó 233 nombres ausentes del top-1000 del registro, entre ellos un llamativo grupo de lengua portuguesa: Dos Santos (17.661, puesto 281), Gonçalves (16.448, puesto 314), De Oliveira (8.253, puesto 780), De Sousa (7.694, puesto 843), Teixeira (7.608, puesto 857).
La lectura evidente es la de una capa lusófona ausente. La lectura evidente es errónea, o al menos incompleta, porque estos sí estaban presentes: Da Silva (28.730, puesto 137), Pereira (21.402, puesto 202), Rodrigues (17.767, puesto 275), Fernandes (17.316, puesto 293).
La capa de lengua portuguesa sí estaba en el corpus. Se desprendieron partes de ella. Y cuando contamos cuántos de los 233 apellidos franceses ausentes contienen un espacio, la respuesta fue 5 — Dos Santos, De Oliveira, De Sousa, Le Borgne, Le Gal. Dos de ellos son bretones. Esto es, al menos en parte, un problema de tratamiento de apellidos de varias palabras, no un problema de migración: los nombres con partícula y espacio sobreviven mal a algunos pasos del pipeline, y lo hacen con independencia de la lengua de la que procedan. (Le Gal lleva en Bretaña bastante más de cincuenta años.) La mecánica de las partículas y la ordenación es un tema por derecho propio, tratado en Prefijos de nombres y ordenación (artículo complementario, aún no publicado).
Gonçalves y Teixeira no llevan espacio y aun así faltaban, así que el efecto de capa migratoria también es real en Francia. Pero quien leyera esa lista portuguesa de cinco nombres como prueba pura de un punto ciego migratorio estaría leyendo un fallo del tokenizador como un hecho demográfico. A nosotros nos faltó poco para hacerlo.
Los registros tienen el mismo punto ciego
La segunda mitad del asunto, y la parte que no se arregla haciendo más profundo un corpus: los registros nacionales también recogen de forma insuficiente la migración reciente, cada uno por su propia razón estructural y cada uno en una dirección que se puede conocer.
El INSEE (Francia) tabula los apellidos por decenio de nacimiento para los nacimientos inscritos en Francia, de 1891 a 2000. Las personas nacidas en el extranjero no figuran en el fichero en absoluto — aproximadamente el 10,7 % de la población francesa. Un recién llegado de primera generación es invisible; solo aparecen sus hijos nacidos en Francia. Toda cifra de origen migratorio procedente del INSEE es, por tanto, un suelo.
El SSB (Noruega) solo publica los apellidos con 200 portadores o más. Podemos confirmarlo a partir del propio fichero: el recuento mínimo del conjunto de las 3.620 entradas es exactamente 200. Todo lo que quede por debajo — y un apellido de llegada reciente tiene una probabilidad desproporcionada de quedar ahí — no existe a efectos de las estadísticas publicadas. Se trata de un suelo de privacidad deliberado, examinado en Umbrales de privacidad en los registros de nombres; aquí lo único que importa es que no es demográficamente neutro.
La ONS (Gran Bretaña) es el caso más nítido, porque el fallo es de antigüedad. Los datos británicos de apellidos que circulan de forma general reflejan aproximadamente el año 2002. Polonia y Rumanía entraron en la UE en 2004 y 2007. La consecuencia, sacada directamente del fichero:
| Apellido | Recuento ONS | Puesto ONS |
|---|---|---|
Nowak | 976 | 6.705 |
Kowalski | 790 | 7.949 |
Wójcik | 387 | 13.153 |
Popescu | 118 | 23.518 |
Ionescu | 56 | 29.886 |
Mazur | ausente | — |
Mazur es uno de los veinte apellidos más comunes de Polonia. No aparece por ninguna parte en un fichero británico de apellidos de 58.242 entradas. Frente a una población británica actual que incluye varios cientos de miles de personas de origen polaco y una amplia comunidad rumana, Popescu con 118 portadores no es una medición — es una marca de tiempo. El fichero no se equivoca sobre 2002; lo que ocurre es que se lee como si hablara de ahora.
Esta es la trampa que importa. Quien construya un corpus tomándolo todo escrupulosamente de las estadísticas nacionales oficiales, y se niegue a añadir nada que no figure en el registro, producirá aun así un conjunto de datos con una generación de retraso — porque ha heredado la fecha de corte del registro junto con su autoridad. Profundizar el corpus no sirve de nada. Los nombres no están más abajo en la lista. No están en la lista.
Lo que cambiamos
La reparación no tiene nada de glamurosa: tomar el top-N del registro, hacer la diferencia de conjuntos con el corpus y reincorporar todo lo que falte con su peso real. El cero de Suecia en la primera tabla es el aspecto que tiene esto una vez terminado — la misma comprobación que devuelve 305 para Gran Bretaña no devuelve nada para Suecia, sobre un corpus de 2.445 entradas frente a un registro de 411.798 entradas.
Para el problema de la antigüedad del registro no hay solución limpia, y no afirmamos tener ninguna. Cuando se sabe que un registro es anterior a un flujo migratorio importante, el corpus hereda esa laguna, y la respuesta honesta consiste en decirlo en las notas sobre los datos en lugar de inventar recuentos. Un apellido que no podemos ponderar a partir de una fuente es un apellido que no añadimos.
Lo que este artículo afirma y lo que no
Todas las cifras anteriores son recuentos de entradas de apellidos. Nada de ello mide el origen étnico, la nacionalidad, la ciudadanía, la lengua hablada ni nada relativo a ninguna persona concreta — Francia y varios otros Estados citados aquí no recogen dato étnico alguno, y nada de este artículo procede de una fuente que sí lo haga. Las agrupaciones de la tabla estadounidense son nuestra clasificación de la tradición lingüística de la que procede un apellido, hecha con el fin de describir una laguna de un conjunto de datos; son aproximadas, son discutibles en los márgenes, y Costa podría situarse razonablemente en dos de ellas.
El hallazgo trata de conjuntos de datos, no de personas: las listas de «nombres del país X» codifican el momento en que se formó el modelo mental de quien hizo la lista, y ese momento suele llevar unas cuantas décadas de retraso. Los registros codifican el momento en que se compiló el registro. Ninguno de los dos es neutro, ambos son corregibles en un solo sentido, y la aritmética que encuentra la laguna cabe en unas cuatro líneas.
Datos actualizados a 2026-07-18
Todas las mediciones de diferencia de conjuntos se calcularon el 18 de julio de 2026 sobre los ficheros de registro que se enumeran a continuación, como parte de una auditoría de corpus de nombres ponderados de 64 locales. Los puestos se recalcularon a partir de los recuentos brutos; cuando un registro contiene empates, la asignación de puestos puede diferir en unas pocas posiciones respecto de la numeración del propio editor — nuestro build anotó Miah/Uddin/Li en 257/542/906 frente a los 254/537/898 calculados aquí, y la discrepancia se debe al tratamiento de los empates, no a un desacuerdo sobre los datos.
Fuentes:
- Reino Unido — ONS, recuentos de apellidos (58.242 entradas, recuento mínimo 5). Antigüedad de los datos: aproximadamente 2002; véase más arriba la nota sobre la migración posterior a 2004. <ons.gov.uk/>
- Francia — INSEE, Fichier des noms de famille, apellidos por decenio de nacimiento, nacimientos inscritos en Francia 1891–2000 (218.983 entradas). Excluye a las personas nacidas en el extranjero. <insee.fr/fr/statistiques/353663…;
- Estados Unidos — US Census Bureau, Frequently Occurring Surnames in the 2010 Census (162.254 entradas). <census.gov/topics/population/gene…;
- Noruega — SSB, estadísticas de apellidos, tabla 12891 de StatBank (3.620 entradas, suelo de publicación de 200 portadores, confirmado como el mínimo del fichero). <ssb.no/statbank/table/12891&g…;
- Suecia — SCB, estadísticas de apellidos (411.798 entradas). SCB dejó de producir estadísticas de nombres en 2024. <scb.se/>
Sobre la sensibilidad. Este artículo describe lagunas en conjuntos de datos. No formula ninguna afirmación sobre personas ni comunidades, no recoge ningún origen étnico y no toma posición sobre la migración. Cada cifra es un recuento de entradas de apellidos en un fichero estadístico público.