Apellidos que no existen: cómo encontrar valores de relleno dentro de un censo
El 78.º apellido más común de Estados Unidos es DOE.
Figura en el fichero de apellidos del censo de 2020 entre PETERSON, en el #77, y WARD, en el #79, con 262.774 portadores. Diez años antes, la misma serie de ficheros situaba DOE en el #4.972, con 7.066 portadores. Eso supone un factor de 37,2 en una sola década, en un apellido que todo el mundo angloparlante sabe ya que es lo que se escribe cuando se desconoce el nombre.
Esto no es un escándalo y el Census Bureau no ha cometido ningún error. DOE es un apellido real, portado por familias reales, y es también la cadena de caracteres que se introduce cuando hay que rellenar un formulario y el apellido no está disponible. El fichero no puede separar esas dos poblaciones, así que publica su suma.
La pregunta interesante no es «¿DOE es falso?». Es esta: ¿cómo encontraría usted el siguiente, en un país cuyas convenciones de denominación desconoce?
Tuvimos que responder a eso el 21 de julio de 2026, mientras reconstruíamos los datos de nombres estadounidenses a partir del censo de 2020. La respuesta resultó ser dos pruebas aritméticas que no exigen conocimiento lingüístico alguno — y, aplicadas juntas, encontraron seis candidatos entre los 5.000 primeros, de los cuales solo conocíamos uno.
Señal uno: un crecimiento que no puede darse
La primera prueba es la evidente y, por sí sola, es inútil. He aquí por qué.
Tome todos los apellidos clasificados entre los 5.000 primeros del fichero de 2020, consulte su recuento de 2010 y calcule la razón. A lo largo de 4.999 apellidos, la distribución es extremadamente estrecha:
| Cuantil | Portadores 2020 ÷ portadores 2010 |
|---|---|
| p01 | 0,90 |
| p10 | 0,93 |
| mediana | 0,96 |
| p90 | 1,04 |
| p99 | 1,64 |
| máx. | 37,19 |
El noventa y nueve por ciento de los apellidos estadounidenses comunes se movió menos de un ±64 % en diez años, y la mediana apenas se movió. Así que cualquier cosa por encima de aproximadamente ×1,7 queda ya fuera del nonagésimo noveno percentil, y las veinte entradas de crecimiento más rápido merecen un examen individual.
Aquí están:
| Apellido | Puesto 2020 | Portadores 2020 | Portadores 2010 | Factor |
|---|---|---|---|---|
DOE | 78 | 262.774 | 7.066 | 37,2 |
REF | 3.337 | 10.563 | 705 | 15,0 |
MALE | 2.611 | 13.499 | 1.773 | 7,6 |
NO | 3.618 | 9.579 | 1.349 | 7,1 |
TAMANG | 4.372 | 7.841 | 1.105 | 7,1 |
LAST | 3.477 | 10.013 | 1.825 | 5,5 |
GURUNG | 2.454 | 14.369 | 3.450 | 4,2 |
THANG | 4.810 | 7.126 | 1.836 | 3,9 |
RAI | 1.760 | 19.927 | 5.295 | 3,8 |
HTOO | 4.097 | 8.400 | 2.681 | 3,1 |
PATIL | 4.235 | 8.091 | 2.790 | 2,9 |
ADHIKARI | 4.642 | 7.408 | 2.889 | 2,6 |
CHILD | 2.673 | 13.159 | 5.237 | 2,5 |
SHRESTHA | 2.993 | 11.764 | 5.535 | 2,1 |
HOSSAIN | 2.784 | 12.599 | 5.978 | 2,1 |
La lista mezcla dos cosas completamente distintas. TAMANG, GURUNG, RAI, SHRESTHA, ADHIKARI, HTOO y THANG son apellidos nepalíes, butaneses y birmanos que crecieron por la razón más ordinaria del mundo: el reasentamiento de refugiados y la migración. Son tan reales como SMITH. El crecimiento por sí solo los señala, y el crecimiento por sí solo no puede exculparlos.
Así pues, la primera prueba produce una lista de candidatos, no un veredicto. Necesita una segunda prueba, independiente, que no tenga nada que ver con el tiempo.
Señal dos: la huella del perfil
El fichero de apellidos del censo estadounidense incluye un bloque auxiliar de columnas que nadie utiliza para esto: para cada apellido publica cómo se reparten sus portadores entre las categorías autodeclaradas que recoge el censo. Aquí usamos esas columnas únicamente como huella forense para identificar una fila que ha sido ensamblada en lugar de observada. No portan ningún significado sobre nombres y poblaciones, y nosotros no extraemos ninguno.
La lógica es mecánica. Todo apellido real de la Tierra llegó a Estados Unidos a través de alguna historia particular, y esa historia deja a los portadores del apellido concentrados en algún sitio. Un valor de relleno no tiene historia. Se escribe en una entrada cada vez que hay que completar una entrada, y eso le ocurre a todo el mundo aproximadamente al ritmo con que cada cual aparece en la población. Por tanto, la distribución de un valor de relleno debería parecerse a los totales propios del fichero, y la de un apellido real no.
Los totales propios del fichero, sobre el conjunto de los 298.870.618 portadores contabilizados, constituyen la referencia:
| Fila | Puesto 2020 | Portadores | A | B | C | D | E | F |
|---|---|---|---|---|---|---|---|---|
| referencia (fichero entero) | — | 298.870.618 | 60,0 | 11,8 | 0,7 | 6,2 | 3,3 | 18,0 |
DOE | 78 | 262.774 | 52,7 | 21,3 | 0,7 | 5,1 | 1,8 | 18,4 |
REF | 3.337 | 10.563 | 49,3 | 19,6 | 1,2 | 6,1 | 2,6 | 21,2 |
SMITH | 1 | 2.369.644 | 68,0 | 22,6 | 0,8 | 0,7 | 4,4 | 3,5 |
WILLIAMS | 3 | 1.561.395 | 43,8 | 46,2 | 0,8 | 0,6 | 5,1 | 3,5 |
GARCIA | 6 | 1.149.510 | 5,7 | 0,5 | 0,5 | 1,6 | 0,4 | 91,2 |
NGUYEN | 29 | 531.404 | 1,3 | 0,2 | 0,0 | 95,4 | 2,1 | 0,8 |
GURUNG | 2.454 | 14.369 | 0,9 | 0,1 | 0,0 | 97,5 | 1,1 | 0,3 |
Lea las cuatro últimas filas: GARCIA coloca el 91 % de su masa en una sola columna; NGUYEN, el 95 %; GURUNG, el 97 %. Incluso SMITH y WILLIAMS, que parecen «genéricos», se alejan radicalmente de la forma nacional: ambos colocan menos del 4 % en la última columna, frente a un 18 % nacional.
Lea ahora DOE. Cada uno de sus seis números se mantiene a unos nueve puntos como máximo de la cifra nacional, y tres de ellos, a menos de un punto.
Condense eso en un único número — la suma de las diferencias absolutas entre las seis proporciones de un apellido y las seis proporciones de referencia, que llamaremos L1 — y el resultado es asombroso:
| Tramo del fichero de 2020 | n | L1 más pequeño | L1 mediano | L1 p90 |
|---|---|---|---|---|
| 100 primeros | 100 | 19,9 — DOE | 43,4 | 148,7 |
| 500 primeros | 500 | 19,9 — DOE | 42,9 | 149,0 |
| 1.000 primeros | 1.000 | 19,9 — DOE | 45,4 | 150,0 |
| 5.000 primeros | 4.999 | 8,2 — CHILD | 57,5 | 149,0 |
DOE tiene el perfil más plano de todos los apellidos entre los 1.000 primeros del censo estadounidense. No entre los diez primeros: el primero. El segundo entre los 500 primeros es SIMON, con 25,4, y la mediana vale más del doble que el valor de DOE.
Existe exactamente una fila en todo el fichero que es más plana, y es el control que valida el método: la fila de resto agregada ALL OTHER NAMES, que representa a 36.257.637 personas cuyos apellidos eran demasiado raros para publicarse individualmente. Esa fila es, por construcción, un tramo aleatorio del país, y su L1 vale 12,36. Lo único del fichero demográficamente más carente de rasgos que un valor de relleno es un cajón de sastre etiquetado «todos los demás».
Cruzar las dos señales
Ninguna prueba decide nada por sí sola. El crecimiento señala migraciones legítimas; la planitud señala apellidos legítimamente mixtos. Ejecute las dos y exija las dos.
Filtro: puesto ≤ 5.000 en 2020, L1 < 30, ordenado por crecimiento. Cincuenta y dos apellidos pasan el filtro de planitud. Ordenada por crecimiento, la cabeza de la lista es inequívoca y después cae en picado:
| Apellido | Puesto 2020 | Portadores 2020 | Portadores 2010 | Factor | L1 |
|---|---|---|---|---|---|
DOE | 78 | 262.774 | 7.066 | 37,2 | 19,9 |
REF | 3.337 | 10.563 | 705 | 15,0 | 23,1 |
MALE | 2.611 | 13.499 | 1.773 | 7,6 | 23,2 |
NO | 3.618 | 9.579 | 1.349 | 7,1 | 24,4 |
LAST | 3.477 | 10.013 | 1.825 | 5,5 | 14,2 |
CHILD | 2.673 | 13.159 | 5.237 | 2,5 | 8,2 |
| — | |||||
DOSSANTOS | 3.800 | 9.120 | 6.137 | 1,5 | 20,0 |
DESOUZA | 3.871 | 8.922 | 6.639 | 1,3 | 18,2 |
DASILVA | 1.397 | 24.905 | 20.338 | 1,2 | 25,6 |
PEREIRA | 1.070 | 32.169 | 29.898 | 1,1 | 28,1 |
MENDES | 3.398 | 10.283 | 10.162 | 1,0 | 15,4 |
Seis entradas por encima de ×2,5, luego un hueco y luego una larga cola de apellidos portugueses y brasileños, entre ×1,0 y ×1,5. Esos nombres lusófonos tienen perfiles planos por una razón perfectamente buena — sus portadores se reparten realmente entre las categorías del censo — y su crecimiento es ordinario, de modo que la segunda señal los exculpa. Los apellidos nepalíes pasan la prueba de crecimiento y fallan la prueba de perfil, con un L1 ≈ 180. Solo seis cosas pasan las dos.
Y cada uno de esos seis es una palabra inglesa que se encontraría en un formulario: doe, ref(erence), male, no, last (name), child.
Los controles que mantienen honesto el método
Un método que señala simples palabras inglesas en una lista de apellidos no vale nada si no exculpa también las simples palabras inglesas que resultan ser apellidos. Lo hace.
| Apellido | Puesto 2020 | Portadores 2020 | Portadores 2010 | Factor | L1 | Veredicto |
|---|---|---|---|---|---|---|
ROE | 1.404 | 24.654 | 25.286 | 1,0 | 55,4 | apellido real |
BLANK | 2.681 | 13.127 | 13.050 | 1,0 | 62,9 | apellido real |
SAMPLE | 3.226 | 10.911 | 11.471 | 1,0 | 39,7 | apellido real |
TEST | 22.518 | 1.171 | 1.121 | 1,0 | 42,1 | apellido real |
FIRST | 14.872 | 1.912 | 1.255 | 1,5 | 37,4 | apellido real |
ROE es el caso más fuerte de todos. En la práctica jurídica estadounidense, Richard Roe es el segundo valor de relleno canónico, empleado junto a John Doe para una segunda parte desconocida desde los alegatos ingleses medievales. Si el método no fuera más que un reconocimiento de patrones sobre «palabras que parecen valores de relleno», ROE encabezaría la lista. En cambio, está totalmente plano, con un crecimiento de ×1,0, y su perfil está concentrado al 87,6 % en una sola columna: nada cerca de la forma nacional. ROE es un apellido angloirlandés auténtico, y el contador así lo dice.
BLANK cuenta la misma historia en sentido inverso: un apellido alemán (blank = reluciente, claro) que figura en el fichero con 13.127 portadores, un L1 de 62,9 y ningún crecimiento en absoluto. Parece exactamente un artefacto de formulario. No lo es.
La apariencia no decide nada. El contador lo decide todo. Es la misma conclusión a la que llegamos por el camino inverso en El problema del umbral de privacidad en los registros de nombres, donde un apellido compuesto chino de aspecto arcaico resultó tener dos portadores vivos y permaneció en el corpus.
La tercera señal, para los nombres de pila
Los valores de relleno infestan también los ficheros de nombres de pila y allí las columnas de perfil no existen: el fichero de nombres de 2020 publica el sexo en su lugar. Resulta que eso funciona igual de bien, porque los valores de relleno no tienen sexo.
Tome los 2.500 primeros nombres de pila del censo de 2020 y mida cuánto se aleja del 50 % la proporción masculina de cada uno. La mediana es de 49,66 puntos porcentuales. No es una errata: el nombre de pila estadounidense típico es esencialmente de un solo sexo, de modo que la desviación habitual respecto a la paridad es casi la máxima posible. Solo el 1 % de los 2.500 primeros se sitúa a menos de 6,4 puntos de un reparto equitativo.
Sobre ese telón de fondo:
| Nombre de pila | Puesto | Portadores | Hombres | Mujeres | Proporción masculina | Desviación respecto al 50 % |
|---|---|---|---|---|---|---|
DOE | 11.533 | 1.106 | 562 | 544 | 50,8 % | 0,8 pp |
BABY | 1.875 | 15.306 | 7.158 | 8.148 | 46,8 % | 3,2 pp |
REF | 1.908 | 14.844 | 7.936 | 6.908 | 53,5 % | 3,5 pp |
| — | ||||||
MALE | 1.309 | 27.911 | 27.703 | 208 | 99,3 % | 49,3 pp |
FEMALE | 1.659 | 18.869 | 102 | 18.767 | 0,5 % | 49,5 pp |
BOY | 1.710 | 18.094 | 17.960 | 134 | 99,3 % | 49,3 pp |
GIRL | 1.760 | 17.156 | 99 | 17.057 | 0,6 % | 49,4 pp |
Dos firmas de relleno distintas, ambas diagnósticas. REF, BABY y DOE son neutros respecto al sexo porque nada de la persona los determina. MALE, FEMALE, BOY y GIRL son el extremo opuesto — puros al 99,3 % — porque el valor de relleno es el campo del sexo filtrándose en el campo del nombre. Un nombre de pila auténtico casi nunca alcanza ninguno de los dos extremos.
Y REF recibe una cuarta confirmación, completamente independiente. Los datos de registro de nacimientos de la Social Security Administration, que son la otra fuente nacional de nombres de pila de Estados Unidos, contienen 32.718 nombres masculinos y 55.399 nombres femeninos distintos. REF no está en ninguno de los dos. El censo dice que 14.844 estadounidenses vivos responden a ese nombre; el registro de nacimientos no ha anotado nunca ni uno solo nacido con él. DOE al menos aparece en los datos de nacimientos (27 nacimientos). REF tiene cero.
Cero nacimientos, catorce mil portadores, paridad de sexos perfecta. Tres instrumentos ortogonales, una sola respuesta.
Lo que esto no demuestra
Cuatro límites honestos, porque este método se presta fácilmente a la exageración.
1. No podemos ver el mecanismo. El fichero muestra que hay un valor de relleno presente y, aproximadamente, cuánto hay de él. No muestra por dónde entró: autorrespuesta, anotación de un agente censal, una entrada administrativa o un paso de procesamiento. Sabemos que DOE ganó alrededor de un cuarto de millón de portadores entre dos censos. Por el fichero no sabemos por qué, y no lo hemos adivinado en este artículo.
2. Los seis no son igual de seguros. DOE, con ×37,2, y REF, con ×15,0, están fuera de discusión. CHILD, con ×2,5 y un L1 de 8,2, es el más débil de los seis: Child es un apellido inglés auténtico, ×2,5 queda muy lejos de ×37, y un apellido real cuyos portadores resulten ser demográficamente medios produciría honestamente un L1 bajo. NO es genuinamente ambiguo en el otro sentido: su perfil muestra un 18,2 % en la cuarta columna frente a un 6,2 % nacional, que es lo que cabría esperar si un apellido coreano real (노) se mezclara con el uso como valor de relleno. Un filtro devuelve candidatos. Solo los candidatos de los extremos son conclusiones.
3. Ambas señales necesitan un suelo. Por debajo de unos pocos miles de portadores, los factores de crecimiento se vuelven ruidosos, y las proporciones de perfil, más ruidosas todavía. Por esa razón restringimos el filtro a los 5.000 primeros. Prolongarlo hacia la cola produciría decenas de «aciertos» que no son más que números pequeños moviéndose.
4. Esto no es una crítica al censo. Un censo recoge lo que aportan los encuestados y las entradas. Publicar DOE en el #78 es más honesto que suprimirlo en silencio, y el fichero suministra exactamente las columnas auxiliares que permiten a alguien de fuera detectarlo. El defecto pertenece a quien consume el fichero sin comprobarlo, lo que, hasta esta semana, nos incluía.
El método, trasladable a cualquier país
Nada de lo anterior exige saber una sola cosa sobre los apellidos estadounidenses. Cada paso es aritmética sobre el fichero, y cada paso se generaliza:
- Consiga dos ediciones del mismo fichero, con diez años de diferencia. Casi todo lo que sigue depende de disponer de un antes.
- Calcule primero la distribución del crecimiento y luego mire los valores atípicos. El p99 le dice qué significa «imposible» para este fichero. No importe un umbral de otro país.
- Encuentre las columnas auxiliares del fichero. Proporciones por raza, repartos por sexo, por región, por ciudadanía: cualquier cosa que varíe entre nombres reales. Esa columna es su lector de huellas.
- Calcule una distancia a los totales propios del fichero. No a una estimación externa de población; a la suma del propio fichero, que es la única referencia que con seguridad está en el mismo plano que las filas.
- Exija dos señales independientes. Una señala la migración. La otra señala los nombres de origen mixto. Su intersección es pequeña y limpia.
- Pruebe los controles antes de creerse los aciertos. Dé al filtro nombres que sepa que son reales y confirme que salen limpios. Si
ROEyBLANKhubieran puntuado comoDOE, el método sería reconocimiento de patrones, no medición. - Cruce con un segundo registro si existe alguno. «Presente en el censo, ausente del registro de nacimientos» es la prueba aislada más contundente que existe, y cuesta una sola unión de tablas.
La parte incómoda es lo grandes que llegan a ser. DOE no es una curiosidad de la cola. Es el 78.º apellido más común de Estados Unidos, por delante de WARD, KELLY y COX, y aparecerá dentro de cualquier tramo mecánico de los 100 primeros que alguien extraiga de ese fichero. El conjunto de datos de alguien lo contiene ahora mismo, ponderado como si un cuarto de millón de estadounidenses hubieran nacido con él.
Datos actualizados a 2026-07-21
Todas las cifras anteriores se recalcularon el 21 de julio de 2026 directamente a partir de los ficheros primarios, no se tomaron de notas. Allí donde nuestras propias notas de trabajo anteriores discrepaban de los ficheros, ganaron los ficheros: véase la corrección más abajo.
Fuentes:
- Estados Unidos — US Census Bureau, Frequently Occurring Surnames in the 2020 Census by Race and Hispanic Origin. 156.620 filas publicadas más la fila agregada
ALL OTHER NAMES; 298.870.618 portadores contabilizados; recuento publicado más bajo, 92. Dominio público. <census.gov/topics/population/gene…; - Estados Unidos — US Census Bureau, Frequently Occurring Surnames in the 2010 Census. 162.254 filas, 294.979.229 portadores contabilizados, recuento publicado más bajo, 100. Utilizado para todas las cifras de 2010. Dominio público.
- Estados Unidos — US Census Bureau, Frequently Occurring First Names in the 2020 Census by Sex. 53.616 filas, 302.031.536 portadores contabilizados, recuento publicado más bajo, 91. Dominio público.
- Estados Unidos — Social Security Administration, datos nacionales de nombres procedentes del registro de nacimientos, utilizados únicamente como comprobación de presencia/ausencia (32.718 nombres masculinos y 55.399 nombres femeninos distintos en el corpus construido a partir de ellos). Dominio público.
Una corrección a nuestra propia nota anterior. Nuestras notas de sesión anotaban DOE en el #2.834, con 11.603 portadores en 2010, lo que daba un factor de crecimiento de ×22,6. Recalculado a partir del propio fichero de 2010, DOE está en el puesto #4.972, con 7.066 portadores, y el factor es de ×37,2. La nota estaba equivocada en los tres números y queda sustituida por este artículo. La misma recomprobación corrigió la cifra de REF como apellido: de un valor tomado del fichero de nombres de pila (14.844) a su cifra correcta de apellido (10.563). REF aparece en ambos ficheros, y son dos recuentos diferentes de cosas diferentes.
Sobre las columnas de categorías del censo. El fichero de apellidos de 2020 publica, para cada apellido, los recuentos absolutos de portadores por raza autodeclarada y origen hispano. En este artículo esas columnas se usan exclusivamente como huella forense para distinguir una fila ensamblada de una observada, y no sustentan inferencia alguna sobre nombres, ascendencia o poblaciones. La fila ALL OTHER NAMES se usa únicamente como control metodológico.
Reproducibilidad. El filtro son cuatro líneas de aritmética: unir los dos ficheros del censo por el apellido, calcular count2020 / count2010, calcular la suma de las diferencias absolutas entre las seis proporciones de categoría de cada fila y los seis totales propios del fichero, y ordenar. Sin modelización, sin datos externos, sin umbrales importados de ninguna parte.