Cuarenta y ocho de quinientos: una lista clásica de apellidos frente a un registro
El 百家姓 — los Cien apellidos familiares — es un manual escolar chino del siglo XI. Es una secuencia rimada de apellidos, compuesta para enseñar caracteres a los niños, y lleva reimprimiéndose sin interrupción desde hace unos novecientos años. Es también, todavía hoy, aquello a lo que la gente recurre cuando necesita « una lista de apellidos chinos », incluida la gente que desarrolla software.
Lo hemos confrontado con un registro moderno que cuenta cada nombre uno por uno. De las 500 entradas distintas de la versión que probamos, 48 no tienen ningún portador en ese registro — no pocos, no recuentos suprimidos, cero. 39 de esas 48 son apellidos de dos caracteres.
Eso suena a historia de apellidos compuestos en vías de desaparición. No lo es, y lo que impide que lo sea constituye la mitad más interesante del asunto: los apellidos compuestos reales están vivos y se pueden contar, y el más frecuente del registro no aparece en absoluto en la lista clásica.
El registro
La comparación solo funciona gracias a una propiedad inusual de la fuente. El Ministerio del Interior de Taiwán publica los recuentos por apellido sin umbral de privacidad: 643 apellidos con exactamente un portador, 406 con exactamente dos, y así hasta el final. La mayoría de los organismos estadísticos suprimen los recuentos pequeños, lo que vuelve ambigua la ausencia — un apellido que falta puede ser raro, puede estar suprimido, puede ser un fallo de análisis. Aquí, faltar significa cero.
| Campo | Valor |
|---|---|
| Editor | Ministerio del Interior, Taiwán |
| Fecha de referencia | 30 de junio de 2023 |
| Entradas distintas | 2.731 |
| Base de población | 23.373.283 |
| Supresión | ninguna — recuentos publicados hasta 1 portador |
Ese registro, su licencia, sus peculiaridades y la discrepancia entre 2.731 y 1.785 los hemos tratado aparte, en su propia documentación — véase De dónde proceden nuestros datos de nombres de Taiwán. Este artículo no trata del registro. Trata de lo que le ocurre a una lista histórica cuando se la confronta con uno.
⚠ Algo que conviene tener presente de principio a fin: este registro cubre 23 millones de personas, no los 1,4 mil millones del mundo sinófono. « Cero portadores en Taiwán » es un hecho firme y verificado. « Extinto » es una afirmación sobre una población mucho mayor que este fichero no puede sostener, y no la hacemos. Lo que el fichero sí puede demostrar es que una lista producida en el siglo XI no describe los apellidos de una población concreta del siglo XXI — que es exactamente la afirmación que se hace implícitamente al usarla como fuente de datos.
El resultado, desglosado por longitud de la entrada
| Tipo de entrada | En la lista | Presentes en el registro | Ausentes | Proporción ausente |
|---|---|---|---|---|
| Un carácter | 438 | 429 | 9 | 2,1 % |
| Dos caracteres | 62 | 23 | 39 | 62,9 % |
| Total | 500 | 452 | 48 | 9,6 % |
La mitad de un carácter de la lista está en excelente estado: el 98 % de sus entradas tiene portadores vivos. La mitad compuesta es un cara o cruz que cae del lado malo — casi dos tercios no tienen a nadie.
Las nueve entradas de un carácter ausentes son 薊, 充, 終, 弘, 夔, 融, 空, 養 y 郈. Ocho de ellas no aparecen en ninguna parte del registro, bajo ninguna forma; 弘 solo sobrevive dentro de una entrada de tres caracteres, 卜思弘, con un solo portador.
Los 39 compuestos ausentes son el mobiliario clásico del género: 萬俟, 聞人, 公冶, 宗政, 單于, 太叔, 公孫, 仲孫, 鍾離, 宇文, 長孫, 閭丘, 司空, 丌官, 司寇, 仉督, 子車, 巫馬, 公西, 漆雕, 樂正, 壤駟, 公良, 拓跋, 夾谷, 宰父, 穀梁, 段干, 百里, 東郭, 南門, 歸海, 羊舌, 微生, 梁丘, 左丘, 東門, 西門, 南宮.
Varios de ellos son famosos. 長孫 y 宇文 son los apellidos de la aristocracia Tang y de los Zhou del Norte. 公孫 y 司空 recorren todo el canon clásico. Su fama es precisamente el problema: un apellido que todo el mundo ha leído no es un apellido que alguien lleve.
La mitad que mantiene honesto al artículo
Si la historia acabara ahí, la conclusión natural sería que los apellidos de dos caracteres son un arcaísmo y que cualquier conjunto de datos que los arrastre se está rellenando de poesía. Esa conclusión es falsa, y el registro lo dice con números.
Apellidos compuestos de la lista clásica que sí tienen portadores:
| Apellido | Portadores | Puesto en el registro |
|---|---|---|
| 歐陽 | 7.653 | 130 |
| 司徒 | 478 | 324 |
| 上官 | 294 | 383 |
| 端木 | 186 | 450 |
| 諸葛 | 180 | 456 |
| 皇甫 | 115 | 521 |
| 尉遲 | 63 | 640 |
| 申屠 | 60 | 649 |
| 司馬 | 49 | 691 |
| 軒轅 | 26 | 822 |
| 澹台 | 2 | 2.051 |
| 公羊 | 1 | 2.146 |
| 呼延 | 1 | 2.302 |
| 慕容 | 1 | 2.629 |
23 de los 62 compuestos de la lista son reales. 慕容 y 呼延 tienen exactamente un portador cada uno, y 澹台 tiene dos — lo que significa que una limpieza guiada por « esto parece arcaico, se borra » habría borrado a personas reales, identificables y vivas. Nada en el aspecto de 慕容 lo distingue de 東郭. Solo lo hace el contador.
Y ahora el hallazgo que replantea todo el ejercicio. El registro contiene 1.062 entradas de apellidos de varios caracteres. Solo 23 de ellas proceden de la lista clásica. Las 1.038 restantes no figuran en ella en absoluto — incluidos todos y cada uno de los más frecuentes:
| Apellido | Portadores | Puesto | ¿En la lista clásica? |
|---|---|---|---|
| 張簡 | 9.162 | 122 | no |
| 歐陽 | 7.653 | 130 | sí |
| 范姜 | 4.259 | 153 | no |
| 周黃 | 594 | 304 | no |
| 江謝 | 533 | 319 | no |
| 張廖 | 491 | 322 | no |
| 司徒 | 478 | 324 | sí |
| 姜林 | 321 | 376 | no |
| 上官 | 294 | 383 | sí |
| 翁林 | 294 | 384 | no |
El apellido compuesto más frecuente de Taiwán es 張簡, con 9.162 portadores, y la lista clásica no lo ha oído nombrar jamás. Tampoco a 范姜, ni a 張廖, ni a 周黃, 江謝, 姜林 o 翁林 — todos los cuales están por delante de 端木, 諸葛 y 司馬, los compuestos con los que abre toda lista de « apellidos compuestos chinos ».
Son apellidos compuestos formados por la unión de dos apellidos existentes, una práctica asociada a la adopción y a los acuerdos de doble linaje, y fuertemente representada en las comunidades hakka. (Esa última frase es contexto, no algo que hayamos derivado del fichero; lo que el fichero demuestra son los recuentos y la ausencia.) El mecanismo que los produce seguía funcionando siglos después de que se escribiera el manual, y sigue funcionando ahora.
Así que el resumen correcto no es « los apellidos compuestos están muertos ». Es: la lista histórica se equivoca sobre los apellidos compuestos en las dos direcciones a la vez. Arrastra 39 que ya no tienen portadores, y le faltan los 1.038 que sí los tienen — 21.087 personas que ningún conjunto de datos derivado de una lista contiene, sencillamente.
En qué es realmente buena la lista clásica
Sería injusto, y falso, concluir que el manual es inútil. Medido frente al registro:
| Medida | Valor |
|---|---|
| Población cubierta por las 452 entradas supervivientes de la lista | 98,84 % |
| Proporción de los apellidos distintos del registro que contiene | 16,6 % |
| Apellidos del registro ausentes de la lista | 2.279 |
| Población que suman esos 2.279 | 1,16 % |
Lea esas dos filas juntas y saldrá a la luz el carácter real de la lista. Como lista de qué apellidos tiene la mayoría de la gente, es excelente — 452 entradas cubren casi el 99 % de una población de 23 millones. Como lista de qué apellidos existen, se equivoca por un factor de seis.
Esa asimetría no es una rareza de este manual. Es lo que cualquier distribución cargada en la cabeza le hace a cualquier lista curada: acertar en la cabeza es fácil y acertar en la cola es otro trabajo, que exige otro tipo de fuente. Una lista que capta el 98,84 % de las personas mientras se deja fuera el 83 % de los apellidos no es « mayormente correcta ». Tiene razón sobre una pregunta y se equivoca sobre la otra, y desde dentro del fichero las dos preguntas parecen idénticas.
Otras tres formas en que la lista no es una clasificación
El orden no es el orden de frecuencia. El manual abre con 趙錢孫李 — Zhao, Qian, Sun, Li. En el registro ocupan los puestos 44, 101, 49 y 5. 趙 encabeza el manual porque era el apellido imperial de la dinastía Song, bajo la cual se compiló el texto; la secuencia posterior la dicta la rima. Los cinco primeros reales son 陳, 林, 黃, 張, 李, y solo 李 está siquiera cerca del comienzo de la secuencia clásica. Quien use el orden de la lista como aproximación a la frecuencia — y los generadores lo hacen — obtiene una distribución equivocada desde la posición uno.
El carácter no es el apellido. Cuatro de los 100 apellidos más frecuentes del registro faltan por completo en la lista, y los cuatro son variantes ortográficas de entradas que sí están en ella:
| Carácter del registro | Portadores | Puesto | Carácter clásico | Portadores | Puesto |
|---|---|---|---|---|---|
| 温 | 42.171 | 64 | 溫 | 13.956 | 104 |
| 黄 | 34.531 | 80 | 黃 | 1.402.808 | 3 |
| 鐘 | 28.759 | 88 | 鍾 | 152.550 | 34 |
| 凃 | 16.374 | 98 | 涂 | 27.298 | 89 |
El par 温/溫 es el más agudo: la variante ausente de la lista clásica tiene tres veces más portadores que la que sí figura en ella. Una regla del tipo « usar la forma canónica de la lista » borraría a 42.171 personas y conservaría a 13.956. El registro de hogares consigna la forma escrita, y ambas formas son legales; no hay un carácter canónico al que recurrir, solo una tabla.
La lista no tiene una longitud fija. La versión que probamos lleva 500 entradas distintas — 438 de un carácter y 62 compuestas. La cifra que más se cita es 504 (444 de un carácter, 60 compuestas). El original de los Song suele darse como 411. Las ediciones difieren, las ampliaciones posteriores difieren, y las transcripciones difieren de ambas.
Eso no es una nota al pie — es descalificante para el uso que la gente le da a la lista. Un denominador que varía un 20 % de una edición a otra no puede sostener una afirmación del tipo « N de los apellidos clásicos están extintos ». Nuestro propio 48 de 500 está limitado por el mismo problema: son 48 de esta reconstrucción. Lo que sobrevive de la cifra es la forma del resultado — que la sección compuesta falla en torno al 60 % mientras que la sección de un carácter falla en torno al 2 % — porque esa proporción no se mueve cuando cambia la edición.
Por qué listas como esta se siguen usando como datos
Tres propiedades hacen que una lista histórica parezca un conjunto de datos cuando no lo es:
- Parece completa. Tiene una composición fija, un orden y un nombre con aire de autoridad. Los registros son desordenados, parciales e incómodos de analizar. La lista, en cambio, es un array limpio.
- Está libre de fricciones de licencia. Un texto del siglo XI no tiene derechos de base de datos, ni obligación de atribución, ni condiciones de uso. Un registro moderno puede tener las tres cosas. La fuente más barata es muy a menudo la más antigua, y la presión de costes selecciona en silencio la antigüedad.
- Es mayormente correcta, de una manera que oculta el fallo. La cifra de cobertura del 98,84 % significa que un conjunto de datos construido a partir de la lista parecerá correcto en cualquier prueba superficial. Los fallos viven en la cola y en los compuestos — es decir, exactamente en las entradas que un revisor menos notaría y que un generador emitiría rara vez.
La forma general: una lista histórica es una instantánea del prestigio en el momento de su redacción; un registro es un censo de los vivos. Responden a preguntas distintas y discrepan en las dos direcciones. Cualquier lista de nombres, lugares o categorías más antigua que la población a la que se aplica tiene esta propiedad — un repertorio onomástico del siglo XIX, un nomenclátor de parroquias, un canon de oficios « tradicionales ». El 百家姓 es simplemente el caso en el que el desacuerdo puede medirse con exactitud, porque una de las partes publica hasta la última persona.
Qué hicimos con el resultado
Nuestros propios datos de apellidos taiwaneses contienen 2.707 entradas, cada una con el recuento de portadores del registro copiado literalmente, y cubren el 99,98 % de la base de población. Son un subconjunto del registro y no una lista curada, de modo que ninguna de las 48 entradas fantasma está en ellos; la comprobación encontró cero. Contienen 慕容 con peso 1 y 澹台 con peso 2, porque son reales. Contienen 張簡 con 9.162, porque es real y frecuente.
Ese estado de cosas es reciente. Una versión anterior del mismo fichero sí se construyó en parte a partir del texto clásico y sí llevaba entradas arcaicas sin portadores; se eliminaron en cuanto tuvimos recuentos por nombre con los que eliminarlas. La historia completa de esa limpieza — incluida la entrada que estuvimos a punto de borrar por su mero aspecto y que hubo que restituir — está en Lo que hicimos mal con los datos de nombres.
La regla que sacamos de ahí, y la que este artículo existe para defender:
Una lista clásica dice qué consideraba una cultura digno de enseñarse. Un registro dice cómo se llama la gente. Use la primera para leer y el segundo para contar, y no deje nunca que una lista decida qué hay que borrar.
Datos actualizados a 2026-07-21
Todas las cifras se recalcularon el 21 de julio de 2026 a partir del fichero primario del registro, y no de nuestras propias notas ni de informes anteriores. Los puestos son posiciones en el registro ordenado por número de portadores; allí donde no se indica un puesto, la entrada queda fuera del conjunto clasificado que hemos tabulado. Las proporciones se calculan sobre la base de población del registro, 23.373.283.
Qué se mide y qué no:
- Medido: cada recuento, cada puesto, cada presencia y cada ausencia de este artículo, calculados por comparación exacta de cadenas con el fichero del registro. Se comprobaron las trampas a nivel de bytes y no saltó ninguna — sin marcas de orden de bytes, sin espacios de ancho cero ni espacios duros, sin discordancia entre caracteres simplificados y tradicionales, sin desplazamiento de normalización Unicode.
- No medido: nada sobre la China continental, ni nada sobre si un apellido existe fuera de Taiwán. « Ausente » significa en todo el texto ausente de este registro.
- Contexto, no derivado: las notas históricas sobre por qué el manual abre con 趙 y sobre el origen de los apellidos dobles formados por unión. Son contexto; las cifras se sostienen sin ellas.
- Dependiente de la edición: el denominador de 500. Véase la sección anterior.
Fuentes:
- Taiwán, Ministerio del Interior — 姓氏排名與人數按三階段年齡分 (puesto de los apellidos y población por tres tramos de edad), fecha de referencia 30 de junio de 2023, 2.731 apellidos distintos, base de población 23.373.283, Government Open Data Licence v1. <data.gov.tw/dataset/126774>
- 百家姓 — el manual clásico, en una reconstrucción ampliamente difundida que recoge 438 entradas de un carácter y 62 entradas de dos caracteres (500 distintas). Las ediciones varían; el total citado habitualmente es 504.
- Páginas relacionadas: De dónde proceden nuestros datos de nombres de Taiwán para el registro en sí, y Qué cuenta como apellido para las cuestiones de definición que subyacen a todo esto.