De dónde proceden nuestros datos de nombres taiwaneses
Cada peso de nuestro conjunto de datos de apellidos taiwaneses se remonta a una fila identificada por su nombre en un registro estatal, con un recuento de portadores anotado justo al lado. Nada en la cabeza de la distribución está modelado, interpolado ni tomado prestado de un país vecino. Eso no puede decirse de ningún otro locale que mantengamos, y vale la pena explicar exactamente qué aporta — y qué sigue sin resolver.
Esta página documenta el registro que hemos utilizado, la frontera entre lo que hemos medido y lo que hemos estimado, las trampas propias de la onomástica taiwanesa y las cosas que no hemos corregido.
El registro que hemos utilizado
| Campo | Valor |
|---|---|
| Conjunto de datos | 姓氏排名與人數按三階段年齡分 (Puesto y población de los apellidos por tres tramos de edad) |
| Organismo publicador | 內政部戶政司 — Departamento de Registro de Hogares, Ministerio del Interior |
| Portal | https://data.gov.tw/dataset/126774 |
| Fecha de referencia | 30 de junio de 2023 (民國112年6月30日) |
| Profundidad | 2.731 apellidos distintos, cada uno repartido en 3 tramos de edad (0–14, 15–64, 65+) |
| Campos | año estadístico, puesto, apellido, tramo de edad, recuento de población |
| Licencia | Government Open Data Licence v1 |
| Base de población | 23.373.283 |
El informe narrativo que lo acompaña — 《全國姓名統計分析》, 8.ª edición, publicado en octubre de 2023 — ofrece los agregados de cabecera: los 10 apellidos más frecuentes cubren 12.339.778 personas, es decir, el 52,79 % de la población, y los 100 primeros cubren 22.582.375, es decir, el 96,62 %.
La discrepancia entre 2.731 y 1.785
El mismo ministerio afirma que Taiwán tiene 1.785 apellidos: 1.667 apellidos de un solo carácter que cubren 23.337.790 personas, más 118 apellidos compuestos que cubren 27.404 personas. Esas dos cifras, sumadas a las 8.089 personas que llevan nombres tradicionales indígenas o nombres extranjeros transliterados, dan exactamente la población nacional. Entonces, ¿por qué el conjunto de datos abiertos contiene 2.731 filas?
No tenemos una respuesta documentada; el ministerio no publica ninguna conciliación. La lectura más plausible es que el recuento de 1.785 abarca solo las categorías 單姓 + 複姓, mientras que el conjunto de datos en bruto lista el remanente de 8.089 personas como filas individuales — unas 946 cadenas de nombres raros con menos de nueve portadores cada una de media. Aritméticamente encaja sin problemas, pero no lo hemos verificado fila por fila. La afirmación honesta es esta: la diferencia corresponde probablemente al bloque de nombres indígenas y transliterados, y no lo sabemos con certeza.
Lo que hemos medido frente a lo que hemos estimado
Medido. Cada apellido del fichero, y cada peso asociado a él, procede del registro. El peso es el recuento de portadores del registro, almacenado tal cual:
weight = count # 陳 → 2618994, not a rescaled 255
Ninguna curva de potencia, ningún ajuste basado en el puesto, ningún juicio experto en la ordenación. Nuestro orden del top 10 — 陳, 林, 黃, 張, 李, 王, 吳, 劉, 蔡, 楊 — es el orden publicado por el ministerio, no nuestra reconstrucción de él.
Nota histórica. Hasta el cambio de formato, los pesos se reescalaban a una escala de 8 bits mediante round(255 × count / count(陳)), lo que introducía un suelo de redondeo: un peso de 1 valía 2.618.994 / 255 = 10.271 portadores, de modo que cualquier apellido por debajo de esa cifra quedaba sobrerrepresentado. Eso obligaba a un corte de profundidad situado en torno a los 2.000 portadores, 401 entradas. Ambas restricciones han desaparecido: el fichero lleva ahora recuentos reales y entrega el corpus completo. Las cifras citadas de builds anteriores — 401 apellidos, peso 255 para 陳 — remiten a ese formato ya superado, y por eso no coinciden con nada que usted pueda calcular a partir del fichero que se entrega hoy.
Estimado. Nada en los pesos. El único juicio que queda es qué filas excluir por inutilizables (véase más abajo), no cómo puntuar las filas que conservamos.
Ni siquiera estimado: el desglose por edades. El registro reparte cada apellido en tres tramos de edad, y nosotros los agregamos. Nuestro fichero no lleva ninguna estructura de edad.
Trampas propias de Taiwán
No hay umbral de privacidad — así que la ausencia significa realmente cero
La mayoría de los institutos estadísticos suprimen los recuentos pequeños. Taiwán no. El registro publica 643 apellidos con exactamente un portador y 406 con dos, hasta llegar a nombres de origen japonés como 八谷 y 大久保, que lleva una sola persona entre 23 millones.
Eso cambia lo que el registro permite hacer. En la mayoría de los países, un apellido ausente de los datos oficiales puede ser raro, puede haber sido suprimido, puede ser un error de datos — no hay forma de saberlo. En Taiwán, ausente significa cero portadores, y punto.
Nos hemos servido de ello. Nuestra lista anterior contenía 33 apellidos tomados del 百家姓, la cartilla de los Cien Apellidos del siglo XI — 亓官, 漆雕, 東郭, 南門, 段干, 百里, 公孫, 萬俟 y otros. Cada uno de ellos tiene cero portadores en Taiwán. Estaban ahí porque la lista se había construido a partir de un texto clásico y no de una población viva. Han desaparecido.
Pero 澹臺 se quedó, y ahí está toda la lección
澹臺 es un apellido arcaico de dos caracteres procedente de la misma cartilla, instalado en el mismo vecindario semántico que los fantasmas y de apariencia idéntica a la suya. Estaba en nuestra lista de borrado. Está en el registro con dos portadores vivos, así que se quedó.
Nada en su apariencia lo distingue de 東郭. Solo lo hace el contador. Lo mismo vale para 歐陽 (7.653), 司徒 (478), 上官 (294), 端木 (186), 諸葛 (180), 皇甫 (115), 慕容 (1) y 呼延 (1) — todos reales, todos conservados. Un registro no es una forma de confirmar lo que uno ya sospechaba; es una forma de que a uno le digan que se equivocaba en una fila concreta.
Por eso mismo, la limpieza taiwanesa no autoriza la misma limpieza en otros sitios. Ucrania no tiene registro de apellidos, así que borrar apellidos ucranianos de aspecto extraño sería borrar a ojo. La diferencia está en el contador, no en lo evidente del defecto.
異體字: las grafías variantes son apellidos distintos, y el registro lo demuestra
El registro de hogares taiwanés consigna la forma escrita, y varios apellidos existen en más de una variante ortográfica legal (異體字): 温/溫, 黄/黃, 鐘/鍾, 凃/涂/塗, 藍/籃, 龎/龐.
La regla tentadora es «Taiwán usa caracteres tradicionales, así que conservamos 溫 y descartamos 温». El registro mata esa regla con una sola cifra: 温 tiene 42.171 portadores y 溫 tiene 13.956. La forma supuestamente incorrecta es tres veces más frecuente. Aplicar la regla borraría a 42.000 ciudadanos reales y conservaría a 14.000.
No se trata de simplificaciones continentales, sino de variantes legales en el 戶籍 taiwanés; el parecido con las formas simplificadas es accidental, porque la simplificación adoptó a menudo una variante ya existente. Las proporciones van en ambos sentidos: 黃 1.402.808 frente a 黄 34.531 y 鍾 152.550 frente a 鐘 28.759 favorecen la forma tradicional, pero 龎 2.099 frente a 龐 1.171 está invertido. No hay regla. Solo está la tabla. Conservamos ambas formas de cada par.
Al margen de eso, 丘 (4.361) y 邱 (343.469) no son variantes en absoluto, sino apellidos distintos — 邱 surgió de 丘 bajo la prohibición Qing sobre el nombre de pila de Confucio, 孔丘.
其他 no es un apellido
El puesto 147 del registro es 其他 — «otro» — con 5.174 personas. Es una categoría de servicio, y cualquier pasada mecánica del tipo «tomar los N primeros» se la traga y produce un conjunto de datos en el que 5.174 taiwaneses se llaman «Otro». La hemos excluido explícitamente.
La cabeza no es la de China
Cualquiera que importe los supuestos continentales se equivoca con Taiwán. 陳 encabeza con el 11,21 %, 林 es segundo con el 8,33 %, y 王 — el apellido más común en la China continental — está solo en el puesto 6, con el 4,09 %. Son poblaciones distintas con historias distintas, no dialectos de una única lista «china».
Por qué ya no nos detenemos en 401 apellidos
La profundidad tenía antes un precio medible. Como un peso de 1 valía 10.271 portadores, cada entrada por debajo de ese umbral se sobrestimaba a sí misma. Sumar la población implícita a lo largo del fichero da una cifra de «cobertura declarada», y bajo la escala de 8 bits era una restricción dura — esta es la tabla que justificaba el corte en el build del 17 de julio de 2026:
| Umbral de profundidad | Entradas | Cobertura declarada | Cobertura real |
|---|---|---|---|
| ≥ 2.000 | 401 | 109,8 % | 99,61 % |
| ≥ 1.000 | 414 | 110,3 % | 99,69 % |
| ≥ 500 | 440 | 111,5 % | 99,76 % |
| ≥ 100 | 579 | 117,6 % | 99,90 % |
| registro completo | 2.730 | 212,1 % | 100,00 % |
Cargar los 2.730 apellidos en esa escala habría producido un conjunto de datos que declaraba dos Taiwanes: el problema era la masa fantasma de la cola, no su longitud.
Esa restricción ya no existe. Con recuentos de portadores reales no hay suelo de redondeo ni masa fantasma, así que no hay razón para truncar. El fichero entregado lleva la totalidad de los 2.707 apellidos utilizables, con pesos que suman 23.367.536 frente a una base de población de 23.373.283 — una cobertura declarada del 99,98 %, que es sencillamente la cobertura real, porque declarada y real son ahora la misma medición. La tabla anterior se conserva porque documentos más antiguos citan sus cifras; describe un formato que ya no entregamos.
⚠ Nuestra suite de pruebas de regresión imprime 99,9 %, no 99,98 %, y eso es un tercer denominador antes que un cuarto error. ng_regression_tests.php divide por una estimación redondeada de la población actual, 23.400.000, mientras que esta página divide por la base propia del registro, 23.373.283. La línea de la suite — 52.81% top-10-in-corpus · 99.9% coverage · 52.73% product — es coherente internamente sobre esa base; frente a la base del registro, la misma identidad se lee 52,81 % × 99,98 % = 52,79 %, que es la proporción del top 10 publicada por el registro. Ninguna de las dos es errónea; lo que sí es erróneo es citar una contra el denominador de la otra.
La asimetría que regía el antiguo build era deliberada: no añadíamos nada por debajo de 2.000 portadores, pero tampoco borrábamos entradas reales ya presentes (慕容 1, 通 1, 澹臺 2). Añadir estaba limitado por la escala; borrar algo real nunca estuvo sobre la mesa. Ahora nada está limitado por la escala, y la regla se reduce a su segunda mitad.
Top 10
| Puesto | Apellido | Portadores (= peso almacenado) | Proporción de la población |
|---|---|---|---|
| 1 | 陳 | 2.618.994 | 11,21 % |
| 2 | 林 | 1.947.520 | 8,33 % |
| 3 | 黃 | 1.402.808 | 6,00 % |
| 4 | 張 | 1.239.880 | 5,30 % |
| 5 | 李 | 1.199.920 | 5,13 % |
| 6 | 王 | 955.035 | 4,09 % |
| 7 | 吳 | 935.684 | 4,00 % |
| 8 | 劉 | 737.607 | 3,16 % |
| 9 | 蔡 | 684.531 | 2,93 % |
| 10 | 楊 | 617.799 | 2,64 % |
Cada recuento anterior es la cifra del registro, almacenada tal cual en el fichero entregado — ya no hay ningún paso de reconstrucción, y ninguna fila necesita un ~. Las proporciones se calculan sobre la base de población de 23.373.283 y pueden diferir en ±0,02 pp del redondeo propio del ministerio.
52,79 % y 52,81 % son dos mediciones distintas
Estas dos cifras aparecen por toda nuestra documentación y no constituyen una discrepancia. Son los mismos diez apellidos sobre dos denominadores distintos:
| Cifra | Denominador | Apellidos | Portadores |
|---|---|---|---|
| 52,79 % | El registro completo del ministerio, tal como se publicó | 2.731 | 23.373.283 |
| 52,81 % | Nuestro corpus, tras excluir las filas inutilizables | 2.707 | 23.367.536 |
La diferencia es de 24 filas y 5.747 portadores — el 0,0246 % de la población — y sabemos exactamente cuáles son esas filas: la categoría de servicio 其他 (5.174 portadores, no un apellido) más 23 filas situadas en la Zona de Uso Privado de Unicode (Private Use Area), donde el ministerio codifica caracteres raros que carecen de asignación Unicode y que se mostrarían como recuadros vacíos para cualquier lector.
Quitar una fina franja de la cola deja el top diez intacto y a la vez reduce el denominador, así que nuestra proporción sale marginalmente más alta. Calculado a partir del fichero de pesos entregado: los diez primeros suman 12.339.778, que es el 52,8074 % de nuestro corpus y el 52,7944 % de la base completa del registro. La formulación correcta es, por tanto, «el registro da 52,79 %; nuestro corpus, tras excluir 24 filas inutilizables, da 52,81 %» — nunca «aproximadamente 52,8 %», que es como se escondería una discrepancia real.
Limitaciones conocidas
- La diferencia 2.731 / 1.785 sigue sin explicación. Nuestra lectura es plausible y no está verificada.
- Se excluyen 24 filas del registro — la categoría de servicio 其他 más 23 filas de la Private Use Area. Eso es todo lo que descartamos: 5.747 portadores, el 0,0246 % de la población. El truncamiento por profundidad que antes eliminaba ~2.330 apellidos de la cola ha desaparecido.
- La cola se entrega ahora con precisión completa, y eso es un cambio de naturaleza. Bajo la escala de 8 bits, todo lo que estaba entre 2.000 y 10.271 portadores se colapsaba en el peso 1 y se sobrestimaba hasta ~5×. Los recuentos reales eliminan la distorsión por completo; cualquier documento que describa ese suelo está describiendo el formato antiguo.
- La estructura por edades se descarta. El registro la tiene; nosotros no la usamos. 郭 es el apellido más envejecido de Taiwán (índice de envejecimiento 158,64) y nuestros datos no pueden expresar eso.
- La identidad top 10 × cobertura no es una verificación. Multiplicar nuestra proporción del top 10 dentro del corpus por la cobertura declarada del corpus reproduce la proporción del top 10 a nivel de población, y lo hace sea cual sea el contenido del fichero: ambos lados se calculan a partir de los mismos pesos, de modo que la identidad se reduce a
(a/b) × (b/c) = a/c, cierta para cualesquiera valores de entrada. Nuestra suite de pruebas de regresión lo lleva como salida informativa con un PASS fijo, no como una prueba. Los pesos proceden de este registro, así que coincidir con él demuestra aritmética, no verdad.
Datos actualizados a 2026-07-18
Fecha de referencia del registro: 30 de junio de 2023. Conjunto de datos revisado y reconstruido por última vez el 18 de julio de 2026. Corpus: 2.707 apellidos que llevan recuentos de portadores reales y cubren el 99,98 % de la población taiwanesa. Los ficheros de portadores masculinos y femeninos son idénticos byte a byte — los apellidos taiwaneses no varían según el género.
⚠ Las cifras de builds más antiguos no coinciden con esta página. Los documentos redactados antes del 18 de julio de 2026 describen un corpus de 401 apellidos en una escala de pesos de 8 bits, y citan un 99,61 % de cobertura, un 109,8 % de cobertura declarada y un top 10 dentro del corpus del 48,14 %. Esas cifras eran correctas para aquel formato y son erróneas para el fichero entregado. Los equivalentes de hoy son 2.707 apellidos, un 99,98 % de cobertura y un top 10 dentro del corpus del 52,81 %. Verificado contra el fichero de pesos entregado el 18 de julio de 2026.