Identificación falsa > Artículos > De dónde proceden nuestros datos de nombres chinos

De dónde proceden nuestros datos de nombres chinos

Pregunte cuál es el apellido más común en China y obtendrá una respuesta rotunda que los datos no respaldan. 王 y 李 se diferencian en 0,06 puntos porcentuales — unas 800.000 personas de entre 1,3 mil millones, muy dentro del ruido de una instantánea del registro de hogares. «El apellido más común en China» es una pregunta sin respuesta que tenga sentido, y lo primero que un conjunto de datos honesto tiene que hacer es dejar de fingir lo contrario.

Esta página documenta la fuente de nuestros pesos de apellidos chinos, lo que pudimos medir y lo que no, y el gran agujero que hay en mitad de los datos publicados y que deliberadamente decidimos no rellenar con invenciones.

El registro utilizado

CampoValor
Fuente全国户籍人口姓氏统计 — análisis nacional de apellidos del registro de hogares
Editor公安部治安管理局 — Oficina de Administración de Seguridad Pública, Ministerio de Seguridad Pública
Fecha de referenciaabril de 2007
Profundidad publicadaTop 100 de apellidos con proporciones de población
Por debajo del puesto 100Nada. No existe ninguna tabla publicada.
BaseRegistro de hogares (户籍), no un muestreo censal

Valores de anclaje publicados en los que nos apoyamos:

  • 王 — 92.881.000 personas, 7,25 %
  • 李 — 92.074.000 personas, 7,19 %
  • 张 — 87.502.000 personas, 6,83 %
  • Top 10: 王, 李, 张, 刘, 陈, 杨, 黄, 赵, 吴, 周 — cada uno por encima de 20 millones; 42,9 % en conjunto
  • Top 100: 84,77 % de la población

Lo que medimos y lo que estimamos

Medido. Los puestos 1–100 y, por extensión, la forma de la cabeza. Los pesos son un reescalado lineal de las proporciones publicadas tomando 王 como referencia:

weight = round(255 × share / 7.25)

Hay aquí un detalle inusual sobre el que conviene ser transparentes. Cuando auditamos la cabeza ya existente del fichero frente a la tabla de 2007, esperábamos encontrar valores ajustados y lo que encontramos fueron valores del registro: 23 de las primeras entradas se desviaban menos de un 2 % (solo 黄 se desviaba un 4 %). La meseta de la cabeza — 王 255, 李 252, 张 240 — no se construyó para que pareciera plana. Salió de las proporciones reales. La recalibración de 2026 reescaló los puestos 1–157; no volvió a derivarlos de la fuente.

Estimado — y queremos decirlo sin rodeos. Los puestos 158–460 están todos asentados en el peso 1, y eso es erróneo por un factor de unos 50. Véase más abajo.

Trampas propias de China

El top 5 es una meseta, no una clasificación

王 7,25 %, 李 7,19 %, 张 6,83 %. La diferencia entre el primero y el segundo es de 0,06 pp. El registro de hogares no es un censo; va por detrás de la migración, las bajas de registro y las declaraciones de nacimiento con márgenes holgadamente superiores a 0,06 pp.

Así que 王, 李 y 张 forman una meseta. Cualquier conjunto de datos, artículo o infografía que presente «#1 王» como un hecho está sobreinterpretando la fuente. Nuestros pesos preservan la meseta porque la meseta es lo que dice la medición. Que puestos contiguos sean casi iguales no es un error que haya que suavizar — es el hallazgo.

La misma cautela vale más abajo en la lista. 赵, 吴 y 周 se sitúan todos en el peso 71 en nuestro fichero, lo que significa que nuestros datos no pueden ordenarlos. El registro sí puede, por muy poco — 赵 2,06 %, 周 2,02 %, 吴 2,00 %. En una escala de números enteros, eso es un único número.

公安部 y 袁义达 no cuentan igual — y ninguno de los dos se equivoca

Esta es la trampa que produce dos clasificaciones «oficiales» contradictorias de los apellidos chinos.

El análisis del MPS de 2007 cuenta 萧 y 肖 por separado, y lo mismo con 戴/代 y 傅/付. Las clasificaciones, ampliamente citadas, del demógrafo 袁义达 los fusionan, con el argumento de que la escisión es un artefacto de la simplificación de caracteres del siglo XX y de sustituciones administrativas, y no una división real de linajes.

Ambas posturas son defendibles. Producen órdenes de puestos distintos, y las listas derivadas de ellas no se pueden empalmar. La nuestra sigue la convención del MPS porque nuestros pesos proceden de la tabla del MPS, y mezclar convenciones dentro de un mismo conjunto de datos es la manera de acabar contando un apellido una vez y media.

Quien haya leído nuestra página sobre Taiwán reconocerá el mismo patrón: el registro taiwanés cuenta 温 y 溫 por separado porque consigna formas escritas. Mismo fenómeno de fondo, respuesta institucional distinta, y en ambos casos la convención de la fuente se impone a nuestra intuición sobre lo que «debería» ser un solo apellido.

No existe tabla publicada para los puestos 100–300 — así que no inventamos ninguna

Este es el agujero, asumido, que hay en mitad de nuestros datos chinos.

El MPS publica el top 100 (84,77 %). El trabajo de 袁义达 de 2006 publica una porción — «129 apellidos con ≥0,1 % suman el 87 %» — que es un agregado, no una tabla puesto por puesto. La única fuente sistemática para los puestos 100–300 es el libro 《中国姓氏·三百大姓》 (袁义达 / 邱家儒, 2007), del que no disponíamos.

Así que los puestos 158–460 de nuestro corpus llevan todos el peso 1. Eso es objetivamente falso, y sabemos exactamente hasta qué punto. En ese suelo compartido conviven 欧阳, con alrededor de un millón de portadores, y 壤驷 / 漆雕 / 澹台, con unos pocos miles cada uno. La relación real es del orden de 50:1; nuestros datos dicen 1:1. Peor aún: esas entradas están ordenadas según su secuencia en la cartilla 百家姓, no por frecuencia — esa sección del fichero es una lista, no una curva.

Podríamos haber interpolado en ese intervalo una curva de potencias de aspecto plausible. Habría quedado mejor y habría sido inventada. La laguna es real, está documentada, y el remedio es el libro, no una fórmula.

La cobertura frente a la cifra del fichero

Nuestro corpus consta de 460 apellidos y cubre en torno al 91 % de la población. Eso explica de inmediato una cifra que la gente intenta «corregir»: la proporción del top 10 dentro de nuestro fichero es del 42,3 %, no del 42,9 %. Denominadores distintos — el 42,9 % es una proporción sobre el conjunto de los chinos; el 42,3 %, sobre un fichero que no contiene todos los apellidos chinos.

El objetivo honesto dentro del fichero es 42,9 % ÷ 91 % ≈ 47 %, y no lo alcanzamos. El 42,3 % es el techo, no un déficit: el top 10 (1.496 unidades de peso) y los puestos 11–157 (1.742 unidades) están anclados a proporciones reales del registro, y las 303 entradas de la cola no pueden pesar menos de 1 (=303 unidades). Cualquier cifra por encima del 42,3 % exige infravalorar los puestos 11–157 — es decir, mentir sobre ellos para que un agregado parezca correcto.

La comprobación que nos pilló

Un diagnóstico merece publicarse porque es trasladable a otros casos. Si un peso de 1 corresponde a share(top1) / 255 de la población, entonces sumar todos los pesos y multiplicar indica cuánta población afirma describir el fichero:

claimed coverage = sum(weights) × share(top1) / max(weight)

Antes de la recalibración de 2026, nuestro fichero chino afirmaba cubrir el 114 % de China. Eso es aritméticamente imposible, y demostró que la cola estaba sobreponderada sin necesidad de juzgar qué entradas parecían erróneas. Tras la recalibración, afirma cubrir el 100,7 %.

Top 10

PuestoApellidoPesoPortadoresProporción de la población
125592.881.0007,25 %
225292.074.0007,19 %
324087.502.0006,83 %
4189> 20.000.000~5,37 %
5158> 20.000.000~4,49 %
6107> 20.000.000~3,04 %
782> 20.000.000~2,33 %
871> 20.000.0002,06 %
971> 20.000.0002,00 %
1071> 20.000.0002,02 %

Qué está medido y qué es aritmética. Los puestos 1–3 son recuentos y proporciones publicados. Los puestos 4–7 muestran proporciones reconstruidas a partir del peso almacenado — el fichero conserva un peso entero, no la proporción original, de modo que solo son recuperables con un margen de redondeo. Los puestos 8–10 muestran las proporciones publicadas, y por eso no están en orden de peso: el fichero no puede separar el 2,00 % del 2,06 %. El MPS solo indica que cada uno de los diez primeros supera los 20 millones de portadores; los recuentos por apellido por debajo del puesto 3 no figuran en el resumen publicado que utilizamos.

Conviene notar que la reconstrucción queda algo por debajo: nuestros pesos, al reconvertirlos, dan un top 10 del ~42,5 % frente al 42,9 % publicado, y un top 100 del 84,0 % frente al 84,77 % publicado. Ese déficit de ~0,8 pp es redondeo entero acumulado a lo largo de 100 entradas, siempre en el mismo sentido.

Limitaciones conocidas

  • Los puestos 158–460 son planos y no están ordenados. El defecto más grave de este locale. ~50:1 de variación real comprimida a 1:1, con las entradas secuenciadas según una cartilla clásica en lugar de por frecuencia. Solo se puede corregir consiguiendo 《中国姓氏·三百大姓》.
  • Los datos son de 2007. Diecinueve años. El MPS ha publicado informes más recientes (《二〇二〇年全国姓名报告》, 《二〇二一年全国姓名报告》), pero no incluyen una tabla equivalente de proporciones del top 100 completo, así que no cambiamos de fuente. Para dar idea de la escala: el informe de 2020 cifra el top 5 en el 30,8 % de la población registrada; nuestra cabeza calibrada sobre 2007 implica un 31,1 %. Eso es una señal de estabilidad temporal procedente del mismo organismo — indicio de que la distribución apenas se ha movido — y explícitamente no una confirmación independiente de que nuestras cifras sean correctas.
  • El top 10 no puede ordenarse con nuestros datos por debajo del puesto 3. Ni debería, a decir verdad. Véase la sección sobre la meseta.
  • La cobertura es de ~91 %. El ~9 % restante de la población lleva apellidos ausentes de nuestro fichero.
  • El registro de hogares no es un censo. El 户籍 va por detrás de la residencia efectiva. Se conoce el sentido del error; su magnitud, no.
  • La fusión de formas simplificadas y variantes sigue la convención del MPS. Si necesita la convención de 袁义达, el nuestro no es el fichero adecuado.
  • La comprobación de coherencia del top 100 no es una verificación. Un 83,4 % dentro del fichero × 100,7 % de cobertura afirmada = 84,0 % frente al 84,77 % publicado es una comprobación de coherencia interna frente a la misma fuente de la que proceden los pesos. Muestra que la curva es aritméticamente coherente más allá de la cabeza. No puede mostrar que sea verdadera.

Datos actualizados a 2026-07-17

Fecha de referencia del registro: abril de 2007. Conjunto de datos recalibrado: 17 de julio de 2026 (top 10 dentro del fichero 37,3 % → 42,3 %; cobertura afirmada 114 % → 100,7 %). Corpus: 460 apellidos que cubren ~91 % de la población. Los ficheros masculino y femenino son idénticos byte a byte — los apellidos chinos no varían según el género.

Fuentes

← Artículos