Identificación falsa > Artículos > De dónde proceden nuestros datos de nombres vietnamitas

De dónde proceden nuestros datos de nombres vietnamitas

En Vietnam no hay registro estatal de apellidos. Todo lo que usted haya leído alguna vez sobre lo común que es Nguyễn — incluida la cifra que tiene ahora mismo en la cabeza — procede de la muestra de alguien. Eso convierte a Vietnam en el más difícil de acertar de nuestros locales de Asia Oriental, y en el locale donde encontramos el mayor error factual aislado de nuestros propios datos.

Las fuentes utilizadas

No hay registro, así que esta sección nombra muestras en su lugar.

CampoValor
Registro estatalNinguno. Vietnam no publica frecuencias de apellidos.
Muestra principalVNTH01 — n = 1.682.729
SecundariaSG01 — n = ~241.000, Ciudad Hồ Chí Minh; publica solo un top 10 fusionado
Sesgo conocidoVNTH01 está sesgado hacia el norte, 63:37, y así lo declara él mismo
AnclajeNguyễn = 30,492 % (VNTH01)

Como no hay ninguna autoridad a la que remitirse, el método cambia: en lugar de fiarnos de una sola fuente, buscamos dos muestras grandes cuyos sesgos apunten en direcciones opuestas y comprobamos si aterrizan en el mismo sitio.

Lo que medimos frente a lo que estimamos

Medido. Los puestos 1–298, procedentes de VNTH01, almacenados como recuentos del registro escalados:

weight = round(1000 × share%)

de modo que el 30,492 % de Nguyễn se convierte en 30492 y una unidad de peso equivale al 0,001 % de la población. El fichero llega hasta el puesto 298 — la última posición cuyo recuento todavía se redondea a un peso de ≥1, es decir, hasta una proporción de alrededor del 0,0005 %. Por debajo de ahí, la frecuencia de un nombre se redondea a cero: cualquier peso situado ahí sería un suelo inventado por nosotros, no un recuento medido por nosotros.

Estimado. La corrección regional — es decir, que no la hay. VNTH01 está sesgado hacia el norte y lo sabemos. Corregirlo exigiría coeficientes regionales que no existen, y SG01 solo publica su top 10. La dirección del sesgo se conoce; su magnitud no, y no la adivinamos.

Cosa poco habitual, la cobertura es casi total. 298 apellidos cubren al 99,4 % de los vietnamitas, lo que invierte una advertencia válida para todos los demás locales que documentamos: aquí la proporción de un apellido dentro del fichero está muy cerca de su proporción en la población. En los demás sitios son dos cifras distintas con denominadores distintos. En Vietnam casi coinciden.

Trampas propias de Vietnam

«Nguyễn = 38 %» es una cifra zombi

Todo el mundo la cita: las enciclopedias, el periodismo, las bibliotecas de generación de nombres, nosotros — en nuestra primera versión.

Se remonta a Lê Trung Hoa, Họ và tên người Việt Nam (1992; edición de 2005), que da a Nguyễn un 38,4 %, a Trần un 12,1 %, a Lê un 9,5 %, a Phạm un 7 %, a Hoàng/Huỳnh un 5,1 %, a Phan un 4,5 % y a Vũ/Võ un 3,9 %. Se repite no porque se haya confirmado, sino porque durante mucho tiempo fue la única cifra publicada. Nuestras notas de trabajo la recogen como basada en una muestra de 1.941 personas; no pudimos verificar ese tamaño de la muestra, y la literatura secundaria reproduce los porcentajes sin indicar metodología alguna. En cualquier caso el problema es el mismo: una fuente única no replicada, sin método publicado, repetida hasta adquirir la textura de un hecho.

Tres muestras grandes dicen lo contrario:

MuestranCarácter regionalNguyễn
VNTH011.682.729sesgada hacia el norte 63:3730,5 %
SG01~241.000Ciudad Hồ Chí Minh31,5 %
Nguyen (2024), Genealogy 8(1)883.835compilación nacional31,57 %

Dos de ellas tienen sesgos regionales opuestos y aun así convergen. La tercera es una compilación independiente revisada por pares, y aterriza en el mismo sitio — al tiempo que informa de un 39,01 % en Hà Nội frente a un 30,61 % en Ciudad Hồ Chí Minh, lo que confirma de forma independiente tanto la existencia como la dirección del sesgo norte/sur que VNTH01 declara sobre sí mismo.

Tres muestras, tres metodologías, una sola respuesta: Nguyễn está en torno al 31 %, no al 38 %. Se trata de una corroboración independiente de verdad, no de que nos estemos dando la razón a nosotros mismos — el artículo de 2024 no tuvo contacto alguno con nuestra fuente de calibración.

La moraleja se generaliza: cuando un dato estadístico se cita en todas partes y el rastro termina en un único estudio pequeño, busque una muestra grande antes de calibrar nada con él. Y la cifra con la que se ancla una curva debe proceder de la misma fuente que las proporciones a las que da escala — fijar las proporciones de VNTH01 a la cifra de 38 que Lê da para Nguyễn en lugar de a su propio 30,492 habría comprimido toda la curva alrededor de un 20 %.

«Top 10 = 85 %» es el mismo zombi con un segundo sombrero puesto

Procede del mismo libro y de la misma muestra — y describe un objeto diferente. La cifra de Lê fusiona las variantes regionales: Hoàng y Huỳnh como un solo apellido, Vũ y Võ como uno solo. Sus siete nombres fusionados suman un 80,5 %; el top 10 fusionado de SG01 está en el 76,1 %.

Nuestro corpus los mantiene separados, porque son cadenas distintas en un campo de formulario vietnamita, de modo que nuestro objetivo honesto es de ~71 %. La cifra del 85 % no queda fuera de alcance porque nuestra curva sea mala, sino porque es una cifra que habla de otra cosa.

Y no es un apellido — y la fuente lo demuestra desde dentro

En el puesto 55 de VNTH01, con un 0,092 %, se sitúa Y. Lo descartamos.

Y es un prefijo honorífico masculino entre los pueblos Ê Đê y Gia Rai — algo así como «Sr.». Y Moan Enuôl, Y Jút. Los nombres de clan de verdad vienen después y se transmiten por vía matrilineal: Niê, Mlô, Ksơr, Kpă.

La prueba está dentro de la muestra. Si Y fuera un apellido, los clanes se clasificarían cerca de él. No lo hacen: Niê ocupa el puesto 210 (0,005 %) y el 247. Y aparece 18 veces más a menudo que el clan al que pertenece — exactamente lo que se vería si un analizador tomara el primer token de cada nombre y barriera a toda la población masculina adulta Ê Đê y Gia Rai hacia un campo «apellido».

El mismo artefacto produjo Thị en el puesto 149 — un nombre intermedio femenino, posiblemente el elemento de nombre más común del país — además de Ka en el 123 y A en el 129. Añadir Y habría escrito también un tratamiento honorífico masculino en la lista de apellidos femeninos.

Este es el aspecto real de una trampa: no una cifra equivocada, sino una cifra correctamente contada que describe el objeto equivocado. La frecuencia de Y en la muestra es exacta. Y simplemente no es un apellido.

Thạch es real, y no es el mismo tipo de artefacto

En apariencia, Thạch parece otro token de lengua minoritaria. No lo es. Danh, Kiên, Kim, Sơn y Thạch son apellidos concedidos a los khmer krom por la corte de los Nguyễn cuando se anexionó Nam Bộ — el mismo mecanismo administrativo que el decreto Clavería en Filipinas. Los portadores khmer krom llevan nombres de pila vietnamitas corrientes: Thạch Kim Tuấn, Thạch Cương.

Así que la prueba no es «¿parece extranjero este token?», sino «¿existe un mecanismo documentado por el cual esto sea un apellido?». Para Y, no lo hay. Para Thạch, sí.

Văn es nuestra entrada más débil y la dejamos en paz

Văn se sitúa en el puesto 42 (0,187 %, ~180.000 personas) con un peso de 187. El apellido es real — Văn Như Cương, un linaje de Quỳnh Lưu — pero la literatura lo describe como un clan pequeño, algo que casa mal con 180.000 portadores. Sospechamos que VNTH01 absorbió en parte el nombre intermedio Văn (como en Nguyễn Văn Nam), el infijo masculino más común del país. No lo redujimos en silencio: eso sería ajustar los datos a una corazonada, y la misma fuente reprodujo el resto de la curva con exactitud (60 coincidencias de 60). Se queda, señalado.

Por qué el fichero se detiene en 298

No hay ningún corte dictado por el gusto. El fichero conserva todo apellido cuyo recuento escalado todavía se redondea a un peso de ≥1 — 298 nombres, hasta una proporción de alrededor del 0,0005 % — que ya es la franja medible completa del registro. Como se trata de recuentos reales y no de suelos inventados, la masa se mantiene por debajo del 100 % en lugar de dispararse por encima, y la profundidad simplemente rinde cada vez menos:

ProfundidadEntradasCoberturaTop 10 en el fichero
hasta el puesto 666696,64 %71,60 %
hasta el puesto 15015098,77 %70,05 %
todos29899,44 %69,58 %

Los 232 nombres de los puestos 67–298 apenas añaden tres puntos de cobertura — cada uno se sitúa por debajo de una proporción del 0,06 % — y todo lo que va más allá del puesto 298 se redondea sencillamente a nada. No hay ningún top 300 al que aspirar: en 298 es donde termina la señal medible del registro.

Top 10

PuestoApellidoPesoProporción de la poblaciónNota
1Nguyễn3049230,49 %~31 % en tres muestras; no 38 %
2Trần9825~9,83 %
37744~7,74 %
4Phạm5932~5,93 %
5Hoàng3316~3,32 %variante septentrional de Huỳnh; se mantiene aparte
62735~2,74 %variante septentrional de Võ; se mantiene aparte
7Bùi2479~2,48 %
8Phan2379~2,38 %
9Đỗ2192~2,19 %
102097~2,10 %variante meridional de Vũ

El top 10 tal como aparece: ~69,2 % de la población, frente a un techo alcanzable del ~71,4 %.

No hay recuentos de portadores, porque no existe ninguno. Vietnam no publica ningún registro de apellidos, así que no existe ninguna fila de la forma «Nguyễn: N personas». Son frecuencias de muestra escaladas a la población; ~ señala las proporciones reconstruidas a partir del peso entero almacenado. Fusione Hoàng/Huỳnh y Vũ/Võ como hace la mayoría de las cifras publicadas y este top 10 pasa a ~76 % — misma población, pregunta distinta.

Limitaciones conocidas

  • No hay registro, y esta página no puede arreglarlo. Cada cifra que aparece aquí es una estimación de muestra — el único de nuestros cuatro locales de Asia Oriental en el que eso ocurre.
  • El sesgo norteño 63:37 de VNTH01 no está corregido. Nông (puesto 27) y otros apellidos de las tierras altas del norte están sobrestimados; los del sur, infraestimados. La división Hà Nội/HCMC del artículo de 2024 en Genealogy (39,01 % frente a 30,61 %) muestra que el efecto es grande. No tenemos coeficientes y no inventamos ninguno.
  • Văn puede estar contaminado por el análisis del nombre intermedio. Documentado más arriba. Se deja tal cual.
  • La cola por debajo de una proporción del ~0,0005 % está ausente — apellidos cuyo recuento escalado se redondea a cero. En conjunto son el ~0,56 % de la población al que la cobertura no llega (se detiene en el 99,44 %).
  • La denominación en lenguas minoritarias apenas está representada. Una vez retirados Y, Thị, Ka y A, de la denominación Ê Đê y Gia Rai solo queda un puñado de nombres de clan rarísimos — Niê, y similares, cada uno cerca del fondo del fichero. Eso refleja el analizador de nuestra muestra, no a Vietnam.
  • Sin fechas en las muestras. Ni VNTH01 ni SG01 llevan una fecha de referencia limpia como sí la lleva un censo.

Datos actualizados a 2026-07-17

Fuentes: los conjuntos de datos de frecuencias de hoten.org VNTH01 (n = 1.682.729) y SG01 (n ≈ 241.000) — CC BY 4.0 según se declara en el texto de la página — contrastados con Nguyen (2024), Genealogy 8(1):16 (n = 883.835). El fichero se reconstruyó directamente a partir de los recuentos de hoten.org: lo que empezó como una lista curada de ~110 entradas en una escala interna de 255 puntos es ahora la franja completa del registro, 298 apellidos, cada uno almacenado como su recuento de frecuencia escalado (weight = share% × 1000). Cobertura 99,44 %, top 10 en el fichero 69,58 %. Los ficheros masculino y femenino son idénticos byte a byte — los apellidos vietnamitas no varían según el género.

Fuentes

← Artículos