Identificación falsa > Artículos > De dónde proceden nuestros datos de nombres de Corea del Sur

De dónde proceden nuestros datos de nombres de Corea del Sur

Corea del Sur dispone de un censo real de apellidos, lo que la sitúa en un club muy reducido. También tiene un problema de sistema de escritura que rompe en silencio la mayoría de los conjuntos de datos construidos a partir de ese censo, incluido — durante un tiempo — el nuestro. Si toma al pie de la letra la tabla coreana de apellidos publicada, se equivocará en el cuarto apellido más frecuente del país. Y no un poco: puesto equivocado, cifra equivocada, nombre equivocado.

Esta página documenta la fuente que utilizamos, dónde termina la medición y dónde empieza la estimación, la trampa hanja/hangul y sus variantes, y el techo con el que nos topamos y que no podíamos superar honestamente.

El registro que utilizamos

CampoValor
Fuente인구주택총조사 — Censo de población y vivienda, estadísticas de apellidos
EditorKOSTAT / Statistics Korea (통계청)
Fecha de referencia1 de noviembre de 2015 (publicado el 7 de septiembre de 2016)
Portalhttps://kostat.go.kr
Profundidad publicada5.582 apellidos distintos; 36.744 clanes (본관)
UmbralApellidos con 5 portadores o más; los más raros agrupados como 기타
Base de población~49,7 millones de nacionales coreanos

El censo de 2015 es el último recuento exhaustivo de apellidos; para este módulo el censo sigue un ciclo de 15 años, de modo que en 2026 no existe nada más reciente.

Lo que medimos y lo que estimamos

Medido. La cabeza. Los pesos son un reescalado de los recuentos del censo respecto a 김:

weight = round(255 × share / share(김))

con 김 = 21,5 %. El orden y los intervalos en los puestos superiores son los del censo, no los nuestros.

Estimado. La cola, y la agregación en hangul.

La agregación en hangul importa y queremos ser explícitos al respecto: la tabla principal de KOSTAT está organizada en torno a apellidos identificados por su hanja. Nuestro corpus almacena hangul. Fusionar 鄭 y 丁 en una sola entrada 정 es aritmética sobre cifras publicadas, así que es medición — pero fusionar todo correctamente exige conocer la composición en hanja de cada sílaba hangul, y para la cola no la conocemos. Por debajo del puesto 30 aproximadamente, considere nuestra agregación en hangul como hecha lo mejor posible, no auditada.

Sin medir en absoluto: los clanes. Volvemos sobre ello más abajo.

Trampas propias de Corea del Sur

Hanja frente a hangul — 정 es 鄭 y 丁 al mismo tiempo

Este es el problema central y todo lo demás se deriva de él.

Un apellido coreano es históricamente un carácter hanja. Los documentos modernos, y nuestro corpus, almacenan hangul. La correspondencia no es biunívoca: una misma sílaba hangul puede portar varios apellidos sin relación entre sí.

HangulHanja subyacenteProporción en la tabla hanjaProporción en hangul
鄭 + 丁 (+ 程)4,33 % (鄭 solo)4,84 %
趙 + 曺2,12 % (趙 solo)2,93 %
林 + 任1,66 % (林 solo)2,04 %

La consecuencia es una inversión de puestos, no una diferencia de redondeo. En la tabla hanja publicada, 최 (4,70 %) supera a 정(鄭) (4,33 %), y 정 ocupa el puesto 5. En hangul — que es lo que contiene realmente un campo de formulario coreano — 정 está en el 4,84 % y supera a 최. Es el puesto 4.

El mismo desplazamiento mueve el agregado: el top 10 supone el 63,9 % en hanja y el 65,8 % en hangul. La cifra del 63,9 % es la que KOSTAT puso en su nota de prensa y la que todo el mundo cita. Es correcta, y es la cifra equivocada para un conjunto de datos en hangul. El nuestro usa el 65,8 %.

본관 no es un apellido — no lo sume

La trampa vecina. 김해 김씨 — Gimhae Kim — es un clan (본관), un linaje ligado a un asiento ancestral, no un apellido distinto. Corea tiene 36.744; solo 김해 김 son 4,457 millones de personas (el 9 % de la población), 밀양 박 es el 6,2 % y 전주 이 el 5,3 %.

Quien extrae una tabla de clanes y trata las filas como apellidos produce un conjunto de datos magníficamente detallado que describe algo que no es una distribución de apellidos. La tabla de apellidos de KOSTAT ya ha sumado los clanes. Lo que hay que separar son los homógrafos hanja. Lo que hay que dejar en paz son los clanes. Tiran en direcciones opuestas y ambos parecen «el mismo nombre que aparece dos veces».

existe un umbral de privacidad — la ausencia no prueba nada

Conviene decirlo con claridad, porque es exactamente lo contrario de Taiwán. El censo de 2015 publica los apellidos portados por cinco personas o más y agrupa el resto bajo 기타. Así que un apellido coreano ausente de los datos del censo puede tener cuatro portadores, o cero, y la tabla publicada no puede decirle cuál de los dos.

Esto significa que la lógica de eliminación que aplicamos a los datos taiwaneses — no está en el registro, luego cero portadores, luego se borra — es inválida para Corea. Otro país, otra regla de divulgación, conclusión opuesta a partir de indicios de aspecto idéntico.

¿Cuántos apellidos tiene Corea? Nadie se pone de acuerdo

Una frase muy repetida afirma que Corea pasó de 286 apellidos en 2000 a 5.582 en 2015 — una explosión de veinte veces en quince años, impulsada por ciudadanos naturalizados que escriben apellidos extranjeros en hangul.

Ambas cifras están publicadas y ambas son reales, pero no cuentan el mismo objeto, y la razón entre ellas no significa nada:

  • 286 es el número de apellidos coreanos tradicionales, derivados de hanja, consignados en torno al censo de 2000 (junto a 4.179 clanes).
  • 5.582 es cada cadena hangul distinta recogida en 2015, de las cuales el 73 % no tiene ningún hanja correspondiente — es decir, en su mayoría nombres de origen extranjero.
  • La propia formulación de KOSTAT habla de «más de 4.800 apellidos nuevos desde 2000», lo que implica una base de partida en 2000 cercana a 780, no a 286.
  • Otra lectura del mismo censo informa de 1.507 apellidos y 36.744 clanes.
  • El recuento de Wikipedia de los datos de 2015, restringido a los nombres con cinco portadores o más, da 191 apellidos hangul distintos y 514 apellidos hanja distintos.

Así que los recuentos publicados para un mismo censo van de 191 a 5.582 según se cuenten cadenas hangul o caracteres hanja, y según se aplique o no el suelo de los cinco portadores. No sabemos cuántos apellidos tiene Corea, y nadie más lo sabe tampoco, en una sola cifra. Lo que sí está claro es la dirección: la naturalización añade con rapidez apellidos que solo existen en hangul, y la concentración en la cabeza no se ha movido en absoluto (63,9 % en 2015 frente a 64,1 % en 2000).

Nuestro corpus contiene 184 apellidos en hangul, cifra que hay que contrastar con esos 191 apellidos hangul con 5 portadores o más, y no con los 5.582.

El techo uint8 — por qué nuestro top 10 se queda en el 60,6 %

Lo más útil que podemos decir del conjunto de datos coreano es dónde falla.

Los pesos son de 8 bits: de 1 a 255. La amplitud real de Corea no cabe ahí. 김 es el 21,5 % de la población; el apellido 다 tiene siete portadores. Eso es una razón de aproximadamente 1.527.138 : 1. La escala ofrece 255 : 1.

La consecuencia aritmética es directa. Una unidad de peso vale ~41.921 personas, de modo que unos 130 apellidos ultrarraros se apoyan en un suelo que los sobrestima en tres órdenes de magnitud, lo que añade alrededor de un 8 % de masa fantasma al denominador. La proporción del top 10 en el fichero queda por tanto en el 60,6 % cuando la realidad es el 65,8 %.

Esa diferencia no es un fallo de calibrado. Cerrarla exigiría borrar del corpus ~65 apellidos coreanos auténticos — lo que equivale a ajustar los datos al objetivo, y el objetivo no es aquello en lo que intentamos acertar. Unos pocos puntos de déficit en un locale tan concentrado son la respuesta correcta, no un defecto.

Top 10

PuestoHangulHanjaPortadores en el censoPesoProporción en hangul
110.689.95925521,50 %
27.306.82817414,67 %
34.192.0741008,43 %
4鄭+丁~2.152.000 (鄭)574,84 %
5~2.334.000564,72 %
6趙+曺~1.056.000 (趙)352,95 %
7姜+康~1.177.000 (姜)302,53 %
8~993.000242,02 %
9~1.021.000242,02 %
10林+任~824.000 (林)242,04 %

⚠ Tres cosas que le está diciendo esta tabla. Primero, los puestos 4 y 5 están intercambiados respecto a todas las listas publicadas del top 10 coreano, y es deliberado — véase la sección hanja/hangul. Segundo, los recuentos de portadores de los puestos 4–10 son los recuentos en hanja de la publicación de KOSTAT, redondeados tal como se publicaron; para las filas fusionadas son por tanto inferiores a lo que sugiere la proporción en hangul, porque el segundo hanja no está incluido. Tercero, los puestos 8, 9 y 10 llevan todos el peso 24 — y lo mismo 신 en el puesto 11. A esta resolución el fichero no puede distinguirlos. El censo publicado sí puede. Nosotros no, en una escala entera tan abrupta.

Limitaciones conocidas

  • La proporción del top 10 es del 60,6 % frente a un 65,8 % real. Estructural, documentado más arriba, no corregible dentro de una escala de 8 bits.
  • La cola está sobreponderada hasta ~1000×. ~130 apellidos se apoyan en un suelo que vale ~41.921 personas.
  • Los puestos 8–11 están empatados y sin ordenar en nuestro fichero. El censo los ordena; nuestra escala no puede.
  • La agregación en hangul por debajo del puesto ~30 no está auditada. Fusionamos los homógrafos que pudimos documentar. No los verificamos todos.
  • Los datos son de 2015. El módulo de apellidos sigue un ciclo censal de 15 años. El próximo es el de 2030. Los apellidos surgidos de las naturalizaciones — la parte más cambiante de esta distribución — llevan once años de retraso y están subestimados.
  • Sin dimensión de clan. Nuestros datos no saben distinguir un Gimhae Kim de un Gyeongju Kim. Esa distinción es socialmente real y tiene 36.744 filas de profundidad, y no la recogemos.
  • Nuestra proporción del top 10 en el fichero y la proporción de población son cifras distintas con denominadores distintos. No «corrija» la una con la otra.

Datos actualizados a 2026-07-17

Fecha de referencia del censo: 1 de noviembre de 2015. Conjunto de datos recalibrado: 17 de julio de 2026 (proporción del top 10: 53,0 % → 60,6 %). Corpus: 184 apellidos en hangul. Los ficheros masculino y femenino son idénticos byte a byte — los apellidos coreanos no varían según el género.

Fuentes

← Artículos