Identificación falsa > Artículos > ¿Es su conjunto de datos «nacional» en realidad regional? Una prueba de cinco minutos

¿Es su conjunto de datos «nacional» en realidad regional? Una prueba de cinco minutos

Nuestros datos de nombres de pila para el Reino Unido se construyeron a partir de fuentes británicas, se etiquetaron como británicos, se validaron como británicos y se entregaron como británicos. Eran escoceses.

Ni parcialmente escoceses ni con un vago aire escocés: cada contador que contenían procedía de nacimientos inscritos en Escocia, un país que reúne alrededor del 8 % de la población del Reino Unido. El fichero había pasado todos los validadores de que disponíamos. Falló en la primera prueba aritmética que alguien se molestó en aplicarle, y esa prueba llevó menos tiempo que leer este párrafo.

Este artículo es esa prueba, más las tres que la respaldan, más la razón por la que el error es mucho más común de lo que suena. Un conjunto de datos «nacional» es regional más a menudo de lo que es erróneo de cualquier otra manera, porque los registros regionales publican con más facilidad que los nacionales, y el fichero más fácil de obtener es el que acaba usándose.

Prueba 1: sumarlo todo

Todo conjunto de datos de frecuencia construido a partir de recuentos declara una población. Sume los contadores y compare el total con la cifra oficial de aquello que el fichero dice describir. En eso consiste toda la prueba.

Nuestro fichero estaba organizado en décadas de nacimiento, desde la de 1940 hasta la de 2000. Una vez sumado:

Mitad del ficheroSuma de todos los contadores
Niños2.403.426
Niñas2.119.942
Total4.523.368

Ahora la comparación. Escocia inscribe unos 4,5 millones de nacimientos a lo largo de esas décadas. El Reino Unido inscribe aproximadamente doce veces esa cifra.

Podemos apoyar el multiplicador en una cifra medida en lugar de en una supuesta. Para los años 2001–2010, los recuentos de nacimientos por nombre los publican los tres organismos de registro civil del Reino Unido, de modo que el cociente no es una estimación:

Organismo de registro civilTerritorioNacimientos de niños 2001–2010Proporción del total
ONSInglaterra y Gales3.169.31888,88 %
NRSEscocia284.5267,98 %
NISRAIrlanda del Norte111.8643,14 %
Reino Unido3.565.708100 %

Escocia representa el 7,98 % de los niños del Reino Unido y el 8,19 % de sus niñas — un factor de 12,5 y 12,2 respectivamente. Un fichero realmente de ámbito británico que cubriera esas mismas décadas contendría, por tanto, en torno a 25–30 millones de nacimientos de niños, no 2,4 millones.

Ese es todo el hallazgo. Una discrepancia de un orden de magnitud no es una barra de error. Unos datos pueden estar desactualizados, truncados, mal analizados o muestreados y aun así quedar dentro de un factor dos. Quedar dentro de un factor doce de un subterritorio concreto, y no quedar ni cerca del país que figura en la etiqueta, significa que el fichero trata de ese subterritorio.

Fíjese en lo que esta prueba no exige: ningún conocimiento de los nombres británicos, ninguna lista de nombres escoceses, ninguna idea de qué es Eilidh. Dos sumas y una división.

Prueba 1b: la suma que cuadra hasta el último dígito

La prueba del orden de magnitud le dice que algo va mal. El paso siguiente le dice exactamente qué, y merece la pena darlo porque convierte una sospecha en una demostración.

Tome las agrupaciones internas del fichero — décadas, regiones, años, lo que tenga — y compare cada una por separado con la fuente candidata. Las nuestras:

Columna de década en el ficheroValor (niños)Nacimientos inscritos en EscociaVeredicto
1941247.6191946–1950: 247.619exacto — pero 5 años
1951460.7761951–1960: 460.776exacto
1961470.6331961–1970: 470.633exacto
1971353.1311971–1980: 353.132desviación de 1
1981338.3511981–1990: 338.352desviación de 1
1991308.4221991–2000: 308.422exacto
2001224.4942001–2008: 224.494exacto — pero 8 años

Cinco columnas de siete reproducen las inscripciones de nacimiento de un solo país hasta la unidad, y las otras dos se desvían en un nombre cada una. La mitad femenina del fichero se comporta de forma idéntica, incluidas las mismas dos anomalías de ventana con los mismos valores (206.683 para 1946–1950 y 213.582 para 2001–2008).

Una coincidencia con esa precisión no existe. No es un fichero que se incline hacia lo escocés; son inscripciones de nacimiento escocesas con una etiqueta británica en la carpeta.

Y la prueba regaló de paso dos defectos más, ambos invisibles para cualquier otra comprobación:

  • La columna etiquetada como 1941 contiene en realidad 1946–1950 — media década, y precisamente la mitad que excluye los años de la guerra.
  • La columna etiquetada como 2001 contiene en realidad 2001–2008 — ocho años de diez, de modo que esa década quedaba un 21 % corta respecto a sus vecinas.

Ninguno de los dos errores es detectable mirando los nombres. Ambos salen a la luz al comparar un subtotal con la fuente que supuestamente lo produjo.

Prueba 2: entradas individuales desproporcionadas

La prueba de la suma demuestra que el fichero es regional. Esta lo demuestra ante un lector que no quiere hacer aritmética, y funciona incluso cuando no se puede conseguir un total nacional limpio.

Elija entradas que espere que estén cargadas geográficamente, calcule su proporción dentro del fichero y calcule esa misma proporción en la distribución nacional. El cociente es la señal reveladora. Medido sobre los nacimientos de 2001–2010 en los tres organismos de registro civil del Reino Unido:

NombreProporción en EscociaProporción en el Reino UnidoCociente
Blair0,349 %0,029 %×11,8
Eilidh0,725 %0,066 %×11,0
Mhairi0,095 %0,010 %×9,9
Ross0,981 %0,160 %×6,1
Fraser0,619 %0,113 %×5,5
Iona0,388 %0,075 %×5,2
Hamish0,207 %0,043 %×4,9
Euan0,668 %0,139 %×4,8
Angus0,316 %0,076 %×4,1
Rory0,507 %0,164 %×3,1
Lewis2,487 %1,235 %×2,0

Cualquier fila aislada podría explicarse de otro modo. Once filas que apuntan en la misma dirección, con las magnitudes ordenadas exactamente como las ordenaría la singularidad regional, no.

Pero la mitad importante de esta prueba es la dirección contraria, y es la mitad que la gente se salta. Un fichero regional no se limita a añadir color local. Borra los nombres de la mayoría:

NombreProporción en EscociaProporción en el Reino UnidoCociente
Mohammed0,224 %0,921 %×0,24
Amelia0,270 %0,906 %×0,30
Isabella0,194 %0,630 %×0,31
Oliver0,634 %1,784 %×0,36
Harry0,606 %1,614 %×0,38

Oliver y Harry estaban entre los nombres de niño más comunes del país durante esa década, y el fichero les asignaba aproximadamente un tercio de su peso real. Mohammed aparecía rebajado en un factor cuatro, porque el subterritorio del que procedían realmente los datos tiene una población surasiática mucho menor que el país en su conjunto.

Ese es el daño que importa. Sobrerrepresentar Eilidh vuelve pintoresco un conjunto de datos. Infrarrepresentar en 3× la verdadera cabeza de la distribución lo vuelve erróneo sobre el caso corriente, que es el caso sobre el que se le preguntará la mayor parte del tiempo.

Prueba 3: solapamiento de puestos — y por qué hay que aplicarla a cada segmento

La versión tosca de la prueba 2. Tome el top 20 del fichero y el top 20 de la distribución nacional y cuente la intersección.

SegmentoEntradas comunes en el top 20
Niños8 de 20
Niñas13 de 20

Doce de los veinte nombres de niño más comunes del fichero no figuraban en absoluto en el top veinte del país: Cameron, Liam, Jamie, Kyle, Adam, Dylan, Ben, Connor, Andrew, Aaron, Logan, Alexander. A la inversa, Thomas, Oliver, Harry, William, Samuel, Joseph, Charlie, Benjamin, Ethan, George, Alfie y Luke estaban todos en el top veinte nacional y ninguno de ellos figuraba en el del fichero.

Fíjese ahora en la asimetría entre las dos filas, porque ahí está el punto metodológico. 8/20 en niños es un fracaso clamoroso. 13/20 en niñas es la clase de cifra ante la que uno se encoge de hombros. El mismo fichero, el mismo defecto, la misma fuente, y un segmento de él habría pasado una revisión superficial.

Si sus datos están divididos en segmentos — por sexo, por año, por región, por categoría —, aplique cada comprobación a cada segmento. Un defecto uniforme en los datos no lo es en su visibilidad.

Por qué esto ocurre tan a menudo

La razón no es el descuido. Es que la disponibilidad de datos está inversamente correlacionada con el tamaño del territorio, y nadie lo advierte porque la disponibilidad parece una propiedad del mundo y no un sesgo en la muestra.

Esta es la forma concreta que adopta en un país. Tres organismos de registro civil publican recuentos de nacimientos por nombre para el Reino Unido:

Organismo de registro civilTerritorioAños publicados con recuentosRegla de supresión
NRSEscociadesde 1935publica hasta 1 nacimiento
ONSInglaterra y Galesdesde 1996suprime los recuentos de 2 o menos
NISRAIrlanda del Nortedesde 1997suprime los recuentos inferiores a 3

El más pequeño de los tres territorios publica el historial más largo, en un único fichero plano y sin supresión alguna. Si quiere datos por nombre del Reino Unido anteriores a 1996, Escocia no es la opción cómoda: es la única opción. Todo el que alguna vez ha necesitado nombres de pila británicos de mediados de siglo ha chocado con ese muro, y el movimiento tentador consiste en tomar el fichero escocés, multiplicarlo por 12 y llamarlo Gran Bretaña.

Nos abstuvimos de hacerlo muy deliberadamente al reconstruir los datos, y la razón es este artículo: escalar un fichero regional hasta los totales nacionales corrige la magnitud y conserva la composición. Se obtiene un fichero que pasa la prueba 1 y falla la prueba 2 con más fuerza que antes, porque ahora Blair lleva asociadas cifras de tamaño nacional.

La misma trampa, con la misma forma, en otro punto de nuestros propios datos: los únicos ficheros de nacimientos por nombre que pudimos obtener para Australia y Canadá cubren Nueva Gales del Sur y la Columbia Británica — un estado y una provincia, cada uno de en torno a un cuarto o un tercio de su país. Ambos se publican con limpieza, ambos aparecen etiquetados con su región en la fuente, y ambos estarían en una carpeta con el nombre de un país si nadie lo hubiera comprobado.

Qué hicimos al respecto y qué no pudimos hacer

Solo una década pudo reconstruirse honestamente. La ventana 2001–2010 es la única en la que publican los tres organismos, de modo que esa década agrega ahora los tres. El resultado de la fusión merece mostrarse, porque sirve además como comprobación de que la propia fusión no está sesgada:

Organismo de registro civilProporción de los nacimientos fusionados 2001–2010Proporción de la población del Reino Unido
ONS88,84 %89,6 %
NRS8,08 %8,1 %
NISRA3,08 %2,8 %

Sumar los recuentos brutos sobre años idénticos da automáticamente a cada territorio su peso verdadero; no se aplica ninguna ponderación manual, y la discrepancia residual con las proporciones de población es como mucho de 0,6 puntos. Si tiene que ponderar la fusión a mano para que parezca correcta, es que sus años no cuadran.

Las décadas de 1940 a 1990 siguen siendo escocesas, porque no existe ninguna fuente que las convierta en otra cosa. Eso está ahora escrito junto a los datos, en lugar de quedar para que lo descubra la siguiente persona. Una limitación que se ha medido y etiquetado es un hecho sobre su conjunto de datos. La misma limitación sin documentar es un defecto que se regenera: hemos visto reabrirse dos veces la misma tarea fantasma porque una nota consignaba una corrección sin consignar su alcance.

La lista de comprobación

  1. Sume los contadores y compárelos con un total oficial. No hace falta ningún conocimiento del dominio. Cualquier desviación superior a un factor 2 aproximado exige una explicación antes de que use el fichero para nada; un orden de magnitud significa que tiene entre manos otra población.
  2. Compare cada subtotal por separado, no solo el total general. Reproducir una fuente candidata hasta la unidad en un segmento convierte una sospecha en demostración, y los segmentos mal alineados salen a la luz de propina — el nuestro estaba etiquetado como si cubriera una década y cubría cinco años.
  3. Verifique la ventana temporal frente a la etiqueta. No «¿cubre 1941–2010?» sino «¿contiene cada periodo los años que dice contener?». Dos de nuestros siete periodos no lo hacían, y en uno de ellos el déficit era del 21 %.
  4. Pruebe los marcadores geográficos en ambas direcciones. La sobrerrepresentación identifica la región; la infrarrepresentación mide el daño. Nuestro fichero regional infló un nombre local en 12× y desinfló dos de los nombres más comunes del país hasta un tercio.
  5. Cuente las unidades administrativas. Un fichero nacional debería contener aproximadamente el número de regiones, provincias o distritos que tiene el país. El equivalente a una sola región, o un subconjunto sospechosamente redondo, es el mismo defecto visto desde otro ángulo.
  6. Aplique cada comprobación a cada segmento. El nuestro fallaba con 8/20 en una mitad y con 13/20 en la otra. Comprobar una mitad es no comprobar nada.
  7. Pregunte quién publica antes de preguntar qué se publica. Si un subterritorio dispone de un organismo estadístico inusualmente generoso, la oferta mundial de datos sobre ese país queda discretamente sesgada hacia él — y su conjunto de datos hereda el sesgo, lo haya elegido alguien o no.

Datos actualizados a 2026-07-21

Todas las cifras se recalcularon el 21 de julio de 2026 directamente a partir de los ficheros publicados por los organismos de registro civil que se enumeran más abajo, y no a partir de nuestras propias notas. «Proporción en Escocia» y «proporción en el Reino Unido» son proporciones de los nacimientos inscritos en 2001–2010, la única década cubierta por los tres organismos; los cocientes son la división de esas dos proporciones. La estimación de 25–30 millones de nacimientos de niños en el Reino Unido a lo largo de 1946–2008 es derivada mediante escalado, no está tomada de una publicación, y se usa únicamente como comparación de orden de magnitud.

⚠ Las inscripciones de nacimiento no son portadores vivos. Cada cifra que aparece aquí describe a personas nacidas en un periodo, que es la base más sólida disponible para los nombres de pila británicos — ningún censo del Reino Unido publica recuentos de nombres de pila.

Fuentes:

  • National Records of Scotland (NRS) — listas completas de nombres de pila con recuentos, por año: tablas del top 100 para 1935–1973 y listas completas para 1974–2020. NRS publica los recuentos hasta un solo nacimiento. <nrscotland.gov.uk/statistics-and-data/st…;
  • Office for National Statistics (ONS)Baby names in England and Wales, recuentos por nombre 1996–2025; los recuentos de 2 o menos se suprimen. <ons.gov.uk/peoplepopulationandcom…;
  • Northern Ireland Statistics and Research Agency (NISRA) — estadísticas de nombres de bebé, recuentos por nombre 1997–2025; los recuentos inferiores a 3 se suprimen. A partir de 2008 las tablas se desglosan por distrito de gobierno local, con una fila residual sin asignar que debe sumarse, no tratarse como un total. <nisra.gov.uk/statistics/births-deat…;
  • Proporciones de la población del Reino Unido por nación constitutiva, 2020, usadas únicamente como comprobación de plausibilidad de la fusión.

Un artículo complementario sobre el mismo modo de fallo tomado por el otro extremo — conjuntos de datos honestos sobre su alcance pero que se fusionan de todos modos — es Capas migratorias en las cohortes de nacimiento. Para la taxonomía general de las trampas de los datos de frecuencia, véase Cómo auditar un conjunto de datos de frecuencia de nombres.

← Artículos