Python & Data Science
Estadística En revisión

Intervalos de confianza: lo que realmente significa '95% de confianza' (sin dolores de cabeza con las matemáticas)

La mentira del ‘promedio’: por qué un solo número no es suficiente

Imagina que entras a una cafetería local y mides la estatura de todas las personas que están ahí. El promedio da exactamente 5’10”. Es tentador ir a casa y decirles a tus amigos: “La estatura promedio de las personas en esta ciudad es 5’10”.”

Pero ¿qué pasaría si hubieras entrado a una cafetería diferente a dos cuadras de distancia? ¿O si hubieras ido un martes en lugar de un sábado? El promedio podría haber sido 5’8” o 6’0”.

En la ciencia de datos, ese único número—el 5’10”—se llama una estimación puntual. Es una conjetura sobre la verdad. Y casi siempre está un poco equivocada. Solo estamos observando un grupo pequeño (una muestra) en lugar de todas las personas de la ciudad (la población). Por lo tanto, nuestro número varía cada vez que tomamos una nueva medición.

Podemos simular esto en Python. Aquí está la configuración: creamos una población “verdadera” y extraemos dos muestras aleatorias de ella.

import numpy as np

# Let's pretend the true average height of the whole city is 175cm
np.random.seed(42)
population_heights = np.random.normal(175, 10, 100000)

# Now, let's take two different samples of 30 people
sample_1 = np.random.choice(population_heights, 30)
sample_2 = np.random.choice(population_heights, 30)

print(f"Sample 1 Average: {sample_1.mean():.2f} cm")
print(f"Sample 2 Average: {sample_2.mean():.2f} cm")
print(f"Difference: {abs(sample_1.mean() - sample_2.mean()):.2f} cm")

En una ejecución, la Muestra 1 podría darnos 173.33cm y la Muestra 2 podría darnos 175.05cm. Misma ciudad, misma población—resultados diferentes. Si solo reportaras un número, estarías ignorando este “margen de variación.” Un solo número no es suficiente; necesitamos una forma de mostrar cuánto confiamos en nuestra conjetura.

Piénsalo como una red, no como una diana

Piensa en una estimación puntual como intentar darle a la diana con un solo dardo. Un Intervalo de Confianza (IC) es más como lanzar una red.

Si te digo: “La estatura promedio es 175cm”, te estoy entregando un dardo. Falla por un milímetro y habrás perdido la verdad. Pero si digo: “La estatura promedio está en algún punto entre 170cm y 180cm”, en cambio he lanzado una red.

Hay un equilibrio en juego. Una red más amplia significa mayor certeza de que he “atrapado” el promedio real. Usa una pequeña —digamos de 174cm a 176cm— y serás preciso, pero hay una gran posibilidad de que el valor real esté fuera de ese rango.

Calculemos un solo intervalo de confianza del 95% para una de nuestras muestras. Usaremos scipy para encargarnos de los cálculos matemáticos.

import scipy.stats as st

data = sample_1
confidence = 0.95

# Calculate the interval
mean = np.mean(data)
stderr = st.sem(data)
interval = st.t.interval(confidence, len(data)-1, loc=mean, scale=stderr)

print(f"Point Estimate: {mean:.2f}")
print(f"95% Confidence Interval: {interval[0]:.2f} to {interval[1]:.2f}")

Nuestra media muestral resultó ser de alrededor de 173cm, pero la red se extiende desde aproximadamente 169cm hasta 177cm. Reportamos un rango porque una muestra es una instantánea, no la imagen completa.

La parte más difícil: qué significa realmente el 95%

Esta es la parte más difícil de asimilar de la estadística: El 95% NO significa que haya un 95% de probabilidad de que el promedio verdadero esté dentro de tu intervalo específico.

Eso suena al revés. En la estadística frecuentista, el “Promedio verdadero” es un número fijo. No se mueve. Tu intervalo sí se mueve, cada vez que tomas una nueva muestra.

Lo que realmente significa: Si tomáramos 100 muestras diferentes y construyéramos 100 redes distintas, 95 contendrían el promedio verdadero. Cinco fallarían por completo. El “95%” describe el proceso, no el resultado específico que tienes en la mano.

Probemos esto con 100 simulaciones y veamos cuántas de nuestras redes atrapan la verdadera media poblacional de 175.

import matplotlib.pyplot as plt

true_mean = 175
success_count = 0
intervals = []

for i in range(100):
    sample = np.random.choice(population_heights, 30)
    mean = np.mean(sample)
    stderr = st.sem(sample)
    low, high = st.t.interval(0.95, len(sample)-1, loc=mean, scale=stderr)
    
    # Check if the true mean is inside this specific net
    is_inside = low <= true_mean <= high
    if is_inside: success_count += 1
    intervals.append((low, high, is_inside))

print(f"Out of 100 intervals, {success_count} caught the true mean.")

Al ejecutar esto, verás un número cercano a 95. Ese es el momento “¡Ajá!”. Algunas redes se desplazan demasiado a la izquierda, otras demasiado a la derecha. Pero el método se cumple el 95% de las veces.

La receta: error estándar y el número mágico 1.96

¿Qué hace que la red sea más ancha o más estrecha? Tres ingredientes controlan el ancho:

  1. Variación (Desviación Estándar): Si casi todos en la ciudad tienen la misma estatura, la red puede ser pequeña. Pero si algunas personas miden 4 pies y otras 7 pies —mucho ruido— necesitas una red mucho más grande para estar seguro.
  2. Tamaño de la Muestra (N): Esta es la que puedes controlar. Más datos estrechan la red. A medida que hablas con más personas, el margen de maniobra se reduce.
  3. El Multiplicador (1.96): Con un 95% de confianza, multiplicamos nuestro error por aproximadamente 1.96. Si subimos a un 99% de confianza, el multiplicador crece a aproximadamente 2.58, haciendo la red más ancha.

Ahora compara una muestra de 30 personas con una muestra de 3,000.

def get_interval_width(n):
    sample = np.random.choice(population_heights, n)
    low, high = st.t.interval(0.95, len(sample)-1, loc=np.mean(sample), scale=st.sem(sample))
    return high - low

print(f"Width with 30 people: {get_interval_width(30):.2f} cm")
print(f"Width with 3000 people: {get_interval_width(3000):.2f} cm")

El ancho para 3,000 personas es mucho menor —a menudo 10x menor. Más datos nos dan precisión. Nos estamos acercando, no solo adivinando.

Comprobémoslo con los datos: un ejemplo del mundo real

En la práctica, esto ocurre todo el tiempo en las pruebas A/B. Supongamos que rediseñas el botón de “Comprar ahora” en tu sitio.

  • Grupo A (Botón anterior): tasa de conversión del 5%.
  • Grupo B (Botón nuevo): tasa de conversión del 7%.

¿Es el nuevo botón realmente mejor? No necesariamente. Si el intervalo de confianza del Grupo A va de 4% a 6% y el del Grupo B va de 6% a 8%, se superponen exactamente en 6%. No puedes descartar la casualidad. Pero si el Grupo A se encuentra entre 4.1% y 4.9% y el Grupo B entre 6.5% y 7.5%, no hay superposición alguna.

Lo que esto significa para nosotros: Cuando los intervalos no se tocan, podemos afirmar con 95% de confianza que la diferencia es real: no solo una fluctuación aleatoria en los datos.

Lista de verificación final

  • Las estimaciones puntuales son conjeturas únicas, generalmente ligeramente incorrectas.
  • Los intervalos de confianza actúan como “redes” que te dan un rango de valores plausibles.
  • El 95% de confianza significa que el proceso funciona 95 de cada 100 veces.
  • Más datos reduce tu intervalo, lo que significa mayor precisión.
  • El solapamiento entre dos intervalos sugiere que una diferencia entre grupos podría ser simplemente ruido.

Así que ya tienes la “red”. Deja de reportar un solo promedio y empieza a reportar la verdad — incertidumbre incluida. A continuación, prueba elevar tu nivel de confianza al 99% y observa cómo responden los intervalos.

Comprueba tu comprensión

Las preguntas a continuación avanzan desde el simple recuerdo hasta el diseño abierto, siguiendo aproximadamente la Taxonomía de Bloom.

Recordar ¿Qué es una “estimación puntual” y por qué se describe un intervalo de confianza como una “red” en lugar de una “diana”?

Comprender En sus propias palabras, explique qué significa realmente tener un “95% de confianza”, utilizando el enfoque del artículo sobre 100 muestras diferentes que producen 100 intervalos diferentes.

Aplicar Usando los tres ingredientes del artículo (variación, tamaño de muestra y el multiplicador de 1.96), si duplicaras tu tamaño de muestra de 100 a 400 mientras la variación se mantiene igual, ¿aproximadamente cuánto más estrecho esperarías que se volviera tu intervalo de confianza (basado en el ejemplo de 30-vs-3000 del artículo)?

Analizar El ejemplo de prueba A/B del artículo dice que intervalos superpuestos (Grupo A: 4%-6%, Grupo B: 6%-8%) significan “no puedes estar completamente seguro de que la diferencia no sea solo suerte”. Explique paso a paso por qué los intervalos de confianza superpuestos no prueban automáticamente que no haya una diferencia real: ¿qué se está confundiendo si alguien trata “que los intervalos se superpongan” como prueba definitiva de “que no hay efecto”?

Evaluar El artículo recomienda ampliar el intervalo (usando un multiplicador mayor) para alcanzar un 99% de confianza en lugar de un 95%. Critique el compromiso: para una decisión de negocios como “¿debemos lanzar el nuevo botón?”, ¿qué se pierde al optar por defecto por un intervalo más amplio y conservador cuando se necesita tomar una decisión pronto?

Crear Diseñe un informe de intervalos de confianza para un gerente de producto: dada una muestra de 500 usuarios en la que un 12% hizo clic en una nueva función, describa qué intervalo calcularía (conceptualmente, usando la receta del artículo) y escriba una oración explicando el resultado de la manera en que le gustaría que un stakeholder no técnico lo entendiera correctamente.


Aplica lo que aprendiste

**Entregable:** Escribe una explicación oral de ~100 palabras que darías en una revisión con las partes interesadas cuando un VP pregunta: *"Entonces, ¿estás 95% seguro de que la verdadera tasa de conversión está entre 6.5% y 7.5%, verdad?"* Tu trabajo es corregir ese planteamiento sin perder la confianza de las partes interesadas en tu análisis. Basa tu respuesta en el ejemplo de prueba A/B del artículo (Grupo A: 4.1%–4.9%, Grupo B: 6.5%–7.5%).

Rúbrica (lista de verificación):

  • ✅ Reformula en torno a un rango/red en lugar de defender una única estimación puntual como la verdad.
  • ✅ Declara correctamente que 95% describe el proceso: si extrajéramos 100 muestras nuevas y construyéramos 100 intervalos, aproximadamente 95 contendrían el valor verdadero — no una probabilidad de 95% de que el valor verdadero se encuentre dentro de este intervalo específico.
  • ✅ Menciona al menos un impulsor del ancho del intervalo de la receta del artículo (tamaño de muestra, variación/desviación estándar, o el multiplicador de 1.96) para justificar por qué la red es tan ancha o estrecha como lo es.
  • ⚠️ Incluye la salvedad clave: la verdadera tasa de conversión es un número fijo; es el intervalo el que se mueve de muestra a muestra — por lo que nunca podemos saber si esta red particular de 6.5%–7.5% realmente la atrapó.

Esta traducción fue generada automáticamente y puede contener errores. Si el idioma inglés es tu preferencia, puedes leer el artículo original en inglés .

¿Buscas otra cosa?

Busca en todos los artículos por título, resumen o tema.