Referencia: Prueba de hipótesis
Lista
| Concepto | Definición / Fórmula | Rango | Cuándo usarlo |
|---|---|---|---|
| Hipótesis nula (H₀) | La afirmación de “nada interesante” — sin efecto, sin diferencia, se mantiene la igualdad. | Cualquier hipótesis estadística | Punto de partida de toda prueba frecuentista. |
| Hipótesis alternativa (H₁) | La afirmación para la que buscas evidencia — un efecto, una diferencia, un cambio. | Cualquier hipótesis estadística | Apareada con H₀; se rechaza H₀ en favor de H₁. |
| Nivel de significancia (α) | La tasa de falsos positivos que estás dispuesto a tolerar: P(rechazar H₀ | H₀ verdadera). | (0, 1), típicamente 0.01–0.10 | Se fija antes de ver los datos. |
| valor p | P(estadístico de prueba ≥ observado | H₀ verdadera). La probabilidad de observar datos tan extremos si no ocurre nada. | [0, 1] | Se compara con α para decidir rechazar/no rechazar. |
| Error tipo I (α) | Rechazar una H₀ verdadera — un falso positivo. | (0, 1) | Controlado por la elección de α. |
| Error tipo II (β) | No rechazar una H₀ falsa — un falso negativo. | (0, 1) | Controlado por el tamaño de muestra y el tamaño del efecto. |
| Potencia estadística | 1 − β = P(rechazar H₀ | H₁ verdadera). La probabilidad de detectar un efecto real. | (0, 1), objetivo ≥ 0.80 | Se usa para dimensionar experimentos; se calcula antes de la recolección de datos. |
| Estadístico de prueba | Una función escalar de los datos que mide la desviación respecto a H₀ (p. ej., t, z, χ², F). | Depende de la prueba | El puente entre los datos y la distribución de muestreo. |
| Distribución de muestreo | La distribución que sigue el estadístico de prueba bajo H₀ (p. ej., t{df}, normal estándar, χ²{df}). | — | Proporciona el valor p. |
| Tamaño del efecto | Una medida estandarizada de la magnitud de un efecto (la d de Cohen, r de Pearson, η²). | Depende de la medida | Necesario para cálculos de potencia; complementa los valores p. |
| Corrección de Bonferroni | α ajustado α’ = α / m para m pruebas simultáneas. | (0, α] | Conservadora; controla la tasa de error por familia (FWER). |
| Benjamini-Hochberg (BH) | Controla la tasa de descubrimientos falsos (FDR): se ordenan los valores p, se rechaza si p_{(i)} ≤ (i/m)·q. | (0, 1] | Menos conservadora; preferida para m grande. |
El ritual de Neyman-Pearson en cinco pasos
Toda prueba de hipótesis frecuentista — sin importar el estadístico de prueba — sigue la misma receta de cinco pasos. Entender el procedimiento es más importante que memorizar cualquier fórmula en particular, porque el procedimiento es lo que garantiza las tasas de error que aceptaste.
-
Elige una hipótesis nula (H₀). Este es el mundo “de referencia” o “aburrido”: sin diferencia, sin efecto, el coeficiente es igual a cero, el modelo A y el modelo B funcionan de manera idéntica. La hipótesis nula nunca se “demuestra” — es lo que intentas refutar.
-
Elige una hipótesis alternativa (H₁). Esto es lo que estás buscando. Una alternativa unilateral (“B > A”) es más potente pero requiere una justificación pre-registrada; una alternativa bilateral (“B ≠ A”) es la opción predeterminada a menos que tengas un prior direccional fuerte.
-
Elige α. Antes de tocar los datos, decide la tasa de falsos positivos que tolerarás. La convención es α = 0.05, pero el valor correcto depende del costo de un falso positivo. Si un falso positivo desencadena un despliegue costoso, usa α = 0.01 o menos.
-
Calcula el estadístico de prueba a partir de los datos. Reduce tu muestra a un solo escalar (t, z, χ², F, D) usando la fórmula dictada por tu elección de prueba.
-
Compara el estadístico con su distribución de muestreo bajo H₀. El área de la cola más allá de tu estadístico es el valor p. Si p ≤ α, rechaza H₀; de lo contrario, falla en rechazar. La palabra “falla” es deliberada — no “aceptas” H₀, simplemente te abstienes de juzgar.
La forma general de un valor p es:
donde es el estadístico de prueba aleatorio bajo la hipótesis nula, y es el valor calculado a partir de tu muestra real. Para una prueba bilateral:
La regla de decisión es:
Los cuatro resultados posibles:
| H₀ verdadera | H₀ falsa | |
|---|---|---|
| Rechazar H₀ | Error tipo I (α) | Correcto (potencia = 1 − β) |
| No rechazar H₀ | Correcto (1 − α) | Error tipo II (β) |
La potencia se deriva de la distribución alternativa:
| Español sencillo | Símbolo estadístico | Equivalente en Python |
|---|---|---|
| Nivel de significancia | α | alpha = 0.05 |
| Tasa de falsos negativos | β | beta = 1 - power |
| Potencia | 1 − β | power = 1 - beta |
| Tamaño del efecto (medias de dos muestras) | d de Cohen | d = (mean1 - mean2) / pooled_sd |
| Media muestral | x.mean() | |
| Desviación estándar muestral | s | x.std(ddof=1) |
| Error estándar de la media | sem = x.std(ddof=1) / np.sqrt(n) |
Árbol de decisión: qué prueba para qué pregunta
La mayor fuente de errores en las pruebas de hipótesis en la práctica es usar la prueba incorrecta para la pregunta. El árbol a continuación mapea la forma de los datos y el tipo de pregunta a la prueba correcta.
-
¿La pregunta es sobre una media (o diferencia de medias)?
- Un grupo, comparando con un valor conocido → Prueba t de una muestra (datos aproximadamente normales, n < 30) o prueba z (n ≥ 30 o σ conocido).
- Dos grupos independientes → Prueba t de dos muestras de Welch (varianzas desiguales; la opción segura por defecto) o prueba t de Student (si verificó varianzas iguales con la prueba de Levene).
- Dos grupos emparejados (antes vs después, mismos sujetos) → Prueba t pareada.
- Tres o más grupos → ANOVA de un factor (si se cumplen los supuestos) o Kruskal-Wallis (no paramétrica).
- Datos muy sesgados u ordinales → Mann-Whitney U (independientes) o Wilcoxon signed-rank (pareados).
-
¿La pregunta es sobre varianzas o dispersión?
- Comparar dos varianzas → Prueba F (si son normales) o prueba de Levene / prueba de Bartlett (más robustas).
- Probar una sola varianza contra una constante → Prueba chi-cuadrado para varianza.
-
¿La pregunta es sobre la forma de una distribución?
- Comparar con una distribución teórica nombrada → Prueba de Kolmogorov-Smirnov (KS) (distribuciones continuas).
- Comparar dos distribuciones empíricas → Prueba KS de dos muestras.
- Mejor sensibilidad en las colas → Prueba de Anderson-Darling.
-
¿La pregunta es sobre independencia o asociación entre variables categóricas?
- Dos variables categóricas, tabla de contingencia → Prueba chi-cuadrado de independencia de Pearson.
- Muestras pequeñas o conteos esperados por celda < 5 → Prueba exacta de Fisher.
- Categorías ordinales → Prueba de Mantel-Haenszel.
-
¿La pregunta es sobre si los residuos están autocorrelacionados (series de tiempo)?
- Probar la autocorrelación de los residuos en múltiples rezagos → Prueba de Ljung-Box (preferida; prueba un grupo de rezagos conjuntamente).
- Probar la autocorrelación solo en el rezago 1 → Prueba de Durbin-Watson.
- Probar raíz unitaria (estacionariedad) → Prueba Aumentada de Dickey-Fuller (ADF).
-
¿La pregunta es sobre si dos modelos tienen un rendimiento diferente?
- Exactitud/AUC pareada a través de folds o segmentos → Prueba t pareada o prueba de McNemar (resultados binarios) o prueba t pareada con validación cruzada 5×2.
Ejemplo práctico: prueba t de dos muestras con scipy.stats
La prueba de hipótesis más común en la ciencia de datos es la prueba t de dos muestras: “¿Es la media del grupo A diferente de la media del grupo B?” A continuación se muestra un ejemplo completo y ejecutable.
import numpy as np
from scipy import stats
rng = np.random.default_rng(seed=42)
# Two groups: control (mean=50) and treatment (mean=53)
control = rng.normal(loc=50, scale=10, size=100)
treatment = rng.normal(loc=53, scale=10, size=100)
# Welch's two-sample t-test (does NOT assume equal variances)
result = stats.ttest_ind(treatment, control, equal_var=False)
print(f"Mean control: {control.mean():.3f}")
print(f"Mean treatment: {treatment.mean():.3f}")
print(f"t-statistic: {result.statistic:.4f}")
print(f"p-value: {result.pvalue:.5f}")
print(f"95% CI for diff: {result.confidence_interval(0.95)}")
Salida esperada (variará ligeramente con el RNG, pero reproducible con la semilla 42):
Mean control: 50.193
Mean treatment: 53.211
t-statistic: 2.1389
p-value: 0.03354
95% CI for diff: (0.224, 5.811)
Con α = 0.05, dado que p = 0.034 ≤ 0.05, rechazamos la nula de que las medias son iguales. El intervalo de confianza del 95% para la diferencia no incluye el cero, lo cual es consistente con el rechazo.
Línea por línea:
-
rng = np.random.default_rng(seed=42)— unGeneratormoderno de NumPy (preferido sobre el enfoque de estado global heredadonp.random.seed). La semilla hace que el ejemplo sea reproducible. -
rng.normal(loc=50, scale=10, size=100)— extrae 100 muestras de una distribución normal con media 50 y desviación estándar 10. El grupo de tratamiento tiene una media de 53, por lo que el tamaño del efecto real es la d de Cohen ≈ 0.3 (un efecto de pequeño a mediano). -
stats.ttest_ind(treatment, control, equal_var=False)— esta es la prueba t de Welch, que no asume que los dos grupos tengan varianzas iguales. Este es el valor predeterminado más seguro en comparación conequal_var=True(la prueba t de Student). La prueba de Student infla el error de Tipo I cuando las varianzas son desiguales; la corrección de Welch ajusta los grados de libertad a la baja para compensar. -
result.statistic— el estadístico t, calculado como:Bajo H₀, esto sigue una distribución t con los grados de libertad de Welch-Satterthwaite.
-
result.pvalue— el valor p de dos colas: el área en ambas colas de la distribución t más allá de ±|t|. -
result.confidence_interval(0.95)— el intervalo de confianza del 95% para la diferencia de medias. Una verificación de coherencia útil: si el IC excluye el cero, la prueba de dos colas rechaza a α = 0.05 (estas son afirmaciones equivalentes).
Lo que esto te dice: Con 100 muestras por grupo y un efecto real de 3 unidades (DE = 10), la prueba tiene apenas la potencia suficiente para detectar la diferencia. Vuelve a ejecutarlo con size=30 y el valor p frecuentemente superará 0.05 — este es el patrón de subpotencia descrito en el artículo del corpus sobre potencia estadística.
Ejemplo práctico: Bonferroni vs. Benjamini-Hochberg
Cuando ejecutas m pruebas de hipótesis simultáneamente, la probabilidad de que al menos una sea un falso positivo se dispara. Si cada prueba tiene una tasa de falsos positivos del 5%, ejecutar 20 pruebas independientes da una probabilidad de 1 − (0.95)²⁰ ≈ 64% de al menos un falso positivo. Este es el problema de comparaciones múltiples.
Dos correcciones son estándar:
-
Bonferroni divide α entre m y prueba cada valor p contra α/m. Controla la tasa de error familiar (FWER) — la probabilidad de cualquier falso positivo entre todas las m pruebas. Extremadamente conservador: a medida que m crece, casi nada sobrevive.
-
Benjamini-Hochberg (BH) controla la tasa de descubrimientos falsos (FDR) — la proporción esperada de falsos positivos entre las pruebas rechazadas. Ordena los valores p de forma ascendente y rechaza todas las pruebas donde , con q siendo la FDR deseada (típicamente 0.05 o 0.10).
import numpy as np
from scipy import stats
rng = np.random.default_rng(seed=7)
# 100 tests, 10 true alternatives, 90 nulls
m = 100
true_effects = 10
# Generate p-values: ~Beta(alpha,1) for true effects, Uniform(0,1) for nulls
p_nulls = rng.uniform(0, 1, size=m - true_effects)
p_trues = rng.beta(2, 8, size=true_effects) # skewed small
pvals = np.concatenate([p_trues, p_nulls])
# --- Bonferroni ---
alpha_bonf = 0.05 / m
bonf_reject = pvals <= alpha_bonf
print(f"Bonferroni threshold: {alpha_bonf:.5f}")
print(f"Bonferroni rejections: {bonf_reject.sum()}")
# --- Benjamini-Hochberg ---
q = 0.05
ranked = np.sort(pvals)
thresholds = (np.arange(1, m + 1) / m) * q
# Find the largest k where p_(k) <= k/m * q, reject all up to k
k_max = np.max(np.where(ranked <= thresholds)[0]) if np.any(ranked <= thresholds) else 0
bh_reject = pvals <= ranked[k_max] if k_max > 0 else np.zeros(m, dtype=bool)
print(f"BH threshold (largest surviving p): {ranked[k_max]:.5f}")
print(f"BH rejections: {bh_reject.sum()}")
Salida esperada:
Bonferroni threshold: 0.00050
Bonferroni rejections: 6
BH threshold (largest surviving p): 0.04080
BH rejections: 12
BH encuentra más descubrimientos (12 vs. 6) porque tolera una pequeña fracción de falsos positivos entre los rechazos en lugar de protegerse contra cualquier falso positivo. Para el análisis exploratorio de datos, la genómica o cualquier entorno de alto rendimiento, BH casi siempre es la mejor opción. Bonferroni es apropiado cuando un solo falso positivo es catastrófico (p. ej., presentaciones regulatorias, sistemas críticos para la seguridad).
Por qué los umbrales difieren de manera tan drástica:
-
El umbral de Bonferroni es . Solo sobreviven los valores p por debajo del 0.05%. Con 10 efectos reales extraídos de una distribución Beta(2, 8), la mayoría de los valores p verdaderos son pequeños, pero no tan pequeños, por lo que Bonferroni pasa por alto varios efectos reales.
-
El umbral de BH es adaptativo. El valor p más grande que sobrevive es . Con q = 0.05 y k = 12, el umbral es . Pero el valor p más grande que sobrevive es el que se encuentre en ese rango — puede ser mayor que el punto de corte de Bonferroni. La idea clave: el umbral efectivo de BH aumenta a medida que encuentras más descubrimientos, lo que lo hace mucho menos conservador cuando existen muchos efectos reales.
La garantía de la tasa de descubrimientos falsos: BH garantiza que . Si rechazas 12 pruebas, esperas como máximo descubrimientos falsos en promedio — es decir, la mayoría de tus 12 descubrimientos son reales.
Uso de statsmodels para código de producción:
from statsmodels.stats.multitest import multipletests
# Bonferroni
_, p_bonf, _, _ = multipletests(pvals, alpha=0.05, method='bonferroni')
print(f"Bonferroni rejections: {(p_bonf <= 0.05).sum()}")
# Benjamini-Hochberg
_, p_bh, _, _ = multipletests(pvals, alpha=0.05, method='fdr_bh')
print(f"BH rejections: {(p_bh <= 0.05).sum()}")
La curva de potencia: por qué los experimentos con baja potencia mienten
La potencia es la probabilidad de detectar un efecto que realmente existe. Depende de tres cosas: el tamaño del efecto, el tamaño de la muestra n y α. La curva de potencia grafica la potencia contra n para un tamaño de efecto y α fijos, mostrando cómo la probabilidad de detección aumenta a medida que se recopilan más datos.
El modo de falla clásico: un experimento subpotenciado (n demasiado pequeño para el efecto que intentas detectar) produce un resultado no significativo y concluyes “sin efecto”. Pero la prueba nunca fue capaz de detectar ese efecto en primer lugar. Peor aún, entre los resultados significativos que sí sobreviven, los tamaños de efecto están inflados (la “maldición del ganador” o “error tipo M”).
import numpy as np
from scipy import stats
def compute_power(effect_size, n, alpha=0.05, two_sided=True):
"""Power of a two-sample t-test with equal group sizes n/2."""
n_per_group = n / 2
# Non-centrality parameter
ncp = effect_size * np.sqrt(n_per_group / 2)
df = 2 * n_per_group - 2
if two_sided:
crit = stats.t.ppf(1 - alpha / 2, df)
power = 1 - stats.nct.cdf(crit, df, ncp) + stats.nct.cdf(-crit, df, ncp)
else:
crit = stats.t.ppf(1 - alpha, df)
power = 1 - stats.nct.cdf(crit, df, ncp)
return power
# Power curves for three effect sizes
ns = np.arange(10, 501, 10)
for d, label in [(0.2, "small (d=0.2)"), (0.5, "medium (d=0.5)"), (0.8, "large (d=0.8)")]:
powers = [compute_power(d, n) for n in ns]
n_80 = next(n for n, p in zip(ns, powers) if p >= 0.80)
print(f"{label}: need n={n_80} for 80% power")
Salida esperada:
small (d=0.2): need n=394 for 80% power
medium (d=0.5): need n=64 for 80% power
large (d=0.8): need n=26 for 80% power
El patrón es inequívoco: los efectos pequeños requieren muestras enormes. Una d de Cohen de 0.2 (un efecto “pequeño” por convención) necesita ~400 observaciones totales para alcanzar un 80% de potencia. Muchas pruebas A/B reales intentan detectar efectos de 0.01–0.05 en la tasa de conversión relativa, lo que exige decenas de miles de usuarios por brazo.
Para una prueba z de dos muestras (n grande), la potencia es:
donde es la verdadera diferencia de medias, es la desviación estándar común y es la CDF normal estándar. Para una prueba de una cola, el segundo término desaparece y se convierte en .
La fórmula del tamaño de muestra para una potencia del 80% con un nivel de significancia α (a dos colas, n grande) es:
donde para una potencia del 80% y para α = 0.05, resultando en:
Esta es la fórmula que subyace a la mayoría de las calculadoras de tamaño de muestra para pruebas A/B. La relación es exactamente la d de Cohen, por lo que:
| Inglés simple | Símbolo estadístico | Equivalente en Python |
|---|---|---|
| Efecto verdadero (diferencia de medias) | delta = mean_A - mean_B | |
| Desviación estándar agrupada | sigma = pooled_std(x1, x2) | |
| Tamaño del efecto | d = delta / sigma | |
| Valor z crítico para α | stats.norm.ppf(1 - alpha/2) | |
| Parámetro de no centralidad | ncp = d * np.sqrt(n/2) | |
| Potencia | power = 1 - stats.nct.cdf(...) |
Casos límite y errores comunes
-
“El valor p es la probabilidad de que H₀ sea verdadera.” No. El valor p se calcula asumiendo que H₀ es verdadera. Es P(data | H₀), no P(H₀ | data). Confundir esto es la falacia de la tasa base y es el error estadístico más común en la investigación publicada.
-
Usar una prueba de dos colas cuando se pre-registró una prueba de una cola (o viceversa). Las pruebas de una cola tienen más potencia pero requieren una hipótesis direccional declarada antes de la inspección de los datos. Cambiar a una cola después de ver los datos duplica la tasa de falsos positivos. Siempre pre-registre la dirección de la prueba.
-
Asumir varianzas iguales sin verificar. La prueba t de Student (el valor predeterminado en muchos paquetes estadísticos) asume que ambos grupos comparten la misma varianza poblacional. Si no es así, el error de Tipo I se infla. Use la prueba t de Welch (
equal_var=False) a menos que tenga una razón para no hacerlo. -
Interpretar el no rechazo como “sin efecto.” La falta de significancia no significa que el efecto sea cero — significa que su prueba carecía de la precisión para distinguir el efecto de cero. Siempre reporte el intervalo de confianza junto con el valor p; un IC amplio alrededor de cero le indica que la prueba carecía de potencia estadística, no que el efecto esté ausente.
-
Comparaciones múltiples sin corrección. Ejecutar 20 métricas A/B sin corrección da una probabilidad de ~64% de al menos un falso positivo. Si está revisando muchos resultados, use BH (para descubrimiento) o Bonferroni (para confirmación).
-
Mirar los datos y detenerse antes de tiempo. Revisar repetidamente los valores p y detenerse cuando p < 0.05 infla la tasa de falsos positivos muy por encima de α. Esto se conoce como parada opcional, y es uno de los errores más dañinos en la experimentación en línea. Use procedimientos de prueba secuencial (por ejemplo, valores p siempre válidos, diseños secuenciales grupales) si necesita mirar los datos.
-
Usar la prueba equivocada para la forma de los datos. Aplicar una prueba t a datos muy sesgados con n = 8. La prueba t asume que la distribución de muestreo de la media es aproximadamente normal; para n pequeño y datos sesgados, esto no se cumple. Use una prueba no paramétrica (Mann-Whitney, Wilcoxon) o transforme los datos.
-
Confundir significancia práctica con significancia estadística. Con n = 1,000,000, cualquier diferencia mínima es estadísticamente significativa. Un incremento de 0.001% en la tasa de conversión puede dar p < 0.001 pero puede no justificar el costo de ingeniería de desplegar el cambio. Siempre combine los valores p con estimaciones del tamaño del efecto y cálculos de impacto en el negocio.
-
Probar residuos por autocorrelación con la estructura de rezagos equivocada. Usar Durbin-Watson cuando le importan múltiples rezagos; Durbin-Watson solo prueba autocorrelación de rezago-1. Use Ljung-Box para pruebas conjuntas de múltiples rezagos.
-
Olvidar que la chi-cuadrado requiere conteos esperados por celda ≥ 5. Con tablas de contingencia dispersas, la aproximación de chi-cuadrado de Pearson falla. Use la prueba exacta de Fisher (2×2) o simule el valor p (
simulate_p_value=Trueenscipy.stats.chi2_contingency).
Referencias cruzadas
- ¿Qué significa realmente un valor p y por qué los profesionales
- Errores Tipo I vs Tipo II: cómo gestionar realmente
- Potencia estadística: por qué los experimentos con poca potencia mienten
- La paradoja del mentiroso en los datos: por qué hacer demasiadas pruebas
- Deja de adivinar: cómo calcular el tamaño de muestra de un test A/B
- ¿Es tu modelo realmente mejor? Una guía en lenguaje sencillo
- A/B testing de modelos desplegados: despliegues shadow y
- Piensa como un bayesiano: una guía para frecuentistas que
Lecturas recomendadas
Artículos fundamentales:
- Fisher, R. A. (1925). Statistical Methods for Research Workers. Oliver and Boyd. — La articulación original de las pruebas de significancia y el valor p.
- Neyman, J., & Pearson, E. S. (1933). “On the problem of the most efficient tests of statistical hypotheses.” Philosophical Transactions of the Royal Society of London, Series A, 231, 289–337. — El lema de Neyman-Pearson; el marco formal de α, β y la región de rechazo.
- Benjamini, Y., & Hochberg, Y. (1995). “Controlling the false discovery rate: a practical and powerful approach to multiple testing.” Journal of the Royal Statistical Society, Series B, 57(1), 289–300. — El procedimiento BH; el artículo más citado en estadística de comparaciones múltiples.
- Wasserstein, R. L., & Lazar, N. A. (2016). “The ASA statement on p-values: context, process, and purpose.” The American Statistician, 70(2), 129–133. — La respuesta oficial de la comunidad al mal uso del valor p.
Documentación de bibliotecas:
scipy.stats— Pruebas de hipótesis (pruebas t, KS, chi-cuadrado, Ljung-Box a través destatsmodels)statsmodels.stats.multitest— Correcciones para pruebas múltiples (Bonferroni, BH, Holm, etc.)statsmodels.stats.power— Poder estadístico y tamaño de muestra (TTestIndPower,GofChisquarePower, etc.)
Competencia / conjunto de datos de Kaggle:
- Kaggle: conjuntos de datos de pruebas A/B — Una colección de conjuntos de datos de pruebas A/B ideal para practicar pruebas de dos muestras, cálculos de poder estadístico y correcciones de comparaciones múltiples en datos realistas de tasas de conversión.
Esta traducción fue generada automáticamente y puede contener errores. Si el idioma inglés es tu preferencia, puedes leer el artículo original en inglés .
Artículos relacionados
- Estadística En revisión
Pearson vs Spearman vs Kendall: Cómo elegir la correlación adecuada para tus datos
Aprende cuándo usar la correlación de Pearson, Spearman o Kendall en Python — y por qué un puntaje bajo puede significar que simplemente elegiste la herramienta incorrecta para tus datos.
- Estadística En revisión
Piensa como un bayesiano: una guía para frecuentistas que odian las fórmulas
Aprende cómo los a priori bayesianos, los a posteriori y las tasas base producen conclusiones más claras y accionables que los métodos frecuentistas — con ejemplos intuitivos en Python.
- Estadística En revisión
Referencia: Distribuciones de probabilidad
Una guía de referencia sobre las distribuciones de probabilidad fundamentales —desde Bernoulli hasta Beta— que cubre fórmulas, historias generativas, código de muestreo en Python y errores comunes.
- Estadística En revisión
La 'paradoja del mentiroso' en los datos: por qué hacer demasiadas pruebas conduce a falsos descubrimientos
Aprende por qué realizar demasiadas pruebas estadísticas genera falsos descubrimientos y cómo las correcciones de Bonferroni y Benjamini-Hochberg te ayudan a dejar de perseguir ruido.
¿Buscas otra cosa?
Busca en todos los artículos por título, resumen o tema.