Skip to main content

Calcula el valor p a partir de una puntuación z o una prueba t para determinar la significación estadística.

Introduce valores para ver el resultado.

Guía: valor p y significación estadística

Valor p es la probabilidad de obtener resultados al menos tan extremos como los observados, suponiendo cierta la hipótesis nula. En otras palabras, mide hasta qué punto los datos contradicen la hipótesis de que no hay efecto ni diferencia.

Interpretar los valores p: Un valor p bajo (normalmente por debajo de 0,05) significa que el resultado sería poco probable si la hipótesis nula fuera cierta. Eso lleva a rechazar la hipótesis nula y aceptar la alternativa. Un valor p alto (por encima de 0,05) significa que no hay pruebas suficientes para rechazar la hipótesis nula.

Prueba Z vs prueba t: La prueba Z se usa cuando se conoce la desviación típica de la población o cuando se dispone de una muestra grande (n mayor que 30). La prueba t se usa cuando la desviación típica poblacional es desconocida y se trabaja con una muestra menor. La prueba t es más conservadora con muestras pequeñas.

Significación estadística vs práctica: La significación estadística no siempre implica relevancia práctica. Con muestras grandes, incluso efectos pequeños pueden ser estadísticamente significativos. Por ejemplo, una diferencia de 0,01 en el precio medio puede ser estadísticamente significativa con un millón de observaciones, pero carecería de importancia práctica.

Limitaciones: El valor p no mide el tamaño del efecto ni la probabilidad de que la hipótesis nula sea cierta. Tampoco pueden compararse valores p de experimentos distintos sin contexto. Informa siempre del tamaño del efecto y de los intervalos de confianza junto a los valores p.

p < 0,05 no significa un 5% de probabilidad de equivocarse

El valor p responde a una pregunta estrecha: si la hipótesis nula fuera cierta, ¿con qué frecuencia aparecerían datos tan extremos? No dice nada sobre con qué frecuencia tus hallazgos significativos son en realidad falsos. Esa segunda cifra depende de cuán plausibles fueran tus hipótesis de partida, y suele ser bastante peor que un 5%.

Cómo funciona

  • Convierte una puntuación z o un estadístico t en un valor p, para contrastes de una o dos colas.
  • Compara el resultado con un umbral de significación elegido.
  • Devuelve el estadístico, no un veredicto: los errores viven en la interpretación.
p = P(datos al menos tan extremos | hipótesis nula cierta)

NO es P(hipótesis nula cierta | datos)

tasa de falsos descubrimientos = falsos positivos ÷ todos los resultados significativos
  falsos positivos = (1 − probabilidad previa) × alfa
  verdaderos positivos = probabilidad previa × potencia

Ejemplo resuelto

Mil hipótesis contrastadas con α = 0,05 y potencia del 80%, de las cuales una de cada diez es realmente cierta.

  1. 100 hipótesis ciertas × 80% de potencia = 80 verdaderos positivos
  2. 900 hipótesis falsas × 5% de alfa = 45 falsos positivos
  3. resultados significativos: 80 + 45 = 125
  4. tasa de falsos descubrimientos: 45 ÷ 125 = 36%

Más de un tercio de los hallazgos significativos son erróneos, pese a que todos superan p < 0,05. Si solo una hipótesis de cada cien fuera cierta, el 86% de los resultados significativos serían falsos.

Cómo leer el resultado

  • La probabilidad previa pesa muchísimo y casi nunca se declara. Contrastar hipótesis plausibles y guiadas por la teoría da una tasa de falsos descubrimientos cercana al 6%; rastrear hipótesis inverosímiles con una previa del 1% la eleva al 86% con el mismo umbral.
  • La baja potencia lo agrava. Con una previa del 10%, bajar la potencia del 80% al 20% lleva la tasa del 36% al 69%: un estudio infrapotenciado no solo pierde efectos reales, sino que vuelve poco fiables sus propios positivos.
  • Contrastar muchos desenlaces multiplica el problema. Veinte contrastes independientes con α = 0,05 dan alrededor de un 64% de probabilidad de al menos un falso positivo: de ahí los métodos de corrección y de ahí lo dañino de los contrastes múltiples no declarados.
  • La significación estadística no es el tamaño del efecto. Con una muestra lo bastante grande, una diferencia trivial alcanza p < 0,001 sin dejar de ser irrelevante en la práctica: lee siempre el intervalo de confianza junto al valor p.

Preguntas frecuentes

¿Qué significa entonces p = 0,03?
Que si la hipótesis nula fuera cierta, datos así de extremos o más ocurrirían el 3% de las veces. Es una afirmación sobre los datos dada una hipótesis, no sobre la hipótesis dados los datos, y no son intercambiables.
¿Conviene usar un umbral más estricto?
Ayuda, pero no lo resuelve. Pasar a α = 0,005 reduce los falsos positivos a la quinta parte, a costa de perder más efectos reales. Las palancas más eficaces son contrastar hipótesis plausibles, hacer estudios con potencia suficiente y preinscribir lo que se pretende contrastar.