Skip to main content

Calculez la valeur p à partir d'un score z ou d'un test t pour déterminer la significativité statistique.

Saisissez des valeurs pour voir le résultat.

Guide : valeur p et signification statistique

Valeur p est la probabilité d'obtenir des résultats au moins aussi extrêmes que ceux observés, en supposant l'hypothèse nulle vraie. Autrement dit, elle mesure à quel point les données contredisent l'hypothèse d'absence d'effet ou de différence.

Interpréter les valeurs p : Une p-valeur faible (généralement inférieure à 0,05) signifie que le résultat serait peu probable si l'hypothèse nulle était vraie. Cela conduit à rejeter l'hypothèse nulle et à retenir l'alternative. Une p-valeur élevée (au-dessus de 0,05) signifie que les preuves sont insuffisantes pour rejeter l'hypothèse nulle.

Test Z vs test t : Le test Z s'utilise quand l'écart type de la population est connu ou quand l'échantillon est grand (n supérieur à 30). Le test t s'utilise quand l'écart type de la population est inconnu et que l'on travaille sur un échantillon plus petit. Le test t est plus conservateur sur les petits échantillons.

Signification statistique vs pratique : La significativité statistique n'équivaut pas toujours à une portée pratique. Sur de grands échantillons, même de petits effets peuvent être statistiquement significatifs. Une différence de 0,01 sur le prix moyen peut être statistiquement significative avec un million d'observations, sans avoir la moindre importance pratique.

Limites : La p-valeur ne mesure ni la taille de l'effet ni la probabilité que l'hypothèse nulle soit vraie. On ne peut pas non plus comparer des p-valeurs d'expériences différentes sans contexte. Indiquez toujours la taille d'effet et les intervalles de confiance à côté des p-valeurs.

p < 0,05 ne signifie pas 5% de risque de se tromper

La valeur p répond à une question étroite : si l'hypothèse nulle était vraie, à quelle fréquence observerait-on des données aussi extrêmes ? Elle ne dit rien de la fréquence à laquelle vos résultats significatifs sont en réalité faux. Ce second chiffre dépend de la plausibilité initiale de vos hypothèses, et il est le plus souvent bien pire que 5%.

Comment ça marche

  • Convertit un score z ou une statistique t en valeur p, pour des tests unilatéraux ou bilatéraux.
  • Compare le résultat à un seuil de significativité choisi.
  • Renvoie la statistique, pas un verdict : c'est dans l'interprétation que se logent les erreurs.
p = P(données au moins aussi extrêmes | hypothèse nulle vraie)

ce n'est PAS P(hypothèse nulle vraie | données)

taux de fausses découvertes = faux positifs ÷ tous les résultats significatifs
  faux positifs = (1 − probabilité a priori) × alpha
  vrais positifs = probabilité a priori × puissance

Exemple chiffré

Mille hypothèses testées à α = 0,05 avec une puissance de 80%, dont une sur dix est réellement vraie.

  1. 100 hypothèses vraies × 80% de puissance = 80 vrais positifs
  2. 900 hypothèses fausses × 5% d'alpha = 45 faux positifs
  3. résultats significatifs : 80 + 45 = 125
  4. taux de fausses découvertes : 45 ÷ 125 = 36%

Plus d'un tiers des résultats significatifs sont faux, alors que tous franchissent p < 0,05. Si une seule hypothèse sur cent était vraie, 86% des résultats significatifs seraient faux.

Lire le résultat

  • La probabilité a priori pèse énormément et n'est presque jamais énoncée. Tester des hypothèses plausibles, guidées par la théorie, donne un taux de fausses découvertes proche de 6% ; ratisser des hypothèses invraisemblables à 1% le porte à 86% avec le même seuil.
  • Une faible puissance aggrave le problème. À 1 chance sur 10 a priori, passer d'une puissance de 80% à 20% fait monter le taux de 36% à 69% : une étude sous-dimensionnée ne se contente pas de rater des effets réels, elle rend ses propres positifs peu fiables.
  • Tester de nombreux critères démultiplie le problème. Vingt tests indépendants à α = 0,05 donnent environ 64% de chances d'au moins un faux positif : d'où les méthodes de correction, et d'où la gravité des tests multiples non déclarés.
  • La significativité statistique n'est pas la taille d'effet. Avec un échantillon assez grand, une différence dérisoire atteint p < 0,001 tout en restant sans portée pratique — lisez toujours l'intervalle de confiance à côté de la valeur p.

Questions fréquentes

Que signifie alors p = 0,03 ?
Que si l'hypothèse nulle était vraie, des données aussi extrêmes ou davantage surviendraient dans 3% des cas. C'est un énoncé sur les données étant donné une hypothèse, non sur l'hypothèse étant donné les données — et ce n'est pas interchangeable.
Faut-il adopter un seuil plus strict ?
Cela aide sans régler la question. Passer à α = 0,005 divise les faux positifs par cinq, au prix de rater davantage d'effets réels. Les leviers plus efficaces sont de tester des hypothèses plausibles, de mener des études suffisamment puissantes et de préenregistrer ce que l'on compte tester.