Comment Varify calcule la significativité
En bref
Cet article explique comment Varify évalue statistiquement les résultats des tests. Par défaut, une méthode fréquentiste avec des tests unilatéraux est utilisée, ce qui permet de voir rapidement si une variante est plus performante. Dans le plan Pro, une méthode fréquentiste bilatérale ainsi qu'une méthode bayésienne sont également disponibles. La méthode bayésienne affiche également une prédiction de durée d'exécution qui estime le moment où une significativité de 95 % sera atteinte. L'article explique aussi pourquoi des durées d'exécution plus longues et peu de métriques - en particulier pour les tests A/A - sont importantes pour éviter des décisions erronées dues au hasard.
Calcul de la significativité dans app.varify.io
Par défaut, Varify utilise une méthode statistique fréquentiste pour évaluer les résultats des tests. Cela consiste à calculer la probabilité qu'une différence entre la variante et l'original soit survenue par hasard. Si le hasard peut être exclu dans la mesure du possible, Varify affiche l'inverse de la valeur p calculée - ce que l'on appelle la significativité. Si celle-ci est supérieure à 95 %, le résultat est affiché comme significatif dans l'outil.
Aperçu des méthodes statistiques
Varify propose trois méthodes statistiques pour analyser les tests A/B. Les méthodes disponibles dépendent du plan sélectionné. La méthode est définie de manière centralisée au niveau du compte et s'applique ensuite à toutes les expériences de ce compte—elle ne peut pas être sélectionnée par expérience. La méthode peut être configurée sous « Advanced Tracking Setup. ».
Test fréquentiste unilatéral (standard)
Par défaut, Varify utilise deux tests statistiques unilatéraux reconnus :
- Un test du chi carré unilatéral est utilisé pour les cibles binomiales (par ex. taux de clics, taux de conversion).
- Pour les métriques de vente ou de valeur (par ex. valeur moyenne de commande, revenu par visiteur), un test t de Student unilatéral est utilisé.
Ces tests unilatéraux ont été choisis délibérément. Ils fournissent des résultats plus rapidement car ils calculent de manière moins conservatrice que les méthodes bilatérales. Cela te permet de voir plus tôt si une variante est susceptible de mieux performer.
Bien sûr, cela a aussi un inconvénient : si un test tourne pendant une durée très courte ou si de nombreuses métriques sont évaluées en même temps, la probabilité d'un faux positif augmente - c'est-à-dire un résultat qui paraît significatif, alors qu'il s'agissait en réalité d'une simple coïncidence.
Test fréquentiste bilatéral (Pro Plan)
Dans le Pro Plan, ce paramètre de compte peut alternativement être basculé vers une méthode fréquentiste bilatérale (two-tailed)—le changement affecte alors toutes les expériences du compte. Les mêmes tests statistiques sont utilisés (chi carré ou test t de Student), mais dans une version bilatérale. La différence : un test bilatéral ne vérifie pas seulement si une variante performe mieux, mais aussi si elle performe moins bien. Cette méthode est plus conservatrice et nécessite généralement plus de données pour atteindre la significativité statistique—mais en contrepartie, elle fournit un résultat plus robuste dans les deux directions.
Méthode bayésienne (selon le plan)
La méthode bayésienne est également disponible dans le Pro Plan. Contrairement à l'approche fréquentiste, elle ne calcule pas de valeurs p, mais une probabilité qu'une variante soit meilleure que l'original. Cela rend souvent les résultats plus intuitifs à interpréter.
Un avantage supplémentaire : avec la méthode bayésienne, Varify affiche une prévision de durée qui estime quand une significativité de 95 % sera probablement atteinte. Cela te permet de mieux évaluer, pendant le test, combien de temps il devrait durer.
Bonnes pratiques pour des résultats fiables
Quelle que soit la méthode choisie, il est préférable de tester un peu plus longtemps afin que les résultats se stabilisent et que tu puisses juger plus fiablement si une variante est réellement meilleure.
Pour les tests A/A en particulier, il est important d'ajouter seulement quelques cibles. L'accumulation de l'erreur alpha augmente la probabilité d'un faux positif à chaque métrique supplémentaire - c'est-à-dire un gagnant supposé qui n'en est en réalité pas un.
Bonnes pratiques pour les tests A/A :
- Durée : au moins 10 jours
- Au moins 500 conversions par variante
- Ajouter un maximum de 3 cibles, en se concentrant sur le KPI principal
- Les valeurs de significativité qui apparaissent entre-temps doivent être ignorées - c'est le résultat final qui compte. C'est la seule façon de maintenir un faible taux de faux positifs et des résultats vraiment fiables.
Calcul propre de la significativité à l'aide d'un calculateur de significativité
Vérifiez les résultats de votre test A/B pour détecter des différences significatives. Pour cela, Varify.io propose un calculateur de signification.
