Wie Varify die Signifikanz berechnet
Kurz gefasst
Der Artikel erklärt, wie Varify Testergebnisse statistisch auswertet. Standardmäßig wird eine frequentistische Methode mit einseitigen Tests verwendet, die schnell zeigt, ob eine Variante besser abschneidet. Im Pro Plan stehen zusätzlich eine zweiseitige frequentistische Methode und eine bayessche Methode zur Verfügung. Die bayessche Methode zeigt außerdem eine Laufzeitprognose, die abschätzt, wann 95 % Signifikanz erreicht wird. Zudem wird erklärt, warum längere Laufzeiten und wenige Metriken - besonders bei A/A-Tests - wichtig sind, um Fehlentscheidungen durch Zufall zu vermeiden.
Berechnung der Signifikanz in app.varify.io
Standardmäßig verwendet Varify eine statistische, frequentistische Methode zur Auswertung von Testergebnissen. Dabei wird berechnet, wie wahrscheinlich es ist, dass ein Unterschied zwischen der Variante und dem Original zufällig entstanden ist. Wenn Zufall so weit wie möglich ausgeschlossen werden kann, zeigt Varify den Kehrwert des berechneten p-Werts an – die sogenannte Signifikanz. Liegt dieser Wert über 95 %, wird das Ergebnis im Tool als signifikant angezeigt.
Statistische Methoden im Überblick
Varify bietet drei statistische Methoden zur Analyse von A/B-Tests. Welche Methoden verfügbar sind, hängt vom gewählten Plan ab. Die Methode wird zentral auf Account-Ebene festgelegt und gilt dann für alle Experimente in diesem Account – sie kann nicht pro Experiment ausgewählt werden. Die Methode kann unter „Advanced Tracking Setup.“ konfiguriert werden.
Einseitiger frequentistischer Test (Standard)
Standardmäßig verwendet Varify zwei etablierte einseitige statistische Tests:
- Ein einseitiger Chi-Quadrat-Test wird für binomiale Zielgrößen verwendet (z. B. Klickrate, Konversionsrate).
- Für Umsatz- oder Wertmetriken (z. B. durchschnittlicher Bestellwert, Umsatz pro Besucher) wird ein einseitiger Student-t-Test verwendet.
Diese einseitigen Tests wurden bewusst gewählt. Sie liefern schneller Ergebnisse, da sie weniger konservativ rechnen als zweiseitige Methoden. So kannst du früher erkennen, ob eine Variante wahrscheinlich besser abschneidet.
Das hat natürlich auch einen Nachteil: Wenn ein Test nur sehr kurz läuft oder viele Metriken gleichzeitig ausgewertet werden, steigt die Wahrscheinlichkeit für ein falsch-positives Ergebnis - also ein Ergebnis, das signifikant erscheint, obwohl es eigentlich nur Zufall war.
Zweiseitiger Frequentistischer Test (Pro Plan)
Im Pro Plan kann diese Account-Einstellung alternativ auf eine zweiseitige frequentistische Methode umgestellt werden – die Änderung wirkt sich dann auf alle Experimente im Account aus. Es werden dieselben statistischen Tests verwendet (Chi-Quadrat oder Student’s t-Test), jedoch in einer zweiseitigen Version. Der Unterschied: Ein zweiseitiger Test prüft nicht nur, ob eine Variante besser abschneidet, sondern auch, ob sie schlechter abschneidet. Diese Methode ist konservativer und benötigt in der Regel mehr Daten, um statistische Signifikanz zu erreichen – liefert dafür aber ein robusteres Ergebnis in beide Richtungen.
Bayes'sche Methode (je nach Plan)
Die Bayes'sche Methode ist ebenfalls im Pro Plan verfügbar. Im Gegensatz zum frequentistischen Ansatz berechnet sie keine p-Werte, sondern eine Wahrscheinlichkeit, dass eine Variante besser ist als das Original. Dadurch sind die Ergebnisse oft intuitiver zu interpretieren.
Ein weiterer Vorteil: Mit der Bayes'schen Methode zeigt Varify eine Laufzeitprognose an, die abschätzt, wann eine Signifikanz von 95 % voraussichtlich erreicht wird. So kannst du während des Tests besser einschätzen, wie lange der Test laufen sollte.
Best Practices für zuverlässige Ergebnisse
Unabhängig von der gewählten Methode ist es besser, etwas länger zu testen, damit sich die Ergebnisse stabilisieren und du zuverlässiger beurteilen kannst, ob eine Variante wirklich besser ist.
Insbesondere bei A/A-Tests ist es wichtig, nur wenige Ziele hinzuzufügen. Die Alpha-Fehler-Kumulierung erhöht mit jeder weiteren Metrik die Wahrscheinlichkeit eines falsch-positiven Ergebnisses - also eines vermeintlichen Gewinners, der tatsächlich keiner ist.
Best Practices für A/A-Tests:
- Dauer: mindestens 10 Tage
- Mindestens 500 Conversions pro Variante
- Maximal 3 Ziele hinzufügen, mit Fokus auf den Haupt-KPI
- Signifikanzwerte, die zwischenzeitlich auftreten, sollten ignoriert werden - entscheidend ist das Endergebnis. Nur so bleibt die Falsch-Positiv-Rate niedrig und die Ergebnisse wirklich zuverlässig.
Eigene Berechnung der Signifikanz mit einem Signifikanzrechner
Überprüfe deine A/B-Test-Ergebnisse auf signifikante Unterschiede. Dafür stellt Varify.io einen Signifikanzrechner bereit.
