Come Varify calcola la significatività
In breve
L'articolo spiega come Varify valuta statisticamente i risultati dei test. Di default viene utilizzato un metodo frequentista con test a una coda, che mostra rapidamente se una variante ha una performance migliore. Nel piano Pro sono disponibili anche un metodo frequentista a due code e un metodo bayesiano. Il metodo bayesiano mostra anche una previsione della durata che stima quando viene raggiunta una significatività del 95%. Viene inoltre spiegato perché durate più lunghe e poche metriche - soprattutto per i test A/A - sono importanti per evitare decisioni sbagliate dovute al caso.
Calcolo della significatività in app.varify.io
Per impostazione predefinita, Varify utilizza un metodo statistico frequentista per valutare i risultati dei test. Questo implica calcolare quanto sia probabile che una differenza tra la variante e l'originale sia dovuta al caso. Se il caso può essere escluso nella misura massima possibile, Varify visualizza il reciproco del valore p calcolato - la cosiddetta significatività. Se questo è superiore al 95%, il risultato viene visualizzato come significativo nello strumento.
Metodi statistici a colpo d'occhio
Varify offre tre metodi statistici per analizzare i test A/B. I metodi disponibili dipendono dal piano selezionato. Il metodo viene impostato a livello centrale dell'account e si applica poi a tutti gli esperimenti di quell'account—non può essere selezionato per singolo esperimento. Il metodo può essere configurato in „Advanced Tracking Setup.“
Test frequentista a una coda (standard)
Per impostazione predefinita, Varify utilizza due test statistici unilaterali consolidati:
- Un test chi-quadrato unilaterale viene utilizzato per obiettivi binomiali (ad es. click rate, conversion rate).
- Per metriche di vendita o di valore (ad es. valore medio dell'ordine, ricavo per visitatore), viene utilizzato un test t di Student unilaterale.
Questi test unilaterali sono stati scelti deliberatamente. Forniscono risultati più velocemente perché calcolano in modo meno conservativo rispetto ai metodi bilaterali. Questo ti permette di vedere prima se una variante è probabilmente migliore.
Naturalmente, questo comporta anche uno svantaggio: se un test viene eseguito per un periodo molto breve o se vengono valutate molte metriche contemporaneamente, la probabilità di un falso positivo aumenta - cioè un risultato che appare significativo, anche se in realtà era solo una coincidenza.
Test Frequentista Bilaterale (Piano Pro)
Nel Pro Plan, questa impostazione dell'account può essere alternativamente commutata su un metodo frequentista a due code—la modifica riguarda quindi tutti gli esperimenti dell'account. Vengono utilizzati gli stessi test statistici (chi-quadrato o t-test di Student), ma in versione a due code. La differenza: un test a due code non verifica solo se una variante ha un rendimento migliore, ma anche se ha un rendimento peggiore. Questo metodo è più conservativo e in genere richiede più dati per raggiungere la significatività statistica—ma in cambio fornisce un risultato più robusto in entrambe le direzioni.
Metodo bayesiano (per piano)
Il metodo bayesiano è disponibile anche nel Piano Pro. A differenza dell'approccio frequentista, non calcola i valori p, ma una probabilità che una variante sia migliore dell'originale. Questo spesso rende i risultati più intuitivi da interpretare.
Un ulteriore vantaggio: con il metodo bayesiano, Varify mostra una previsione della durata che stima quando è probabile raggiungere il 95% di significatività. Questo ti permette di stimare meglio durante il test per quanto tempo il test dovrebbe durare.
Best practice per risultati affidabili
Indipendentemente dal metodo scelto, è meglio testare un po' più a lungo in modo che i risultati si stabilizzino e tu possa giudicare in modo più affidabile se una variante è davvero migliore.
In particolare per i test A/A, è importante aggiungere solo pochi target. L'accumulo dell'errore alfa aumenta la probabilità di un falso positivo con ogni metrica aggiuntiva, ovvero un presunto vincitore che in realtà non lo è.
Best practice per i test A/A:
- Durata: almeno 10 giorni
- Almeno 500 conversioni per variante
- Aggiungi al massimo 3 target, concentrandoti sul KPI principale
- I valori di significatività che si verificano nel frattempo dovrebbero essere ignorati: ciò che conta è il risultato finale. Questo è l'unico modo per mantenere basso il tasso di falsi positivi e i risultati veramente affidabili.
Calcolo autonomo della significatività tramite un calcolatore di significatività
Controlla i risultati del tuo test A/B per verificare differenze significative. A questo scopo Varify.io fornisce un calcolatore di significatività.
