Como a Varify calcula a significância
Em resumo
Este artigo explica como a Varify avalia estatisticamente os resultados dos testes. Por padrão, é usado um método frequentista com testes unilaterais, que mostra rapidamente se uma variante tem melhor desempenho. No plano Pro, também estão disponíveis um método frequentista bilateral e um método bayesiano. O método bayesiano também mostra uma previsão de duração que estima quando a significância de 95% será atingida. Também explica por que durações de execução mais longas e poucas métricas - especialmente para testes A/A - são importantes para evitar decisões erradas por acaso.
Cálculo da significância no app.varify.io
Por padrão, o Varify usa um método estatístico frequentista para avaliar os resultados dos testes. Isso envolve calcular a probabilidade de uma diferença entre a variante e o original ter ocorrido por acaso. Se o acaso puder ser descartado o máximo possível, o Varify exibe o recíproco do valor-p calculado - a chamada significância. Se este for superior a 95 %, o resultado é exibido como significativo na ferramenta.
Métodos estatísticos em resumo
A Varify oferece três métodos estatísticos para analisar testes A/B. Os métodos disponíveis dependem do plano selecionado. O método é definido centralmente ao nível da conta e depois aplica-se a todas as experiências dessa conta — não pode ser selecionado por experiência. O método pode ser configurado em „Advanced Tracking Setup.“
Teste frequentista unilateral (padrão)
Por padrão, a Varify usa dois testes estatísticos unilaterais estabelecidos:
- Um teste qui-quadrado unilateral é usado para metas binomiais (por exemplo, taxa de clique, taxa de conversão).
- Para métricas de vendas ou de valor (por exemplo, valor médio do pedido, receita por visitante), é usado um teste t de Student unilateral.
Estes testes unilaterais foram escolhidos deliberadamente. Eles entregam resultados mais rapidamente porque calculam de forma menos conservadora do que os métodos bilaterais. Isto permite-te ver mais cedo se uma variante tem probabilidade de ter um desempenho melhor.
Claro que isto também tem uma desvantagem: se um teste correr durante muito pouco tempo ou se muitas métricas forem avaliadas ao mesmo tempo, a probabilidade de um falso positivo aumenta - ou seja, um resultado que parece ser significativo, embora na realidade tenha sido apenas uma coincidência.
Teste Frequentista Bilateral (Plano Pro)
No Pro Plan, esta definição de conta pode alternativamente ser alterada para um método frequentista bicaudal — a alteração afeta então todas as experiências na conta. São utilizados os mesmos testes estatísticos (qui-quadrado ou teste t de Student), mas numa versão bicaudal. A diferença: um teste bicaudal não verifica apenas se uma variante tem melhor desempenho, mas também se tem pior desempenho. Este método é mais conservador e geralmente requer mais dados para atingir significância estatística — mas, em contrapartida, fornece um resultado mais robusto em ambas as direções.
Método Bayesiano (por plano)
O método Bayesiano também está disponível no Pro Plan. Ao contrário da abordagem frequentista, não calcula valores-p, mas sim uma probabilidade de que uma variante seja melhor do que o original. Isto torna frequentemente os resultados mais intuitivos de interpretar.
Uma vantagem adicional: Com o método Bayesiano, o Varify apresenta uma previsão de duração que estima quando é provável que se alcance 95 % de significância. Isto permite-te estimar melhor durante o teste quanto tempo este deve durar.
Melhores práticas para resultados fiáveis
Independentemente do método escolhido, é melhor testar um pouco mais para que os resultados se estabilizem e possas avaliar com mais confiabilidade se uma variante é realmente melhor.
Especialmente em testes A/A, é importante adicionar apenas alguns targets. O acúmulo de erro alfa aumenta a probabilidade de um falso positivo com cada métrica adicional - ou seja, um supposto vencedor que na realidade não é um vencedor.
Melhores práticas para testes A/A:
- Duração: pelo menos 10 dias
- Pelo menos 500 conversões por variante
- Adicionar no máximo 3 targets, com foco no KPI principal
- Os valores de significância que ocorrem no meio devem ser ignorados - o resultado final é o que conta. Esta é a única forma de manter a taxa de falsos positivos baixa e os resultados verdadeiramente confiáveis.
Cálculo próprio da significância usando uma calculadora de significância
Verifique os resultados do seu teste A/B para diferenças significativas. Para isso, o Varify.io fornece uma calculadora de significância.
