Pular para o conteúdo principal

Como a Varify calcula a significância

Última atualização em 17 de set. de 20263 min de leitura

Em resumo​

Este artigo explica como a Varify avalia estatisticamente os resultados dos testes. Por padrão, é usado um método frequentista com testes unilaterais, que mostra rapidamente se uma variante tem melhor desempenho. No plano Pro, também estão disponíveis um método frequentista bilateral e um método bayesiano. O método bayesiano também mostra uma previsão de duração que estima quando a significância de 95% será atingida. Também explica por que durações de execução mais longas e poucas métricas - especialmente para testes A/A - são importantes para evitar decisões erradas por acaso.

Cálculo da significância no app.varify.io​

Por padrão, o Varify usa um método estatístico frequentista para avaliar os resultados dos testes. Isso envolve calcular a probabilidade de uma diferença entre a variante e o original ter ocorrido por acaso. Se o acaso puder ser descartado o máximo possível, o Varify exibe o recíproco do valor-p calculado - a chamada significância. Se este for superior a 95 %, o resultado é exibido como significativo na ferramenta.

Métodos estatísticos em resumo​

A Varify oferece três métodos estatísticos para analisar testes A/B. Os métodos disponíveis dependem do plano selecionado. O método é definido centralmente ao nível da conta e depois aplica-se a todas as experiências dessa conta — não pode ser selecionado por experiência. O método pode ser configurado em „Advanced Tracking Setup.“

A definição de conta „Statistical Method“: Frequentist selecionado como padrão ao lado de Bayesian, e abaixo a direção da hipótese com One-Tailed como padrão ao lado de Two-Tailed.

Teste frequentista unilateral (padrão)​

Por padrão, a Varify usa dois testes estatísticos unilaterais estabelecidos:

  • Um teste qui-quadrado unilateral é usado para metas binomiais (por exemplo, taxa de clique, taxa de conversão).
  • Para métricas de vendas ou de valor (por exemplo, valor médio do pedido, receita por visitante), é usado um teste t de Student unilateral.

Estes testes unilaterais foram escolhidos deliberadamente. Eles entregam resultados mais rapidamente porque calculam de forma menos conservadora do que os métodos bilaterais. Isto permite-te ver mais cedo se uma variante tem probabilidade de ter um desempenho melhor.

Claro que isto também tem uma desvantagem: se um teste correr durante muito pouco tempo ou se muitas métricas forem avaliadas ao mesmo tempo, a probabilidade de um falso positivo aumenta - ou seja, um resultado que parece ser significativo, embora na realidade tenha sido apenas uma coincidência.

Teste Frequentista Bilateral (Plano Pro)​

No Pro Plan, esta definição de conta pode alternativamente ser alterada para um método frequentista bicaudal — a alteração afeta então todas as experiências na conta. São utilizados os mesmos testes estatísticos (qui-quadrado ou teste t de Student), mas numa versão bicaudal. A diferença: um teste bicaudal não verifica apenas se uma variante tem melhor desempenho, mas também se tem pior desempenho. Este método é mais conservador e geralmente requer mais dados para atingir significância estatística — mas, em contrapartida, fornece um resultado mais robusto em ambas as direções.

Método Bayesiano (por plano)​

O método Bayesiano também está disponível no Pro Plan. Ao contrário da abordagem frequentista, não calcula valores-p, mas sim uma probabilidade de que uma variante seja melhor do que o original. Isto torna frequentemente os resultados mais intuitivos de interpretar.

Uma vantagem adicional: Com o método Bayesiano, o Varify apresenta uma previsão de duração que estima quando é provável que se alcance 95 % de significância. Isto permite-te estimar melhor durante o teste quanto tempo este deve durar.

Melhores práticas para resultados fiáveis​

Independentemente do método escolhido, é melhor testar um pouco mais para que os resultados se estabilizem e possas avaliar com mais confiabilidade se uma variante é realmente melhor.

Especialmente em testes A/A, é importante adicionar apenas alguns targets. O acúmulo de erro alfa aumenta a probabilidade de um falso positivo com cada métrica adicional - ou seja, um supposto vencedor que na realidade não é um vencedor.

Melhores práticas para testes A/A:​

  • Duração: pelo menos 10 dias
  • Pelo menos 500 conversões por variante
  • Adicionar no máximo 3 targets, com foco no KPI principal
  • Os valores de significância que ocorrem no meio devem ser ignorados - o resultado final é o que conta. Esta é a única forma de manter a taxa de falsos positivos baixa e os resultados verdadeiramente confiáveis.

Cálculo próprio da significância usando uma calculadora de significância​

Verifique os resultados do seu teste A/B para diferenças significativas. Para isso, o Varify.io fornece uma calculadora de significância.

Ir para a calculadora de significância

Calculadora de significância: 20.000 visitantes cada, 3.400 contra 3.800 conversões; a variação atinge 19,00 % e um uplift de 11,76 %, marcado como significativo