Saltar al contenido principal

Cómo calcula Varify la significancia

Última actualización el 17 sept 20264 min de lectura

En resumen​

El artículo explica cómo Varify evalúa estadísticamente los resultados de las pruebas. Por defecto, se utiliza un método frecuentista con pruebas unilaterales, que muestra rápidamente si una variante rinde mejor. En el Plan Pro, también están disponibles un método frecuentista bilateral y un método bayesiano. El método bayesiano también muestra una predicción de duración que estima cuándo se alcanza el 95 % de significancia. También explica por qué duraciones más largas y pocas métricas —especialmente en las pruebas A/A— son importantes para evitar decisiones erróneas por azar.

Cálculo de la significancia en app.varify.io​

Por defecto, Varify utiliza un método estadístico frecuentista para evaluar los resultados de los tests. Esto implica calcular la probabilidad de que una diferencia entre la variante y el original se haya producido por azar. Si se puede descartar el azar en la medida de lo posible, Varify muestra el reciproco del valor p calculado, la llamada significancia. Si este es superior al 95 %, el resultado se muestra como significativo en la herramienta.

Métodos estadísticos de un vistazo​

Varify ofrece tres métodos estadísticos para analizar los tests A/B. Los métodos disponibles dependen del plan seleccionado. El método se configura de forma centralizada a nivel de cuenta y luego se aplica a todos los experimentos de esa cuenta; no se puede seleccionar por experimento. El método se puede configurar en «Advanced Tracking Setup».

La configuración de cuenta «Statistical Method»: Frequentist seleccionado como opción predeterminada junto a Bayesian, y debajo la dirección de la hipótesis con One-Tailed como opción predeterminada junto a Two-Tailed.

Test frecuentista unilateral (estándar)​

Por defecto, Varify utiliza dos pruebas estadísticas unilaterales establecidas:

  • Se utiliza una prueba chi-cuadrado unilateral para objetivos binomiales (p. ej., tasa de clics, tasa de conversión).
  • Para métricas de ventas o de valor (p. ej., valor medio de pedido, ingresos por visitante), se utiliza una prueba t de Student unilateral.

Estas pruebas unilaterales se eligieron deliberadamente. Ofrecen resultados más rápido porque calculan de forma menos conservadora que los métodos bilaterales. Esto te permite ver antes si es probable que una variante tenga mejor rendimiento.

Por supuesto, esto también tiene una desventaja: si una prueba se ejecuta durante muy poco tiempo o se evalúan muchas métricas al mismo tiempo, aumenta la probabilidad de un falso positivo, es decir, un resultado que parece significativo aunque en realidad fue solo una coincidencia.

Prueba Frecuentista Bilateral (Pro Plan)​

En el Pro Plan, esta configuración de cuenta se puede cambiar alternativamente a un método frecuentista de dos colas; el cambio afecta entonces a todos los experimentos de la cuenta. Se utilizan las mismas pruebas estadísticas (chi-cuadrado o t de Student), pero en una versión de dos colas. La diferencia: una prueba de dos colas no solo comprueba si una variante rinde mejor, sino también si rinde peor. Este método es más conservador y generalmente requiere más datos para alcanzar significancia estadística, pero a cambio proporciona un resultado más robusto en ambas direcciones.

Método bayesiano (según el plan)​

El método bayesiano también está disponible en el Plan Pro. A diferencia del enfoque frecuentista, no calcula valores p, sino una probabilidad de que una variante sea mejor que el original. Esto suele hacer que los resultados sean más intuitivos de interpretar.

Una ventaja adicional: con el método bayesiano, Varify muestra una previsión de duración que estima cuándo es probable alcanzar el 95 % de significancia. Esto te permite estimar mejor durante el test cuánto tiempo debería ejecutarse.

Buenas prácticas para resultados fiables​

Independientemente del método que elijas, es mejor testear un poco más para que los resultados se estabilicen y puedas juzgar con más fiabilidad si una variante es realmente mejor.

En los test A/A en particular, es importante añadir solo unos pocos objetivos. La acumulación de error alfa aumenta la probabilidad de un falso positivo con cada métrica adicional, es decir, un supuesto ganador que en realidad no lo es.

Mejores prácticas para los test A/A:​

  • Duración: al menos 10 días
  • Al menos 500 conversiones por variante
  • Añade un máximo de 3 objetivos, con el foco en el KPI principal
  • Los valores de significancia que aparezcan por el camino deben ignorarse: lo que cuenta es el resultado final. Esta es la única forma de mantener baja la tasa de falsos positivos y que los resultados sean realmente fiables.

Cálculo propio de la significancia mediante una calculadora de significancia​

Comprueba tus resultados del test A/B para detectar diferencias significativas. Para ello, Varify.io ofrece una calculadora de significancia.

Ir a la calculadora de significancia

Calculadora de significancia: 20.000 visitantes cada uno, 3.400 frente a 3.800 conversiones; la variación alcanza el 19,00 % y un uplift del 11,76 %, marcado como significativo