Definición: Un test A/B es un experimento controlado que compara dos versiones de un elemento mediante la asignación aleatoria de unidades equivalentes, como usuarios, sesiones o cuentas. La versión A actúa normalmente como control y la versión B incorpora el cambio que se quiere evaluar. Ambas se observan durante el mismo periodo y con una métrica definida de antemano para estimar si las diferencias detectadas pueden atribuirse al cambio y no solo a variaciones del tráfico.
Índice de contenidos
Cómo funciona un test A/B
El experimento divide una población elegible entre dos grupos. Cada unidad debe mantener la versión asignada durante el periodo relevante para evitar que una misma persona alterne entre A y B. La comparación puede aplicarse a una landing page, un formulario, un mensaje, un precio, un flujo de compra o una función de un producto digital.
Antes de empezar se formula una hipótesis que relaciona un cambio con un efecto medible. Por ejemplo, simplificar un formulario podría aumentar la proporción de envíos completados. El objetivo no es decidir qué diseño gusta más, sino estimar el efecto de una intervención sobre una métrica concreta.
Un test suele incluir estos componentes:
- Control y variante: la referencia actual y la alternativa que se compara con ella.
- Unidad de asignación: usuario, cuenta, sesión, dispositivo u otra entidad que se distribuye entre los grupos.
- Métrica principal: resultado utilizado para evaluar la hipótesis, como una tasa de conversión, ingresos por usuario o finalización de una tarea.
- Métricas de protección: indicadores que no deberían empeorar, como errores, cancelaciones, devoluciones o tiempo de carga.
- Población y exposición: condiciones que determinan quién entra en el experimento y cuándo se considera que ha visto la variante.
La aleatorización busca que las diferencias previas entre los grupos se compensen. No elimina errores de instrumentación, tráfico no comparable ni efectos externos, por lo que la asignación y la recogida de datos también deben comprobarse.
Diseño del experimento
El tamaño necesario no se determina con una cifra universal de visitas. Depende de la tasa inicial, la variabilidad, el efecto mínimo que se quiere detectar, la potencia estadística y el nivel de error aceptado. Un cambio pequeño necesita normalmente más observaciones que uno grande. La duración también debe cubrir ciclos relevantes del negocio sin prolongarse de forma arbitraria.
El plan se define antes de observar los resultados. Debe indicar:
- La hipótesis y la decisión que podría cambiar.
- La métrica principal y su fórmula.
- La unidad de asignación y la población incluida.
- El efecto mínimo detectable y el tamaño previsto.
- La duración, los criterios de parada y las exclusiones.
- Las métricas de protección y los controles de calidad.
Mirar los resultados repetidamente y detener el test en cuanto una variante parece ganar aumenta el riesgo de conclusiones falsas si el método no contempla análisis secuencial. También puede distorsionar la lectura probar muchas métricas, variantes o segmentos y comunicar solo la combinación favorable. La guía de GOV.UK sobre estudios A/B recomienda partir de una hipótesis, decidir la muestra cuando sea necesario y comparar la intervención con un control.
Proceso para ejecutar y validar un test
Un procedimiento reproducible separa la preparación, la ejecución y la interpretación:
- Definir el problema: documentar el comportamiento actual y la evidencia que justifica experimentar.
- Redactar la hipótesis: indicar el cambio, la población, el efecto esperado y la métrica que lo representará.
- Preparar las versiones: modificar solo lo necesario para que el resultado pueda relacionarse con una diferencia identificable.
- Instrumentar y probar: validar asignación, exposición, eventos, fórmulas, dispositivos y recorridos antes de utilizar los datos.
- Ejecutar según el plan: mantener las reglas previstas y vigilar fallos, efectos perjudiciales y desequilibrios entre grupos.
- Analizar el resultado: estimar la magnitud del efecto y su incertidumbre, revisar las métricas de protección y comprobar la calidad de la muestra.
- Decidir y documentar: adoptar, descartar o repetir la variante según la evidencia, conservando fechas, configuración, resultados y limitaciones.
Una diferencia inesperada en la proporción de unidades asignadas puede revelar fallos de identificación, redirecciones, exclusiones o procesamiento. Un estudio sobre sample ratio mismatch documenta causas en la asignación, la ejecución, el procesamiento y el análisis.
Interpretación, tipos y límites
La significación estadística no indica por sí sola que un cambio sea importante para el negocio. Conviene examinar la diferencia absoluta y relativa, el intervalo de incertidumbre, el coste de implementación y posibles efectos adversos. Un resultado no concluyente tampoco demuestra que ambas versiones sean idénticas: puede significar que la muestra no permite detectar el efecto buscado.
Un test A/B compara dos experiencias dentro de un experimento. Un test multivariante combina cambios de varios componentes para estudiar sus efectos e interacciones, por lo que suele requerir más tráfico. Una prueba de URL dividida puede servir dos páginas distintas, mientras que una comparación antes y después carece de un control simultáneo y queda más expuesta a estacionalidad, campañas u otros cambios.
Los resultados pueden verse afectados por novedad, aprendizaje, contaminación entre grupos, usuarios que emplean varios dispositivos, interferencia entre participantes o una muestra poco representativa. Los análisis por segmentos deben estar justificados y conservar suficiente tamaño; dividir los datos después de ver el resultado puede producir patrones fortuitos.
En pruebas que afectan a páginas indexables también se revisan canonicals, redirecciones y duración. Las directrices de Google para pruebas en sitios web explican cómo ejecutar variantes sin utilizar encubrimiento ni convertir una prueba temporal en un estado permanente.
El test A/B apoya la optimización de la conversión cuando conecta una hipótesis con una decisión verificable. No garantiza que una variante funcione igual para toda audiencia o en cualquier momento. Su valor depende del diseño, la instrumentación, la calidad de la muestra y la transparencia con la que se interpretan y conservan los resultados.
