El p-valor NO es la probabilidad de que B sea mejor: es la probabilidad de ver una diferencia así si no la hubiera. Y solo vale si decidiste el tamaño antes y no paraste al ver un buen resultado (pestaña «Mirar antes de tiempo»).
Escribe visitantes y conversiones de cada variante (A es el control). Antes de nada se comprueba el reparto de tráfico (SRM): si no casa con el pedido, el resultado no es fiable y hay que buscar la causa. Después verás la diferencia con su intervalo de confianza, que dice cuánto, no solo si. Con pocos datos o una tasa en 0 % o 100 % se usa el test exacto de Fisher, porque la aproximación normal declara ganadores que no lo son.
El p-valor es la probabilidad de ver una diferencia así o mayor si en realidad no la hubiera. No es la probabilidad de que B sea mejor: eso lo da la parte bayesiana, P(B > A). Con más de dos variantes se corrige por comparaciones múltiples (Holm o Benjamini-Hochberg): comparar varias variantes a la vez da más ocasiones de acertar por azar.
El p-valor NO es la probabilidad de que B sea mejor: es la probabilidad de ver una diferencia así si no la hubiera. Y solo vale si decidiste el tamaño antes y no paraste al ver un buen resultado (pestaña «Mirar antes de tiempo»).