Gib die Besucher und Conversions jeder Variante ein (A ist die Kontrolle). Zuerst wird die Traffic-Verteilung geprüft (SRM): Stimmt sie nicht mit der gewünschten überein, ist das Ergebnis nicht zuverlässig, und du musst die Ursache suchen. Danach siehst du die Differenz mit ihrem Konfidenzintervall, die sagt, wie viel, nicht nur ob. Bei wenig Daten oder einer Rate von 0 % oder 100 % wird der exakte Test nach Fisher verwendet, weil die Normalapproximation Gewinner erklärt, die keine sind.
rule
Was der p-Wert ist (und was nicht)
Der p-Wert ist die Wahrscheinlichkeit, einen so großen oder größeren Unterschied zu sehen, wenn es ihn in Wirklichkeit gar nicht gäbe. Er ist nicht die Wahrscheinlichkeit, dass B besser ist: Das liefert der bayessche Teil, P(B > A). Bei mehr als zwei Varianten wird für multiples Testen korrigiert (Holm oder Benjamini-Hochberg): Mehrere Varianten gleichzeitig zu vergleichen gibt mehr Gelegenheiten, zufällig richtig zu liegen.
scienceA/B-TestAnalysiere, plane und mach dir nichts vor, indem du vorher hinschaust
science
A/B-TestAnalysiere mit Intervallen und exaktem Test, plane die Stichprobengröße und prüfe, wie sehr es täuscht, zu früh zu schauen
scienceAnalysieren
eventPlanen
visibilityZu früh schauen
table_chartDaten pro Tag
BesucherConversionsVerteilung % (optional)Rate
A Kontrolle
12,00 %
B
14,00 %
check_circleTraffic-Verteilung stimmt mit der angeforderten überein (SRM: p = 1,0000).
help_outlineMit diesen Daten wird keine Differenz nachgewiesen
P(B besser als A)90,8 %bayessch, gleichverteilte Priors
Der p-Wert ist NICHT die Wahrscheinlichkeit, dass B besser ist: Er ist die Wahrscheinlichkeit, eine solche Differenz zu sehen, wenn es sie gar nicht gäbe. Und er gilt nur, wenn du die Stichprobengröße vorher festgelegt hast und nicht beim Anblick eines guten Ergebnisses aufgehört hast (Tab «Zu früh schauen»).