Online-Handel & Geschäft

Signifikanz eines A/B-Tests berechnen

Tragen Sie für beide Varianten die Besucher und die Conversions ein und wählen Sie das Konfidenzniveau. Der Rechner zeigt, ob der Unterschied statistisch gesichert ist.

Testergebnis
Ergebnis

Zufall oder echter Unterschied?

Bei einem A/B-Test sehen zwei Gruppen von Besuchern unterschiedliche Varianten einer Seite, einer Anzeige oder einer E-Mail. Am Ende hat meist eine Variante die höhere Konversionsrate. Die entscheidende Frage ist, ob der Unterschied echt ist oder nur zufällig entstanden. Genau das beantwortet ein Signifikanztest.

Der Rechner verwendet den Zwei-Proportionen-z-Test. Er vergleicht den Unterschied der beiden Konversionsraten mit der Schwankung, die bei dieser Stichprobengröße allein durch Zufall zu erwarten ist. Daraus ergeben sich der z-Wert und der p-Wert. Der p-Wert gibt an, wie wahrscheinlich ein mindestens so großer Unterschied wäre, wenn beide Varianten in Wahrheit gleich gut sind.

Liegt der p-Wert unter 5 Prozent, gilt das Ergebnis auf dem üblichen 95-Prozent-Niveau als signifikant. Die angezeigte statistische Sicherheit ist 1 minus p-Wert. Zusätzlich zeigt der Rechner den relativen Uplift, also um wie viel Prozent Variante B besser oder schlechter abschneidet als A.

z=pB−pAp×(1−p)×(1nA+1nB)mit p=Conversions A+BBesucher A+B; p-Wert=2×(1−Φ (∣ z ∣))z = \frac{\text{pB} - \text{pA}}{\sqrt{p \times \left(1 - p\right) \times \left(\frac{1}{\text{nA}} + \frac{1}{\text{nB}}\right)}}\quad \text{mit}\ p = \frac{\text{Conversions A} + B}{\text{Besucher A} + B};\ \text{p-Wert} = 2 \times \left(1 - Φ\,\left(|\,z\,|\right)\right)

Beispiel: Variante A: 10.000 Besucher, 300 Conversions, also 3,0 Prozent. Variante B: 10.000 Besucher, 360 Conversions, also 3,6 Prozent. Der relative Uplift beträgt 20 Prozent. Die gemeinsame Rate liegt bei 3,3 Prozent, der z-Wert bei 2,375 und der p-Wert bei 0,0175. Die statistische Sicherheit beträgt 98,2 Prozent; das Ergebnis ist auf dem 95-Prozent-Niveau signifikant, auf dem 99-Prozent-Niveau nicht.

Typische Fehler bei A/B-Tests

Der häufigste Fehler ist das vorzeitige Beenden. Wer täglich nachsieht und den Test stoppt, sobald er signifikant aussieht, findet viel öfter einen Gewinner, als es wirklich gibt. Legen Sie deshalb vor dem Start fest, wie viele Besucher je Variante nötig sind, und werten Sie erst danach aus. Die nötige Größe zeigt der Stichprobengrößen-Rechner.

Lassen Sie Tests mindestens eine, besser zwei volle Wochen laufen, damit Wochentage und Wochenenden gleichermaßen enthalten sind. Ändern Sie während des Tests nichts an den Varianten oder am Traffic-Mix. Testen Sie viele Varianten oder viele Kennzahlen gleichzeitig, steigt die Gefahr von Zufallstreffern; das Konfidenzniveau sollte dann strenger gewählt werden.

Signifikant heißt nicht automatisch wichtig. Bei sehr großen Stichproben werden auch winzige Unterschiede signifikant, die sich wirtschaftlich kaum lohnen. Umgekehrt kann ein großer Uplift bei wenigen Besuchern noch reiner Zufall sein. Betrachten Sie deshalb immer beides: Signifikanz und die Größe des Effekts.

Die Rechnung setzt unabhängige Besucher und eine zufällige Aufteilung voraus. Bei sehr kleinen Zahlen von Conversions, etwa unter zehn je Variante, ist der z-Test ungenau. Wie sich Konversionsraten berechnen, zeigt der Conversion-Rate-Rechner, die Grundlagen der Normalverteilung der Normalverteilungs-Rechner.

Tipps und typische Fehler

Sauber testen.

  • Vorher: Stichprobe festlegen.
  • Laufzeit: Volle Wochen.
  • Nicht spähen: Erst am Ende auswerten.
  • Effekt: Größe beachten.

Weitere Rechner: Online-Handel & Geschäft

Häufige Fragen

Ab wann ist ein A/B-Test signifikant?

Üblicherweise, wenn der p-Wert unter 5 Prozent liegt, also mit 95 Prozent statistischer Sicherheit.

Was ist der Uplift?

Die relative Veränderung der Konversionsrate von Variante B gegenüber A in Prozent.

Wie lange sollte ein A/B-Test laufen?

Bis die vorher festgelegte Stichprobengröße erreicht ist, mindestens aber eine bis zwei volle Wochen.

Was ist ein A/A-Test?

Ein Test mit zwei identischen Varianten, um zu prüfen, ob das Testwerkzeug korrekt misst.

Kann ich mehr als zwei Varianten testen?

Ja, dann sollten Sie das Konfidenzniveau strenger wählen, weil mehr Vergleiche mehr Zufallstreffer erzeugen.

Auch gesucht als:
  • A/B-Test Signifikanz berechnen
  • AB Test Rechner
  • Split-Test Signifikanz
  • Konversionsrate signifikant
  • p-Wert A/B-Test
  • Uplift berechnen

Alle Berechnungen erfolgen direkt in Ihrem Browser, Ihre Eingaben werden nicht übertragen oder gespeichert. Die Ergebnisse sind Orientierungswerte ohne Gewähr und ersetzen keine steuerliche, rechtliche oder finanzielle Beratung. Die Erklärtexte auf dieser Seite wurden mit KI erstellt. Letzte inhaltliche Änderung dieser Seite: . Mehr dazu: So entstehen und prüfen wir die Rechner.