Lesezeichen    
Kombinatorik    
Zufallszahl    
Mittelwert    
Lagemaße    
Standardabw.    
Häufigkeiten    
z-Wert    
Prozentfehler    
Rabattrechner    
MwSt-Rechner    
Margenrechner    
Molarität    
Molare Masse    
Farbcode    
Spannungsfall    
Schuhgrößen    
kgV Rechner    
ggT Rechner    
Primfaktoren    
Bruchrechner    
Runden    
Potenzen    
Logarithmus    
Stellenzahl    
Halbwertszeit    
Polarform    
de Moivre    
Steigung    
Zuordnungen    
Punktabstand    
3D-Abstand    
Teilungspunkt    
Entfernung    
Scheitelpunkt    
Kegelschnitte    
Arithm. Folge    
Vektorrechner    
Kreuzprodukt    
Determinante    
Sin Cos Tan    
Pythagoras    
Ähnlichkeit    
Kreisrechner    
Kreissektor    
Quadervolumen    
Kugelvolumen    
Kugelsegment    
Kugelkappe    
Kegelvolumen    
Kegelstumpf    
Rohrvolumen    
Kapselvolumen    
Altersrechner    
Tagerechner    
Datumsrechner    
Wochentag    
Zeit addieren    
Arbeitszeit    
Zeitdifferenz    
Stundenzettel    
Zinseszins    
Zinsrechner    
Finanzrechner    
ROI-Rechner    
IRR-Rechner    
BIP-Rechner    
CTR-Rechner    
ROAS-Rechner    
CLV-Rechner    
CAC-Rechner    
Churn Rate    
SEO-Traffic    
CAGR-Rechner    
BMI-Rechner    
Schlafzyklen    
Grundumsatz    
TDEE-Rechner    
Idealgewicht    
Körperfett    
Magermasse    
Proteinbedarf    
Kohlenhydrate    
Fettbedarf    
Golf-Handicap    
Pace-Rechner    
1RM-Rechner    
Trainingspuls    
Hitzeindex    
Windchill    
Taupunkt    
Zahlensysteme    
Downloadzeit    
kWh in Euro    
Heizkosten    
LED-Ersparnis    
Haushaltsbuch    
Spritkosten    
Ladekosten    
Reifenrechner    
PV-Ertrag    
Modulanzahl    
Betonrechner    
Wandfläche    
Tapetenbedarf    
Farbbedarf    
Kiesrechner    
Holzzuschnitt    
GRZ und GFZ    
Rollrasen    
Rampenlänge    
Vorbohren    
Luftwechsel    
Sockelleisten    
Rollo-Maße    
Rohrgefälle    
Zaunrechner    
Holzschwinden    
Wärmeverlust    
Umzugskartons    
Durchbiegung    
   Hinzufügen
Wahrscheinlichkeit und Zufallszahlen: Rechner
Zwei Ereignisse
Zwei Ereignisse
Fehlende Werte
Fehlende Werte
Wiederholungen
Wiederholungen
Satz von Bayes
Satz von Bayes
Erwartungswert
Erwartungswert
Binomialverteilung
Binomialverteilung
Kombinatorik
Kombinatorik
Kreispermutation
Kreispermutation
Mit Wiederholung
Mit Wiederholung
Zufallszahl
Zufallszahl
Mittelwerte und Statistik: Rechner
Mittelwert
Mittelwert
Lagemaße
Lagemaße
Standardabw.
Standardabw.
Quartile & IQR
Quartile & IQR
Häufigkeiten
Häufigkeiten
Korrelation (r)
Korrelation (r)
Normalverteilung
Normalverteilung
z-Wert
z-Wert
Konfidenzintervall
Konfidenzintervall
Stichprobenumfang
Stichprobenumfang
Fang-Wiederfang
Fang-Wiederfang
p-Wert-Rechner
p-Wert-Rechner
Prozent und Verhältnis: Rechner
Prozentrechner
Prozentrechner
Prozentänderung
Prozentänderung
Prozent-Differenz
Prozent-Differenz
Prozentfehler
Prozentfehler
Verhältnisrechner
Verhältnisrechner
Rabattrechner
Rabattrechner
MwSt-Rechner
MwSt-Rechner
Margenrechner
Margenrechner
Geschwindigkeit: Rechner
Geschwindigkeit
Geschwindigkeit
Dichte und Konzentration: Rechner
Dichte berechnen
Dichte berechnen
Molarität
Molarität
Molare Masse
Molare Masse
Physik und Elektrizität: Rechner
Ohmsches Gesetz
Ohmsches Gesetz
Watt in Ampere
Watt in Ampere
Farbcode
Farbcode
Spannungsfall
Spannungsfall
Einheitenumrechnung: Rechner
Gewicht umrechnen
Gewicht umrechnen
Schuhgrößen
Schuhgrößen
Ganze Zahlen und Vorzeichen: Rechner
Schriftl. Division
Schriftl. Division
kgV Rechner
kgV Rechner
ggT Rechner
ggT Rechner
Negative Zahlen
Negative Zahlen
Primfaktoren
Primfaktoren
Diophant-Rechner
Diophant-Rechner
Modulo-Rechner
Modulo-Rechner
Teiler berechnen
Teiler berechnen
Römische Zahlen
Römische Zahlen
Brüche, Dezimalzahlen und Runden: Rechner
Bruchrechner
Bruchrechner
Gemischte Zahlen
Gemischte Zahlen
Brüche kürzen
Brüche kürzen
Bruch zu Dezimal
Bruch zu Dezimal
Dezimal zu Bruch
Dezimal zu Bruch
Runden
Runden
Gleichungen und Ungleichungen: Rechner
Lineare Gleichung
Lineare Gleichung
Gleichungssystem
Gleichungssystem
Mitternachtsformel
Mitternachtsformel
Betragsgleichung
Betragsgleichung
Quadr. Ungleichung
Quadr. Ungleichung
Polynome: Rechner
Binomischer Lehrsatz
Binomischer Lehrsatz
Quadratwurzeln und n-te Wurzeln: Rechner
Wurzeln vereinfachen
Wurzeln vereinfachen
Wurzel berechnen
Wurzel berechnen
Potenzen und Logarithmen: Rechner
Potenzen
Potenzen
Logarithmus
Logarithmus
Stellenzahl
Stellenzahl
Zehnerpotenzen
Zehnerpotenzen
Zehnerpotenz-Rechner
Zehnerpotenz-Rechner
Halbwertszeit
Halbwertszeit
Komplexe Zahlen: Rechner
Komplexe Zahlen
Komplexe Zahlen
Polarform
Polarform
de Moivre
de Moivre
Funktionen und Graphen: Rechner
Steigung
Steigung
Lineare Funktion
Lineare Funktion
Zuordnungen
Zuordnungen
y = ax² Rechner
y = ax² Rechner
Punktabstand
Punktabstand
3D-Abstand
3D-Abstand
Teilungspunkt
Teilungspunkt
Punkt–Gerade
Punkt–Gerade
Entfernung
Entfernung
Scheitelpunkt
Scheitelpunkt
Kreisgleichung
Kreisgleichung
Kegelschnitte
Kegelschnitte
Polarkoordinaten
Polarkoordinaten
Folgen: Rechner
Arithm. Folge
Arithm. Folge
Geometr. Folge
Geometr. Folge
Fibonacci-Folge
Fibonacci-Folge
Rekursive Folge
Rekursive Folge
Vektoren: Rechner
Vektorrechner
Vektorrechner
Kreuzprodukt
Kreuzprodukt
Matrizen: Rechner
Matrizenrechner
Matrizenrechner
Determinante
Determinante
Inverse Matrix
Inverse Matrix
Ebene Geometrie: Rechner
Sin Cos Tan
Sin Cos Tan
Grad ⇔ Bogenmaß
Grad ⇔ Bogenmaß
a sin θ + b cos θ
a sin θ + b cos θ
Dreiecksrechner
Dreiecksrechner
Dreiecksfläche
Dreiecksfläche
Rechtw. Dreieck
Rechtw. Dreieck
Pythagoras
Pythagoras
Vieleck-Winkel
Vieleck-Winkel
Ähnlichkeit
Ähnlichkeit
Parallelen-Winkel
Parallelen-Winkel
Rechteckfläche
Rechteckfläche
Parallelogramm
Parallelogramm
Trapez-Fläche
Trapez-Fläche
Kreisrechner
Kreisrechner
Kreissektor
Kreissektor
Peripheriewinkel
Peripheriewinkel
Ellipsenfläche
Ellipsenfläche
Raumgeometrie: Rechner
Würfelvolumen
Würfelvolumen
Würfeloberfläche
Würfeloberfläche
Quadervolumen
Quadervolumen
Quaderoberfläche
Quaderoberfläche
Zylindervolumen
Zylindervolumen
Zylinderoberfläche
Zylinderoberfläche
Kugelvolumen
Kugelvolumen
Kugeloberfläche
Kugeloberfläche
Kugelsegment
Kugelsegment
Kugelkappe
Kugelkappe
Ellipsoid Volumen
Ellipsoid Volumen
Ellipsoidfläche
Ellipsoidfläche
Pyramidenvolumen
Pyramidenvolumen
Pyramidenfläche
Pyramidenfläche
Kegelvolumen
Kegelvolumen
Kegeloberfläche
Kegeloberfläche
Kegelstumpf
Kegelstumpf
Kegelstumpf-Fläche
Kegelstumpf-Fläche
Rohrvolumen
Rohrvolumen
Kapselvolumen
Kapselvolumen
Kapsel-Oberfläche
Kapsel-Oberfläche
Datum und Uhrzeit: Rechner
Altersrechner
Altersrechner
Tagerechner
Tagerechner
Datumsrechner
Datumsrechner
Stunden später
Stunden später
Wochentag
Wochentag
Zeit addieren
Zeit addieren
Zeitzonenrechner
Zeitzonenrechner
Arbeitszeit
Arbeitszeit
Zeitdifferenz
Zeitdifferenz
Stundenzettel
Stundenzettel
Finanzen und Wirtschaft: Rechner
Zinseszins
Zinseszins
Zinsrechner
Zinsrechner
Sparplanrechner
Sparplanrechner
Finanzrechner
Finanzrechner
Barwertrechner
Barwertrechner
Endwertrechner
Endwertrechner
ROI-Rechner
ROI-Rechner
IRR-Rechner
IRR-Rechner
Amortisationsdauer
Amortisationsdauer
Rendite p. a.
Rendite p. a.
BIP-Rechner
BIP-Rechner
Online-Marketing und Werbekennzahlen: Rechner
CTR-Rechner
CTR-Rechner
Conversion-Rate
Conversion-Rate
CPC, CPM & CPA
CPC, CPM & CPA
ROAS-Rechner
ROAS-Rechner
Break-even-CPA
Break-even-CPA
CLV-Rechner
CLV-Rechner
CAC-Rechner
CAC-Rechner
Churn Rate
Churn Rate
A/B-Test Rechner
A/B-Test Rechner
A/B Stichprobe
A/B Stichprobe
SEO-Traffic
SEO-Traffic
Break-even-Punkt
Break-even-Punkt
Marge/Aufschlag
Marge/Aufschlag
CAGR-Rechner
CAGR-Rechner
Gesundheit und Fitness: Rechner
BMI-Rechner
BMI-Rechner
Schlafzyklen
Schlafzyklen
Kalorienbedarf
Kalorienbedarf
Grundumsatz
Grundumsatz
TDEE-Rechner
TDEE-Rechner
Idealgewicht
Idealgewicht
Körperfett
Körperfett
Magermasse
Magermasse
Kalorienverbrauch
Kalorienverbrauch
Proteinbedarf
Proteinbedarf
Makros berechnen
Makros berechnen
Kohlenhydrate
Kohlenhydrate
Fettbedarf
Fettbedarf
Zielgröße Kind
Zielgröße Kind
Sport: Rechner
Golf-Handicap
Golf-Handicap
Pace-Rechner
Pace-Rechner
1RM-Rechner
1RM-Rechner
Trainingspuls
Trainingspuls
Wetter: Rechner
Hitzeindex
Hitzeindex
Windchill
Windchill
Taupunkt
Taupunkt
Informatik: Rechner
Zahlensysteme
Zahlensysteme
Subnetzrechner
Subnetzrechner
Downloadzeit
Downloadzeit
Haushaltsenergie und Budget: Rechner
Stromkosten Gerät
Stromkosten Gerät
kWh in Euro
kWh in Euro
kWh/Jahr in Euro
kWh/Jahr in Euro
Klimaanlage kW
Klimaanlage kW
Klima-Stromkosten
Klima-Stromkosten
Heizkosten
Heizkosten
Gas oder Strom
Gas oder Strom
LED-Ersparnis
LED-Ersparnis
Gehalt umrechnen
Gehalt umrechnen
Haushaltsbuch
Haushaltsbuch
Auto: Rechner
Spritkosten
Spritkosten
Ladekosten
Ladekosten
E-Auto vs Benziner
E-Auto vs Benziner
Spritverbrauch
Spritverbrauch
Reifenrechner
Reifenrechner
Solarstrom und Batteriespeicher: Rechner
PV-Ertrag
PV-Ertrag
Modulanzahl
Modulanzahl
PV-Amortisation
PV-Amortisation
Speichergröße
Speichergröße
Haus und Heimwerken: Rechner
Fliesenrechner
Fliesenrechner
Treppenrechner
Treppenrechner
Betonrechner
Betonrechner
Wandfläche
Wandfläche
Tapetenbedarf
Tapetenbedarf
Farbbedarf
Farbbedarf
Laminatrechner
Laminatrechner
Fassadenfläche
Fassadenfläche
Kiesrechner
Kiesrechner
Mörtel & Beton
Mörtel & Beton
Gefälle berechnen
Gefälle berechnen
Holzzuschnitt
Holzzuschnitt
GRZ und GFZ
GRZ und GFZ
PVC-Belag Meterware
PVC-Belag Meterware
Dämmstoff-Menge
Dämmstoff-Menge
Vorhang-Größe
Vorhang-Größe
Fernseher-Abstand
Fernseher-Abstand
Erde berechnen
Erde berechnen
Rollrasen
Rollrasen
Mauerstein-Rechner
Mauerstein-Rechner
Ziegel-Rechner
Ziegel-Rechner
Terrassendielen
Terrassendielen
Rampenlänge
Rampenlänge
Vorbohren
Vorbohren
Luftwechsel
Luftwechsel
Farbe verdünnen
Farbe verdünnen
Sockelleisten
Sockelleisten
Rollo-Maße
Rollo-Maße
Bilder aufhängen
Bilder aufhängen
Rohrgefälle
Rohrgefälle
Schraubenmenge
Schraubenmenge
Holzvolumen (m³)
Holzvolumen (m³)
Zaunrechner
Zaunrechner
Holzschwinden
Holzschwinden
Silikonrechner
Silikonrechner
Wärmeverlust
Wärmeverlust
Möbel durch Tür
Möbel durch Tür
Umzugskartons
Umzugskartons
Stauraum berechnen
Stauraum berechnen
Plattenzuschnitt
Plattenzuschnitt
Durchbiegung
Durchbiegung

A/B-Test Stichprobenumfang berechnen (MDE, Signifikanz, Teststärke und Testdauer)

Um den Stichprobenumfang zu berechnen, geben Sie die Basis-CVR, den MDE, das Signifikanzniveau und die Teststärke ein und klicken Sie auf „Berechnen“. Sie erhalten den Stichprobenumfang je Gruppe für A und B (aufgerundet) und die Summe, dazu die nötigen Tage, wenn Sie Ihre Besucher pro Tag eingeben. Stellen Sie „Gesucht“ auf Teststärke, um den Stichprobenumfang je Gruppe festzulegen und stattdessen die Teststärke 1 − β zu berechnen.

Geben Sie CVR und MDE als Prozentwerte ein (bei 3 % tippen Sie „3“, bei einer Steigerung um 10 % tippen Sie „10“). Der MDE kann ein relativer Prozentwert (3 % auf 3,3 % sind 10 %) oder in Prozentpunkten (Pp.) angegeben werden (3 % auf 3,3 % sind 0,3). Geben Sie bei den Besuchern pro Tag die Summe von A und B zusammen ein (alle Besuche der getesteten Seite).
Ergebnis und Diagramm
Füllen Sie links die Felder aus und klicken Sie auf „Berechnen“. Hier erscheinen das Ergebnis und ein Diagramm „MDE und nötiger Stichprobenumfang“.

Was Sie auf dieser Seite tun können

  • Geben Sie die Basis-CVR (die Conversion-Rate Ihrer aktuellen Version A), den minimal nachweisbaren Effekt (MDE, als relativen Prozentwert oder in Prozentpunkten), das Signifikanzniveau \(\alpha\) (zwei- oder einseitig) und die Teststärke \(1-\beta\) ein. Sie erhalten den Stichprobenumfang, den jede Gruppe Ihres A/B-Tests braucht (aufgerundet), und die Summe
  • „Meine Seite konvertiert mit 3 %. Wie viele Besucher brauchen A und B jeweils, um eine Steigerung um 10 % (3 % auf 3,3 %) nachzuweisen?“ Diese Seite beantwortet die wichtigste Frage, die Sie vor dem Start eines Tests stellen sollten
  • Geben Sie Ihre Besucher pro Tag ein (optional), um auch zu sehen, wie viele Tage es dauert, bis dieser Stichprobenumfang erreicht ist (aufgerundet)
  • Können Sie pro Gruppe nur eine feste Zahl an Besuchern erreichen, legen Sie den Stichprobenumfang fest und berechnen die Teststärke \(1-\beta\) zurück (die Wahrscheinlichkeit, einen Unterschied zu finden, wenn es wirklich einen gibt)
  • Ein Diagramm, wie sich der Stichprobenumfang mit dem MDE ändert, eine leicht verständliche Erklärung der Formeln sowie Formeln zum Kopieren für Excel, Google Tabellen und Python finden Sie ebenfalls auf dieser Seite
Diese Seite ist nur für A/B-Tests gedacht, die prüfen, ob sich die Versionen A und B in der CVR (Conversion-Rate) unterscheiden. Sie verwendet die Standardformel für einen z-Test für zwei Anteile. Für die Frage, wie viele Personen eine Umfrage braucht, um einen Prozentwert genau zu messen, nutzen Sie den „Stichprobenumfang-Rechner“. Um den p-Wert aus bereits erhobenen Ergebnissen abzulesen, nutzen Sie den „p-Wert-Rechner“. Dass der nötige Stichprobenumfang erreicht ist, beweist allein noch nicht, dass ein signifikantes Ergebnis ein echter Effekt ist. Bitte lesen Sie auch die Hinweise in der Formelerklärung.

Wofür ist diese Berechnung nützlich?

Einen A/B-Test für den „Kaufen“-Button in einem Onlineshop planen

Angenommen, die Produktseite eines Onlineshops konvertiert mit 2 %, und Sie möchten mit einem neuen Buttontext eine relative Steigerung um 10 % (2 % auf 2,2 %) nachweisen. Bei einem Signifikanzniveau von 5 % (zweiseitig) und 80 % Teststärke brauchen Sie etwa 80.682 Besucher pro Gruppe, insgesamt etwa 161.364.
Der Vergleich einiger Dutzend oder Hundert Besucher („B war letzte Woche besser“) kann einen zufälligen von einem echten Unterschied nicht trennen. Wer den Stichprobenumfang vor dem Start berechnet, verhindert, dass er Wochen für einen Test aufwendet, der keine Antwort liefern kann.

Festlegen, wie viele Tage eine B2B-SaaS-Landingpage getestet wird

Eine Landingpage erhält Demo-Anfragen mit einer CVR von 5 %. Um eine Steigerung um 1 Punkt (5 % auf 6 %) nachzuweisen, brauchen Sie 8.158 Besucher pro Gruppe, insgesamt 16.316. Bei 300 Besuchen am Tag sind das \(16316 \div 300 \approx 54{,}4\), also 55 Tage oder 8 Wochen, wenn Sie die Wochentage ausgleichen möchten.
Verlangt jemand Ergebnisse in 2 Wochen, können Sie mit dieser Rechnung in Zahlen erklären: „In 2 Wochen (4.200 Besucher, 2.100 pro Gruppe) bräuchten wir einen deutlich größeren MDE, etwa 3 Punkte (5 % auf 8 %, das braucht 1.059 pro Gruppe).“

Betreffzeilen eines Newsletters testen (Öffnungsraten)

Hat Ihr Newsletter eine Öffnungsrate von 20 % und Sie möchten mit einer neuen Betreffzeile eine Steigerung um 2 Punkte (20 % auf 22 %) nachweisen, müssen Sie an 6.510 Personen pro Gruppe senden, insgesamt 13.020 (5 % Signifikanzniveau, 80 % Teststärke).
Eine Kennzahl mit hohem Anteil wie die Öffnungsrate braucht weniger Personen, um einen Unterschied zu zeigen, als eine CVR von wenigen Prozent. Das liegt am Teil \(p(1-p)\) der Formel: Dieselben „2 Punkte“ brauchen für jede Kennzahl einen anderen Stichprobenumfang.

Die Teststärke prüfen, bevor Sie „kein Unterschied“ schlussfolgern

Angenommen, ein Test, der auf eine relative Steigerung um 10 % bei einer Seite mit 3 % CVR zielte, lief mit 5.000 Besuchern pro Gruppe und zeigte „keinen signifikanten Unterschied“. Rechnen Sie die Teststärke zurück, sind es nur etwa 13,5 %. Der Test war so angelegt, dass er eine echte Verbesserung in mehr als 8 von 10 Fällen übersieht.
Die richtige Schlussfolgerung lautet hier nicht „es hatte keine Wirkung“, sondern „dieser Stichprobenumfang konnte es nicht erkennen“. Wer die Teststärke zurückrechnet, liest einen Test nicht falsch und wirft keine gute Idee weg.

Die Kundenbindung nach einem neuen App-Tutorial vergleichen

Eine App hat eine Next-Day-Retention von 40 %. Um mit einem neuen Tutorial eine relative Steigerung um 10 % (40 % auf 44 %) nachzuweisen, genügen etwa 2.389 neue Nutzer pro Gruppe, insgesamt etwa 4.778 (5 % Signifikanzniveau, 80 % Teststärke).
Eine Kennzahl nahe 50 %, etwa die Retention, hat eine große Streuung, aber auch die Differenz der Anteile (4 Punkte) ist groß, sodass Ergebnisse schneller vorliegen als bei einem Test auf eine CVR von wenigen Prozent. Den Stichprobenumfang je Kennzahl zu schätzen, hilft auch bei der Entscheidung, welche Verbesserung Sie zuerst angehen.

90 % Teststärke für Tests verwenden, die Sie nicht übersehen dürfen

Bei einem Test, bei dem das Übersehen einer guten Idee teuer wäre, etwa bei einer geänderten Preisdarstellung, können Sie die Teststärke von 80 % auf 90 % erhöhen. Bei einer CVR von 3 % und einer relativen Steigerung um 10 % steigt der Stichprobenumfang je Gruppe von 53.211 auf 71.233 (etwa das 1,34-Fache).
Diese Rechnung zeigt genau, wie viele Besucher mehr es braucht, um die Fehlerquote beim Übersehen zu halbieren (von 20 % auf 10 %), sodass Sie Stichprobenumfang und Testdauer an die Bedeutung des Tests anpassen können.

Formeln und Abbildungen

Formel für die Ziel-CVR (die CVR, die Version B erreichen soll)
Mathematische Schreibweise (die übliche Schreibweise)
\(p_2\) \(=\) \(p_1\) \(\times\) \(\left(1 + \dfrac{r}{100}\right)\)
\(p_2\) \(=\) \(p_1\) \(+\) \(d\)
In Worten (die Symbole durch Wörter ersetzt)
③ \(p_2\): Ziel-CVR \(=\) ① \(p_1\): Basis-CVR \(\times\) ② \(1 +\) relative Steigerung \(r \div 100\)
\(p_2\): Ziel-CVR \(=\) \(p_1\): Basis-CVR \(+\) ④ \(d\): MDE in Prozentpunkten
Die Formel in Worten
① Nehmen Sie die \(p_1\): Basis-CVR
② multiplizieren Sie sie mit \(1 +\) relative Steigerung \(r \div 100\)
③ und Sie erhalten die \(p_2\): Ziel-CVR
④ (Geben Sie den MDE in Prozentpunkten an, addieren Sie den \(d\): MDE in Prozentpunkten direkt zur Basis-CVR \(p_1\), um die Ziel-CVR zu erhalten.)
Einfaches Beispiel
Bei einer Basis-CVR von 3 % und einer nachzuweisenden relativen Steigerung von 10 % beträgt die Ziel-CVR
\(p_2\): Ziel-CVR \(=\) Basis-CVR (3 %) \(\times\) \(1 + 10 \div 100\)
\(3 \times (1 + 10 \div 100) = 3 \times 1{,}1 = 3{,}3\ \ (3{,}3\,\%)\)
Der Kerngedanke
Vorsicht bei „eine Verbesserung um 10 %“: Das lässt sich auf zwei Arten lesen. Als relativer Prozentwert heißt es „3 % plus ein Zehntel von 3 % = 3,3 %“. In Prozentpunkten heißt es „3 % + 10 Punkte = 13 %“. Beide ergeben völlig unterschiedliche Stichprobenumfänge. Im Marketing ist mit „einer Steigerung der CVR um 10 %“ meist der relative Prozentwert gemeint, und das ist auch die Voreinstellung dieser Seite. Die Ziel-CVR \(p_2\) ist keine Prognose dafür, was Version B tatsächlich erreicht. Sie ist die kleinste Differenz, die Sie nicht übersehen wollen (der MDE). Ist die reale Differenz kleiner, wird der Test selbst bei vollem Stichprobenumfang wahrscheinlich keinen signifikanten Unterschied zeigen.
Formel für den Stichprobenumfang je Gruppe (z-Test für zwei Anteile)
Abbildung
Mathematische Schreibweise (die übliche Schreibweise)
\(n\) \(=\) \(\bigl(\) \(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}\) \(+\) \(z_{\beta}\sqrt{p_1(1-p_1)+p_2(1-p_2)}\) \(\bigr)^2\) \(\div\) \((p_2 - p_1)^2\)
In Worten (die Symbole durch Wörter ersetzt)
④ \(n\): Stichprobenumfang je Gruppe \(=\) \(\bigl(\) ① \(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}\): Signifikanzterm \(+\) ② \(z_{\beta}\sqrt{p_1(1-p_1)+p_2(1-p_2)}\): Teststärketerm \(\bigr)^2\) \(\div\) ③ \((p_2 - p_1)^2\): das Quadrat der nachzuweisenden Differenz
Die Formel in Worten
① Addieren Sie den Signifikanzterm (der \(z_{\alpha/2}\) aus dem Signifikanzniveau × die Streuung ohne Unterschied, \(\sqrt{2\bar{p}(1-\bar{p})}\))
② und den Teststärketerm (der \(z_{\beta}\) aus der Teststärke × die Streuung bei einem Unterschied, \(\sqrt{p_1(1-p_1)+p_2(1-p_2)}\)) und quadrieren Sie die Summe,
③ teilen Sie sie durch das Quadrat der nachzuweisenden Differenz, \((p_2 - p_1)^2\)
④ und Sie erhalten den \(n\): Stichprobenumfang je Gruppe (Bruchteile werden aufgerundet)
Einfaches Beispiel
Bei einer Basis-CVR von 3 % (0,03), einer Ziel-CVR von 3,3 % (0,033), einem zweiseitigen Test bei einem Signifikanzniveau von 5 % (\(z_{\alpha/2} = 1{,}9600\)) und 80 % Teststärke (\(z_{\beta} = 0{,}8416\)) beträgt der Stichprobenumfang je Gruppe
\(n\): Stichprobenumfang je Gruppe \(=\) \(\bigl(\) \(1{,}9600 \times \sqrt{2 \times 0{,}0315 \times 0{,}9685}\) \(+\) \(0{,}8416 \times \sqrt{0{,}03 \times 0{,}97 + 0{,}033 \times 0{,}967}\) \(\bigr)^2\) \(\div\) \((0{,}033 - 0{,}03)^2\)
\(\bar{p} = (0{,}03 + 0{,}033) \div 2 = 0{,}0315\)
\(1{,}9600 \times \sqrt{2 \times 0{,}0315 \times 0{,}9685} = 1{,}9600 \times 0{,}24701 \approx 0{,}48414\)
\(0{,}8416 \times \sqrt{0{,}03 \times 0{,}97 + 0{,}033 \times 0{,}967} = 0{,}8416 \times 0{,}24700 \approx 0{,}20788\)
\((0{,}48414 + 0{,}20788)^2 \div (0{,}033 - 0{,}03)^2 = 0{,}47889 \div 0{,}000009 \approx 53210{,}3 \rightarrow 53211\)
Der Kerngedanke
\(\bar{p}\) ist der Durchschnitt der beiden CVRs, \((p_1 + p_2) \div 2\): die gemeinsame CVR, die Sie annehmen, wenn es keinen Unterschied gibt. \(\sqrt{2\bar{p}(1-\bar{p})}\) und \(\sqrt{p_1(1-p_1)+p_2(1-p_2)}\) messen beide, wie stark die Differenz der CVR zufällig schwankt. Die erste gilt für „kein Unterschied“ und die zweite für „ein echter Unterschied“. Sehen Sie sich die Formel an: Der Stichprobenumfang wird durch das Quadrat der nachzuweisenden Differenz geteilt. Halbieren Sie den MDE, wird der Stichprobenumfang etwa 4-mal so groß, bei einem Drittel etwa 9-mal so groß. Deshalb steigt die Besucherzahl so schnell, wenn Sie auch kleine Steigerungen erfassen wollen. Der z-Wert aus dem Signifikanzniveau ist \(z_{\alpha/2}\) bei einem zweiseitigen Test (1,9600 bei 5 %, 2,5758 bei 1 %, 1,6449 bei 10 %) und \(z_{\alpha}\) bei einem einseitigen Test (1,6449 bei 5 %, 2,3263 bei 1 %, 1,2816 bei 10 %). Der z-Wert aus der Teststärke, \(z_{\beta}\), beträgt 0,8416 bei 80 % und 1,2816 bei 90 %. Lehrbücher und andere Werkzeuge verwenden manchmal eine vereinfachte Formel, die die beiden Streuungen zu einer einzigen \(\sqrt{2\bar{p}(1-\bar{p})}\) zusammenfasst: \(n \approx 2\bar{p}(1-\bar{p})(z_{\alpha/2}+z_{\beta})^2 \div (p_2-p_1)^2\). Dieser Rechner verwendet die Formel auf der Karte oben (mit zwei getrennten Streuungen) und zeigt den vereinfachten Wert im Ergebnis zum Vergleich ebenfalls an. Bei einer kleinen CVR unterscheiden sich beide kaum (53.211 gegenüber 53.212 im obigen Beispiel). Dass der nötige Stichprobenumfang erreicht ist, macht ein signifikantes Ergebnis nicht zu einem sicheren Effekt. Die Formel gilt nur, wenn die Besucher zufällig zugeteilt werden, Sie die Ergebnisse nicht immer wieder ansehen und vorzeitig abbrechen (Peeking) und Sie eine strengere Grenze verwenden, wenn Sie mehrere Kennzahlen oder mehrere B-Versionen gleichzeitig vergleichen (multiples Testen).
Formel für die nötigen Tage (aus den Besuchern pro Tag)
Mathematische Schreibweise (die übliche Schreibweise)
\(D\) \(=\) \(\lceil\) \(2n\) \(\div\) \(V\) \(\rceil\)
In Worten (die Symbole durch Wörter ersetzt)
③ \(D\): nötige Tage \(=\) \(\lceil\) ① \(2n\): Stichprobenumfang für A und B zusammen \(\div\) ② \(V\): Besucher pro Tag \(\rceil\)
Die Formel in Worten
① Nehmen Sie den \(2n\): Stichprobenumfang für A und B zusammen (das Doppelte des Stichprobenumfangs je Gruppe \(n\))
② teilen Sie ihn durch die \(V\): Besucher pro Tag und runden Sie einen Bruchteil auf (\(\lceil\ \rceil\) ist das Symbol fürs Aufrunden),
③ und Sie erhalten die \(D\): nötige Tage
Einfaches Beispiel
Beträgt der Stichprobenumfang je Gruppe 53.211 und hat die getestete Seite 2.000 Besuche am Tag, sind die nötigen Tage
\(D\): nötige Tage \(=\) \(\lceil\) \(2 \times 53211\) \(\div\) 2.000 Besuche \(\rceil\)
\(2 \times 53211 \div 2000 = 106422 \div 2000 = 53{,}211 \rightarrow 54\)
Der Kerngedanke
\(\lceil\ \rceil\) ist das Symbol fürs Aufrunden (die Aufrundungsfunktion), aus 53,211 Tagen werden also 54 Tage. Die Besucher werden je zur Hälfte auf A und B aufgeteilt, geben Sie also die Besucher pro Tag für A und B zusammen ein (alle Besuche der getesteten Seite). Auch wenn die Rechnung 54 Tage ergibt, werden echte Tests meist über ganze Wochen laufen gelassen. Die CVR ändert sich mit dem Wochentag (Besucher unter der Woche und am Wochenende unterscheiden sich), sodass ein Lauf über 7, 14, ... Tage den Wochentagseffekt gleichmäßig auf beide Gruppen verteilt. In diesem Beispiel sind 8 Wochen (56 Tage) ein guter Plan. Reichen die nötigen Tage über mehrere Monate, ist es realistischer, einen größeren MDE zu wählen oder auf einer Seite mit mehr Traffic zu testen.
Formel für die Teststärke (bei festem Stichprobenumfang je Gruppe)
Abbildung
Mathematische Schreibweise (die übliche Schreibweise)
\(z_{1-\beta}\) \(=\) \(\bigl(\) \(|p_2 - p_1|\sqrt{n}\) \(-\) \(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}\) \(\bigr)\) \(\div\) \(\sqrt{p_1(1-p_1)+p_2(1-p_2)}\)
\(1-\beta\) \(=\) \(\Phi\bigl(\) \(z_{1-\beta}\) \(\bigr)\)
In Worten (die Symbole durch Wörter ersetzt)
④ \(z_{1-\beta}\): z-Wert zur Teststärke \(=\) \(\bigl(\) ① \(|p_2 - p_1|\sqrt{n}\): nachzuweisende Differenz × \(\sqrt{\text{Stichprobenumfang je Gruppe}}\) \(-\) ② \(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}\): Signifikanzterm \(\bigr)\) \(\div\) ③ \(\sqrt{p_1(1-p_1)+p_2(1-p_2)}\): Streuung bei einem Unterschied
⑥ \(1-\beta\): Teststärke \(=\) \(\Phi\bigl(\) ⑤ \(z_{1-\beta}\): z-Wert zur Teststärke \(\bigr)\)
Die Formel in Worten
① Nehmen Sie die nachzuweisende Differenz \(|p_2 - p_1|\) mal Quadratwurzel des Stichprobenumfangs je Gruppe, \(\sqrt{n}\)
② ziehen Sie den \(z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}\): Signifikanzterm
③ teilen Sie durch die \(\sqrt{p_1(1-p_1)+p_2(1-p_2)}\): Streuung bei einem Unterschied
④ und Sie erhalten den \(z_{1-\beta}\): z-Wert zur Teststärke
⑤ Bestimmen Sie mit der Verteilungsfunktion \(\Phi\) der Standard-Normalverteilung die Wahrscheinlichkeit, dass ein Wert höchstens so groß ist wie der \(z_{1-\beta}\): z-Wert zur Teststärke
⑥ und Sie erhalten die \(1-\beta\): Teststärke
Einfaches Beispiel
Bei einer Basis-CVR von 3 %, einer Ziel-CVR von 3,3 % und einem zweiseitigen Test bei einem Signifikanzniveau von 5 % (\(z_{\alpha/2} = 1{,}9600\)) beträgt die Teststärke, wenn Sie nur 30.000 Besucher pro Gruppe erreichen können,
\(z_{1-\beta}\): z-Wert zur Teststärke \(=\) \(\bigl(\) \(0{,}003 \times \sqrt{30000}\) \(-\) \(1{,}9600 \times 0{,}24701\) \(\bigr)\) \(\div\) \(0{,}24700\)
\(0{,}003 \times \sqrt{30000} = 0{,}003 \times 173{,}205 \approx 0{,}51962\)
\((0{,}51962 - 0{,}48414) \div 0{,}24700 \approx 0{,}1436\)
\(1 - \beta = \Phi(0{,}1436) \approx 0{,}5571\ \ (55{,}71\,\%)\)
Der Kerngedanke
Das ist die Formel für den „Stichprobenumfang je Gruppe“, nach \(z_{\beta}\) aufgelöst. \(\Phi\) (Phi) ist die Verteilungsfunktion der Standard-Normalverteilung. Sie liefert die Wahrscheinlichkeit, dass ein z-Wert höchstens so groß ist wie ein vorgegebener Wert (\(\Phi(0{,}8416) \approx 0{,}80\), \(\Phi(1{,}2816) \approx 0{,}90\)). Im obigen Beispiel beträgt die Teststärke nur etwa 56 %. Selbst wenn Version B wirklich 3,3 % erreicht, wird ein Test mit 30.000 Besuchern pro Gruppe also fast in der Hälfte der Fälle „kein Unterschied“ melden. Ein Test mit einer Teststärke unter 80 % übersieht oft echte Effekte. Aus einem Test mit geringer Teststärke zu schließen „es gab keinen Unterschied“, ist voreilig. Streng genommen sollte ein zweiseitiger Test auch den anderen Ausläufer berücksichtigen (die Wahrscheinlichkeit, dass B signifikant schlechter ausfällt). Dieser Wert ist winzig, deshalb lässt ihn dieser Rechner der gängigen Praxis folgend weg.
Der Stichprobenumfang je Gruppe eines A/B-Tests ist „(Signifikanzterm + Teststärketerm) zum Quadrat ÷ (nachzuweisende Differenz) zum Quadrat“, aufgerundet. Halbieren Sie den MDE, wird der Stichprobenumfang etwa 4-mal so groß, der Kniff ist also, zuerst zu entscheiden, wie große Steigerungen Sie erfassen wollen (der MDE). Teilen Sie durch die Besucher pro Tag, erhalten Sie die nötigen Tage, oder legen Sie den Stichprobenumfang fest und lösen die Formel erneut nach der Teststärke auf.

Symbole und Begriffe

Symbole

\(p_1\) p Index 1 Die Basis-CVR (die Conversion-Rate der aktuellen Version A). \(p\) steht für Anteil (proportion) oder Wahrscheinlichkeit (probability). In den Formeln werden 3 % als Dezimalzahl 0,03 geschrieben.
\(p_2\) p Index 2 Die Ziel-CVR (die Conversion-Rate, die Version B erreichen soll). Sie ist \(p_1 (1 + r/100)\) bei einem relativen Prozentwert und \(p_1 + d\) bei Prozentpunkten.
\(\bar{p}\) p quer Der Durchschnitt der beiden CVRs, \((p_1 + p_2) \div 2\). Es ist die gemeinsame CVR, die Sie annehmen, wenn es keinen Unterschied gibt. In der Statistik kennzeichnet der Balken oben einen Durchschnitt.
\(r\) r Der als relativer Prozentwert angegebene MDE. Er steht für ratio (Verhältnis) und sagt, um wie viel Prozent sich die Basis-CVR verbessert (3 % auf 3,3 % ergibt \(r = 10\)).
\(d\) d Der in Prozentpunkten angegebene MDE. Er steht für difference (Differenz) und ist die reine Differenz der CVR (3 % auf 3,3 % ergibt \(d = 0{,}3\) Punkte).
\(p_2 - p_1\) p2 minus p1 Die nachzuweisende Differenz, in Prozentpunkten als Dezimalzahl geschrieben (0,3 Punkte sind 0,003). Der Stichprobenumfang wird durch ihr Quadrat geteilt, je kleiner die Differenz, desto schneller wächst er also.
\(\alpha\) Alpha Das Signifikanzniveau: die Wahrscheinlichkeit, eine Differenz als real zu werten, obwohl es keine gibt (die Wahrscheinlichkeit eines Fehlers 1. Art). Üblich sind 5 % (0,05). Alpha ist der erste griechische Buchstabe und wird in der Statistik für die Wahrscheinlichkeit der „ersten“ Fehlerart verwendet.
\(\beta\) Beta Die Wahrscheinlichkeit, einen Unterschied zu übersehen, der wirklich vorhanden ist (die Wahrscheinlichkeit eines Fehlers 2. Art). Beta ist der zweite griechische Buchstabe und wird für die Wahrscheinlichkeit der „zweiten“ Fehlerart verwendet.
\(1-\beta\) eins minus Beta Die Teststärke: die Wahrscheinlichkeit, einen Unterschied zu finden, wenn es wirklich einen gibt. Üblich sind 80 % oder 90 %.
\(z_{\alpha/2}\) z Alpha halbe Der z-Wert zum Signifikanzniveau \(\alpha\) bei einem zweiseitigen Test (der Punkt, über dem \(\alpha/2\) der Standard-Normalverteilung liegen). Er beträgt 1,9600 bei 5 %, 2,5758 bei 1 % und 1,6449 bei 10 %. Ein einseitiger Test verwendet stattdessen \(z_{\alpha}\) (1,6449 bei 5 %).
\(z_{\beta}\) z Beta Der z-Wert zur Teststärke \(1-\beta\) (der Punkt, unter dem die Wahrscheinlichkeit \(1-\beta\) der Standard-Normalverteilung liegt). Er beträgt 0,8416 bei 80 % und 1,2816 bei 90 %.
\(z_{1-\beta}\) z eins minus Beta In der Formel für die Teststärke der aus dem Stichprobenumfang zurückgerechnete z-Wert. Setzen Sie ihn in \(\Phi\) ein, erhalten Sie die Teststärke. (Es ist dasselbe wie \(z_{\beta}\), nur aus Sicht des gesuchten Werts geschrieben.)
\(\Phi\) Phi Die Verteilungsfunktion der Standard-Normalverteilung. Sie liefert die Wahrscheinlichkeit, dass ein z-Wert höchstens so groß ist wie ein vorgegebener Wert: \(\Phi(1{,}96) \approx 0{,}975\) und \(\Phi(0{,}8416) \approx 0{,}80\). Der griechische Großbuchstabe Phi ist das übliche Symbol für diese Funktion.
\(n\) n Der Stichprobenumfang je Gruppe (für Version A und Version B jeweils). Er steht für number (Anzahl). Die Summe für A und B ist \(2n\).
\(\sqrt{\ \ }\) Wurzel Die Quadratwurzel: die positive Zahl, die quadriert die Zahl darin ergibt, zum Beispiel \(\sqrt{30000} \approx 173{,}205\). Sie taucht auf, wenn man die Streuung (Standardabweichung) einer CVR bestimmt.
\(V\) V Besucher pro Tag (alle Besuche der getesteten Seite, A und B zusammen). Es steht für visits (Besuche).
\(D\) D Die nötigen Tage. Es steht für days (Tage).
\(\lceil\ \rceil\) Aufrunden Das Symbol für das Aufrunden (die Aufrundungsfunktion). Sie liefert die kleinste ganze Zahl, die größer oder gleich der Zahl darin ist (\(\lceil 53{,}211 \rceil = 54\)).

Begriffe

A/B-Test Ein Experiment, bei dem Besucher im selben Zeitraum zufällig auf die aktuelle Version (A) und eine neue Version (B) aufgeteilt werden, um zu sehen, welche besser abschneidet (zum Beispiel eine höhere CVR hat). Damit prüfen Sie mit Daten statt mit Bauchgefühl, ob eine Änderung wie eine Buttonfarbe, eine Überschrift, die Darstellung eines Preises oder das Layout einer Landingpage wirklich hilft.
CVR (Conversion-Rate) Der Anteil der Besucher oder Klicks, der in einer Zielhandlung endet (einer Conversion), etwa einem Kauf oder einer Anmeldung. In den Formeln auf dieser Seite ist die CVR der Version A \(p_1\) und die der Version B \(p_2\).
MDE (minimal nachweisbarer Effekt) Die kleinste Steigerung, die Sie nachweisen können wollen. Es ist der erste Wert, den Sie bei der Planung eines A/B-Tests festlegen. Je kleiner er ist, desto schneller wächst der Stichprobenumfang (er ist umgekehrt proportional zum Quadrat der Differenz), wählen Sie also die kleinste Steigerung, die für Ihr Geschäft eine Rolle spielt.
Signifikanzniveau Die Wahrscheinlichkeit \(\alpha\) für den Fehler, den Sie hinnehmen - einen zufälligen Unterschied sehen und ihn als real werten, obwohl es keinen gibt. 5 % sind üblich, das lässt einen Fehlalarm etwa 1-mal in 20 zu. Ein strengeres Niveau (1 %) braucht einen größeren Stichprobenumfang.
Teststärke (Power) Die Wahrscheinlichkeit \(1-\beta\), einen Unterschied zu finden, wenn es wirklich einen gibt. 80 % sind üblich, das nimmt in Kauf, eine echte Steigerung etwa 1-mal in 5 zu übersehen. Meldet ein Test mit geringer Teststärke „kein Unterschied“, ist das kein Beleg dafür, dass es keinen Unterschied gibt.
Fehler 1. Art Der Fehler, eine Differenz als real zu werten, obwohl es keine gibt (ein falsch positives Ergebnis). Die Wahrscheinlichkeit, die Sie dafür zulassen, ist das Signifikanzniveau \(\alpha\). Er ist die Kehrseite eines Fehlers 2. Art (eines Übersehens): Drückt man den einen, steigt tendenziell der andere. Der grundlegendste Weg, beide klein zu halten, ist ein größerer Stichprobenumfang.
Fehler 2. Art Der Fehler, einen Unterschied zu übersehen, der wirklich vorhanden ist (ein falsch negatives Ergebnis). Seine Wahrscheinlichkeit ist \(\beta\), und \(1-\beta\) ist die Teststärke. Er ist die Kehrseite eines Fehlers 1. Art (eines Fehlalarms): Drückt man den einen, steigt tendenziell der andere. Der grundlegendste Weg, beide klein zu halten, ist ein größerer Stichprobenumfang.
Nullhypothese Die Hypothese „die Versionen A und B haben dieselbe CVR“, die der Test widerlegen will. Der Test fragt, wie ungewöhnlich die Daten wären, wenn die Nullhypothese stimmte. Sind sie ungewöhnlich genug, wird die Nullhypothese verworfen, und das Ergebnis lautet „ein Unterschied“.
Alternativhypothese Die Hypothese „die Versionen A und B haben unterschiedliche CVRs“, die der Test zeigen will. Sie wird angenommen, wenn die Nullhypothese (kein Unterschied) verworfen wird.
zweiseitiger Test Ein Test, der sowohl „B ist höher“ als auch „B ist niedriger“ als Unterschied zählt. Er wird bei einem normalen A/B-Test verwendet, bei dem Sie nicht wissen, in welche Richtung es geht. Er braucht einen größeren Stichprobenumfang als ein einseitiger Test, erfasst aber auch, wenn B schlechter abschneidet.
einseitiger Test Ein Test, der nur nach „B ist höher“ sucht. Er braucht einen kleineren Stichprobenumfang als ein zweiseitiger Test, kann aber nicht erfassen, wenn B schlechter abschneidet, deshalb müssen Sie ihn vor dem Start des Tests wählen. (Nach dem Blick auf die Ergebnisse auf einseitig umzustellen, ist nicht zulässig.)
z-Test für zwei Anteile Ein Test, der prüft, ob sich zwei Gruppen in einem Anteil (etwa der CVR) unterscheiden, mit einem z-Wert (der standardisierten Differenz) und der Standard-Normalverteilung. Die Formeln auf dieser Seite bestimmen den Stichprobenumfang für diesen Test. Die Normalapproximation funktioniert, wenn jede Gruppe genügend Conversions hat (als Faustregel mindestens 5 bis 10).
Standard-Normalverteilung Die Normalverteilung mit Mittelwert 0 und Standardabweichung 1 (eine symmetrische Glockenform). Ein z-Wert ist ein Punkt auf ihrer horizontalen Achse, und jedem z-Wert entspricht genau eine Wahrscheinlichkeit, etwa „die Fläche rechts von 1,96 beträgt 2,5 %“.
Verteilungsfunktion Eine Funktion, die die Wahrscheinlichkeit liefert, einen vorgegebenen Wert oder weniger zu erhalten. Die der Standard-Normalverteilung wird \(\Phi\) geschrieben und steht am Ende der Formel für die Teststärke. In Excel ist es NORM.S.VERT (mit WAHR als zweitem Argument), in Python NormalDist().cdf.
Standardabweichung (Streuung) Wie stark Daten streuen. Die Streuung eines Anteils \(p\) ist proportional zu \(\sqrt{p(1-p)}\). Die beiden Wurzelausdrücke in den Formeln sind die Streuung der Differenz zwischen den CVRs der beiden Gruppen.
multiples Testen Mehrere B-Versionen oder mehrere Kennzahlen gleichzeitig vergleichen. Je mehr Vergleiche, desto wahrscheinlicher sieht mindestens einer zufällig signifikant aus, daher ist eine Anpassung nötig, etwa das Signifikanzniveau durch die Zahl der Vergleiche zu teilen (die Bonferroni-Korrektur).
Peeking (vorzeitiger Abbruch) Die Ergebnisse immer wieder ansehen, bevor der nötige Stichprobenumfang erreicht ist, und abbrechen, sobald das Ergebnis signifikant aussieht. Dadurch werden zufällige Unterschiede leicht erwischt, und ein Test mit gedachten 5 % Signifikanzniveau liegt in Wahrheit weit öfter falsch. Die Formeln auf dieser Seite setzen voraus, dass Sie den Stichprobenumfang zuerst festlegen und warten, bis Sie ihn erreichen.

Was Sie vorab wissen sollten

Hier steht, was Ihnen hilft, die Berechnung auf dieser Seite mit echtem Verständnis zu nutzen, statt nur auf die Schaltfläche zu klicken.
Wenn Sie nicht weiterkommen, ist das Wiederholen dieser Themen der schnellste Weg.

Prozente (Klasse 6–7, 11–13 Jahre)
  • Zwischen Prozentsätzen und Dezimalzahlen wechseln können (\(3\,\%\) = \(0{,}03\), \(0{,}033\) = \(3{,}3\,\%\))
  • Den Unterschied zwischen einer relativen prozentualen Steigerung (3 % um ein Zehntel erhöht sind 3,3 %) und einer Steigerung in Prozentpunkten (3 % + 0,3 Punkte = 3,3 %) kennen
Wurzeln (Klasse 8–9, 13–15 Jahre)
  • Wissen, dass \(\sqrt{a}\) die positive Zahl ist, die quadriert \(a\) ergibt, und Werte wie \(\sqrt{30000} \approx 173{,}2\) mit einem Taschenrechner bestimmen können
  • Wissen, dass beim Teilen durch ein Quadrat die Antwort 4-mal so groß wird, wenn man die Zahl, durch die man teilt, halbiert (\((1/2)^2 = 1/4\))
Stochastik-Basics (Klasse 7 bis Sek. II)
  • Eine Rate wie „30 Käufe aus 1.000 Besuchen“ als Wahrscheinlichkeit (eine Zahl von 0 bis 1) behandeln können
  • Ein Gefühl dafür haben, dass ein Unterschied zufällig auftreten kann, obwohl es keinen gibt (7-mal Kopf bei 10 Münzwürfen ist nicht ungewöhnlich)
Normalverteilung, z-Werte (Sek. II)
  • Wissen, dass die Normalverteilung glockenförmig und symmetrisch ist und dass etwa 95 % im Bereich von 1,96 σ um den Mittelwert liegen
  • Wissen, dass ein z-Wert angibt, um wie viele σ ein Wert vom Mittelwert entfernt ist
Testlogik (Sek. II oder Grundstudium)
  • Wissen, wie ein Test funktioniert: Sie stellen die Nullhypothese „kein Unterschied“ auf, und wären die Daten unter ihr ungewöhnlich, schließen Sie „es gibt einen Unterschied“
  • Wissen, dass sich das Signifikanzniveau \(\alpha\) (die Wahrscheinlichkeit, eine Differenz als real zu werten, obwohl es keine gibt) und die Teststärke \(1-\beta\) (die Wahrscheinlichkeit, einen echten Unterschied zu finden) auf zwei verschiedene Fehler beziehen
Aufrunden (Klasse 4, 9–10 Jahre)
  • Verstehen, warum Zahlen von Personen und Tagen auf ganze Zahlen aufgerundet werden, etwa 53.210,3 Besucher zu 53.211 und 53,211 Tage zu 54

Mit Excel berechnen

Kopieren Sie die gesamte Tabelle unten und fügen Sie sie in Zelle A1 von Excel ein. Sie funktioniert unverändert.
Tabelle zur Berechnung der Ziel-CVR (relativer Prozentwert)
Basis-CVR p1 (%) 3
Relative Steigerung r (%) 10
Ziel-CVR p2 (%) =B1*(1+B2/100)
Tabelle zur Berechnung des Stichprobenumfangs je Gruppe
Basis-CVR p1 (%) 3
Ziel-CVR p2 (%) 3,3
Signifikanzniveau α (%, zweiseitig) 5
Teststärke 1−β (%) 80
z_α/2 =NORM.S.INV(1-B3/100/2)
z_β =NORM.S.INV(B4/100)
Durchschnittliche CVR p̄ =(B1+B2)/2/100
Stichprobenumfang je Gruppe n (aufgerundet) =AUFRUNDEN((B5*WURZEL(2*B7*(1-B7))+B6*WURZEL(B1/100*(1-B1/100)+B2/100*(1-B2/100)))^2/((B2-B1)/100)^2;0)
Tabelle zur Berechnung der nötigen Tage
Stichprobenumfang je Gruppe n 53211
Besucher pro Tag V (A + B zusammen) 2000
Nötige Tage D (aufgerundet) =AUFRUNDEN(2*B1/B2;0)
Tabelle zur Berechnung der Teststärke (fester Stichprobenumfang je Gruppe)
Basis-CVR p1 (%) 3
Ziel-CVR p2 (%) 3,3
Signifikanzniveau α (%, zweiseitig) 5
Stichprobenumfang je Gruppe n 30000
z_α/2 =NORM.S.INV(1-B3/100/2)
Durchschnittliche CVR p̄ =(B1+B2)/2/100
z_1−β =(ABS(B2-B1)/100*WURZEL(B4)-B5*WURZEL(2*B6*(1-B6)))/WURZEL(B1/100*(1-B1/100)+B2/100*(1-B2/100))
Teststärke 1−β (%) =NORM.S.VERT(B7;WAHR)*100
Nach dem Einfügen sind die oberen Zeilen Ihre Eingaben, und die letzte Zeile wird automatisch berechnet.
Die erste Tabelle zeigt in B3 den Wert 3,3 (eine Ziel-CVR von 3,3 %), die zweite in B8 den Wert 53211 (den Stichprobenumfang je Gruppe), die dritte in B3 den Wert 54 (die nötigen Tage) und die vierte in B8 etwa 55,71 (eine Teststärke von 55,71 %).
NORM.S.INV macht aus einer Wahrscheinlichkeit einen z-Wert, und NORM.S.VERT (mit WAHR als zweitem Argument) macht aus einem z-Wert eine Wahrscheinlichkeit. Für einen einseitigen Test löschen Sie das „/2“ in der Formel für z_α/2, sodass sie =NORM.S.INV(1-B3/100) lautet. AUFRUNDEN(…;0) rundet auf.

Mit Google Tabellen berechnen

Kopieren Sie die gesamte Tabelle unten und fügen Sie sie in Zelle A1 von Google Tabellen ein. Sie funktioniert unverändert.
Tabelle zur Berechnung der Ziel-CVR (relativer Prozentwert)
Basis-CVR p1 (%) 3
Relative Steigerung r (%) 10
Ziel-CVR p2 (%) =B1*(1+B2/100)
Tabelle zur Berechnung des Stichprobenumfangs je Gruppe
Basis-CVR p1 (%) 3
Ziel-CVR p2 (%) 3,3
Signifikanzniveau α (%, zweiseitig) 5
Teststärke 1−β (%) 80
z_α/2 =NORM.S.INV(1-B3/100/2)
z_β =NORM.S.INV(B4/100)
Durchschnittliche CVR p̄ =(B1+B2)/2/100
Stichprobenumfang je Gruppe n (aufgerundet) =AUFRUNDEN((B5*WURZEL(2*B7*(1-B7))+B6*WURZEL(B1/100*(1-B1/100)+B2/100*(1-B2/100)))^2/((B2-B1)/100)^2;0)
Tabelle zur Berechnung der nötigen Tage
Stichprobenumfang je Gruppe n 53211
Besucher pro Tag V (A + B zusammen) 2000
Nötige Tage D (aufgerundet) =AUFRUNDEN(2*B1/B2;0)
Tabelle zur Berechnung der Teststärke (fester Stichprobenumfang je Gruppe)
Basis-CVR p1 (%) 3
Ziel-CVR p2 (%) 3,3
Signifikanzniveau α (%, zweiseitig) 5
Stichprobenumfang je Gruppe n 30000
z_α/2 =NORM.S.INV(1-B3/100/2)
Durchschnittliche CVR p̄ =(B1+B2)/2/100
z_1−β =(ABS(B2-B1)/100*WURZEL(B4)-B5*WURZEL(2*B6*(1-B6)))/WURZEL(B1/100*(1-B1/100)+B2/100*(1-B2/100))
Teststärke 1−β (%) =NORM.S.VERT(B7;WAHR)*100
Dieselben Formeln wie in Excel funktionieren unverändert (auch Google Tabellen kennt NORM.S.INV, NORM.S.VERT und AUFRUNDEN). Kopieren Sie die ganze Tabelle, fügen Sie sie in Zelle A1 ein und ersetzen Sie die Eingaben in Spalte B durch Ihre eigenen Zahlen.

Mit Python berechnen

from math import sqrt, ceil
from statistics import NormalDist

base_cvr = 3.0          # Basis-CVR (%)
relative_mde = 10.0     # nachzuweisender MDE (relativer Prozentwert)
alpha = 0.05            # Signifikanzniveau (zweiseitig)
power = 0.80            # Teststärke
daily_visits = 2000     # Besucher pro Tag (A + B zusammen)

p1 = base_cvr / 100
p2 = p1 * (1 + relative_mde / 100)          # Ziel-CVR
z_alpha = NormalDist().inv_cdf(1 - alpha / 2)  # bei einseitigem Test 1 - alpha verwenden
z_beta = NormalDist().inv_cdf(power)
p_bar = (p1 + p2) / 2

n_exact = (z_alpha * sqrt(2 * p_bar * (1 - p_bar))
           + z_beta * sqrt(p1 * (1 - p1) + p2 * (1 - p2))) ** 2 / (p2 - p1) ** 2
n_per_group = ceil(n_exact)                  # Stichprobenumfang je Gruppe (aufgerundet)
days = ceil(2 * n_per_group / daily_visits)  # nötige Tage

print(f"Ziel-CVR: {p2 * 100:.4g} %")
print(f"Stichprobenumfang je Gruppe: {n_per_group} (insgesamt {2 * n_per_group})")
print(f"Nötige Tage: {days}")

# Umgekehrt gerechnet: Teststärke bei 30.000 Besuchern pro Gruppe
n_fixed = 30000
z_power = (abs(p2 - p1) * sqrt(n_fixed) - z_alpha * sqrt(2 * p_bar * (1 - p_bar))) \
          / sqrt(p1 * (1 - p1) + p2 * (1 - p2))
print(f"Teststärke bei {n_fixed} pro Gruppe: {NormalDist().cdf(z_power) * 100:.2f} %")
Läuft nur mit der Standardbibliothek (statistics.NormalDist braucht Python 3.8 oder neuer). In diesem Beispiel beträgt die Ziel-CVR 3,3 %, der Stichprobenumfang je Gruppe 53211 (106422 insgesamt), die nötigen Tage 54 und die Teststärke bei 30.000 Besuchern pro Gruppe etwa 55,71 % (Python zeigt Dezimalzahlen mit Punkt an). Ändern Sie oben die Werte und führen Sie den Code aus.

Die Formel in LaTeX und anderen mathematischen Schreibweisen (zum Kopieren)

Formel für die Ziel-CVR (die CVR, die Version B erreichen soll)
p₂ = p₁ × (1 + r/100)
p_2 = p_1 \left(1 + \dfrac{r}{100}\right)
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <msub><mi>p</mi><mn>2</mn></msub>
    <mo>=</mo>
    <msub><mi>p</mi><mn>1</mn></msub>
    <mo>(</mo><mn>1</mn><mo>+</mo><mfrac><mi>r</mi><mn>100</mn></mfrac><mo>)</mo>
  </mrow>
</math>
p_2 = p_1 (1 + r/100)
p1*(1 + r/100)
p2 := p1*(1 + r/100);
p2 = p1*(1 + r/100);
p_2 = p_1 (1 + r/100)
Formel für den Stichprobenumfang je Gruppe (z-Test für zwei Anteile)
n = (z_α/2 √(2p̄(1 − p̄)) + z_β √(p₁(1 − p₁) + p₂(1 − p₂)))² ÷ (p₂ − p₁)²
n = \dfrac{\left( z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})} + z_{\beta}\sqrt{p_1(1-p_1)+p_2(1-p_2)} \right)^2}{(p_2 - p_1)^2}
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>n</mi>
    <mo>=</mo>
    <mfrac>
      <msup>
        <mrow>
          <mo>(</mo>
          <msub><mi>z</mi><mrow><mi>&#x3B1;</mi><mo>/</mo><mn>2</mn></mrow></msub>
          <msqrt><mn>2</mn><mover><mi>p</mi><mo>&#xAF;</mo></mover><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><mover><mi>p</mi><mo>&#xAF;</mo></mover><mo>)</mo></msqrt>
          <mo>+</mo>
          <msub><mi>z</mi><mi>&#x3B2;</mi></msub>
          <msqrt>
            <msub><mi>p</mi><mn>1</mn></msub><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><msub><mi>p</mi><mn>1</mn></msub><mo>)</mo>
            <mo>+</mo>
            <msub><mi>p</mi><mn>2</mn></msub><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><msub><mi>p</mi><mn>2</mn></msub><mo>)</mo>
          </msqrt>
          <mo>)</mo>
        </mrow>
        <mn>2</mn>
      </msup>
      <msup>
        <mrow><mo>(</mo><msub><mi>p</mi><mn>2</mn></msub><mo>&#x2212;</mo><msub><mi>p</mi><mn>1</mn></msub><mo>)</mo></mrow>
        <mn>2</mn>
      </msup>
    </mfrac>
  </mrow>
</math>
n = (z_(alpha/2) sqrt(2 bar p (1 - bar p)) + z_beta sqrt(p_1(1 - p_1) + p_2(1 - p_2)))^2 / (p_2 - p_1)^2
Ceiling[(za*Sqrt[2*pbar*(1 - pbar)] + zb*Sqrt[p1*(1 - p1) + p2*(1 - p2)])^2/(p2 - p1)^2]
n := ceil((za*sqrt(2*pbar*(1 - pbar)) + zb*sqrt(p1*(1 - p1) + p2*(1 - p2)))^2/(p2 - p1)^2);
n = ceil((za*sqrt(2*pbar*(1 - pbar)) + zb*sqrt(p1*(1 - p1) + p2*(1 - p2)))^2/(p2 - p1)^2);
n = (z_(α/2) √(2p̄(1 − p̄)) + z_β √(p_1(1 − p_1) + p_2(1 − p_2)))^2/(p_2 − p_1)^2
Formel für die nötigen Tage (aus den Besuchern pro Tag)
D = ⌈2n ÷ V⌉
D = \left\lceil \dfrac{2n}{V} \right\rceil
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mi>D</mi>
    <mo>=</mo>
    <mo>&#x2308;</mo>
    <mfrac><mrow><mn>2</mn><mi>n</mi></mrow><mi>V</mi></mfrac>
    <mo>&#x2309;</mo>
  </mrow>
</math>
D = |~ (2n)/V ~|
Ceiling[2*n/v]
days := ceil(2*n/V);
D = ceil(2*n/V);
D = ⌈2n/V⌉
Formel für die Teststärke (bei festem Stichprobenumfang je Gruppe)
1 − β = Φ((|p₂ − p₁|√n − z_α/2 √(2p̄(1 − p̄))) ÷ √(p₁(1 − p₁) + p₂(1 − p₂)))
1 - \beta = \Phi\left( \dfrac{|p_2 - p_1|\sqrt{n} - z_{\alpha/2}\sqrt{2\bar{p}(1-\bar{p})}}{\sqrt{p_1(1-p_1)+p_2(1-p_2)}} \right)
<math xmlns="http://www.w3.org/1998/Math/MathML" display="block">
  <mrow>
    <mn>1</mn><mo>&#x2212;</mo><mi>&#x3B2;</mi>
    <mo>=</mo>
    <mi>&#x3A6;</mi>
    <mo>(</mo>
    <mfrac>
      <mrow>
        <mo>|</mo><msub><mi>p</mi><mn>2</mn></msub><mo>&#x2212;</mo><msub><mi>p</mi><mn>1</mn></msub><mo>|</mo>
        <msqrt><mi>n</mi></msqrt>
        <mo>&#x2212;</mo>
        <msub><mi>z</mi><mrow><mi>&#x3B1;</mi><mo>/</mo><mn>2</mn></mrow></msub>
        <msqrt><mn>2</mn><mover><mi>p</mi><mo>&#xAF;</mo></mover><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><mover><mi>p</mi><mo>&#xAF;</mo></mover><mo>)</mo></msqrt>
      </mrow>
      <msqrt>
        <msub><mi>p</mi><mn>1</mn></msub><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><msub><mi>p</mi><mn>1</mn></msub><mo>)</mo>
        <mo>+</mo>
        <msub><mi>p</mi><mn>2</mn></msub><mo>(</mo><mn>1</mn><mo>&#x2212;</mo><msub><mi>p</mi><mn>2</mn></msub><mo>)</mo>
      </msqrt>
    </mfrac>
    <mo>)</mo>
  </mrow>
</math>
1 - beta = Phi((|p_2 - p_1| sqrt(n) - z_(alpha/2) sqrt(2 bar p (1 - bar p))) / sqrt(p_1(1 - p_1) + p_2(1 - p_2)))
CDF[NormalDistribution[0, 1], (Abs[p2 - p1]*Sqrt[n] - za*Sqrt[2*pbar*(1 - pbar)])/Sqrt[p1*(1 - p1) + p2*(1 - p2)]]
power := Statistics[CDF](Normal(0, 1), (abs(p2 - p1)*sqrt(n) - za*sqrt(2*pbar*(1 - pbar)))/sqrt(p1*(1 - p1) + p2*(1 - p2)));
power = normcdf((abs(p2 - p1)*sqrt(n) - za*sqrt(2*pbar*(1 - pbar)))/sqrt(p1*(1 - p1) + p2*(1 - p2)));
1 − β = Φ((|p_2 − p_1| √n − z_(α/2) √(2p̄(1 − p̄)))/√(p_1(1 − p_1) + p_2(1 − p_2)))

Die Berechnung von ChatGPT  ausführen lassen

Sie sind ein Assistent für die Planung von A/B-Tests. Führen Sie die folgende Berechnung tatsächlich mit Python-Code aus und stützen Sie Ihre Antwort nur auf die Zahlen aus dem Ergebnis der Ausführung (antworten Sie nicht per Kopfrechnen oder Schätzen).

Die CVR der aktuellen Seite (die Basis-CVR) beträgt 3 %. Ich möchte mit Version B eine relative Steigerung um 10 % (eine CVR von 3,3 %) nachweisen können.
Bei einem Signifikanzniveau von 5 % (zweiseitiger Test) und 80 % Teststärke berechnen Sie jeweils:
1. Die Ziel-CVR p2 (p2 = p1 × (1 + 10/100))
2. Den Stichprobenumfang je Gruppe n (Formel des z-Tests für zwei Anteile: n = (z_{α/2}·√(2p̄(1−p̄)) + z_β·√(p1(1−p1)+p2(1−p2)))² ÷ (p2−p1)², mit p̄ = (p1+p2)/2, aufgerundet) und den gesamten Stichprobenumfang für A und B
3. Die nötigen Tage (aufgerundet) bei 2.000 Besuchern pro Tag (A und B zusammen)
4. Die Teststärke, wenn nur 30.000 Besucher pro Gruppe verfügbar sind (1−β = Φ((|p2−p1|·√n − z_{α/2}·√(2p̄(1−p̄))) ÷ √(p1(1−p1)+p2(1−p2))))

Verwenden Sie statistics.NormalDist für die z-Werte und die Verteilungsfunktion und zeigen Sie die verwendeten Formeln und die Zahlen aus dem Ergebnis der Ausführung.

Anleitung
  1. 1
    Zahlen eingeben
    Geben Sie die Zahlen, mit denen Sie rechnen möchten, in die Eingabefelder ein
  2. 2
    Berechnen
    Klicken Sie auf die Schaltfläche „Berechnen“
  3. 3
    Ergebnis ablesen
    Das Ergebnis erscheint sofort. Auf derselben Seite finden Sie auch den Rechenweg und die Erklärung der Formel
  Die Vorteile von DataChef
Einfach und kostenlos
Kostenlose Umwandlung ohne Limit
Kein Fachwissen nötig – einfach und intuitiv
Keine Anmeldung erforderlich
Sofort nach dem Öffnen der Seite nutzbar
Keine persönlichen Daten erforderlich
Sicher und geschützt
Stark verschlüsselte Verbindung (SSL)
Die Datei wird nach dem Download automatisch gelöscht
Schnell
Schnelle Anzeige und Umwandlung – ganz ohne Wartezeit
Keine Wasserzeichen
Kein Wasserzeichen
Keine Quellenangabe nötig
Kommerzielle Nutzung möglich
Kostenlos auch für die kommerzielle Nutzung
Keine vorherige Genehmigung erforderlich