# A/B-Test Signifikanzrechner

Geben Sie Kontrolle-/Behandlungs-Daten ein: Differenz der Raten, 95%/99%-Konfidenzintervalle, p-Wert des Z-Tests (Anteile) oder Welch-t (stetig), Signifikanz, Lift, Stichprobengröße für 80%/90% Power, empfohlene Tage, Sequential-Testing-Warnung und Bonferroni-Korrektur.

> Kanonische Seite: https://elysiatools.com/de/tools/ab-test-significance-calculator

- **Kategorie:** Data Analysis

- **Schlagwörter:** A/B-Test, Signifikanz, p-Wert, Konfidenzintervall, Z-Test, Welch-t, Konversionsrate, Stichprobengröße, Power, Bonferroni, sequenziell, Lift

## Überblick

Entscheide, ob dein A/B-Test-Ergebnis echtes Signal oder Rauschen ist — mit korrekter Statistik.

**Zwei Testtypen.**
- **Anteil / Konversionsrate.** Erfolge + Besucher von Kontrolle und Behandlung. Berechnet Raten, relativen Lift, gepoolten Z-Test und das 95%/99%-KI der Differenz.
- **Stetige Metrik (Mittelwert & SD).** Mittelwert, SD und n beider Gruppen. Führt einen Welch-t-Test (ohne gleiche Varianzen) mit Welch–Satterthwaite-Freiheitsgraden aus.

**Mehr als der p-Wert:** Lift, Konfidenzintervall, Stichprobengröße für 80%/90% Power, empfohlene Tage, Bonferroni-Korrektur bei Mehrfachvergleichen und Sequential-Testing-Warnung (den p-Wert mittendrin nicht anschauen).

"Signifikant" bedeutet, die Daten sind bei α=0,05 unverträglich mit Null-Differenz — nicht, dass der Lift groß oder wichtig ist. Kombiniere Signifikanz mit Effektgröße vor dem Rollout.

## Eingaben

- **Testtyp** (select)
- **Kontrolle: Erfolge** (number): e.g. 1200
- **Kontrolle: Besucher** (number): e.g. 20000
- **Behandlung: Erfolge** (number): e.g. 1320
- **Behandlung: Besucher** (number): e.g. 20000
- **Kontrolle: Mittelwert** (number): e.g. 42.5
- **Kontrolle: Standardabw.** (number): e.g. 12.0
- **Kontrolle: Stichprobe** (number): e.g. 500
- **Behandlung: Mittelwert** (number): e.g. 45.8
- **Behandlung: Standardabw.** (number): e.g. 12.5
- **Behandlung: Stichprobe** (number): e.g. 500
- **Signifikanzniveau α** (select)
- **Statistische Power** (select)
- **Basis-Konversionsrate (%)** (number): e.g. 6 (for sample-size planning)
- **MDE-Steigerung (%)** (number): e.g. 5 (minimum detectable lift)
- **Tägliche Besucher** (number): e.g. 4000 (for days estimate)
- **Traffic-Aufteilung (%)** (select)
- **Anzahl Vergleiche** (number): 1 unless running multiple variants
- **Dezimalstellen** (number)

## Wann verwenden

- Wenn Sie die Konversionsraten zweier Landingpages vergleichen und wissen möchten, ob der gemessene Lift statistisch signifikant ist.
- Wenn Sie stetige Metriken wie die durchschnittliche Ladezeit oder den Warenkorbwert (Mittelwert und Standardabweichung) zwischen zwei Gruppen analysieren.
- Wenn Sie vorab die benötigte Stichprobengröße und Testdauer basierend auf Ihrer täglichen Besucherzahl und dem minimal erkennbaren Effekt (MDE) planen wollen.

## Funktionsweise

- Wählen Sie den passenden Testtyp aus: 'Anteil (Konversionsrate)' für binäre Ereignisse oder 'Stetig (Mittelwert & SD)' für kontinuierliche Messwerte.
- Geben Sie die Leistungsdaten für die Kontroll- und Behandlungsgruppe ein (z. B. Erfolge und Besucher oder Mittelwert, Standardabweichung und Stichprobengröße).
- Konfigurieren Sie das gewünschte Signifikanzniveau (α), die statistische Power sowie optionale Parameter wie die Anzahl der Vergleiche für die Bonferroni-Korrektur.
- Das Tool berechnet sofort den p-Wert, den relativen Lift, das Konfidenzintervall sowie eine Empfehlung zur Stichprobengröße und warnt vor vorzeitigem Abbrechen (Sequential-Testing).

## Anwendungsfälle

- Validierung von Conversion-Rate-Optimierungen (CRO) auf E-Commerce-Websites durch Auswertung von Klicks und Käufen.
- Vergleich von kontinuierlichen Performance-Metriken wie der durchschnittlichen Verweildauer oder dem Bestellwert nach einem App-Update.
- Berechnung der benötigten Stichprobengröße und Testlaufzeit vor dem Start einer Marketingkampagne zur Vermeidung von unterpowerten Tests.

## Häufig gestellte Fragen

### Was bedeutet ein signifikantes Ergebnis bei einem A/B-Test?

Es bedeutet, dass der beobachtete Unterschied zwischen den Gruppen bei dem gewählten Signifikanzniveau (z. B. 5 %) sehr unwahrscheinlich durch reinen Zufall entstanden ist.

### Wann sollte ich den Welch-t-Test statt des Z-Tests verwenden?

Nutzen Sie den Welch-t-Test für stetige Metriken wie Umsatz pro Nutzer oder Sitzungsdauer. Der Z-Test eignet sich für Anteile wie Klick- oder Konversionsraten.

### Warum warnt das Tool vor 'Sequential Testing' (vorzeitigem Reinschauen)?

Regelmäßiges Prüfen des p-Werts während des laufenden Tests erhöht die Wahrscheinlichkeit für falsch-positive Ergebnisse (Fehler 1. Art) drastisch.

### Was bewirkt die Bonferroni-Korrektur im Rechner?

Sie passt das Signifikanzniveau an, wenn Sie mehrere Varianten gleichzeitig gegen die Kontrolle testen, um die Anhäufung von Fehlern zu verhindern.

### Wie wird die empfohlene Testdauer berechnet?

Sie basiert auf der berechneten erforderlichen Stichprobengröße pro Variante, der Traffic-Aufteilung und Ihren täglichen Besuchern.

## Ähnliche Tools

- [Monte-Carlo-Simulations-Builder](https://elysiatools.com/de/tools/monte-carlo-simulation-builder): Definieren Sie Eingangsverteilungen (normal/uniform/lognormal/triangular), schreiben Sie eine Formel, führen Sie Tausende Durchläufe aus und erhalten Sie das Histogramm mit Konfidenzintervallen.
- [RSS / Atom Feed Markdown-Zusammenfasser](https://elysiatools.com/de/tools/rss-feed-markdown-summarizer): Lädt einen RSS/Atom-Feed per URL (oder als rohes XML), sortiert nach Veröffentlichungsdatum, dedupliziert, wendet ein Zeitfenster an und erzeugt eine saubere Markdown-Zusammenfassung
- [KI-Markdown-Artikel-Uebersetzer](https://elysiatools.com/de/tools/ai-markdown-article-translator): Uebersetzt komplette Markdown-Artikel mit KI und behaelt Ueberschriften, Tabellen, Links, Bilder und Codebloecke bei
- [Dateinamen-Desinfektionsmittel](https://elysiatools.com/de/tools/filename-sanitizer): Bereinigt und desinfiziert Dateinamen durch Entfernen illegaler Zeichen für Windows, Linux und Mac
- [Analysewerkzeug für das Mittlere Plättchenvolumen (MPV)](https://elysiatools.com/de/tools/mean-platelet-volume-analyzer): Analysiert das Mittlere Plättchenvolumen MPV (fL). Referenz ~7.5–11.5 fL. Niedriges MPV (< 7.5 fL, kleine alte Plättchen) deutet auf gedrosselte Produktion: aplastische Anämie, Chemo/Strahlentherapie, kürzliche Plättchentransfusion, frühe Regeneration bei Eisenmangel, Wiskott-Aldrich-Syndrom. Hohes MPV (> 11.5 fL, große junge Plättchen) spricht für peripheren Abbau mit kompensatorischer Markproduktion oder Makrothrombozytopenie: ITP, nach Splenektomie, myeloproliferative Neoplasien (ET/CML/MF), schwere Sepsis in Erholung, Bernard-Soulier/MYH9, megaloblastäre Anämie, akuter Herzinfarkt (Marker für Plättchenaktivierung und ungünstige kardiovaskuläre Prognose). MPV kombiniert mit der Thrombozytenzahl verfeinert: niedrige Plättchen + hohes MPV → peripherer Abbau (ITP, TTP, DIC-Erholung); niedrig + niedrig → Unterproduktion; hoch + niedrig → reaktive Thrombozytose; hoch + hoch → myeloproliferative Neoplasie. Hinweis: in EDTA-Blut quellen Plättchen (~2 h) und erhöhen das MPV; methodenabhängig (Impedanz > optisch > immunologisch) — im selben Labor und Analysator vergleichen. Quellen: Bath 1996, Leader 2012, Vagdatli 2010, MDCalc. Keine medizinische Beratung.
- [Normalverteilungs-Plotter](https://elysiatools.com/de/tools/normal-distribution-plotter): Zeichnet eine Normalverteilungskurve als SVG mit z-Markern, Intervall-/Schwanz-Schattierung und σ-Bändern 68/95/99.7.
- [Array-Gruppierer](https://elysiatools.com/de/tools/array-grouper): Gruppiert Array-Elemente basierend auf verschiedenen Kriterien wie Länge, alphabetischer Reihenfolge, numerischen Bereichen, benutzerdefinierten Bedingungen und mehr
- [APACHE II Score Rechner](https://elysiatools.com/de/tools/apache-ii-score): Berechnet den APACHE II Score: akutes Physiologie-Score (APS, 12 Variablen, je 0-4 Punkte, schlechtester Wert in den ersten 24 h auf der Intensivstation) + Alterspunkte (0-6) + chronischer Gesundheitszustand (0/2/5); Gesamt 0-71; je höher, desto schlechter die Prognose. Oxygenierung: bei FiO₂≥0.5 A-a-Gradient, sonst PaO₂; Kreatinin ×2 bei akutem Nierenversagen; GCS = 15−GCS. Enthält die Mortalitätsprognose des Basismodells (Logit=−3.517+0.146×Score, ohne Diagnose-Gewichtung). Quellen: Knaus 1985 Crit Care Med, SFAR-Tabelle. Ersetzt nicht die klinische Beurteilung. Keine medizinische Beratung.

## Beispiele

- [Android Java Bildverarbeitungsbeispiele](https://elysiatools.com/de/samples/android-image-processing-java): Android Java Bildverarbeitungsbeispiele einschließlich Lesen/Schreiben, Skalierung und Formatkonvertierung
- [Android Kotlin Bildverarbeitungsbeispiele](https://elysiatools.com/de/samples/android-image-processing-kotlin): Android Kotlin Bildverarbeitungsbeispiele einschließlich Lesen/Schreiben, Skalierung und Formatkonvertierung
- [Web Python Bildverarbeitung Beispiele](https://elysiatools.com/de/samples/web-image-processing-python): Web Python Bildverarbeitungsbeispiele mit PIL/Pillow einschließlich Lesen, Speichern, Skalieren und Formatkonvertierung
- [Web Rust Bildverarbeitungsbeispiele](https://elysiatools.com/de/samples/web-image-processing-rust): Web Rust Bildverarbeitungsbeispiele einschließlich Lesen/Schreiben, Skalierung und Formatkonvertierung

## Verwandte Inhalte

- [A/B-Experimentdesign, Stichprobengröße und statistische Power](https://elysiatools.com/de/hubs/ab-testing-experiment-design-and-statistical-power): Planen Sie ein A/B-Experiment, bestimmen Sie den Evidenzumfang, wählen Sie den passenden Test und prüfen Sie den Effekt vor einer Entscheidung.
