# A/B 测试显著性计算器

输入对照组/实验组数据，输出转化率差异、95%/99% 置信区间、Z-test（比率）或 Welch t 检验（连续变量）的 p-value 与显著性判定、提升百分比、达到 80%/90% 功效所需样本量、推荐实验天数、Sequential testing 警告与 Bonferroni 多重比较修正。

> 标准页面: https://elysiatools.com/zh/tools/ab-test-significance-calculator

- **分类:** Data Analysis

- **关键词:** A/B 测试, 显著性, p值, 置信区间, Z检验, Welch t检验, 转化率, 样本量, 统计功效, Bonferroni, 序贯检验, 提升

## 概述

判断你的 A/B 测试结果是真实信号还是噪声——而且统计方法做对。

**两种检验类型。**
- **比率 / 转化率。** 输入对照组和实验组的成功数与访客数。工具计算转化率、相对提升、合并 Z 检验，以及差异的 95%/99% 置信区间。
- **连续指标（均值与标准差）。** 输入每组的均值、标准差和样本量。工具运行 Welch t 检验（不假设方差相等），自由度采用 Welch–Satterthwaite，并报告差异、相对变化和置信区间。

**不止看 p 值。** 单凭一个 p 值不足以行动。本工具还提供：
- **提升**——相对变化，干系人真正关心的数。
- **置信区间**——真实效应的可能范围；若跨越零则不显著。
- **样本量**——要可靠地检出这种规模的效应，每个变体需要多少用户（80%/90% 功效）。
- **推荐实验天数**——基于每日流量和分流比例。
- **Bonferroni 修正**——当你做多次比较时，有效 α 会缩小；工具告诉你结果能否在修正后仍然成立。

**序贯检验警告。** 在实验中途偷看 p 值并提前停止会抬高假阳性。工具会就此警告。如果必须反复查看，请使用 always-valid 序贯方法（如 mSPRT），或预注册样本量并坚持执行。

**如何读结论。** "显著"意味着数据在 α=0.05 下与"没有差异"不相容——它*并不*意味着提升很大或很重要。上线前务必把显著性与效应量（提升和置信区间）结合起来看。

## 输入项

- **测试类型** (select)
- **对照组：成功数** (number): e.g. 1200
- **对照组：访客数** (number): e.g. 20000
- **实验组：成功数** (number): e.g. 1320
- **实验组：访客数** (number): e.g. 20000
- **对照组：均值** (number): e.g. 42.5
- **对照组：标准差** (number): e.g. 12.0
- **对照组：样本量** (number): e.g. 500
- **实验组：均值** (number): e.g. 45.8
- **实验组：标准差** (number): e.g. 12.5
- **实验组：样本量** (number): e.g. 500
- **显著性水平 α** (select)
- **统计功效** (select)
- **基线转化率 (%)** (number): e.g. 6 (for sample-size planning)
- **MDE 提升 (%)** (number): e.g. 5 (minimum detectable lift)
- **每日访客数** (number): e.g. 4000 (for days estimate)
- **流量分配 (%)** (select)
- **比较组数** (number): 1 unless running multiple variants
- **小数位数** (number)

## 适用场景

- 评估网页或 App 新版界面的转化率（如点击率、注册率、购买率）是否相比旧版有显著提升。
- 比较两个版本在连续型指标（如用户停留时长、客单价、页面加载时间）上的均值差异。
- 在进行多组变体测试（A/B/n 测试）时，需要引入 Bonferroni 修正以控制整体假阳性率。

## 工作原理

- 选择测试类型：对于注册率等比例数据选择“比率（转化率）”，对于客单价等数值数据选择“连续变量”。
- 输入对照组与实验组的样本数据（如成功数与访客数，或均值、标准差与样本量），并设置显著性水平 α 和统计功效。
- 工具自动运行 Z 检验或 Welch t 检验，计算出 p 值、置信区间、相对提升度，并基于每日访客数估算所需的实验天数与样本量。

## 使用案例

- 电商平台评估新版结账流程对购买转化率的实际提升效果。
- 内容网站对比两种推荐算法下用户的平均阅读时长（连续变量）。
- 运营团队在多变体测试中评估不同文案对广告点击率的影响，并进行多重比较修正。

## 常见问题

### 什么是 p 值（p-value），如何判断结果是否显著？

p 值是在假设两组无差异时，观察到当前或更极端差异的概率。当 p 值小于设定的显著性水平 α（通常为 0.05）时，判定结果具有统计学显著性。

### 为什么不能在实验过程中频繁查看 p 值并提前结束？

频繁查看（即序贯检验）会显著抬高假阳性率。若必须提前结束，需使用特定的序贯检验设计，否则应坚持达到预设样本量。

### 什么是 Bonferroni 修正，什么时候需要使用？

当同时测试多个实验组（A/B/n 测试）时，发生假阳性的概率会累积。Bonferroni 修正通过将 α 除以比较组数来严格控制多重比较的错误率。

### 为什么我的实验结果显著，但置信区间却很宽？

置信区间宽通常意味着样本量较小，虽然检测到了显著差异，但对真实效应量的估计精度较低。增加样本量可以缩窄置信区间。

### 连续变量检验中，为什么要使用 Welch t 检验而不是 Student's t 检验？

Welch t 检验不假设两组数据的方差相等，在实际 A/B 测试中，对照组和实验组的方差往往不同，Welch t 检验比传统 t 检验更稳健。

## 相关工具

- [蒙特卡洛模拟构建器](https://elysiatools.com/zh/tools/monte-carlo-simulation-builder): 定义输入分布（正态/均匀/对数正态/三角），写出公式，运行上万次模拟，得到输出分布直方图与置信区间。
- [RSS / Atom 订阅源 Markdown 摘要器](https://elysiatools.com/zh/tools/rss-feed-markdown-summarizer): 通过 URL 抓取 RSS / Atom 订阅源（或粘贴原始 XML），按发布日期排序、去重、按时间窗口过滤，并输出一份适合 newsletter 与聚合站的干净 Markdown 摘要
- [AI Markdown 文章翻译器](https://elysiatools.com/zh/tools/ai-markdown-article-translator): 使用 AI 翻译整篇 Markdown 文章，并保留标题、表格、链接、图片与代码块结构，适合直接发布
- [文件名清理器](https://elysiatools.com/zh/tools/filename-sanitizer): 清理和消毒文件名，移除Windows、Linux和Mac的非法字符
- [平均血小板体积 (MPV) 分析器](https://elysiatools.com/zh/tools/mean-platelet-volume-analyzer): 分析平均血小板体积 MPV（单位 fL）。参考范围约 7.5–11.5 fL。低 MPV（< 7.5 fL，小而老的血小板）提示骨髓生成受抑：再生障碍性贫血、化疗/放疗后、近期血小板输注、缺铁性贫血早期恢复、Wiskott-Aldrich 综合征。高 MPV（> 11.5 fL，大而年轻的血小板）提示外周破坏伴代偿性骨髓生成、或大血小板性血小板减少：免疫性血小板减少症 ITP、脾切除后、骨髓增殖性肿瘤（ET/CML/MF）、重症感染恢复期、Bernard-Soulier/MYH9、巨幼细胞贫血、急性心肌梗死（血小板活化的不良心血管标志）。结合血小板计数可细化鉴别：低血小板+高 MPV→外周破坏（ITP/TTP/DIC 恢复）；低血小板+低 MPV→生成低下；高血小板+低 MPV→反应性血小板增多；高血小板+高 MPV→骨髓增殖性肿瘤。注意事项：EDTA 抗凝血放置约 2 小时血小板肿胀使 MPV 升高，且方法学相关（阻抗法 > 光学法 > 免疫法），应同实验室同仪器比较。来源 Bath 1996、Leader 2012、Vagdatli 2010、MDCalc。不构成医疗建议。
- [正态分布绘图器](https://elysiatools.com/zh/tools/normal-distribution-plotter): 将正态分布绘制为 SVG 钟形曲线，可标注 z 分数、区间或尾部概率阴影，并叠加 68/95/99.7 标准差带。
- [数组分组器](https://elysiatools.com/zh/tools/array-grouper): 根据各种条件对数组元素进行分组，如长度、字母顺序、数值范围、自定义条件等
- [APACHE II 危重病评分计算器](https://elysiatools.com/zh/tools/apache-ii-score): 计算 APACHE II 危重病评分：急性生理评分 APS（12 项生理变量，每项 0-4 分，取入 ICU 24h 内最差值）+ 年龄分（0-6）+ 慢性健康分（0/2/5），总分 0-71，越高预后越差。氧合：FiO₂≥0.5 用 A-a 梯度，否则用 PaO₂；急性肾衰时肌酐分翻倍；GCS 计 15−GCS。同时给出基础死亡风险预测（logit=−3.517+0.146×分，不含诊断类别权重）。来源 Knaus 1985 Crit Care Med、SFAR 评分表。不能替代临床判断。不构成医疗建议。

## 示例

- [Android Java 图像处理示例](https://elysiatools.com/zh/samples/android-image-processing-java): Android Java 图像处理示例，包括图像读取保存、缩放和格式转换
- [Android Kotlin 图像处理示例](https://elysiatools.com/zh/samples/android-image-processing-kotlin): Android Kotlin 图像处理示例，包括图像读取保存、缩放和格式转换
- [Web Python 图像处理示例](https://elysiatools.com/zh/samples/web-image-processing-python): Web Python 图像处理示例，使用 PIL/Pillow 包括读取、保存、缩放和格式转换
- [Web Rust 图像处理示例](https://elysiatools.com/zh/samples/web-image-processing-rust): Web Rust 图像处理示例，包括图像读取保存、缩放和格式转换

## 相关内容

- [A/B 实验设计、样本量与统计功效](https://elysiatools.com/zh/hubs/ab-testing-experiment-design-and-statistical-power): 规划 A/B 实验、估算证据规模、选择合适检验，并在采取行动前复核效果量与不确定性。
