指标是比例还是连续测量值?
两个独立二元结果应使用 two-proportion-z-test-calculator。两个独立连续指标且不能合理假设方差相等时使用 welch-t-test-calculator;只有同一批单位确实成对测量前后值时才使用 paired-t-test-calculator。
Elysia Tools
导航
Workflow Playbook
规划 A/B 实验、估算证据规模、选择合适检验,并在采取行动前复核效果量与不确定性。
专题
规划 A/B 实验、估算证据规模、选择合适检验,并在采取行动前复核效果量与不确定性。
本指南将当前任务范围转化为可复核的交付结果。请保留源文件、中间产物和关键判断,让后续协作者能够理解检查了什么以及为什么这样处理。
在查看结果前确定一个主要指标、对照基线、最小有用效果、显著性水平或置信水平,以及目标统计功效。
准备经过核对的各组计数或汇总统计量,明确随机化单位、实验窗口、护栏指标和停止规则;计算器不会验证埋点或流量分配。
决策点: 指标是比例还是连续测量值?. 两个独立二元结果应使用 two-proportion-z-test-calculator。两个独立连续指标且不能合理假设方差相等时使用 welch-t-test-calculator;只有同一批单位确实成对测量前后值时才使用 paired-t-test-calculator。
决策点: 统计证据是否达到业务验收线?. 只有当区间和效果量达到预先设定的实际门槛且护栏通过时才提交上线评审。p 值很小只说明与零假设的相容性,不等于改动有价值或安全。
用 effect-size-calculator 表达预期差异,用 sample-size-calculator 或 margin-of-error-calculator 了解精度,用 statistical-power-calculator 做单样本敏感性检查。真正的两组 A/B 设计使用 ab-test-significance-calculator 输入基线、提升、显著性水平、功效、流量和分流比例,估算用户数与天数。 使用 effect-size-calculator, sample-size-calculator, margin-of-error-calculator, statistical-power-calculator, ab-test-significance-calculator.
两个独立转化率使用 two-proportion-z-test-calculator,一个比例对固定基准使用 one-proportion-z-test-calculator。已知总体标准差或单一比例可用 z-test-calculator,单组均值用 one-sample-t-test-calculator,匹配观测用 paired-t-test-calculator,方差相等有依据时才用 two-sample-t-test-calculator,方差可能不等时用 welch-t-test-calculator。 使用 two-proportion-z-test-calculator, one-proportion-z-test-calculator, z-test-calculator, one-sample-t-test-calculator, paired-t-test-calculator, two-sample-t-test-calculator, welch-t-test-calculator.
输入冻结后的对照组和实验组计数或汇总统计量。用 ab-test-significance-calculator 计算差异、提升、区间、p 值、样本估算和警告;需要独立核对时使用 confidence-interval-calculator 与 p-value-calculator。看到结果后不要改主要指标或停止规则。 使用 ab-test-significance-calculator, confidence-interval-calculator, p-value-calculator.
把绝对和相对效果及其区间与实际门槛比较,复核样本质量、曝光规则、多重比较、序贯查看警告和外部护栏,再记录决定及理由。统计显著可能仍达不到业务门槛,不显著也不能证明完全没有效果。 使用 effect-size-calculator, confidence-interval-calculator, ab-test-significance-calculator, p-value-calculator.
工作流指南
用 effect-size-calculator 表达预期差异,用 sample-size-calculator 或 margin-of-error-calculator 了解精度,用 statistical-power-calculator 做单样本敏感性检查。真正的两组 A/B 设计使用 ab-test-significance-calculator 输入基线、提升、显著性水平、功效、流量和分流比例,估算用户数与天数。
两个独立转化率使用 two-proportion-z-test-calculator,一个比例对固定基准使用 one-proportion-z-test-calculator。已知总体标准差或单一比例可用 z-test-calculator,单组均值用 one-sample-t-test-calculator,匹配观测用 paired-t-test-calculator,方差相等有依据时才用 two-sample-t-test-calculator,方差可能不等时用 welch-t-test-calculator。
输入冻结后的对照组和实验组计数或汇总统计量。用 ab-test-significance-calculator 计算差异、提升、区间、p 值、样本估算和警告;需要独立核对时使用 confidence-interval-calculator 与 p-value-calculator。看到结果后不要改主要指标或停止规则。
把绝对和相对效果及其区间与实际门槛比较,复核样本质量、曝光规则、多重比较、序贯查看警告和外部护栏,再记录决定及理由。统计显著可能仍达不到业务门槛,不显著也不能证明完全没有效果。
两个独立二元结果应使用 two-proportion-z-test-calculator。两个独立连续指标且不能合理假设方差相等时使用 welch-t-test-calculator;只有同一批单位确实成对测量前后值时才使用 paired-t-test-calculator。
只有当区间和效果量达到预先设定的实际门槛且护栏通过时才提交上线评审。p 值很小只说明与零假设的相容性,不等于改动有价值或安全。