A/B 测试计算器 — 统计显著性

判断 A/B 测试结果是否具有统计显著性:转化率、提升幅度、z 值、p 值和通俗易懂的结论。

🔒 全部在你的浏览器中运行。输入和输出都不会发送到服务器或被保存,十分安全。

使用合并方差的双比例 z 检验(双侧)。p < 0.05 视为 95% 水平显著(90%:p < 0.10;99%:p < 0.01)。统计显著不等于商业上的保证——也要看提升幅度。点击结果即可复制。

这个工具有用吗?点一下表达心情

关于此工具

这款 A/B 测试计算器可判断两个版本之间的差异是真实的还是仅为噪声。输入 A 与 B 的访客数和转化数,它会算出各自的转化率、相对提升、两比例 z 检验及其 p 值,以及差异的置信区间。它会明确指出结果在 95% 水平上是否具有统计显著性(并显示 90%、99% 的门槛),让你凭证据而非直觉做决定。所有计算都在浏览器中本地完成。

常见问题

p 值到底是什么意思?

p 值是指:若两个版本其实完全相同,出现至少这么大差异的概率。p 很小(低于 0.05)意味着这种差距很难由偶然造成,于是称其“显著”。它既不是“B 胜过 A 的概率”,也不是效应大小——流量足够时,微小到无用的改进也可能显著。请把显著性和提升一起看:显著性说明效应是否真实,提升说明是否值得上线。

为什么不能一显著就停止测试?

因为反复偷看并在首次显著时就停止,会大幅增加假阳性——随机噪声出人意料地经常会暂时越过 0.05 线。请事先确定样本量(样本量计算器有帮助),跑到该样本量后再读结果。还要跑满完整的周期:工作日与周末、发薪日等效应否则可能伪装成“获胜版本”。

我的流量数据会离开电脑吗?

不会。z 检验、p 值和置信区间都由浏览器内的 JavaScript 计算,你输入的访客数和转化数不会被上传或保存,加载后可离线使用,从而保护商业数据。本工具假设每位访客只计一次且独立分配;若同一批用户同时出现在两组中,检验的前提就会失效。