自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

统计与概率入门

  1. 01数据到底在说什么
  2. 02数据从哪里来:调查、实验与偏差
  3. 03用图表看数据:分布、形状与异常值
  4. 04平均数不总是平均:中心与离散
  5. 05相关不等于因果
  6. 06概率从不确定开始
  7. 07计数、排列组合与概率计算
  8. 08条件概率:信息会改变概率
  9. 09随机变量与常见分布
  10. 10从样本推总体:抽样误差与置信区间
  11. 11显著性检验:差异是真的,还是偶然的
正在加载课程章节内容
课程数学统计与概率入门显著性检验:差异是真的,还是偶然的

显著性检验:差异是真的,还是偶然的

上一节里,我们用置信区间给未知参数圈出了一段合理范围。现在把问题换一个方向:如果有人先提出一个明确说法,样本数据能不能把这个说法推翻?

这类问题在生活里到处都是。一个按钮的报名率从 6.1%6.1\%6.1% 变成 6.8%6.8\%6.8%,到底是改版有效,还是刚好分到了一批更愿意报名的人?一种新药的改善率比安慰剂高 111111 个百分点,是疗效,还是几百人的样本波动?某城市今年的平均通勤时间多了 444 分钟,是交通真的变差了,还是这次抽到的人碰巧住得更远?

显著性检验不会直接宣布哪一种解释“绝对正确”。它做的是一件更克制的事:先把“没有真实差异”当作基线,再衡量眼前的数据离这条基线有多远。 如果在基线世界里,这么远的结果很少见,我们就有理由怀疑基线;如果并不少见,证据就还不够。

这个过程经常得出反直觉的结论。样本里明明有差异,检验却可能说证据不足;p 值明明只有 0.0490.0490.049,结论也不等于“已经证明有效”。这一章的目标不是让你机械套公式,而是把这些容易拧巴的地方一件件想顺。

显著性检验从原假设分布衡量观测统计量并计算双侧 p 值

检验统计量把“离原假设多远”换成统一尺度;p 值则把同样极端或更极端的尾部概率加起来。


先把研究问题翻译成两种说法

我们先看一个贯穿全章的 A/B 测试。某学习网站把访客随机分到两个版本:

  • A 版本有 100001000010000 名访客,其中 610610610 人报名,样本报名率为 6.1%6.1\%6.1%;
  • B 版本也有 100001000010000 名访客,其中 680680680 人报名,样本报名率为 6.8%6.8\%6.8%。

样本里 B 比 A 高 0.70.70.7 个百分点。这是已经看到的事实,不需要检验。但团队真正关心的不是这两万名访客,而是这次实验覆盖机制下的目标访客面对两个版本时的真实报名率:也就是有机会进入网站、符合实验纳入规则并能被同一套系统随机分流的那类访客。把两个版本在这个目标总体中的报名率分别记作 pAp_ApA​ 和 pBp_BpB​,研究问题就变成了:pB−pAp_B-p_ApB​−pA​ 是否真的不等于 000?

原假设是暂时采用的基线

原假设记作 H0H_0H0​。它通常写成“没有差异”“没有效果”或“总体参数等于某个基准值”。A/B 测试的原假设是:

H0:pB−pA=0H_0:p_B-p_A=0H0​:pB​−pA​=0

这句话不是说我们已经相信两个版本完全一样。它只是搭起一个可计算的世界:假如两个版本真实报名率相同,那么随机分组会制造出多大的样本差异? 后面所有“意不意外”的判断,都先在这个世界里进行。

备择假设说清楚我们在找什么

备择假设记作 H1H_1H1​。如果实验前只想判断两个版本是否不同,不管谁高谁低,就写成:

H1:pB−pA≠0H_1:p_B-p_A\ne0H1​:pB​−pA​=0

这是双侧检验,因为正方向和负方向都算与 H0H_0H0​ 相矛盾的结果。B 明显更好值得发现,B 明显更差也不能装作没看见。

如果产品团队在实验前就有充分理由只关心“B 是否更高”,也可以写成:

H1:pB−pA>0H_1:p_B-p_A>0H1​:pB​−pA​>0

这是一项右侧检验。相应地,质量检查若只关心不合格率是否超过上限 p0p_0p0​,会写成 H1:p>p0H_1:p>p_0H1​:p>p0​;若只关心一种治疗是否降低复发率,则可能写成 H1:p治疗−p对照<0H_1:p_{\text{治疗}}-p_{\text{对照}}<0H1​:p治疗​−p对照​<0。

单侧还是双侧,必须在看最终数据前决定。看见 B 更高以后才把双侧改成右侧,会少算另一边同样极端的结果,人为压低 p 值。更麻烦的是,如果数据意外显示 B 有害,原先的右侧检验不能临时掉头去追这个方向。医学和安全问题通常更适合双侧检验,因为反方向的伤害也需要被发现。

假设必须谈总体参数

另一个常见错误,是把已经知道的样本数字写进假设。例如写成 H0:p^A=0.061H_0:\hat p_A=0.061H0​:p^​A​=0.061 没有什么可检验的:这只是样本事实。假设要谈未知的总体参数,例如总体比例 ppp、总体均值 μ\muμ、总体比例差 p1−p2p_1-p_2p1​−p2​ 或总体均值差 μ1−μ2\mu_1-\mu_2μ1​−μ2​。

研究问题、参数和假设之间应该能一口气读下来:我们想知道实验覆盖的目标访客在 B 版本的真实报名率是否与 A 不同,所以参数是 pB−pAp_B-p_ApB​−pA​,基线是差值为 000,备择是差值不为 000。若要把结论继续推广到未来,还要额外相信访客构成、季节、流量渠道和页面运行系统没有发生足以改变效果的变化;显著性检验本身不会替我们保证这种稳定性。


检验统计量:数据离原假设到底有多远

只说“相差 0.70.70.7 个百分点”还不够。若每组只有 202020 人,这点差异小得几乎看不出来;若每组有一百万人,同样的差异可能远超普通随机波动。我们需要拿观察到的差异去除以它在 H0H_0H0​ 下通常会波动的尺度:

检验统计量=样本估计值−原假设值原假设下的标准误\text{检验统计量} = \frac{\text{样本估计值}-\text{原假设值}} {\text{原假设下的标准误}}检验统计量=原假设下的标准误样本估计值−原假设值​

这就是“离原假设多远”的统一刻度。统计量为 000,表示样本估计正好落在原假设值上;统计量为 222,表示它离原假设大约两个标准误;统计量为 −3-3−3,表示它在相反方向上离了三个标准误。正负号告诉我们方向,绝对值告诉我们距离。

为什么要除以标准误?因为 555 分钟的差异放在“每次波动只有 111 分钟”的研究里很醒目,放在“每次波动有 202020 分钟”的研究里就很普通。标准误把研究本身的噪声算进来了,让不同单位、不同样本量的问题可以用同一种距离直觉理解。

比例问题通常得到 z 统计量

检验一个总体比例是否等于 p0p_0p0​ 时,在 H0:p=p0H_0:p=p_0H0​:p=p0​ 下使用:

SEH0=p0(1−p0)nSE_{H_0} = \sqrt{\frac{p_0(1-p_0)}{n}}SEH0​​=np0​(1−p0​)​​ z=p^−p0SEH0z = \frac{\hat p-p_0}{SE_{H_0}}z=SEH0​​p^​−p0​​

这里特意使用 p0p_0p0​,而不是样本比例 p^\hat pp^​。原因很直接:检验正在问“如果 H0H_0H0​ 成立,样本会怎样波动”,所以标准误也要从 H0H_0H0​ 给定的比例出发。

比较两个比例,且原假设是 H0:p1−p2=0H_0:p_1-p_2=0H0​:p1​−p2​=0 时,H0H_0H0​ 认为两组共享同一个比例。我们把两组成功数合在一起估计它:

p^合并=x1+x2n1+n2\hat p_{\text{合并}} = \frac{x_1+x_2}{n_1+n_2}p^​合并​=n1​+n2​x1​+x2​​ SEH0=p^合并(1−p^合并)(1n1+1n2)SE_{H_0} = \sqrt{ \hat p_{\text{合并}}(1-\hat p_{\text{合并}}) \left(\frac{1}{n_1}+\frac{1}{n_2}\right) }SEH0​​=p^​合并​(1−p^​合并​)(n1​1​+n2​1​)​

对应的检验统计量为:

z=(p^1−p^2)−0SEH0z = \frac{(\hat p_1-\hat p_2)-0}{SE_{H_0}}z=SEH0​​(p^​1​−p^​2​)−0​

均值问题通常得到 t 统计量

检验总体均值是否等于 μ0\mu_0μ0​ 时,总体标准差通常未知,只能用样本标准差 sss 估计。因此我们使用尾部稍厚的 ttt 分布:

SE=snSE = \frac{s}{\sqrt n}SE=n​s​ t=xˉ−μ0s/nt = \frac{\bar x-\mu_0}{s/\sqrt n}t=s/n​xˉ−μ0​​

单样本均值检验的自由度通常为 df=n−1df=n-1df=n−1。样本越小,sss 对总体波动的估计越不稳定,ttt 分布的尾部就越厚;样本增大后,它会越来越接近标准正态分布。

先检查数据能不能支撑这个模型

公式不会替我们修复坏数据。比例的正态近似检验通常要求观察彼此独立,并且在 H0H_0H0​ 下每组预期的“成功”和“失败”数量都不能太少,常用的入门检查线是至少 101010。均值的 t 检验同样需要独立观察;小样本还要特别留意明显偏斜和离群点,大样本虽然更耐受偏斜,也不能无视极端离群值。

随机抽样帮助我们把结论推广到目标总体,随机分组帮助我们解释因果。两者解决的不是同一个问题。如果网站只让新用户看 B、老用户看 A,即使公式给出很小的 p 值,我们也分不清差异来自页面还是用户构成。

检验统计量只量化模型所描述的随机波动。选择偏差、混杂、重复记录、测量错误和不恰当的停止规则,不会因为除了一次标准误就自动消失。


p 值:只在原假设世界里提问

p 值最准确的定义是:

在原假设成立,并且检验模型的条件也成立时,得到当前这么有利于备择假设、或更加极端的检验统计量的概率,就是 p 值。

用条件概率的形式写,就是:

p 值=P(检验统计量至少像当前一样极端∣H0 成立)p\text{ 值} = P(\text{检验统计量至少像当前一样极端}\mid H_0\text{ 成立})p 值=P(检验统计量至少像当前一样极端∣H0​ 成立)

注意条件写在竖线右边:我们暂时把 H0H_0H0​ 当真,再问这样的数据有多少见。p 值不是下面这个概率:

P(H0 成立∣已经看到当前数据)P(H_0\text{ 成立}\mid\text{已经看到当前数据})P(H0​ 成立∣已经看到当前数据)

这两个问题看起来只是把左右对调,含义却完全不同。就像“下雨时地面湿的概率”不能直接倒过来当成“地面湿时一定下过雨”,因为洒水车也会让地面变湿。

“更极端”由备择假设决定

若 H1:p>p0H_1:p>p_0H1​:p>p0​,更大的统计量更支持备择,p 值取右尾面积;若 H1:p<p0H_1:p<p_0H1​:p<p0​,p 值取左尾面积。若 H1:p≠p0H_1:p\ne p_0H1​:p=p0​,正负两个方向都算偏离,p 值要包含两侧同样远或更远的尾部。

以 z=2.02z=2.02z=2.02 为例,右侧单尾面积约为 0.0220.0220.022;双侧检验还要把左边 z≤−2.02z\le-2.02z≤−2.02 的同等极端结果算进去,所以 p 值约为 0.0440.0440.044。这就是为什么同一份数据采用单侧或双侧会得到不同 p 值,也说明为什么方向不能事后挑。

一个小 p 值究竟说明什么

假设双侧检验得到 p=0.03p=0.03p=0.03。准确说法是:如果 H0H_0H0​ 成立且模型合适,重复进行同样的研究,得到当前这么极端或更极端统计量的概率约为 3%3\%3%。

它不表示:

  • H0H_0H0​ 只有 3%3\%3% 的概率为真;
  • H1H_1H1​ 有 97%97\%97% 的概率为真;
  • 结果有 97%97\%97% 的概率可以重复;
  • 效果有 97%97\%97% 的概率足够大;
  • 随机波动只解释了结果的 3%3\%3%。

p 值衡量的是数据与一个指定原假设之间的不相容程度,不是给所有解释排出概率。数据造假、实验偏差、模型失配和真实效果都可能让数据显得与 H0H_0H0​ 不相容,单独一个 p 值分不开它们。


显著性水平:先定规则,再看结果

显著性水平记作 α\alphaα。它是看数据前定下的决策阈值。常见的 α=0.05\alpha=0.05α=0.05 不是自然界的一条分界线,也不是“可信度必须达到 95%95\%95%”,而是一条人为选择的长期错误控制规则。

在一套满足条件的检验中,如果 H0H_0H0​ 真的成立,我们仍可能因为随机波动得到很极端的样本。把规则设为 α=0.05\alpha=0.05α=0.05,意思是长期反复使用这套规则时,第一类错误率不超过约 5%5\%5%:

P(拒绝 H0∣H0 真实)≤αP(\text{拒绝 }H_0\mid H_0\text{ 真实})\le\alphaP(拒绝 H0​∣H0​ 真实)≤α

为什么这里一般写“小于或等于”?像二项计数这样的离散数据,只能取若干个跳跃的结果,拒绝域未必刚好凑出 5%5\%5% 的概率,实际错误率可能更小。对连续分布、临界值又能精确校准的简单检验,等号有时成立。无论是哪种情况,α\alphaα 表示事前承诺的上限,不是数据算出来的“原假设出错概率”。

做决定时比较 p 值与 α\alphaα:

  • 若 p<αp<\alphap<α,拒绝 H0H_0H0​,说数据提供了反对 H0H_0H0​、支持 H1H_1H1​ 的统计证据;
  • 若 p≥αp\ge\alphap≥α,不能拒绝 H0H_0H0​,说当前证据不足以把观察结果与 H0H_0H0​ 下的随机波动区分开。

第二句话故意写得有点绕,因为“不能拒绝”确实不等于“接受”。法庭里证据不足以定罪,不等于已经证明被告绝对无辜;小样本里没有检出差异,也不等于真实差异严格为零。

0.049 和 0.051 没有本质鸿沟

如果 α=0.05\alpha=0.05α=0.05,p=0.049p=0.049p=0.049 会落在“拒绝”一边,p=0.051p=0.051p=0.051 会落在“不能拒绝”一边。但这两个 p 值表达的证据强度几乎一样。把前者写成“确定有效”、后者写成“完全无效”,是在让一条方便决策的线冒充自然界的断崖。

更诚实的报告方式是同时给出 p 值、效应大小和置信区间。例如:“估计提升 0.70.70.7 个百分点,95% 置信区间约为 0.020.020.02 到 1.381.381.38 个百分点,双侧 p≈0.044p\approx0.044p≈0.044。”读者可以看出证据刚刚越过预设门槛,区间也靠近 000,而不是只看到“显著”两个字。

α\alphaα 是事前规则,p 值是事后由数据算出的连续证据指标。不要把 p 值写成只有“过线”和“没过线”两种状态,更不要把 0.050.050.05 解释成结论为真的概率。


完整例子:A/B 测试该不该上线

回到开头的数据。A 版本 100001000010000 人中有 610610610 人报名,B 版本 100001000010000 人中有 680680680 人报名。假设访客在实验开始时被随机分流,主要指标和实验时长也提前确定。我们使用双侧检验,显著性水平为 α=0.05\alpha=0.05α=0.05。

随机分流的 A/B 测试中两个版本的访客数、报名数和报名率

先把研究问题落到总体参数。我们关心实验覆盖机制下目标访客在两个版本中的真实报名率差 pB−pAp_B-p_ApB​−pA​,所以写出 H0:pB−pA=0H_0:p_B-p_A=0H0​:pB​−pA​=0 与 H1:pB−pA≠0H_1:p_B-p_A\ne0H1​:pB​−pA​=0。双侧意味着 B 更好或更差都不能忽略。

检查数据来源和近似条件。随机分流让两组在实验开始时具有可比性;每名访客只进入一个版本,而且假设没有同一家庭、团队或营销渠道形成的明显聚类,也没有一个访客看到某版本后去影响另一名访客的报名决定,因此可以把观察近似看作独立。在 H0H_0H0​ 下,两组使用共同报名率,预期报名和未报名人数都远大于 101010,正态近似没有小计数问题。

先描述样本里实际发生了什么:

p^A=61010000=0.061\hat p_A=\frac{610}{10000}=0.061p^​A​=10000610​=0.061p^B=68010000=0.068\hat p_B=\frac{680}{10000}=0.068p^​B​=10000680​=0.068

因而 B 比 A 高 0.068−0.061=0.0070.068-0.061=0.0070.068−0.061=0.007,也就是 0.70.70.7 个百分点。每一万名访客大约多 707070 次报名。

在 H0H_0H0​ 下,两个版本共享同一个真实报名率。把两组数据合起来估计这个共同值:

p^合并=610+68010000+10000=0.0645\hat p_{\text{合并}} = \frac{610+680}{10000+10000} =0.0645p^​合并​=10000+10000610+680​=0.0645

用合并比例计算 H0H_0H0​ 世界中两组差值的标准误:

SEH0=0.0645(1−0.0645)(110000+110000)≈0.00347SE_{H_0} = \sqrt{ 0.0645(1-0.0645) \left(\frac{1}{10000}+\frac{1}{10000}\right) } \approx0.00347SEH0​​=0.0645(1−0.0645)(100001​+100001​)​≈0.00347

也就是说,如果两个版本其实一样,两个样本报名率之差的典型波动尺度约为 0.3470.3470.347 个百分点。

把观察到的差异换成“离 H0H_0H0​ 几个标准误”:

z=(0.068−0.061)−00.00347≈2.02z = \frac{(0.068-0.061)-0}{0.00347} \approx2.02z=0.00347(0.068−0.061)−0​≈2.02

B 的样本优势离“真实差值为 000”大约两个标准误。

双侧检验把正负两个方向的同等极端结果都算进去,得到 p≈0.044p\approx0.044p≈0.044。准确解释是:如果两个版本真实报名率相同,且随机分流与模型条件成立,观察到至少相差 0.70.70.7 个百分点这么极端的样本结果,概率约为 4.4%4.4\%4.4%。

因为 0.044<0.050.044<0.050.044<0.05,按事前规则拒绝 H0H_0H0​。数据对“两个版本完全没有差异”提供了反证,但证据只是刚刚越过门槛,不能写成“B 已被证明必胜”。

最后看实际大小。检验和区间在这里要使用不同的标准误。检验暂时采用 H0:pA=pBH_0:p_A=p_BH0​:pA​=pB​,所以前面使用合并比例;置信区间是在估计未知差值,不先假定两组相等,因此使用两组各自的样本比例:

SE区间=0.061(1−0.061)10000+0.068(1−0.068)10000≈0.00347SE_{\text{区间}} = \sqrt{ \frac{0.061(1-0.061)}{10000} + \frac{0.068(1-0.068)}{10000} } \approx0.00347SE区间​=100000.061(1−0.061)​+100000.068(1−0.068)​​≈0.00347

本例中合并标准误与非合并标准误四舍五入后碰巧都约为 0.003470.003470.00347,但概念和一般公式并不相同。差值的近似 95% 置信区间为:

0.007±1.96×0.00347≈(0.0002,0.0138)0.007\pm1.96\times0.00347 \approx(0.0002,0.0138)0.007±1.96×0.00347≈(0.0002,0.0138)

换成百分点,大约是提升 0.020.020.02 到 1.381.381.38 个百分点。区间告诉我们,效果可能很小,也可能足够可观。是否上线还要结合每次报名价值、改版成本、护栏指标和复验结果。

这个例子还有一个容易忽略的前提:实验不能每天看一次 p 值,一到 0.050.050.05 以下就停。反复查看相当于给随机波动很多次“撞线机会”,实际第一类错误率会高于原先承诺的 5%5\%5%。若确实需要连续监控,就要预先使用适合序贯实验的规则,不能把普通固定样本检验原样照搬。

即使这次随机实验内部做得很好,结论最直接支持的仍是实验覆盖机制下的目标访客。若未来访客来自不同地区,节假日改变了访问动机,广告渠道换了一批人,或者报名系统本身被改动,效果都可能变化。把这次结果推广到未来,需要这些关键条件大体稳定,并最好在新的时间窗口复验。


完整例子:新药真的提高了改善率吗

假设一项随机、双盲、安慰剂对照实验招募了 400400400 名符合条件的患者。药物组 200200200 人中有 707070 人明显改善,安慰剂组 200200200 人中有 484848 人明显改善。主要结局、分析方法和 α=0.05\alpha=0.05α=0.05 都在研究开始前确定。

这次仍做双侧检验,因为新药可能更好,也可能更差:

H0:p药物−p安慰剂=0H_0:p_{\text{药物}}-p_{\text{安慰剂}}=0H0​:p药物​−p安慰剂​=0 H1:p药物−p安慰剂≠0H_1:p_{\text{药物}}-p_{\text{安慰剂}}\ne0H1​:p药物​−p安慰剂​=0

随机分组让两组具有可比性,双盲减少治疗期待和结果评估带来的偏差。每名患者只在一组中出现。在 H0H_0H0​ 下,两组预期改善人数和未改善人数都大于 101010,可以使用两比例 z 检验。

样本改善率分别为:

p^药物=70200=0.35\hat p_{\text{药物}}=\frac{70}{200}=0.35p^​药物​=20070​=0.35p^安慰剂=48200=0.24\hat p_{\text{安慰剂}}=\frac{48}{200}=0.24p^​安慰剂​=20048​=0.24

观察到的绝对差异为 0.110.110.11,即每 100100100 名患者约多 111111 人改善。

在 H0H_0H0​ 下估计共同改善率:

p^合并=70+48200+200=0.295\hat p_{\text{合并}} = \frac{70+48}{200+200} =0.295p^​合并​=200+20070+48​=0.295

标准误为:

SEH0=0.295(1−0.295)(1200+1200)≈0.0456SE_{H_0} = \sqrt{ 0.295(1-0.295) \left(\frac{1}{200}+\frac{1}{200}\right) } \approx0.0456SEH0​​=0.295(1−0.295)(2001​+2001​)​≈0.0456

因而检验统计量为:

z=0.35−0.240.0456≈2.41z = \frac{0.35-0.24}{0.0456} \approx2.41z=0.04560.35−0.24​≈2.41

双侧 p 值约为 0.0160.0160.016。如果新药与安慰剂真实改善率相同,在同样条件下得到当前这么大或更大的双向差异,概率约为 1.6%1.6\%1.6%。因为 0.016<0.050.016<0.050.016<0.05,拒绝 H0H_0H0​。

用未合并的两组样本比例估计差值的置信区间,近似得到:

0.11±1.960.35(1−0.35)200+0.24(1−0.24)200≈(0.021,0.199)0.11\pm1.96 \sqrt{ \frac{0.35(1-0.35)}{200} + \frac{0.24(1-0.24)}{200} } \approx(0.021,0.199)0.11±1.962000.35(1−0.35)​+2000.24(1−0.24)​​≈(0.021,0.199)

数据相容的真实改善优势大约为 2.12.12.1 到 19.919.919.9 个百分点。这个范围比“p 值显著”更接近临床真正要讨论的问题。

现在还不能直接宣布药物应该投入使用。我们需要知道“明显改善”怎样定义、随访是否完整、不良反应有多严重、样本能否代表目标患者、改善能维持多久,以及其他研究能否重复这个结果。统计检验处理的是随机波动,不会替医学判断做完后面的工作。


两类错误、功效和样本量

只要根据随机样本做决定,就有可能出错。真实世界有两种状态,检验也有两种决定,组合起来是四种情况:

真实情况不拒绝 H0H_0H0​拒绝 H0H_0H0​
H0H_0H0​ 成立决定正确第一类错误,假阳性
H1H_1H1​ 对应的真实效果存在第二类错误,假阴性决定正确

在药物例子里,第一类错误是药物其实没有改善作用,我们却把随机差异误认成疗效;第二类错误是药物确实有效,研究却没有检出足够证据。

降低一类错误,通常会抬高另一类

把 α\alphaα 从 0.050.050.05 降到 0.010.010.01,拒绝 H0H_0H0​ 需要更极端的数据,第一类错误会减少。但在样本量不变时,真实效果也更难跨过门槛,第二类错误往往增加。反过来,提高 α\alphaα 会更容易发现效果,也会制造更多假阳性。

所以阈值要结合后果来选。把无效药误判为有效可能带来严重副作用,就需要更严格的第一类错误控制;一种低成本筛查若漏掉疾病的后果很重,研究设计则要特别关心第二类错误。这里没有脱离情境的万能数字。

功效问的是“真有效时,我们发现得了吗”

第二类错误概率常记作 β\betaβ,检验功效定义为:

功效=1−β\text{功效}=1-\beta功效=1−β

它表示在某个具体的真实效果大小下,检验能够拒绝 H0H_0H0​ 的概率。功效不是一项研究固定不变的标签:真实提升若只有 0.10.10.1 个百分点,可能很难发现;若提升有 555 个百分点,同一研究的功效会高得多。

通常,下列变化会提高发现真实效果的机会:

  • 增加样本量,让标准误变小;
  • 改善测量,降低噪声;
  • 使用合理的配对或分层设计,减少无关个体差异;
  • 在确有事前依据时使用单侧检验;
  • 提高 α\alphaα,但这会增加第一类错误。

样本量规划不能只问“多少人才容易显著”。研究开始前应先规定最小实际重要差异,再结合可接受的第一类错误率、目标功效和数据波动,估算需要多少观察。这样得到的样本量是在回答现实问题,而不是保证产生一个好看的 p 值。

小样本没有显著结果时,先看置信区间。如果区间既包含“几乎没有效果”,也包含“很有价值的效果”,这项研究不是证明了无效,而是信息还不够精确。要主张两种方案足够接近,需要专门设计等效性或非劣效性检验,不能靠普通检验的“不显著”代替。


统计显著不等于现实中重要

p 值同时受效应大小和样本量影响。样本特别大时,微小到几乎无关紧要的差异也可能得到很小的 p 值;样本很小时,一个实际看起来不小的差异又可能因为标准误太大而没有显著。

假设某平台有数百万用户,改版把平均停留时间从 30.00030.00030.000 分钟提高到 30.01530.01530.015 分钟。只要样本足够大,这 0.0150.0150.015 分钟也可能统计显著。但它只有 0.90.90.9 秒,是否值得投入研发、是否改善学习效果,是另一个问题。

反过来,一项早期罕见病试验估计症状缓解率提高 121212 个百分点,却因为样本很少得到 p=0.09p=0.09p=0.09。我们不能说“没有效果”,也不能跳过不确定性说“一定有效”。更有用的信息是效应估计、置信区间和追加数据的计划。

所以报告检验结果时,至少把三件事放在一起:

  • 效应方向和大小,例如“提高 0.70.70.7 个百分点”;
  • 不确定范围,例如“95% 置信区间为 0.020.020.02 到 1.381.381.38 个百分点”;
  • p 值和事前阈值,例如“双侧 p=0.044p=0.044p=0.044,α=0.05\alpha=0.05α=0.05”。

统计显著回答“随机波动是否容易解释这个结果”,实际重要回答“效果是否大到值得行动”。两者都要回答,但不能互相冒充。


多重比较和事后挑选:偶然也会挑出漂亮结果

如果只做一次检验,并把 α\alphaα 设为 0.050.050.05,在 H0H_0H0​ 成立时误报概率约为 5%5\%5%。但如果同一份数据上独立检验 202020 个完全无效的指标,只要有一个 p 值小于 0.050.050.05 就宣布发现,至少出现一次假阳性的概率是:

1−(1−0.05)20=1−0.9520≈0.6421-(1-0.05)^{20} = 1-0.95^{20} \approx0.6421−(1−0.05)20=1−0.9520≈0.642

也就是约 64.2%64.2\%64.2%。这不是公式失效,而是研究者悄悄把“一次机会”变成了“二十次机会”。

类似问题还包括:同时比较很多用户分组,只报告显著的那个;试了多个终点,挑 p 值最小的一个;看到数据后改变排除规则;今天不显著就继续收集,明天显著便停;先看结果,再编一个像是事前提出的假设。这些做法会让报告中的 p 值比真实证据更漂亮。

入门阶段先记住三个防线:

  • 在看结果前写清主要指标、样本量、停止规则、备择方向和分析方法;
  • 把探索性发现诚实标成探索,不伪装成事前假设,并用新数据验证;
  • 同时检验很多假设时,使用适合的多重比较校正或整体检验,并报告做过多少次比较。

“我们测了 30 个指标,其中一个 p=0.03p=0.03p=0.03”和“我们事前只指定这一个主要指标,得到 p=0.03p=0.03p=0.03”不是同等强的证据。p 值的解释离不开它是怎样被挑出来的。


数据类型变了,检验骨架没有变

前面的两个完整例子都在比较比例,但同一套思路可以迁移到均值。真正稳定不变的是:确定参数和假设,检查数据来源与模型条件,用标准误把差异标准化,从对应分布求尾部概率,再回到现实问题解释。

单个总体比例

若一条生产线声称次品率为 2%2\%2%,抽取 nnn 件产品后观察到样本次品率 p^\hat pp^​,检验 H0:p=0.02H_0:p=0.02H0​:p=0.02 时使用:

z=p^−0.020.02(1−0.02)/nz = \frac{\hat p-0.02} {\sqrt{0.02(1-0.02)/n}}z=0.02(1−0.02)/n​p^​−0.02​

这里用 0.020.020.02 检查 H0H_0H0​ 下的预期成功、失败数并计算标准误。如果预期次品数太少,正态近似会失真,应考虑精确二项方法,而不是硬套 z 公式。

两个总体比例

A/B 测试和药物改善率都属于这一类。在 H0:p1=p2H_0:p_1=p_2H0​:p1​=p2​ 下用合并比例构造标准误,因为原假设说两组共享一个比例。构造差值的置信区间时却通常不用合并比例,因为区间不是先假定两组相等,而是在估计差值本身。这两个公式看着相似,用的比例不同,背后的提问也不同。

一个总体均值

若包装机目标平均灌装量为 500500500 克,抽取 nnn 袋得到均值 xˉ\bar xxˉ、样本标准差 sss,检验:

H0:μ=500H_0:\mu=500H0​:μ=500 H1:μ≠500H_1:\mu\ne500H1​:μ=500

检验统计量为:

t=xˉ−500s/nt = \frac{\bar x-500}{s/\sqrt n}t=s/n​xˉ−500​

它仍然是在算“观察均值离原假设几个标准误”,只是因为总体标准差未知,尾部概率从自由度为 n−1n-1n−1 的 t 分布中取得。

配对均值:先把每一对变成一个差

同一名患者治疗前后各测一次血压,两个数共享同一个人的体质、年龄和生活习惯,不能当成两个独立样本。先为每个人规定统一的相减顺序,例如:

di=治疗后血压−治疗前血压d_i=\text{治疗后血压}-\text{治疗前血压}di​=治疗后血压−治疗前血压

随后只分析这 nnn 个差值:

H0:μd=0H_0:\mu_d=0H0​:μd​=0 t=dˉ−0sd/nt = \frac{\bar d-0}{s_d/\sqrt n}t=sd​/n​dˉ−0​

这在数学上就是一次单样本 t 检验。配对的价值在于先扣掉许多个体间的固定差异,让问题集中在“同一个人改变了多少”。但配对关系必须真实存在,不能为了让 p 值变小随意把两组人凑成对。

两个独立总体均值

若比较随机分到两种教学法的两组学生,且每名学生只接受其中一种教学法,参数是 μ1−μ2\mu_1-\mu_2μ1​−μ2​。常见的标准误为:

SE=s12n1+s22n2SE = \sqrt{\frac{s_1^2}{n_1}+\frac{s_2^2}{n_2}}SE=n1​s12​​+n2​s22​​​ t=(xˉ1−xˉ2)−0SEt = \frac{(\bar x_1-\bar x_2)-0}{SE}t=SE(xˉ1​−xˉ2​)−0​

自由度通常交给软件按两组样本量和方差计算;手算时可以采用保守近似。这里既要检查每组内部的独立性,也要确认两组彼此独立。若其实是同一批学生的前后测,就应该回到配对差值,而不是使用独立双样本检验。

可以把选择方法时最关键的分岔压缩成一句话:结果是类别就看比例,结果是数值就看均值;同一对象被测两次就看配对差,来自不同对象就看独立两组。选对结构以后,后面的“估计值减原假设值,再除以标准误”仍然是同一件事。

回归斜率也能进入同一框架

第 5 页用散点图和相关系数描述两个数值变量怎样一起变化。若进一步拟合总体直线 y=β0+β1xy=\beta_0+\beta_1xy=β0​+β1​x,常见检验是 H0:β1=0H_0:\beta_1=0H0​:β1​=0,统计量仍是“样本斜率减去 000,再除以斜率标准误”。小 p 值支持目标总体中存在非零线性关联,却不会自动把关联变成因果;抽样方式、离群点、非线性和混杂仍要回到第 5 页的检查中。


卡方检验:当问题变成一整张频数表

两个比例可以用 z 检验比较,可一旦类别多起来,逐对比较会变得笨重,还会制造多重比较问题。卡方检验把整张频数表一次放进同一个问题:实际观察到的各格人数,与 H0H_0H0​ 认为应该出现的人数,相差得是否太大?

卡方检验处理的是计数,不是百分比本身,也不是每个个体的数值大小。它有两种最常见的用法。

拟合优度:一种分类变量是否符合指定分布

掷一枚六面骰子 606060 次,若骰子公平,六个点数的期望概率都应为 1/61/61/6,每一类的期望频数就是 60/6=1060/6=1060/6=10。拟合优度检验比较六个观察频数与这六个期望频数:

H0:各类别概率符合指定分布H_0:\text{各类别概率符合指定分布}H0​:各类别概率符合指定分布 H1:至少一个类别概率不符合指定分布H_1:\text{至少一个类别概率不符合指定分布}H1​:至少一个类别概率不符合指定分布

若指定分布中的概率事先完全给定,有 kkk 个类别时,自由度通常是 k−1k-1k−1。如果某些概率参数先由同一份数据估计,自由度还要扣掉估计的参数个数,不能照搬 k−1k-1k−1。

独立性与同质性:两种分类变量是否有关

独立性检验从同一个总体抽样,同时记录两个分类变量,例如“使用设备”和“是否报名”,问它们是否有关。若二者独立,知道一个人的设备类型,不会改变对其报名概率的判断。

同质性检验则从几个总体或处理组取得样本,问各组的分类结果分布是否相同,例如三种教学法的成绩等级比例是否一致。两种问题的数据来源和措辞不同,计算使用的列联表公式却相同。

对于一个 rrr 行、ccc 列的表,H0H_0H0​ 下第 iii 行第 jjj 列的期望频数为:

Eij=第 i 行合计×第 j 列合计总人数E_{ij} = \frac{\text{第 }i\text{ 行合计}\times\text{第 }j\text{ 列合计}} {\text{总人数}}Eij​=总人数第 i 行合计×第 j 列合计​

卡方统计量把每一格的偏离加起来:

χ2=∑(O−E)2E\chi^2 = \sum\frac{(O-E)^2}{E}χ2=∑E(O−E)2​

OOO 是观察频数,EEE 是原假设下的期望频数。平方让正负偏离都产生贡献,除以 EEE 则让同样相差 101010 人在“大格子”和“小格子”里得到不同分量。独立性或同质性检验的自由度为:

df=(r−1)(c−1)df=(r-1)(c-1)df=(r−1)(c−1)

χ2\chi^2χ2 不会是负数;它越大,整张表与 H0H_0H0​ 的期望格局越不相容。卡方检验通常只看右尾。

使用前先看观察单位和期望频数

每个观察单位应只给表中一个格子贡献一次,随机抽样或随机分组应与研究目标相符,而且不应有未处理的家庭、班级等聚类。正态近似比例检验看成功与失败数,卡方近似则看每格期望频数。入门阶段可以采用保守规则:所有 EEE 都至少为 555。若小格子太多,应考虑合并有实际意义的类别、收集更多数据或使用精确方法,不能为了过条件随意拼接无关类别。

分步例子:设备类型与报名是否有关

某网站随机抽取 400400400 名目标访客,得到下表:

设备报名未报名合计
手机606060140140140200200200
电脑909090110110110200200200
合计150150150250250250400400400

我们检验设备类型与报名是否独立。

写出假设。H0H_0H0​ 是“在目标访客中,设备类型与是否报名独立”;H1H_1H1​ 是“二者有关联”。这不是在检验手机报名率和电脑报名率是否恰好等于某个外部数字。

在独立假设下计算期望频数。手机且报名这一格为:

E=200×150400=75E = \frac{200\times150}{400} =75E=400200×150​=75

同理,手机未报名为 125125125,电脑报名为 757575,电脑未报名为 125125125。四格期望频数都大于 555。

计算四格贡献并相加:

χ2=(60−75)275+(140−125)2125+(90−75)275+(110−125)2125=9.6\chi^2 = \frac{(60-75)^2}{75} + \frac{(140-125)^2}{125} + \frac{(90-75)^2}{75} + \frac{(110-125)^2}{125} =9.6χ2=75(60−75)2​+125(140−125)2​+75(90−75)2​+125(110−125)2​=9.6

这是 2×22\times22×2 表,所以自由度为 (2−1)(2−1)=1(2-1)(2-1)=1(2−1)(2−1)=1。在自由度为 111 的卡方分布下,χ2=9.6\chi^2=9.6χ2=9.6 的右尾概率约为 0.0020.0020.002。若 α=0.05\alpha=0.05α=0.05,拒绝独立假设,数据支持设备类型与报名有关联。

整体显著以后,还要问差异主要在哪里。每格的 Pearson 残差为:

rij=Oij−EijEijr_{ij} = \frac{O_{ij}-E_{ij}}{\sqrt{E_{ij}}}rij​=Eij​​Oij​−Eij​​

手机报名格的残差约为 −1.73-1.73−1.73,电脑报名格约为 1.731.731.73,说明观察数据中手机报名少于独立模型的期望、电脑报名多于期望。各格的 (O−E)2/E(O-E)^2/E(O−E)2/E 还能直接告诉我们哪些格子为总 χ2\chi^2χ2 贡献最多。

但“有关联”仍不等于“设备导致报名变化”。若这只是观察数据,设备类型可能同时带着年龄、访问场景或流量渠道差异。效果大小也不能只看 p 值;2×22\times22×2 表可报告两组比例差、优势比,或用 Cramér 的 VVV 概括表的关联强度。本例:

V=χ2Nmin⁡(r−1,c−1)=9.6400≈0.155V = \sqrt{\frac{\chi^2}{N\min(r-1,c-1)}} = \sqrt{\frac{9.6}{400}} \approx0.155V=Nmin(r−1,c−1)χ2​​=4009.6​​≈0.155

这个数要结合应用背景解释,不能只靠固定标签说“大”或“小”。

练习:骰子是否符合公平分布

一枚六面骰子掷 606060 次,点数 111 到 666 的观察次数分别为 8,9,10,11,12,108,9,10,11,12,108,9,10,11,12,10。请计算拟合优度检验的 χ2\chi^2χ2 和自由度,并说明能否据此怀疑骰子不公平。

公平骰子的六类期望频数都是 101010。所以:

χ2=(8−10)210+(9−10)210+(10−10)210+(11−10)210+(12−10)210+(10−10)210=1.0\chi^2 = \frac{(8-10)^2}{10} + \frac{(9-10)^2}{10} + \frac{(10-10)^2}{10} + \frac{(11-10)^2}{10} + \frac{(12-10)^2}{10} + \frac{(10-10)^2}{10} =1.0χ2=10(8−10)2​+10(9−10)2​+10(10−10)2​+10(11−10)2​+10(12−10)2​+10(10−10)2​=1.0

六类概率事先给定,所以 df=6−1=5df=6-1=5df=6−1=5。χ2=1.0\chi^2=1.0χ2=1.0 在自由度为 555 的分布中并不极端,p 值约为 0.9630.9630.963,不能拒绝公平骰子的假设。这不等于证明骰子绝对公平,只表示这 606060 次结果与公平波动很相容。


单因素 ANOVA:一次比较三个或更多均值

若有三种教学法,分别做三次两样本 t 检验,会重复使用同一批数据,并抬高至少误报一次的概率。单因素方差分析,简称单因素 ANOVA,先做一个整体问题:各组总体均值是否全部相同?

假设有 kkk 组,总体均值为 μ1,μ2,…,μk\mu_1,\mu_2,\ldots,\mu_kμ1​,μ2​,…,μk​。原假设是:

H0:μ1=μ2=⋯=μkH_0:\mu_1=\mu_2=\cdots=\mu_kH0​:μ1​=μ2​=⋯=μk​

备择假设不是“所有均值两两不同”,而是:

H1:至少有一个总体均值不同H_1:\text{至少有一个总体均值不同}H1​:至少有一个总体均值不同

因此,ANOVA 显著只能先推翻“全部相等”,不能单凭整体 p 值说第几组高于第几组。

F 比值在比较两种波动

即使各组总体均值相同,样本均值也会有一点差异。ANOVA 把总变异拆成两部分:

  • 组间变异看各组样本均值离总均值有多远;若处理效果真实存在,这部分会变大;
  • 组内变异看同一组个体围绕本组均值有多分散,它提供没有组间效果时的噪声尺度。

把平方和除以各自自由度,得到组间均方和组内均方:

MS组间=SS组间k−1MS_{\text{组间}} = \frac{SS_{\text{组间}}}{k-1}MS组间​=k−1SS组间​​ MS组内=SS组内N−kMS_{\text{组内}} = \frac{SS_{\text{组内}}}{N-k}MS组内​=N−kSS组内​​

检验统计量是:

F=MS组间MS组内F = \frac{MS_{\text{组间}}}{MS_{\text{组内}}}F=MS组内​MS组间​​

若 H0H_0H0​ 成立,组间与组内都主要在反映同一种随机噪声,FFF 通常靠近 111。组间均值分得远、组内数据又很紧时,FFF 会变大,因此 ANOVA 也只看右尾。它有两个自由度:分子自由度 k−1k-1k−1,分母自由度 N−kN-kN−k。

条件仍然从研究设计开始

经典单因素 ANOVA 通常要求观察在组内和组间独立,来自随机样本或随机分组;每组分布没有严重偏斜和极端离群点;各总体的组内方差大致相近。组大小接近时,它对轻微非正态和方差差异比较耐受,但严重失衡、明显异方差或离群点仍会扭曲结果。方差差异明显时,可以考虑 Welch ANOVA;数据结构是重复测量或配对时,则不能把同一个人的多次观察当成独立组。

一个能看清计算骨架的小例子

假设三种教学法各随机分到 333 名学生,测验成绩为:

  • A 组:78,80,8278,80,8278,80,82,均值 808080;
  • B 组:82,84,8682,84,8682,84,86,均值 848484;
  • C 组:88,90,9288,90,9288,90,92,均值 909090。

总均值为 84.6784.6784.67。组间平方和是每组人数乘以组均值与总均值的平方距离:

SS组间=3(80−84.67)2+3(84−84.67)2+3(90−84.67)2=152SS_{\text{组间}} = 3(80-84.67)^2 +3(84-84.67)^2 +3(90-84.67)^2 =152SS组间​=3(80−84.67)2+3(84−84.67)2+3(90−84.67)2=152

每组内部三个数都离本组均值 −2,0,2-2,0,2−2,0,2 分,所以每组组内平方和是 888,三组合计:

SS组内=8+8+8=24SS_{\text{组内}}=8+8+8=24SS组内​=8+8+8=24

这里 k=3k=3k=3、N=9N=9N=9,所以:

MS组间=1523−1=76MS_{\text{组间}} = \frac{152}{3-1} =76MS组间​=3−1152​=76 MS组内=249−3=4MS_{\text{组内}} = \frac{24}{9-3} =4MS组内​=9−324​=4 F=764=19F = \frac{76}{4} =19F=476​=19

在分子自由度 222、分母自由度 666 的 F 分布下,右尾 p 值约为 0.00250.00250.0025。若研究设计和模型条件可信,可以拒绝三组总体均值全部相等的假设。

这个微型数据只是为了让平方和看得见。每组只有 333 人,实际研究很难靠这么少的数据判断正态性、离群点和方差稳定,不能因为算出漂亮的 F 值就跳过条件检查。

显著以后还要定位差异

整体 ANOVA 显著只说明至少一组均值不同。若要知道是 A 与 B、A 与 C,还是 B 与 C 不同,需要进行预先计划的对比,或使用 Tukey 等控制多重比较错误率的事后方法。不能在看到数据后把所有成对 t 检验都做一遍,再只报告最小的 p 值。

同时还应报告各组均值、置信区间和实际差异。效应大小可以用 η2=SS组间/SS总\eta^2=SS_{\text{组间}}/SS_{\text{总}}η2=SS组间​/SS总​ 等指标表达“总变异中有多少与分组有关”,但在观察研究里,这仍是关联大小,不会自动排除混杂或证明因果。

练习:怎样解释一项显著的 ANOVA

三种复习方法的样本平均分分别是 72,75,8172,75,8172,75,81。整体单因素 ANOVA 得到 F=5.9F=5.9F=5.9、p=0.004p=0.004p=0.004,事前设定 α=0.05\alpha=0.05α=0.05。下面三句话中,哪些能由这个结果直接支持?

  1. 三种方法的总体平均分不全相同。
  2. 方法 C 一定优于方法 A 和方法 B。
  3. 至少需要进一步比较,才能判断具体哪些方法存在差异。

第 1 句和第 3 句可以支持。因为 0.004<0.050.004<0.050.004<0.05,拒绝“全部总体均值相等”的原假设,说明至少有一个均值不同。但整体 F 检验没有指出差异出现在哪一对,单看样本均值也不能把 C 与另外两组分别宣布为显著不同。下一步应查看各组分布和置信区间,并使用预先计划的对比或带多重比较控制的事后检验。第 2 句中的“一定”还忽略了估计误差、实际效应大小和研究设计条件。


几个必须改掉的说法

“p 值是原假设为真的概率”

错。p 值的条件是 H0H_0H0​ 成立,输出是数据至少这么极端的概率。它没有计算 H0H_0H0​ 本身的概率。

“没有显著差异,所以两组相同”

错。没有拒绝 H0H_0H0​ 只表示证据不足。样本太小、噪声太大或检验功效不足,都可能让真实差异没被发现。

“p 值小,效果一定大”

错。大样本能让很小的效果也得到很小的 p 值。看实际大小要读效应估计和置信区间。

“p 值刚好过线,结论就很稳”

错。0.0490.0490.049 与 0.0510.0510.051 的证据强度几乎没有差别。刚过线的发现尤其值得复验,而不是用“显著”遮住不确定性。

“随机分组以后,任何小 p 值都能解释成因果”

也不够。随机分组是强有力的前提,但还要检查失访、未按分组执行、结局选择、重复检验和数据质量。检验模型只在研究过程可信时才有意义。


练习

练习一:从研究问题写出假设

某学校过去的期末通过率是 78%78\%78%。学校随机抽取参加新复习课的 120120120 名学生,其中 102102102 人通过。若学校在课程开始前只关心新复习课能否提高通过率,请写出参数、原假设和备择假设,并说明应使用哪一侧检验。

令 ppp 表示所有同类学生参加新复习课后的真实通过率。原假设与备择假设为:

H0:p=0.78H_0:p=0.78H0​:p=0.78H1:p>0.78H_1:p>0.78H1​:p>0.78

因为事前研究问题只关心“是否提高”,所以使用右侧单样本比例检验。若学校关心通过率是否发生任何改变,包括变差,就应把备择写为 H1:p≠0.78H_1:p\ne0.78H1​:p=0.78,并使用双侧检验。

练习二:准确解释 p 值

一次双侧检验得到 p=0.08p=0.08p=0.08,显著性水平是 α=0.05\alpha=0.05α=0.05。请解释 p 值并给出决定。

准确解释是:如果原假设成立,并且抽样与模型条件都合适,得到当前这么极端或更极端的双向检验统计量的概率约为 8%8\%8%。因为 0.08≥0.050.08\ge0.050.08≥0.05,所以在 5%5\%5% 显著性水平下不能拒绝 H0H_0H0​。这不是接受 H0H_0H0​,也不是说 H0H_0H0​ 有 92%92\%92% 的概率为真。

练习三:比较 0.049 与 0.051

两项设计和样本量几乎相同的研究,p 值分别为 0.0490.0490.049 和 0.0510.0510.051。某人说第一项“证明确有作用”,第二项“证明完全没有作用”。这句话哪里错了?

若事前使用 α=0.05\alpha=0.05α=0.05,两项研究会落在不同的形式决定一侧,但它们的证据强度几乎相同。p 值是连续量,0.050.050.05 只是预先选定的决策线,不是自然界的断点。应比较两项研究的效应估计、置信区间、数据质量和重复结果,不能把 0.0490.0490.049 写成确定、把 0.0510.0510.051 写成零效果。

练习四:辨认两类错误

一种快速传染病检测以“没有感染”为 H0H_0H0​,“已经感染”为 H1H_1H1​。分别解释第一类错误和第二类错误。若漏诊的后果特别严重,研究设计还应关心什么?

第一类错误是在实际没有感染时拒绝 H0H_0H0​,把健康者误报为感染;第二类错误是在实际已经感染时没有拒绝 H0H_0H0​,造成漏诊。若漏诊后果特别严重,就要重点控制第二类错误,并关注检验在有意义的感染状态下的功效。提高样本或重复测量质量可以提高功效;单纯提高 α\alphaα 也可能减少漏诊,但会增加误报,因此要结合代价权衡。

练习五:该用配对还是独立双样本

研究者记录同一批 404040 名患者服药前和服药四周后的收缩压,想判断平均血压是否变化。应该使用配对检验还是独立双样本检验?请写出差值和假设。

同一名患者的前后两次测量有天然对应关系,应使用配对 t 检验。可以定义:

di=服药后血压−服药前血压d_i=\text{服药后血压}-\text{服药前血压}di​=服药后血压−服药前血压

然后检验:

H0:μd=0H_0:\mu_d=0H0​:μd​=0H1:μd≠0H_1:\mu_d\ne0H1​:μd​=0

分析对象是 404040 个个体差值,不是把前后共 808080 个数当成彼此独立的观察。若只关心血压是否下降且方向事前确定,备择也可以写成 H1:μd<0H_1:\mu_d<0H1​:μd​<0。

练习六:多重比较会发生什么

某团队在一次没有任何真实改版效果的实验中检查 202020 个彼此独立的指标,每个都以 α=0.05\alpha=0.05α=0.05 检验。只要任意一个指标显著就宣布改版有效。至少出现一个假阳性的概率约是多少?

单个无效指标不显著的概率是 0.950.950.95。若把 202020 次检验近似看作独立,全部不显著的概率为:

0.9520≈0.3580.95^{20}\approx0.3580.9520≈0.358

所以至少出现一个假阳性的概率为:

1−0.9520≈0.6421-0.95^{20}\approx0.6421−0.9520≈0.642

也就是约 64.2%64.2\%64.2%。团队需要事前指定主要指标,并对多重比较作适当校正;探索出来的结果应在新数据中验证。

练习七:显著以后还要看什么

某应用把通知文案改版后,平均每日使用时长增加 0.120.120.12 分钟,样本量为 300300300 万,得到 p<0.001p<0.001p<0.001。产品经理说:“p 值非常小,所以用户体验提升很大,应该立刻上线。”请评价。

很小的 p 值说明“真实平均差为 000”不容易解释当前数据,但 0.120.120.12 分钟只有 7.27.27.2 秒,效果是否实际重要还不知道。大样本会让很小的差异也统计显著。还应查看差值的置信区间、留存和关闭通知等护栏指标、实现成本、随机分流是否可靠,以及效果能否在后续实验中重复,然后再决定是否上线。


把整门课串成一次完整判断

现在回头看这门课走过的路,会发现显著性检验不是最后突然多出来的一套仪式。它只是把前面的每一环扣得更紧。

一项判断首先从数据从哪里来开始。是随机抽样、随机分组,还是方便取得的一批记录?观察单位是谁,有没有重复、失访或测量偏差?这一步决定结论能推广给谁,也决定能不能谈因果。来源站不住,后面的精确小数只是在把偏差算得很漂亮。

接着要描述真正看到的样本。看分布、中心、离散程度、比例和离群点,把 6.1%6.1\%6.1% 与 6.8%6.8\%6.8%、均值差 444 分钟这类观察事实说清楚。描述统计回答“这批数据是什么样”,不会越权把样本差异直接宣布成总体规律。

然后才轮到概率模型。我们把重复抽样想象很多次,用二项、正态、t、卡方或 F 分布刻画统计量的随机波动,用标准误、期望频数以及组内变异说明样本结果通常会晃多远。概率不是装饰,它是从一次样本跨向未观察总体的桥。

有了这座桥,统计推断才开始工作。置信区间给出与数据相容的参数范围;显著性检验暂时采用一个原假设,把观察差异变成 z、t、χ2\chi^2χ2 或 F 等能与原假设分布比较的统计量,再用 p 值衡量它有多意外。两种方法都在提醒我们:样本给的是证据,不是真值本身。

最后回到现实判断。一个结果即使统计显著,也要看效应有多大、区间有多宽、错误代价是什么、是否做了多重比较、能否重复,以及行动的成本和风险。一个结果若不显著,也要问研究是否有足够功效,不能顺手把“没发现”改写成“并不存在”。

所以,从拿到一份数据到做出决定,完整的思路不是“算出 p 值,低于 0.050.050.05,结束”,而是沿着一条不能跳步的链走下去:可信的数据来源,让描述有对象;清楚的描述,让概率模型有落点;合适的概率模型,让推断有尺度;诚实的推断,才让现实判断知道自己有多大把握。

上一章从样本推总体:抽样误差与置信区间