检验需要事先确定哪些样本结果会导致拒绝。规则固定后,误拒概率和功效才能按重复抽样计算;它们描述的是整条决策规则的表现。
这一章使用抽样分布、似然和基本积分。二项模型可以把实际水平与功效算到底,Neyman–Pearson 引理则提供比较检验强弱的依据,最终用于按目标差异规划样本量。
1. 零假设、备择与两种错误
设参数空间分成不相交的两部分,检验
H0:θ∈Θ0,H1:θ∈Θ1.
非随机化检验是一条取值为 0 或 1 的函数 φ(X):取 1 表示拒绝。允许在边界使用独立随机数时,可令 0≤φ(X)≤1,其数值是观察到该样本后拒绝的概率。规则必须把抽样方案、统计量、方向和阈值都说清。
图 10-1:检验的两种错误
当 H0 为真却拒绝,是Ⅰ类错误;当 H1 为真却不拒绝,是Ⅱ类错误。两者的概率都由真实参数决定。定义功效函数
π(θ)=Eθ[φ(X)].
在零假设范围内,它是误拒概率;在备择范围内,它是正确拒绝概率。检验的大小为
supθ∈Θ0π(θ).
上确界不超过预定 α,就称为水平 α 的检验。水平给的是上限,实际大小可以更低。 如果最后不拒绝,也还没证明零假设成立:数据可能与它相容,也可能只是样本不够,分不出你关心的差异。
不拒绝与“没有作用”的区别
要检验新流程成功率是否高于 0.5,做了 20 次,其中成功 12 次,比例为 0.6。这个结果也可能由 p=0.5 下的随机波动产生。不拒绝只说明样本尚未跨过预定证据门槛,不能直接解释为新流程没有作用。
真实成功率若只有 0.51,区分它与 0.50 会比区分 0.50 与 0.90 困难得多。检验能发现多大差异,取决于设计。只给研究贴上“成功”或“失败”的标签,会掩盖样本原本能够分辨的范围。
这里一直在两个条件下算概率:零假设为真时会误拒多少,指定备择为真时又能检出多少。别把条件倒过来读成“已经拒绝的结论有多大概率错”,那个问题还缺额外信息。
2. 阈值在零假设下校准
已知总体标准差 σ,独立正态样本检验 H0:μ≤μ0 对 H。若样本均值很大,就倾向拒绝。取规则
Z=σn(
这里 zq 表示标准正态分布的 q 分位数。因为误拒概率随 μ 单调增加,零假设中最不利的参数是边界 μ0;在该点,右尾恰好为 ,所以整个零假设范围都受到控制。
图 10-2:阈值分配错误预算
观察到 zobs 后,右尾 p 值为 1−Φ(zobs。它衡量零假设边界模型下,出现至少如此偏向备择的统计量有多罕见,并不表示零假设为真的概率或效应大小。尾部方向须事先决定,看完结果再选有利方向会改变错误率。
离散右尾检验常用 p=Pθ0(T≥tobs),等号要留着。双侧时,还得说明哪些结果算“同样极端”。把单侧概率乘 2 可以是一种约定,却不能不加说明地当成唯一答案。
p 值的校准性质
一个有效 p 值应在每个零假设参数下满足 Pθ(p(X)≤u)≤u,对所有 0≤u≤1 成立。这样用 拒绝才是水平 的规则。连续简单零假设下,若大统计量反对它、累积分布为严格递增的 ,则 。由于 服从 均匀分布,。
离散情况的证明略有不同。取上尾 p 值 p(t)=P0(T≥t),它随 t 下降。事件 p(T)≤ 若非空,就由某个达到阈值的上尾组成;按该上尾的定义,其概率至多 。所以离散 p 值通常比均匀分布更保守。不能删掉等号:在最大可能结果处,,会把一个具有正零假设概率的结果错误报成零 p 值。
复合零假设中,一种直接但可能保守的构造是 p(t)=supθ∈Θ0Pθ(T。对任一真实零参数,它至少不小于该参数自己的有效上尾 p 值,所以超不过相应错误率界。在正态右尾模型里,
Pμ(Z≥z)=1−Φ(z−
它随 μ 增大而增大,上确界在 μ0 取得,因此可以使用边界公式。其他复合检验的最不利参数需要重新确认,未必位于预想的边界。
有未指定参数时,零假设也可能是复合的
若 Xi∼N(μ,σ2)、两参数均未知,H0 并非简单假设:它还允许任意 。第 2 章构造的 在这些全部零假设分布下都是 ,所以用这个共同分布校准,能同时控制所有方差。
因此,把这次 s 填进“已知 σ”的标准正态公式,仍然没完成未知方差检验。需要控制的是整个零假设族的重复实验,只填上一个数,并没有补出这个保证。
3. 功效是一条曲线
上面的正态检验在真实均值 μ 下满足
π(μ)=1−Φ(z1−α−
它来自把拒绝条件改写成以真实 μ 为中心的标准正态变量。固定 n,σ,α,正差异越大,功效越高;固定差异,样本越多,均值的随机波动越小,功效也越高。
图 10-3:功效必须指定真实参数
功效必须对应具体备择,“80%”本身没有交代针对多大的差异。对某个 θ1∈Θ1,Ⅱ类错误概率为 β(θ1;换一个备择,需要重新计算,不能共用未加说明的 。
试着把 α 从 0.05 调到 0.01:其他条件不变,临界值会右移,误拒更少,对同一个备择的功效通常也下降。你提高了拒绝门槛,部分原本能发现的差异也就被挡住了。
4. 简单假设之间,优先选择似然比大的样本
现在把范围缩小为两个完全指定的分布:H0:θ=θ0 与 H1。它们的联合密度或概率质量记作 。如果某个样本在备择下相对更常见,就更值得放入拒绝域。Neyman–Pearson 引理把这句话精确化:在同一大小约束下,优先拒绝满足
f0(x)f1(x)>k
的样本,并在等号边界上按需要随机化,可得到针对这个简单备择的最强检验。对 f0=0 的点,可直接用 f1−kf0 的符号来定义规则,避免比值未定义。
图 10-4:似然比优先挑证据
任取一个竞争规则,可以把最强性变成逐点比较。令 φ∗ 为上述规则,大小恰为 α,竞争检验 φ 的大小不超过 α。在 f1 时, ;小于零的区域有 ,两个负量的乘积仍非负。等号边界的乘积为零,不受随机化方式影响。因此逐点都有
(φ∗−φ)(f1−kf0)≥0.
积分得到
E1φ∗−E1φ≥k(E
第一个不等式来自非负函数的积分。第二个还用了 k≥0 和 E0φ∗=α≥E,所以候选规则实际大小的校准是证明的一部分。离散模型的边界随机化可以补足这一步所需的大小。
右边非负,说明候选规则在这个备择下至少和竞争者一样有力。这里固定了一个零假设和一个备择。换不同备择后,若最强规则碰巧始终相同,才可能得到一致最强;双侧问题往往做不到。
要说“一致最强”,还得比较所有备择
对已知方差正态模型,比较 μ0 与任意固定 μ1>μ0,展开两条平方和得
logfμ0
它对 xˉ 严格递增,因此所有正方向简单备择的最强规则都拒绝足够大的均值;零假设校准后的均值阈值为 μ0+σz1−α/,不依赖所挑的 。又由前面单调功效的证明,这条规则在整个 下合法。任何对这个复合零假设合法的竞争检验,当然也在边界 合法,所以 Neyman–Pearson 逐一给出它对每个 都不更强。这才完成的论证。
若备择还包括 μ1<μ0,对负方向的同一计算会给左尾最强。连续正态下,似然比不等式在阈值之外严格,最强规则除零概率边界外被确定。于是一个规则不可能同时等于左尾和右尾规则,通常的双侧均值问题不存在对全部水平合格规则的一致最强检验。双侧检验可以依据对称性或其他明确约束设计,但不能直接沿用单侧的最优性称号。
离散模型中的拒绝概率分配
考虑只有 A、B、C、D 四种结果的模型。零假设概率为 0.50,0.30,0.15,0.05,备择概率为 0.10,0.20,0.30,0.40。允许事先声明的随机化,大小上限为 0.125,目标是在这项约束下取得最高功效。
四个似然比 f1/f0 为 0.2,2/3,,给出 D、C、B、A 的顺序。它比较的是每单位误拒概率对应的检出概率,单看 的大小还不够。
0.5 必须在看见结果之前成为规则的一部分。不允许随机化的任务,可以采用合适的保守规则,但需要重新报告功效,不能继续使用随机化规则的最优值。
实验:按似然比分配误拒概率
p1 从大于 p0 改为小于 p0 时,备择所偏向的成功次数会改变。由此判断哪些 k 应优先获得拒绝概率。
从全 0 分配开始,某一行的 φ 可以手动增加,“分配剩余”也能完成调整。尝试按似然比降序分配,与界面的最优分配比较。p1 调至 p0 下方后,重点观察排序的变化。
高似然比的行,每单位预算带来的功效更多。最优规则通常先将若干行的拒绝概率设满,再给一条临界行分配部分概率;备择改变,顺序也可能反过来。
增加 δ 拒绝概率,会消耗 f0δ、得到 f1δ,比值 f1/f0 决定优先顺序。超过 α 时,页面不会把功效当作公平比较的结果:若误拒预算都不同,仅看谁检出更多没有回答最强性问题。
5. 一个能算到底的二项检验
独立进行 20 次试验,成功次数 K∼Bin(20,p)。检验 H0:p≤0.5 对 ,取 。对每个固定 , 随 增加,所以右尾规则有明确依据。
计算两个相邻阈值:
P0.5(K≥14)≈0.057659>0.05,
P0.5(K≥15)≈0.020695≤0.05.
不随机化的右尾整数阈值可取 K≥15。实际大小约为 2.07%,低于 5%,因为整根概率柱无法任意切分。成功率为 0.75 时,其功效为
P0.75(K≥15)≈0.617173.
图 10-5:离散检验不一定用满α
若设计允许事先声明的随机化,可在 K=14 时以概率
γ=P0.5(K=14)0.05−P
拒绝,并在 K≥15 时总拒绝、 K≤13 时不拒绝。这样大小恰为 0.05,在 p=0.75 时功效约为 0.750846。遇到同一个边界结果,按事先固定的概率使用独立随机数,就实现了“切分柱子”。如果选择保守的非随机化规则,也可以,只需报告它实际的大小。
实验:离散阈值与错误率的跳变
临界值从 15 降到 14,会把一整格概率质量纳入拒绝域。根据相邻尾概率,判断误拒率是否能恰好停在 5%。
默认 n=20、p0=.5、p1=.75、alpha=.05,c=14 和 c=15 对应不同的错误预算。勾选边界随机化后,页面会回到按 α 分配的临界点,可以核对新增的部分拒绝概率。
c=15 时确定拒绝率约 2.06947%,c=14 却超过 5%。在 K=14 时以 γ≈.7927967 拒绝,才刚好用满预算。
还是同一个 φ(k),用 H0 概率加权求和得到 size,用 p1 概率加权得到 power。离散质量是一整格,边界随机化让你只分配这一格的部分拒绝概率。
双侧功效需要把两条尾部都算进去
检验 H0:μ=μ0 对 μ=,已知方差时采用 ,。真实标准化差异记为 ,则 在该真值下服从 。因此
π(μ)=P(Z>c)+P(Z<−c)=1−
两项分别是右尾和左尾拒绝,没重复计算; d=0 时相加恰为 α。即使真实均值偏高,左尾概率也非零,所以声称精确功效时不能悄悄删掉它。正态对称性还给出 π(d)=π(−d)。
例如 α=0.05、d=2,功效约为 1−Φ(−0.0400)+Φ(−3.9600)≈0.5160。如果错误地沿用单侧临界值 1.6449,会高估这套双侧规则的功效。单侧把全部预算放到一端,对预先指定方向更敏感;代价是另一方向的改变不属于该拒绝目标。
6. 在研究开始前规划样本量
对已知 σ 的正态右尾检验,若希望在 μ=μ0+Δ 时达到目标功效 1−β,其中 Δ,解功效公式可得
n≥(Δ(z1−α+z
例如 σ=4,Δ=1,α=0.05、目标功效 0.8,右侧约 98.92,故至少取 n=99。这是已知方差、独立正态、单侧检验下的规划。方差未知、聚类抽样或失访都需要调整;双侧检验也应重新代入对应拒绝域。图中三项目标之外,噪声大小与抽样设计同样参与计算。
图 10-6:样本量来自可检测差异
有实际意义的目标差异应在研究开始前确定,样本量才能据此规划。事后把观察效应代回功效公式,并未增加独立证据。此时效应估计及其区间,结合样本量和预定规则,更能说明数据支持什么。
把样本量公式从功效要求里解出来
在已知方差正态右尾检验中,真实均值比边界高 Δ>0。要求功效至少 1−β,便有
1−Φ(z1−α−σn
移项后,正态累计概率不超过 β,其输入就必须不大于 zβ=−z1−β。所以
σnΔ≥z
左边把真实差异换成了均值标准差的倍数,右边则同时考虑误拒和检出要求。再平方,就回到样本量公式。差异减半要约四倍样本,也能从这里看出来:信号小了一半,均值噪声就得相应减半。
双侧规划与研究中的多次查看
双侧希望在 Δ>0 处达到 1−β,可用上一节的两尾公式逐个整数检查 n,找到满足要求的最小值。若先忽略有利的远端尾概率,取
n≥[Δ(z1−α/2+z
这是一个充分、可能略保守的样本量:右尾已经达到目标,另一尾只会增加功效,不能称为任何情形下的精确最小值。如果用未知尺度的精确 t 检验,就要按备择下的非中心 t 分布或相应数值设计计算,直接把 z 换成 t 还缺推导。
边收集边检验,第一次 p<0.05 就停止,定义的是一套新的规则。单次 5% 不会自动成为整个查看过程的 5%,错误率必须按实际停止规则控制,报告也应交代查看过程。
7. 同时寻找多个结果时,错误预算也要合并
假设同时做 m 个检验,真正为零的那部分记作 H0。希望控制的是“至少错误拒绝其中一个”的概率。若每个检验用 α/m 的有效水平,由并集界
Pj∈H
这就是 Bonferroni 分配,证明没有用到检验独立。例如事先比较 8 个指标,整体误拒要求不超过 0.05,每项可用 0.00625。它可能保守,但给的是整套多指标分析的保证。
作为对照,若 20 个真实零假设的检验相互独立、各自精确误拒 0.05,则至少一个误拒概率为 1−0.9520≈0.6415。同一批数据的相关检验不能照搬这个独立公式,但也不能因为相关就宣布没有多次比较问题。
反复查看累积数据的统计量通常彼此依赖。若计划最多查看 m 次,可以事先把预算分为 α1,…,αm、总和不超过 α,每次使用在其设计下有效的对应水平检验;同一个并集界就控制“曾经误拒”。更精细的序贯设计可能更有力,本课程不展开。关键是先定义整套决策规则,不能只报告最后一次越过阈值的检验。
条件概率的方向
1一个检验实际大小为 0.032。以下哪种表述准确?
2对嵌套拒绝域而言,缩小拒绝域会使误拒概率和固定备择下的功效都不增加。
3在指定备择下功效为 0.7,Ⅱ类错误概率是多少?
8. 练习:拒绝规则的校准与功效
练习 1|复合零假设的边界。 已知标准差为 2,n=16,检验 H0:μ≤5。采用 X。写出任意 的拒绝概率,并证明大小为 0.05。
拒绝概率为 1−Φ[z0.95−2(μ−5)],随 μ 递增;对 μ,最大值在 5 取得,为 。这里是用整个功效函数证明边界最不利,不能只检查一个零参数而不说明其余位置。
练习 2|p 值的等号。 零假设下 T 等概率取 1、2、3、4,大值反对零假设。列出包含等号的上尾 p 值,并计算 P(p≤0.3)。若错误地用严格大于,会得到什么?
正确 p 值依次为 1、0.75、0.5、0.25,故 P(p≤0.3)=0.25≤0.3。错误 p 值为 0.75、0.5、0.25、0,在水平 0.3 下拒绝后两个结果,误拒率为 0.5,超过声称的上限。
练习 3|重建最强性证明。 给定 φ∗ 在 f1>kf0 时为 1,在小于时为 0,且 。逐点分三种情况证明它不弱于任意 的检验,并指出若 ,最后一行为什么不再成立。
在正差区域 1−φ≥0;负差区域 −φ≤0;零差区域乘积为零。故积分给 E1(。最后一项由大小约束非负,还需要 ;若 k 为负,乘法会改变符号,不能推出功效差非负。
练习 4|新模型中的随机化。 三种结果 A、B、C 在零假设下概率为 0.6,0.3,0.1,备择下为 0.2,0.3,0.5。允许随机化,大小预算 0.16,求最强规则及功效。
似然比依次为 1/3,1,5,先全纳入 C,耗费 0.1、取得功效 0.5;剩余 0.06 给 B,故 B 时以 0.2 概率拒绝,A 不拒绝。实际大小 0.1+0.2⋅0.3=0.16,功效 0.5+0.2⋅0.3=。随机化须由独立随机数按预定规则实施。
练习 5|双侧不是两个单侧随意挑。 已知尺度正态检验中,观察到 Z=−2。若方向事前为右尾,p 值是多少?若方向事前为双侧又是多少?看到负号才改用左尾 5% 为什么改变了规则?
右尾是 1−Φ(−2)≈0.97725,双侧是 2Φ(−2)≈0.04550。如果看到符号后才选有利的左尾或右尾 5%,实际等于两端各留 5% 的拒绝区,总误拒变成 10%。方向已经改变了整条规则,不能仍按单侧 5% 解释。
练习 6|两尾功效。 已知方差双侧 5% 检验,真实标准化差异 d=1.5。写出两尾功效并说明它在 d=−1.5 时是否改变。为什么没有在全部非零均值处一致最强?
功效为 1−Φ(1.959964−1.5)+Φ(−1.959964−1.5)≈0.32304,换负号后两尾交换、总和不变。对称功效不等于一致最强:固定正备择的唯一最强规则用右尾,固定负备择用左尾,同一双侧规则不能同时取代二者。
练习 7|从目标倒推观测量。 已知 σ=3,单侧 1% 水平,希望均值高出 1.5 时功效至少 90%。用 z0.99=2.32635,z0.90=1.28155 求样本量并向上取整。
n≥[(2.32635+1.28155)⋅3/1.5]2≈52.0678,故取 53。一个分位数控制零假设误拒,另一个控制指定备择下的漏检;取整数前不能先把两者过度舍入。
练习 8|一套研究的错误概率。 计划检查 10 个指标,整体误拒上限为 0.05。说明每项用 0.005 为什么无须独立仍有保证;若只挑最小 p 值按 0.05 报告,缺少了什么?
真正为零的指标的误拒事件取并集,概率不超过各项之和,最多 10⋅0.005=0.05,无需独立。只挑最小 p 值按单次 0.05 报告,遗漏了选择过程。应评价任一指标越线的概率,或使用相应的多重比较校准。