逐个比较估计公式,无法排除所有尚未想到的候选。信息不等式能约束整个无偏估计类;在某些模型里,充分性与完全性还可直接证明最优性。
1. 得分衡量参数方向上的局部变化
样本均值使用了全部观测,但这还不是最优性的证明。要排除任何其他无偏规则具有更小方差的可能,可以证明一个适用于整个候选类的下界,并检查样本均值能否达到。下界不适用时,充分性与完全性提供了另一条证明路线。
对数似然 ℓ(θ;X) 关于参数的局部导数写成
Uθ(X)=∂θ∂ℓ(θ;X)
这个导数叫得分函数。得分为正,局部增大参数会提高对数似然;得分为负,就往相反方向变化。可微内点最大值处通常为零。这里的“得分”描述变化方向,还不是标准化后的证据强度。
图 7-1:得分是似然的局部斜率
对一个伯努利观测,Up(X)=X/p−(1−X)/(1−p)=(X−p)/[p(1−p)]。这个公式只在 0<p<1 内直接可用。若 p 是真参数,则 Ep(X)=p,所以 Ep(Up)=0。
一般模型里,得分均值为零来自对归一化条件求导:若允许交换微分与积分,
Eθ(Uθ)=∫∂θ∂fθ(x)dx=∂θ∂∫fθ(x)dx=0.
这一步交换了求导和积分,合法性需要条件。下面的指数模型可以验证这些条件,均匀模型则会显示交换失败时遗漏了什么。
求导与积分交换的充分条件
一种常用的充分条件是:真值附近的密度一阶、二阶参数导数分别被可积的函数控制。这样可以用控制收敛把导数移入积分。对指数模型,若真值 λ0>0,先限制在 [λ0/2,3λ0/2] 的邻域;密度导数是某个低次多项式乘 e−λx,其绝对值可被常数乘 (1+x2)e−λ0x/2 控制。后者在正半轴可积,所以所需交换有依据。
这个邻域只用来证明固定真值附近的局部论证合法,没有要求参数永远限在里面。如果还要对估计量 T 的无偏性求导,乘上 T 后是否可积也得查。只查密度本身,还覆盖不了所有统计量。
2. Fisher 信息:局部可区分程度
在正则条件下,定义单次观测信息
I1(θ)=Eθ[Uθ(X)2]=Varθ(Uθ(X)).
在允许相应二阶微分交换的条件下,也有
I1(θ)=−Eθ[∂θ2∂2logfθ(X)].
图 7-2:信息量与曲率
从得分的零均值恒等式再求一次导数,可以联系两个信息公式。设 u=∂θlogfθ,已有 ∫ufθ=0,乘法法则给出
0=∫[(∂θu)fθ+u(∂θfθ)]dx=Eθ(∂θu)+Eθ(u2),
这里用了 ∂θfθ=ufθ,移项才得到 E(u2)=−E(u′)。所以这不是任意函数都成立的导数关系;归一化和求导交换的条件都参与了证明。
以指数速率为例,u=1/λ−X,所以 E(u2)=Var(X)=1/λ2;另一方面 −u′=1/λ2,两条路径给同一结果。以一个泊松观测为例,u=X/λ−1,观测负曲率为 X/λ2,它会随样本改变;期望信息才是 E(X)/λ2=1/λ。
期望负曲率越大,参数局部偏离时,似然越容易显示差别。这里的期望信息 I 与当前样本的观测信息 J(θ;x)=−ℓ′′(θ;x) 要区分。适当的大样本条件可以联系它们,却不意味着二者数值和含义相同。
换单位还会改变信息的数值。比如时间从秒换成毫秒,参数尺度变了,信息也要跟着变。跨参数或跨单位比较之前,得先有共同的误差尺度。
两个直接计算的例子:伯努利概率的信息为 I1(p)=1/[p(1−p)];已知方差正态模型关于均值的信息为 I1(μ)=1/σ2。后者来自 Uμ=(X−μ)/σ2 的方差。
稀有事件的绝对精度与相对精度
伯努利模型里 I1(p)=1/[p(1−p)],p 越小,这个数越大。可罕见事件恰好经常一例都观察不到。这并不矛盾:信息下界说的是当前参数尺度上的局部绝对精度,没有保证相对误差小,也没保证有限样本近似好。
样本比例的标准差为 p(1−p)/n,除以真值 p 后,相对标准差为
np1−p.
若 p=0.01,n=100,绝对标准差约 0.00995,但相对标准差约 99.5%。一份数据可以在绝对数值上波动不大,却仍不足以把一个很小的概率估得相对准确。并且此处 np=1,全失败样本仍常见,不能把信息公式顺手变成可靠的正态区间。
目标改为 η=log[p/(1−p)] 时,链式法则给出关于 η 的单次信息 p(1−p)。数据和模型都没变,参数坐标却改变了信息数值。比较信息大小之前,需要统一参数和单位。
参数换单位时,用链式法则同步换信息
若 η=g(θ) 为可微的一一变换,其逆导数存在,则 uη=uθ(dθ/dη),从而 Iη=Iθ(dθ/dη)2。所以在同一点附近,二次量 Iη(dη)2=Iθ(dθ)2 不变;改变的是坐标上的数字。
对伯努利对数赔率,p=eη/(1+eη),dp/dη=p(1−p),得到 Iη=p(1−p)。这与 Ip=1/[p(1−p)] 一大一小,却没有矛盾。讨论“精度”之前,先说误差是按概率点、百分点还是对数赔率衡量。
3. 独立样本的信息可加性
iid 样本的对数似然是各项相加,所以总得分为 Un=∑Ui。各得分独立且均值为零,因而
In(θ)=E(Un2)=∑E(Ui2)=nI1(θ).
图 7-3:独立信息可以相加
独立但不同分布时,在适当条件下仍可把各项信息相加,却未必是某个共同 I1 的 n 倍。若观测相关,就得回到实际联合分布计算,不能直接沿用这一步。
例如正态测量的已知标准差为2,25次独立观测关于均值的总信息是 25/4=6.25,100次为25。与后面的方差下界结合,会得到样本量四倍、标准误减半的熟悉规律。
4. Cramér–Rao 无偏方差下界
设 T 是 θ 的无偏估计,方差有限,模型满足正则条件。对 Eθ(T)=θ 求导,交换微分与积分得
1=Eθ(TUn)=Covθ(T,Un),
最后一步用了 E(Un)=0。由 Cauchy–Schwarz 不等式,
1≤Varθ(T)Varθ(Un)=Varθ(T)In(θ).
因此
Varθ(T)≥In(θ)1.
图 7-4:Cramér–Rao 下界
如果估计的是可微函数 τ(θ) 且 T 对它无偏,则右侧改为 [τ′(θ)]2/In(θ)。存在偏差时不能直接套这个无偏版本;偏差导数也会进入相应的一般信息不等式。
已知方差正态模型中,Xˉ 的方差为 σ2/n,正好等于下界,因此在该模型、无偏估计类与方差准则下达到最优。伯努利样本比例也达到 p(1−p)/n 的下界。
有了下界,还要检查能不能达到。等号要求中心化估计量与得分几乎处处成比例;若找不到符合要求的统计量,这条界就只是参照。有偏收缩估计的 MSE 即使更低,也没有违反只约束无偏估计的定理。
实验:期望信息与观测信息的变化
固定 n 和 p₀,成功次数改变会影响当前似然。根据两个信息量的定义,判断其中哪一个会随这份记录变化。
n=25、p₀=.60、k=15 给出初始曲线,将 k 改成 4 可观察样本结果的影响。n=100、k=60 则适合比较样本量四倍时的下界。
k 改变时,橙色曲线的倾斜和曲率都变了,深色期望曲线与 Iₙ 却不动。把样本量增到四倍,CRLB 降为原来的四分之一。
观测信息取当前样本的负二阶导数,期望信息则把所有可能样本平均。图中的二次虚线只在 p₀ 附近近似期望曲线,不能拿它替代远处的整条曲线。
把正态均值的下界证明一遍
已知方差 σ2 的 iid 正态模型可以完整展示证明。目标是确定样本均值是否达到估计 μ 的无偏方差下界。
从对数密度求关于均值的导数,单次得分为 (Xi−μ)/σ2。总得分是 Un=n(Xˉ−μ)/σ2;它的均值为零,方差为 n/σ2。
对任意无偏估计 T,恒等式 EμT=μ 在允许交换积分和微分时导出 Eμ(TUn)=1。因为总得分均值为零,左边就是 Cov(T,Un)。
两个随机量的相关系数绝对值不超过 1,等价地,协方差平方不超过方差乘积。所以 1≤Var(T)n/σ2,得到下界 σ2/n。
候选 Xˉ 无偏,方差恰为 σ2/n,并满足 Xˉ−μ=(σ2/n)Un。这正是取等所需的线性关系,因此样本均值在该模型的无偏估计类中具有最小方差。
这次证明里,有两处不能省:候选限定为无偏估计,得分的归一化求导也必须合法。若改变其中一处,就得重新检查,不能只记一句“均值最稳定”。
一般目标与有偏规则的信息界
若 m(θ)=EθT 可微,刚才的同一证明给
Varθ(T)≥In(θ)[m′(θ)]2.
估计目标为 τ(θ) 时,设偏差 b=m−τ,于是分子为 [τ′+b′]2。在平方风险中还要加回 b2。这解释了有偏估计为何可以有比无偏界更小的方差:它连“平均随参数移动多快”都改变了。
例如已知方差为 v 的正态均值模型,T=cXˉ,其中 c 事先固定。它的平均为 cμ,一般信息下界为 c2v/n,正好等于其方差;但估计 μ 的 MSE 是 c2v/n+(c−1)2μ2。若只对比方差、不写偏差和参数范围,就会把缩小数字误当成无条件提高估计质量。
等号条件与可实施的估计规则
当目标无偏且 In>0,Cauchy–Schwarz 取等要求
T−τ(θ)=In(θ)τ′(θ)Un几乎处处.
移项后虽然能写出 T 的表达式,还得检查它是否含未知参数。统计量必须用同一条可计算规则处理所有参数;若做不到,就没有规则能在所有参数处达到这条界。
例如伯努利模型估计 p2,代入 Un=(S−np)/[p(1−p)]、In=n/[p(1−p)],取等将要求 T=2pS/n−p2。这个式子仍依赖未知 p,不能作为通用统计量。因此找到 UMVU 后,它也未必达到这条信息界;后面会算出确切差距。
5. 支持变化会破坏常用证明
图 7-5:正则条件是一扇门
这组常用充分条件要求参数位于开集内、支持固定、对数密度足够光滑。相关求导还必须能与积分交换,信息应为正且有限。均匀模型的支持会随参数移动,下面可以看到证明在哪一步失效。
均匀 [0,θ] 模型中,若只对支持内部的 −nlogθ 求导,会得到总得分 −n/θ,其期望不是零。原因是积分的上界也随 θ 移动,直接交换时遗漏边界贡献。这个模型不能套刚才的正则无偏下界。
用单个观测就能定位遗漏的项:
dθd∫0θθ1dx=上限移动θ1+内部密度变化∫0θ−θ21dx=0.
只留下积分内导数会得到 −1/θ,漏的恰好是移动上限的贡献。多个样本时,支持区域也随参数扩大,道理相同,边界项仍不能省。
无偏上界估计 θ~=(n+1)M/n 的方差为 θ2/[n(n+2)],数量级是 n−2;常见正则参数估计的方差数量级则是 n−1。这里估得更快,有一个具体原因:参数改变时,哪些观测可能出现也跟着变,支持本身带来了信息。
实验:最大值逼近上界的速度
最大值与上界的典型间隙按 1/n 的量级缩小。用这一关系判断样本量增至四倍时的变化,再与模拟中的间隙比较。
固定 θ=2,将 n 从 10 改为 40,样本带同时显示 M、无偏修正及缩放间隙密度。“换一组样本”会改变这一次结果,分布规律却由同一模型决定。
无偏修正的标准差按 1/n 量级下降,W=n(θ−M)/θ 的密度逐渐靠近 Exp(1)。某一批里,修正估计也可能超过真实上界,别把典型速度当作每次都从下方接近的保证。
Uniform 的支持依赖 θ,积分会带上边界项,因此不能直接认定得分均值为零。刚才正则模型中的信息相加和 CRLB 证明,也就不能原样搬来。
6. 多参数信息与矩阵逆
如果参数有两个分量,得分也是两个分量,信息矩阵记录它们的方差与协方差。设总信息为
In=(abbc),a>0,c>0,ac>b2.
估计第一参数时,其他参数未知对应的方差下界是逆矩阵第一对角元素
(In−1)11=ac−b2c=a−b2/c1,
这里不能只取 1/a。第二参数确实已知时,下界才是 1/a。被扣除的 b2/c 来自两个得分方向的重叠:你以为是第一参数造成的变化,第二参数也可能解释一部分。
取 In=(8222),第二参数未知时第一参数界为 1/6,已知时为 1/8。不能只看 8 就跳过联合不确定性。第 11 章将把同样的扣除用于有干扰参数的得分检验。
更一般的目标 τ(θ) 的无偏下界为 ∇τTIn−1∇τ。它可由一个非负方差证明:令 V=T−τ−∇τTIn−1U,利用 Cov(U,T)=∇τ 展开,得到 Var(V)=Var(T)−∇τTIn−1∇τ≥0。矩阵逆由消去与得分相关的线性部分自然出现。
7. 完全性:用另一条路径确认最优
统计量 T 的分布族称为完全的,若任何满足 Eθ∣g(T)∣<∞ 且对所有参数有 Eθg(T)=0 的函数,都必须满足 g(T)=0 几乎处处。它排除了一个“处处零均值却非零”的歧义方向。
图 7-6:完全性与唯一性
伯努利总数的证明。 对 S∼Bin(n,p),假设 ∑s=0ng(s)(sn)ps(1−p)n−s=0 对每个 p∈(0,1) 成立。除以 (1−p)n,令 t=p/(1−p)>0,得到一个对所有正 t 都为零的多项式。它的每个系数都必须为零,所以 g(s)=0。因此 S 完全;第 6 章又已证明它充分。
Lehmann–Scheffé 结论。 如果 T 完全且充分,h(T) 对目标参数函数无偏并有有限方差,那么它是在所有无偏估计量中一致最小方差的估计,简称 UMVU,且在几乎处处意义下唯一。
任意无偏竞争者经过 Rao–Blackwell 条件平均,都变为风险不增加的 T 的函数。两个这样的无偏函数之差,在所有参数处的期望为零,完全性便迫使它们几乎处处相同。这就完成了对整个无偏估计类的比较。
例如 S/n 是 p 的 UMVU;n≥2 时,S(S−1)/[n(n−1)] 对 p2 无偏,也因此是 p2 的 UMVU。无偏性可由 S(S−1)=∑i=jXiXj 的期望验证。
完全性中“对所有参数”的要求
令 g(S)=S−n/2。当 p=1/2 时它的期望为零,但它显然不是处处等于零。这个例子不违反完全性,因为完全性要求同一个函数在每一个允许的 p 下期望都为零。事实上 Epg(S)=n(p−1/2),其他参数处不会消失。
第 6 章已经给出 p2 的无偏估计 S(S−1)/[n(n−1)]。现在任取另一个无偏估计,先条件化成 S 的函数,方差不会增加。再与候选相减,差对每个 p 都零均值,完全性便使它们几乎处处相同。这个证明一次比较了全部无偏竞争者。
说 UMVU 时,“无偏”这两个字要一起读:它在每个参数处的方差都不大于其他无偏估计。允许有偏、换一种损失之后,还要重新比较,第 3 章的收缩例子仍然成立。
8. 连续模型中的完全性,也能亲手证明
对 iid Uniform[0,θ],最大值 M 的密度是 nmn−1/θn,0<m<θ。假设同一个可测函数 g 对所有 θ>0 都可积且满足 Eθg(M)=0,则
∫0θg(m)mn−1dm=0对每个 θ>0.
左边是上限为 θ 的积分。因为被积函数在每个有限区间上可积,这个积分函数绝对连续,导数几乎处处等于 g(θ)θn−1。积分函数恒为零,因此 g(θ)θn−1=0 几乎处处;在正半轴上权重为正,所以 g=0 几乎处处,也即在每个最大值分布下几乎必然为零。于是 M 完全。
题目没有假定 g 连续,因此只能得到几乎处处为零,不能扩大为每个点都为零。密度分布赋予单点的概率为零,这种区别不影响相应统计结论。
第 6 章已证明 M 充分;又由积分
Eθ(Mk)=θnn∫0θmn+k−1dm=n+knθk(k>0),
由此, nn+kMk 是 θk 的 UMVU。证明使用充分性与完全性,没有依赖正则得分恒等式,因而支持移动不妨碍这条路线。
9. UMVU 与信息下界之间的差距
令 A 为任意有限方差无偏竞争者。对充分的 T 条件化,得到 A∗=E(A∣T);第 6 章保证该规则可实施、无偏且方差不增加。已有无偏候选 h(T),两者之差满足 Eθ[A∗−h(T)]=0,对所有参数成立。完全性给出 A∗=h(T) 几乎处处,因此每个参数处都有 Var(h(T))≤Var(A)。竞争者若风险也相同,被消去的条件方差必须为零,它就与候选几乎处处相同。
证明依赖的是充分性、完全性以及估计的无偏和有限方差,并未要求达到 Cramér–Rao 界。以伯努利目标 p2 的候选
H=n(n−1)S(S−1)
为例,记下降阶乘 (s)k=s(s−1)⋯(s−k+1)。(S)k 数的是互不相同的 k 个位置同时成功的有序组合,故 E(S)k=(n)kpk。展开多项式可核验 (S)22=(S)4+4(S)3+2(S)2,取期望再减 p4,得到
Var(H)=n4p3(1−p)+n(n−1)2p2(1−p)2.
第一项恰是估计 p2 的信息下界,第二项在内部参数处却严格为正。代入 n=4,p=1/2,界为 1/16,真实方差是 7/96。这不是还没找到更好的无偏估计:规则已经是 UMVU,只是这条信息下界没能贴到真实最小方差。
完全性、充分性与最小充分性的区别
充分性要求压缩后的剩余条件分布不再含参数;在这个要求之下,最小充分性进一步去掉仍可合并的区分。完全性研究的则是统计量的函数:能否存在一个非零函数,对所有参数都具有零期望。三者不能凭名称互推。恒定统计量 T≡0 的任何函数都只是常数,零期望迫使常数为零,所以它完全,却通常没有保留参数信息,因而不充分。
给“最优”加上正确的限定
1某个有偏估计的 MSE 小于 Cramér–Rao 无偏方差下界,首先应得出什么结论?
2运用完全性时,必须检查同一个函数对所有允许参数的期望都为零。
3正态均值模型的已知方差为 9,独立样本量为 36,关于均值的总 Fisher 信息是多少?
10. 练习:亲手证明“最优”
练习 1|两条路径算信息。 对一个指数速率观测,分别由得分平方期望与负二阶导数计算单次信息。若目标改为平均时间 μ=1/λ,关于 μ 的信息是什么?
uλ=1/λ−X,均值零、方差 1/λ2;负二阶导数同样为 1/λ2。因为 dλ/dμ=−1/μ2,信息变为 Iμ=Iλ/μ4=1/μ2。写相同的形式不表示单位相同,要随所用参数解释。
练习 2|有偏版本。 已知正态方差为 16、样本量为 25,规则 T=0.8Xˉ 用于估计均值。求它的方差、偏差、MSE,并核验一般信息界。
总信息 25/16,m′(μ)=0.8,一般方差界为 0.64⋅16/25=0.4096,恰为其方差。偏差为 −0.2μ,MSE 为 0.4096+0.04μ2。它的方差小于无偏界 0.64 不矛盾,因为平均函数的导数也缩小了。
练习 3|目标不是参数本身。 伯努利目标为 p(1−p),写出无偏方差下界。在 p=1/2 时下界为零,是否存在处处正确的零方差估计?
目标导数为 1−2p,界为 (1−2p)2p(1−p)/n。在 p=1/2 为零只是局部下界没有约束力。一个对所有 p 无偏的规则不能据此在不知道参数的情况下恒等于真值;例如第 6 章的无偏估计 S(n−S)/[n(n−1)] 在该点仍随机。
练习 4|完全性的量词。 对 S∼Bin(n,p),有人用 g(S)=S−n/3 在 p=1/3 处零期望反驳完全性。指出错误,并说明为什么多项式证明需要整个参数区间。
完全性要求同一个函数对所有允许的 p 都零期望,这里的期望却是 n(p−1/3),只在一点为零。多项式在一点为零,只说明有一个根;在整个正区间为零,才会迫使所有系数为零。错误就在把“每一个参数”换成了“某一个参数”。
练习 5|完整 UMVU 构造。 均匀上界模型有 n=5,目标为 θ2。给出 UMVU,证明无偏,并写清完全性与充分性分别在哪一步使用。
候选为 7M2/5。由 E(M2)=5θ2/7 可知无偏,且有有限方差。充分性使任意竞争者可条件化成 M 的函数而不增风险;完全性使任何两个这样的无偏函数几乎处处相同。因此该候选在所有无偏估计中方差最小。无偏性不能由“充分”二字代替。
练习 6|计算 UMVU 的真实方差。 在上一题中,用 E(M4) 求候选的方差。为什么不能直接拿正则信息界当它的方差?
E(M4)=5θ4/9,因此方差为 (49/25)(5/9)θ4−θ4=4θ4/45。该模型支持随参数移动,常规得分零均值证明失效;即使在正则模型中,信息下界也不自动等于最优估计的方差。
练习 7|干扰参数的代价。 总信息矩阵为 (10332)。第二参数已知与未知时,第一参数的无偏方差界各是多少?
已知时为 1/10;未知时为 1/(10−9/2)=2/11≈0.1818。行列式为 11、矩阵正定,逆存在。第一对角元素的倒数忽略了与第二得分方向重叠的部分,给出了过于乐观的界。
练习 8|最优结论能否跨出模型。 S/n 在 iid 伯努利模型中达到无偏方差下界。若所有 Xi 实际都等于同一个伯努利随机变量,原结论哪一步失败?实际方差是多少?
此时 S/n=X1,方差是 p(1−p)。实际联合似然不是 n 个独立质量的乘积,信息也就不能乘以 n。比例仍然无偏,但整批数据只有一份独立随机信息,精度评价需要回到这个联合模型。