自在学

我们与你共同进步

  • 分类课程
  • 文章
  • 工作台
  • 订阅

  • 关于我们
  • 隐私政策
  • 使用条款

探索

  • 分类课程
  • 文章
  • 工作台
  • 订阅

网站信息

  • 关于我们
  • 隐私政策
  • 使用条款

加入社区

自在学学习社区微信二维码

微信扫码,交流学习

株洲市自在学教育科技有限公司© 2025 - 2026 版权所有

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

湘公网安备43020302000292号|湘ICP备2025148919号-1
分类课程工作台文章订阅
分类课程工作台文章价格

数理统计 I

  1. 01统计模型:把问题变成可检验的假设
  2. 02抽样分布:正态、卡方、t 与 F
  3. 03估计量的评价:偏差、方差与一致性
  4. 04矩估计:用样本特征解出参数
  5. 05最大似然:让已观察的数据得到合理解释
  6. 06充分统计量:压缩数据而不丢参数信息
  7. 07信息与最优性:估计精度的界限
  8. 08大样本推断:从极限到标准误
  9. 09置信区间:构造并解释覆盖保证
  10. 10检验原理:错误率、功效与最强检验
  11. 11似然比、Wald 与得分:三条检验路径
  12. 12综合推断:正态线性模型与可复核报告
正在加载课程章节内容
课程数学数理统计 I信息与最优性:估计精度的界限

逐个比较估计公式,无法排除所有尚未想到的候选。信息不等式能约束整个无偏估计类;在某些模型里,充分性与完全性还可直接证明最优性。

1. 得分衡量参数方向上的局部变化

样本均值使用了全部观测,但这还不是最优性的证明。要排除任何其他无偏规则具有更小方差的可能,可以证明一个适用于整个候选类的下界,并检查样本均值能否达到。下界不适用时,充分性与完全性提供了另一条证明路线。

对数似然 ℓ(θ;X)\ell(\theta;X)ℓ(θ;X) 关于参数的局部导数写成

Uθ(X)=∂∂θℓ(θ;X)U_\theta(X)=\frac{\partial}{\partial\theta}\ell(\theta;X)Uθ​(X)=∂θ∂​ℓ(θ;X)

这个导数叫得分函数。得分为正,局部增大参数会提高对数似然;得分为负,就往相反方向变化。可微内点最大值处通常为零。这里的“得分”描述变化方向,还不是标准化后的证据强度。

得分是似然的局部斜率
图 7-1:得分是似然的局部斜率

对一个伯努利观测,Up(X)=X/p−(1−X)/(1−p)=(X−p)/[p(1−p)]U_p(X)=X/p-(1-X)/(1-p)=(X-p)/[p(1-p)]Up​(X)=X/p−(1−X)/(1−p)=(X−p)/[p(1−p)]。这个公式只在 0<p<10<p<10<p<1 内直接可用。若 ppp 是真参数,则 Ep(X)=pE_p(X)=pEp​(X)=p,所以 Ep(Up)=0E_p(U_p)=0Ep​(Up​)=0。

一般模型里,得分均值为零来自对归一化条件求导:若允许交换微分与积分,

Eθ(Uθ)=∫∂fθ(x)∂θ dx=∂∂θ∫fθ(x) dx=0.E_\theta(U_\theta)=\int\frac{\partial f_\theta(x)}{\partial\theta}\,dx =\frac\partial{\partial\theta}\int f_\theta(x)\,dx=0.Eθ​(Uθ​)=∫∂θ∂fθ​(x)​dx=∂θ∂​∫fθ​(x)dx=0.

这一步交换了求导和积分,合法性需要条件。下面的指数模型可以验证这些条件,均匀模型则会显示交换失败时遗漏了什么。

求导与积分交换的充分条件

一种常用的充分条件是:真值附近的密度一阶、二阶参数导数分别被可积的函数控制。这样可以用控制收敛把导数移入积分。对指数模型,若真值 λ0>0\lambda_0>0λ0​>0,先限制在 [λ0/2,3λ0/2][\lambda_0/2,3\lambda_0/2][λ0​/2,3λ0​/2] 的邻域;密度导数是某个低次多项式乘 e−λxe^{-\lambda x}e−λx,其绝对值可被常数乘 (1+x2)e−λ0x/2(1+x^2)e^{-\lambda_0x/2}(1+x2)e−λ0​x/2 控制。后者在正半轴可积,所以所需交换有依据。

这个邻域只用来证明固定真值附近的局部论证合法,没有要求参数永远限在里面。如果还要对估计量 TTT 的无偏性求导,乘上 TTT 后是否可积也得查。只查密度本身,还覆盖不了所有统计量。

2. Fisher 信息:局部可区分程度

在正则条件下,定义单次观测信息

I1(θ)=Eθ[Uθ(X)2]=Var⁡θ(Uθ(X)).I_1(\theta)=E_\theta[U_\theta(X)^2] =\operatorname{Var}_\theta(U_\theta(X)).I1​(θ)=Eθ​[Uθ​(X)2]=Varθ​(Uθ​(X)).

在允许相应二阶微分交换的条件下,也有

I1(θ)=−Eθ ⁣[∂2∂θ2log⁡fθ(X)].I_1(\theta)=-E_\theta\!\left[\frac{\partial^2}{\partial\theta^2}\log f_\theta(X)\right].I1​(θ)=−Eθ​[∂θ2∂2​logfθ​(X)].
信息量与曲率
图 7-2:信息量与曲率

从得分的零均值恒等式再求一次导数,可以联系两个信息公式。设 u=∂θlog⁡fθu=\partial_\theta\log f_\thetau=∂θ​logfθ​,已有 ∫ufθ=0\int uf_\theta=0∫ufθ​=0,乘法法则给出

0=∫[(∂θu)fθ+u(∂θfθ)]dx=Eθ(∂θu)+Eθ(u2),0=\int[(\partial_\theta u)f_\theta+u(\partial_\theta f_\theta)]dx =E_\theta(\partial_\theta u)+E_\theta(u^2),0=∫[(∂θ​u)fθ​+u(∂θ​fθ​)]dx=Eθ​(∂θ​u)+Eθ​(u2),

这里用了 ∂θfθ=ufθ\partial_\theta f_\theta=uf_\theta∂θ​fθ​=ufθ​,移项才得到 E(u2)=−E(u′)E(u^2)=-E(u')E(u2)=−E(u′)。所以这不是任意函数都成立的导数关系;归一化和求导交换的条件都参与了证明。

以指数速率为例,u=1/λ−Xu=1/\lambda-Xu=1/λ−X,所以 E(u2)=Var⁡(X)=1/λ2E(u^2)=\operatorname{Var}(X)=1/\lambda^2E(u2)=Var(X)=1/λ2;另一方面 −u′=1/λ2-u'=1/\lambda^2−u′=1/λ2,两条路径给同一结果。以一个泊松观测为例,u=X/λ−1u=X/\lambda-1u=X/λ−1,观测负曲率为 X/λ2X/\lambda^2X/λ2,它会随样本改变;期望信息才是 E(X)/λ2=1/λE(X)/\lambda^2=1/\lambdaE(X)/λ2=1/λ。

期望负曲率越大,参数局部偏离时,似然越容易显示差别。这里的期望信息 III 与当前样本的观测信息 J(θ;x)=−ℓ′′(θ;x)J(\theta;x)=-\ell''(\theta;x)J(θ;x)=−ℓ′′(θ;x) 要区分。适当的大样本条件可以联系它们,却不意味着二者数值和含义相同。

换单位还会改变信息的数值。比如时间从秒换成毫秒,参数尺度变了,信息也要跟着变。跨参数或跨单位比较之前,得先有共同的误差尺度。

两个直接计算的例子:伯努利概率的信息为 I1(p)=1/[p(1−p)]I_1(p)=1/[p(1-p)]I1​(p)=1/[p(1−p)];已知方差正态模型关于均值的信息为 I1(μ)=1/σ2I_1(\mu)=1/\sigma^2I1​(μ)=1/σ2。后者来自 Uμ=(X−μ)/σ2U_\mu=(X-\mu)/\sigma^2Uμ​=(X−μ)/σ2 的方差。

稀有事件的绝对精度与相对精度

伯努利模型里 I1(p)=1/[p(1−p)]I_1(p)=1/[p(1-p)]I1​(p)=1/[p(1−p)],ppp 越小,这个数越大。可罕见事件恰好经常一例都观察不到。这并不矛盾:信息下界说的是当前参数尺度上的局部绝对精度,没有保证相对误差小,也没保证有限样本近似好。

样本比例的标准差为 p(1−p)/n\sqrt{p(1-p)/n}p(1−p)/n​,除以真值 ppp 后,相对标准差为

1−pnp.\sqrt{\frac{1-p}{np}}.np1−p​​.

若 p=0.01,n=100p=0.01,n=100p=0.01,n=100,绝对标准差约 0.00995,但相对标准差约 99.5%。一份数据可以在绝对数值上波动不大,却仍不足以把一个很小的概率估得相对准确。并且此处 np=1np=1np=1,全失败样本仍常见,不能把信息公式顺手变成可靠的正态区间。

目标改为 η=log⁡[p/(1−p)]\eta=\log[p/(1-p)]η=log[p/(1−p)] 时,链式法则给出关于 η\etaη 的单次信息 p(1−p)p(1-p)p(1−p)。数据和模型都没变,参数坐标却改变了信息数值。比较信息大小之前,需要统一参数和单位。

参数换单位时,用链式法则同步换信息

若 η=g(θ)\eta=g(\theta)η=g(θ) 为可微的一一变换,其逆导数存在,则 uη=uθ(dθ/dη)u_\eta=u_\theta(d\theta/d\eta)uη​=uθ​(dθ/dη),从而 Iη=Iθ(dθ/dη)2I_\eta=I_\theta(d\theta/d\eta)^2Iη​=Iθ​(dθ/dη)2。所以在同一点附近,二次量 Iη(dη)2=Iθ(dθ)2I_\eta(d\eta)^2=I_\theta(d\theta)^2Iη​(dη)2=Iθ​(dθ)2 不变;改变的是坐标上的数字。

对伯努利对数赔率,p=eη/(1+eη)p=e^\eta/(1+e^\eta)p=eη/(1+eη),dp/dη=p(1−p)dp/d\eta=p(1-p)dp/dη=p(1−p),得到 Iη=p(1−p)I_\eta=p(1-p)Iη​=p(1−p)。这与 Ip=1/[p(1−p)]I_p=1/[p(1-p)]Ip​=1/[p(1−p)] 一大一小,却没有矛盾。讨论“精度”之前,先说误差是按概率点、百分点还是对数赔率衡量。

3. 独立样本的信息可加性

iid 样本的对数似然是各项相加,所以总得分为 Un=∑UiU_n=\sum U_iUn​=∑Ui​。各得分独立且均值为零,因而

In(θ)=E(Un2)=∑E(Ui2)=nI1(θ).I_n(\theta)=E(U_n^2)=\sum E(U_i^2)=nI_1(\theta).In​(θ)=E(Un2​)=∑E(Ui2​)=nI1​(θ).
独立信息可以相加
图 7-3:独立信息可以相加

独立但不同分布时,在适当条件下仍可把各项信息相加,却未必是某个共同 I1I_1I1​ 的 nnn 倍。若观测相关,就得回到实际联合分布计算,不能直接沿用这一步。

例如正态测量的已知标准差为2,25次独立观测关于均值的总信息是 25/4=6.2525/4=6.2525/4=6.25,100次为25。与后面的方差下界结合,会得到样本量四倍、标准误减半的熟悉规律。

4. Cramér–Rao 无偏方差下界

设 TTT 是 θ\thetaθ 的无偏估计,方差有限,模型满足正则条件。对 Eθ(T)=θE_\theta(T)=\thetaEθ​(T)=θ 求导,交换微分与积分得

1=Eθ(TUn)=Cov⁡θ(T,Un),1=E_\theta(TU_n)=\operatorname{Cov}_\theta(T,U_n),1=Eθ​(TUn​)=Covθ​(T,Un​),

最后一步用了 E(Un)=0E(U_n)=0E(Un​)=0。由 Cauchy–Schwarz 不等式,

1≤Var⁡θ(T)Var⁡θ(Un)=Var⁡θ(T)In(θ).1\le\operatorname{Var}_\theta(T)\operatorname{Var}_\theta(U_n) =\operatorname{Var}_\theta(T)I_n(\theta).1≤Varθ​(T)Varθ​(Un​)=Varθ​(T)In​(θ).

因此

Var⁡θ(T)≥1In(θ).\boxed{\operatorname{Var}_\theta(T)\ge\frac1{I_n(\theta)}.}Varθ​(T)≥In​(θ)1​.​
Cramér–Rao 下界
图 7-4:Cramér–Rao 下界

如果估计的是可微函数 τ(θ)\tau(\theta)τ(θ) 且 TTT 对它无偏,则右侧改为 [τ′(θ)]2/In(θ)[\tau'(\theta)]^2/I_n(\theta)[τ′(θ)]2/In​(θ)。存在偏差时不能直接套这个无偏版本;偏差导数也会进入相应的一般信息不等式。

已知方差正态模型中,Xˉ\bar XXˉ 的方差为 σ2/n\sigma^2/nσ2/n,正好等于下界,因此在该模型、无偏估计类与方差准则下达到最优。伯努利样本比例也达到 p(1−p)/np(1-p)/np(1−p)/n 的下界。

有了下界,还要检查能不能达到。等号要求中心化估计量与得分几乎处处成比例;若找不到符合要求的统计量,这条界就只是参照。有偏收缩估计的 MSE 即使更低,也没有违反只约束无偏估计的定理。

实验:期望信息与观测信息的变化

固定 n 和 p₀,成功次数改变会影响当前似然。根据两个信息量的定义,判断其中哪一个会随这份记录变化。

n=25、p₀=.60、k=15 给出初始曲线,将 k 改成 4 可观察样本结果的影响。n=100、k=60 则适合比较样本量四倍时的下界。

k 改变时,橙色曲线的倾斜和曲率都变了,深色期望曲线与 Iₙ 却不动。把样本量增到四倍,CRLB 降为原来的四分之一。

观测信息取当前样本的负二阶导数,期望信息则把所有可能样本平均。图中的二次虚线只在 p₀ 附近近似期望曲线,不能拿它替代远处的整条曲线。

把正态均值的下界证明一遍

已知方差 σ2\sigma^2σ2 的 iid 正态模型可以完整展示证明。目标是确定样本均值是否达到估计 μ\muμ 的无偏方差下界。

从对数密度求关于均值的导数,单次得分为 (Xi−μ)/σ2(X_i-\mu)/\sigma^2(Xi​−μ)/σ2。总得分是 Un=n(Xˉ−μ)/σ2U_n=n(\bar X-\mu)/\sigma^2Un​=n(Xˉ−μ)/σ2;它的均值为零,方差为 n/σ2n/\sigma^2n/σ2。

对任意无偏估计 TTT,恒等式 EμT=μE_\mu T=\muEμ​T=μ 在允许交换积分和微分时导出 Eμ(TUn)=1E_\mu(TU_n)=1Eμ​(TUn​)=1。因为总得分均值为零,左边就是 Cov⁡(T,Un)\operatorname{Cov}(T,U_n)Cov(T,Un​)。

两个随机量的相关系数绝对值不超过 1,等价地,协方差平方不超过方差乘积。所以 1≤Var⁡(T)n/σ21\le\operatorname{Var}(T)n/\sigma^21≤Var(T)n/σ2,得到下界 σ2/n\sigma^2/nσ2/n。

候选 Xˉ\bar XXˉ 无偏,方差恰为 σ2/n\sigma^2/nσ2/n,并满足 Xˉ−μ=(σ2/n)Un\bar X-\mu=(\sigma^2/n)U_nXˉ−μ=(σ2/n)Un​。这正是取等所需的线性关系,因此样本均值在该模型的无偏估计类中具有最小方差。

这次证明里,有两处不能省:候选限定为无偏估计,得分的归一化求导也必须合法。若改变其中一处,就得重新检查,不能只记一句“均值最稳定”。

一般目标与有偏规则的信息界

若 m(θ)=EθTm(\theta)=E_\theta Tm(θ)=Eθ​T 可微,刚才的同一证明给

Var⁡θ(T)≥[m′(θ)]2In(θ).\operatorname{Var}_\theta(T)\ge\frac{[m'(\theta)]^2}{I_n(\theta)}.Varθ​(T)≥In​(θ)[m′(θ)]2​.

估计目标为 τ(θ)\tau(\theta)τ(θ) 时,设偏差 b=m−τb=m-\taub=m−τ,于是分子为 [τ′+b′]2[\tau'+b']^2[τ′+b′]2。在平方风险中还要加回 b2b^2b2。这解释了有偏估计为何可以有比无偏界更小的方差:它连“平均随参数移动多快”都改变了。

例如已知方差为 vvv 的正态均值模型,T=cXˉT=c\bar XT=cXˉ,其中 ccc 事先固定。它的平均为 cμc\mucμ,一般信息下界为 c2v/nc^2v/nc2v/n,正好等于其方差;但估计 μ\muμ 的 MSE 是 c2v/n+(c−1)2μ2c^2v/n+(c-1)^2\mu^2c2v/n+(c−1)2μ2。若只对比方差、不写偏差和参数范围,就会把缩小数字误当成无条件提高估计质量。

等号条件与可实施的估计规则

当目标无偏且 In>0I_n>0In​>0,Cauchy–Schwarz 取等要求

T−τ(θ)=τ′(θ)In(θ)Un几乎处处.T-\tau(\theta)=\frac{\tau'(\theta)}{I_n(\theta)}U_n \quad\text{几乎处处}.T−τ(θ)=In​(θ)τ′(θ)​Un​几乎处处.

移项后虽然能写出 TTT 的表达式,还得检查它是否含未知参数。统计量必须用同一条可计算规则处理所有参数;若做不到,就没有规则能在所有参数处达到这条界。

例如伯努利模型估计 p2p^2p2,代入 Un=(S−np)/[p(1−p)]U_n=(S-np)/[p(1-p)]Un​=(S−np)/[p(1−p)]、In=n/[p(1−p)]I_n=n/[p(1-p)]In​=n/[p(1−p)],取等将要求 T=2pS/n−p2T=2pS/n-p^2T=2pS/n−p2。这个式子仍依赖未知 ppp,不能作为通用统计量。因此找到 UMVU 后,它也未必达到这条信息界;后面会算出确切差距。

5. 支持变化会破坏常用证明

正则条件是一扇门
图 7-5:正则条件是一扇门

这组常用充分条件要求参数位于开集内、支持固定、对数密度足够光滑。相关求导还必须能与积分交换,信息应为正且有限。均匀模型的支持会随参数移动,下面可以看到证明在哪一步失效。

均匀 [0,θ][0,\theta][0,θ] 模型中,若只对支持内部的 −nlog⁡θ-n\log\theta−nlogθ 求导,会得到总得分 −n/θ-n/\theta−n/θ,其期望不是零。原因是积分的上界也随 θ\thetaθ 移动,直接交换时遗漏边界贡献。这个模型不能套刚才的正则无偏下界。

用单个观测就能定位遗漏的项:

ddθ∫0θ1θ dx=1θ⏟上限移动+∫0θ−1θ2dx⏟内部密度变化=0.\frac d{d\theta}\int_0^\theta\frac1\theta\,dx =\underbrace{\frac1\theta}_{\text{上限移动}} +\underbrace{\int_0^\theta-\frac1{\theta^2}dx}_{\text{内部密度变化}}=0.dθd​∫0θ​θ1​dx=上限移动θ1​​​+内部密度变化∫0θ​−θ21​dx​​=0.

只留下积分内导数会得到 −1/θ-1/\theta−1/θ,漏的恰好是移动上限的贡献。多个样本时,支持区域也随参数扩大,道理相同,边界项仍不能省。

无偏上界估计 θ~=(n+1)M/n\tilde\theta=(n+1)M/nθ~=(n+1)M/n 的方差为 θ2/[n(n+2)]\theta^2/[n(n+2)]θ2/[n(n+2)],数量级是 n−2n^{-2}n−2;常见正则参数估计的方差数量级则是 n−1n^{-1}n−1。这里估得更快,有一个具体原因:参数改变时,哪些观测可能出现也跟着变,支持本身带来了信息。

实验:最大值逼近上界的速度

最大值与上界的典型间隙按 1/n 的量级缩小。用这一关系判断样本量增至四倍时的变化,再与模拟中的间隙比较。

固定 θ=2,将 n 从 10 改为 40,样本带同时显示 M、无偏修正及缩放间隙密度。“换一组样本”会改变这一次结果,分布规律却由同一模型决定。

无偏修正的标准差按 1/n 量级下降,W=n(θ−M)/θ 的密度逐渐靠近 Exp(1)。某一批里,修正估计也可能超过真实上界,别把典型速度当作每次都从下方接近的保证。

Uniform 的支持依赖 θ,积分会带上边界项,因此不能直接认定得分均值为零。刚才正则模型中的信息相加和 CRLB 证明,也就不能原样搬来。

6. 多参数信息与矩阵逆

如果参数有两个分量,得分也是两个分量,信息矩阵记录它们的方差与协方差。设总信息为

In=(abbc),a>0,c>0,ac>b2.I_n=\begin{pmatrix}a&b\\b&c\end{pmatrix},\qquad a>0,c>0,ac>b^2.In​=(ab​bc​),a>0,c>0,ac>b2.

估计第一参数时,其他参数未知对应的方差下界是逆矩阵第一对角元素

(In−1)11=cac−b2=1a−b2/c,(I_n^{-1})_{11}=\frac{c}{ac-b^2}=\frac1{a-b^2/c},(In−1​)11​=ac−b2c​=a−b2/c1​,

这里不能只取 1/a1/a1/a。第二参数确实已知时,下界才是 1/a1/a1/a。被扣除的 b2/cb^2/cb2/c 来自两个得分方向的重叠:你以为是第一参数造成的变化,第二参数也可能解释一部分。

取 In=(8222)I_n=\begin{pmatrix}8&2\\2&2\end{pmatrix}In​=(82​22​),第二参数未知时第一参数界为 1/61/61/6,已知时为 1/81/81/8。不能只看 888 就跳过联合不确定性。第 11 章将把同样的扣除用于有干扰参数的得分检验。

更一般的目标 τ(θ)\tau(\boldsymbol\theta)τ(θ) 的无偏下界为 ∇τTIn−1∇τ\nabla\tau^{\mathsf T}I_n^{-1}\nabla\tau∇τTIn−1​∇τ。它可由一个非负方差证明:令 V=T−τ−∇τTIn−1UV=T-\tau-\nabla\tau^{\mathsf T}I_n^{-1}\mathbf UV=T−τ−∇τTIn−1​U,利用 Cov⁡(U,T)=∇τ\operatorname{Cov}(\mathbf U,T)=\nabla\tauCov(U,T)=∇τ 展开,得到 Var⁡(V)=Var⁡(T)−∇τTIn−1∇τ≥0\operatorname{Var}(V)=\operatorname{Var}(T)-\nabla\tau^{\mathsf T}I_n^{-1}\nabla\tau\ge0Var(V)=Var(T)−∇τTIn−1​∇τ≥0。矩阵逆由消去与得分相关的线性部分自然出现。

7. 完全性:用另一条路径确认最优

统计量 TTT 的分布族称为完全的,若任何满足 Eθ∣g(T)∣<∞E_\theta|g(T)|<\inftyEθ​∣g(T)∣<∞ 且对所有参数有 Eθg(T)=0E_\theta g(T)=0Eθ​g(T)=0 的函数,都必须满足 g(T)=0g(T)=0g(T)=0 几乎处处。它排除了一个“处处零均值却非零”的歧义方向。

完全性与唯一性
图 7-6:完全性与唯一性

伯努利总数的证明。 对 S∼Bin⁡(n,p)S\sim\operatorname{Bin}(n,p)S∼Bin(n,p),假设 ∑s=0ng(s)(ns)ps(1−p)n−s=0\sum_{s=0}^n g(s)\binom ns p^s(1-p)^{n-s}=0∑s=0n​g(s)(sn​)ps(1−p)n−s=0 对每个 p∈(0,1)p\in(0,1)p∈(0,1) 成立。除以 (1−p)n(1-p)^n(1−p)n,令 t=p/(1−p)>0t=p/(1-p)>0t=p/(1−p)>0,得到一个对所有正 ttt 都为零的多项式。它的每个系数都必须为零,所以 g(s)=0g(s)=0g(s)=0。因此 SSS 完全;第 6 章又已证明它充分。

Lehmann–Scheffé 结论。 如果 TTT 完全且充分,h(T)h(T)h(T) 对目标参数函数无偏并有有限方差,那么它是在所有无偏估计量中一致最小方差的估计,简称 UMVU,且在几乎处处意义下唯一。

任意无偏竞争者经过 Rao–Blackwell 条件平均,都变为风险不增加的 TTT 的函数。两个这样的无偏函数之差,在所有参数处的期望为零,完全性便迫使它们几乎处处相同。这就完成了对整个无偏估计类的比较。

例如 S/nS/nS/n 是 ppp 的 UMVU;n≥2n\ge2n≥2 时,S(S−1)/[n(n−1)]S(S-1)/[n(n-1)]S(S−1)/[n(n−1)] 对 p2p^2p2 无偏,也因此是 p2p^2p2 的 UMVU。无偏性可由 S(S−1)=∑i≠jXiXjS(S-1)=\sum_{i\ne j}X_iX_jS(S−1)=∑i=j​Xi​Xj​ 的期望验证。

完全性中“对所有参数”的要求

令 g(S)=S−n/2g(S)=S-n/2g(S)=S−n/2。当 p=1/2p=1/2p=1/2 时它的期望为零,但它显然不是处处等于零。这个例子不违反完全性,因为完全性要求同一个函数在每一个允许的 ppp 下期望都为零。事实上 Epg(S)=n(p−1/2)E_p g(S)=n(p-1/2)Ep​g(S)=n(p−1/2),其他参数处不会消失。

第 6 章已经给出 p2p^2p2 的无偏估计 S(S−1)/[n(n−1)]S(S-1)/[n(n-1)]S(S−1)/[n(n−1)]。现在任取另一个无偏估计,先条件化成 SSS 的函数,方差不会增加。再与候选相减,差对每个 ppp 都零均值,完全性便使它们几乎处处相同。这个证明一次比较了全部无偏竞争者。

说 UMVU 时,“无偏”这两个字要一起读:它在每个参数处的方差都不大于其他无偏估计。允许有偏、换一种损失之后,还要重新比较,第 3 章的收缩例子仍然成立。

8. 连续模型中的完全性,也能亲手证明

对 iid Uniform⁡[0,θ]\operatorname{Uniform}[0,\theta]Uniform[0,θ],最大值 MMM 的密度是 nmn−1/θnnm^{n-1}/\theta^nnmn−1/θn,0<m<θ0<m<\theta0<m<θ。假设同一个可测函数 ggg 对所有 θ>0\theta>0θ>0 都可积且满足 Eθg(M)=0E_\theta g(M)=0Eθ​g(M)=0,则

∫0θg(m)mn−1dm=0对每个 θ>0.\int_0^\theta g(m)m^{n-1}dm=0\qquad\text{对每个 }\theta>0.∫0θ​g(m)mn−1dm=0对每个 θ>0.

左边是上限为 θ\thetaθ 的积分。因为被积函数在每个有限区间上可积,这个积分函数绝对连续,导数几乎处处等于 g(θ)θn−1g(\theta)\theta^{n-1}g(θ)θn−1。积分函数恒为零,因此 g(θ)θn−1=0g(\theta)\theta^{n-1}=0g(θ)θn−1=0 几乎处处;在正半轴上权重为正,所以 g=0g=0g=0 几乎处处,也即在每个最大值分布下几乎必然为零。于是 MMM 完全。

题目没有假定 ggg 连续,因此只能得到几乎处处为零,不能扩大为每个点都为零。密度分布赋予单点的概率为零,这种区别不影响相应统计结论。

第 6 章已证明 MMM 充分;又由积分

Eθ(Mk)=nθn∫0θmn+k−1dm=nn+kθk(k>0),E_\theta(M^k)=\frac n{\theta^n}\int_0^\theta m^{n+k-1}dm =\frac n{n+k}\theta^k\quad(k>0),Eθ​(Mk)=θnn​∫0θ​mn+k−1dm=n+kn​θk(k>0),

由此, n+knMk\frac{n+k}{n}M^knn+k​Mk 是 θk\theta^kθk 的 UMVU。证明使用充分性与完全性,没有依赖正则得分恒等式,因而支持移动不妨碍这条路线。

9. UMVU 与信息下界之间的差距

令 AAA 为任意有限方差无偏竞争者。对充分的 TTT 条件化,得到 A∗=E(A∣T)A^*=E(A\mid T)A∗=E(A∣T);第 6 章保证该规则可实施、无偏且方差不增加。已有无偏候选 h(T)h(T)h(T),两者之差满足 Eθ[A∗−h(T)]=0E_\theta[A^*-h(T)]=0Eθ​[A∗−h(T)]=0,对所有参数成立。完全性给出 A∗=h(T)A^*=h(T)A∗=h(T) 几乎处处,因此每个参数处都有 Var⁡(h(T))≤Var⁡(A)\operatorname{Var}(h(T))\le\operatorname{Var}(A)Var(h(T))≤Var(A)。竞争者若风险也相同,被消去的条件方差必须为零,它就与候选几乎处处相同。

证明依赖的是充分性、完全性以及估计的无偏和有限方差,并未要求达到 Cramér–Rao 界。以伯努利目标 p2p^2p2 的候选

H=S(S−1)n(n−1)H=\frac{S(S-1)}{n(n-1)}H=n(n−1)S(S−1)​

为例,记下降阶乘 (s)k=s(s−1)⋯(s−k+1)(s)_k=s(s-1)\cdots(s-k+1)(s)k​=s(s−1)⋯(s−k+1)。(S)k(S)_k(S)k​ 数的是互不相同的 kkk 个位置同时成功的有序组合,故 E(S)k=(n)kpkE(S)_k=(n)_kp^kE(S)k​=(n)k​pk。展开多项式可核验 (S)22=(S)4+4(S)3+2(S)2(S)_2^2=(S)_4+4(S)_3+2(S)_2(S)22​=(S)4​+4(S)3​+2(S)2​,取期望再减 p4p^4p4,得到

Var⁡(H)=4p3(1−p)n+2p2(1−p)2n(n−1).\operatorname{Var}(H)=\frac{4p^3(1-p)}n +\frac{2p^2(1-p)^2}{n(n-1)}.Var(H)=n4p3(1−p)​+n(n−1)2p2(1−p)2​.

第一项恰是估计 p2p^2p2 的信息下界,第二项在内部参数处却严格为正。代入 n=4,p=1/2n=4,p=1/2n=4,p=1/2,界为 1/161/161/16,真实方差是 7/967/967/96。这不是还没找到更好的无偏估计:规则已经是 UMVU,只是这条信息下界没能贴到真实最小方差。

完全性、充分性与最小充分性的区别

充分性要求压缩后的剩余条件分布不再含参数;在这个要求之下,最小充分性进一步去掉仍可合并的区分。完全性研究的则是统计量的函数:能否存在一个非零函数,对所有参数都具有零期望。三者不能凭名称互推。恒定统计量 T≡0T\equiv0T≡0 的任何函数都只是常数,零期望迫使常数为零,所以它完全,却通常没有保留参数信息,因而不充分。

给“最优”加上正确的限定

1
某个有偏估计的 MSE 小于 Cramér–Rao 无偏方差下界,首先应得出什么结论?
2
运用完全性时,必须检查同一个函数对所有允许参数的期望都为零。
3
正态均值模型的已知方差为 9,独立样本量为 36,关于均值的总 Fisher 信息是多少?

10. 练习:亲手证明“最优”

练习 1|两条路径算信息。 对一个指数速率观测,分别由得分平方期望与负二阶导数计算单次信息。若目标改为平均时间 μ=1/λ\mu=1/\lambdaμ=1/λ,关于 μ\muμ 的信息是什么?

uλ=1/λ−Xu_\lambda=1/\lambda-Xuλ​=1/λ−X,均值零、方差 1/λ21/\lambda^21/λ2;负二阶导数同样为 1/λ21/\lambda^21/λ2。因为 dλ/dμ=−1/μ2d\lambda/d\mu=-1/\mu^2dλ/dμ=−1/μ2,信息变为 Iμ=Iλ/μ4=1/μ2I_\mu=I_\lambda/\mu^4=1/\mu^2Iμ​=Iλ​/μ4=1/μ2。写相同的形式不表示单位相同,要随所用参数解释。

练习 2|有偏版本。 已知正态方差为 16、样本量为 25,规则 T=0.8XˉT=0.8\bar XT=0.8Xˉ 用于估计均值。求它的方差、偏差、MSE,并核验一般信息界。

总信息 25/1625/1625/16,m′(μ)=0.8m'(\mu)=0.8m′(μ)=0.8,一般方差界为 0.64⋅16/25=0.40960.64\cdot16/25=0.40960.64⋅16/25=0.4096,恰为其方差。偏差为 −0.2μ-0.2\mu−0.2μ,MSE 为 0.4096+0.04μ20.4096+0.04\mu^20.4096+0.04μ2。它的方差小于无偏界 0.64 不矛盾,因为平均函数的导数也缩小了。

练习 3|目标不是参数本身。 伯努利目标为 p(1−p)p(1-p)p(1−p),写出无偏方差下界。在 p=1/2p=1/2p=1/2 时下界为零,是否存在处处正确的零方差估计?

目标导数为 1−2p1-2p1−2p,界为 (1−2p)2p(1−p)/n(1-2p)^2p(1-p)/n(1−2p)2p(1−p)/n。在 p=1/2p=1/2p=1/2 为零只是局部下界没有约束力。一个对所有 ppp 无偏的规则不能据此在不知道参数的情况下恒等于真值;例如第 6 章的无偏估计 S(n−S)/[n(n−1)]S(n-S)/[n(n-1)]S(n−S)/[n(n−1)] 在该点仍随机。

练习 4|完全性的量词。 对 S∼Bin⁡(n,p)S\sim\operatorname{Bin}(n,p)S∼Bin(n,p),有人用 g(S)=S−n/3g(S)=S-n/3g(S)=S−n/3 在 p=1/3p=1/3p=1/3 处零期望反驳完全性。指出错误,并说明为什么多项式证明需要整个参数区间。

完全性要求同一个函数对所有允许的 ppp 都零期望,这里的期望却是 n(p−1/3)n(p-1/3)n(p−1/3),只在一点为零。多项式在一点为零,只说明有一个根;在整个正区间为零,才会迫使所有系数为零。错误就在把“每一个参数”换成了“某一个参数”。

练习 5|完整 UMVU 构造。 均匀上界模型有 n=5n=5n=5,目标为 θ2\theta^2θ2。给出 UMVU,证明无偏,并写清完全性与充分性分别在哪一步使用。

候选为 7M2/57M^2/57M2/5。由 E(M2)=5θ2/7E(M^2)=5\theta^2/7E(M2)=5θ2/7 可知无偏,且有有限方差。充分性使任意竞争者可条件化成 MMM 的函数而不增风险;完全性使任何两个这样的无偏函数几乎处处相同。因此该候选在所有无偏估计中方差最小。无偏性不能由“充分”二字代替。

练习 6|计算 UMVU 的真实方差。 在上一题中,用 E(M4)E(M^4)E(M4) 求候选的方差。为什么不能直接拿正则信息界当它的方差?

E(M4)=5θ4/9E(M^4)=5\theta^4/9E(M4)=5θ4/9,因此方差为 (49/25)(5/9)θ4−θ4=4θ4/45(49/25)(5/9)\theta^4-\theta^4=4\theta^4/45(49/25)(5/9)θ4−θ4=4θ4/45。该模型支持随参数移动,常规得分零均值证明失效;即使在正则模型中,信息下界也不自动等于最优估计的方差。

练习 7|干扰参数的代价。 总信息矩阵为 (10332)\begin{pmatrix}10&3\\3&2\end{pmatrix}(103​32​)。第二参数已知与未知时,第一参数的无偏方差界各是多少?

已知时为 1/101/101/10;未知时为 1/(10−9/2)=2/11≈0.18181/(10-9/2)=2/11\approx0.18181/(10−9/2)=2/11≈0.1818。行列式为 11、矩阵正定,逆存在。第一对角元素的倒数忽略了与第二得分方向重叠的部分,给出了过于乐观的界。

练习 8|最优结论能否跨出模型。 S/nS/nS/n 在 iid 伯努利模型中达到无偏方差下界。若所有 XiX_iXi​ 实际都等于同一个伯努利随机变量,原结论哪一步失败?实际方差是多少?

此时 S/n=X1S/n=X_1S/n=X1​,方差是 p(1−p)p(1-p)p(1−p)。实际联合似然不是 nnn 个独立质量的乘积,信息也就不能乘以 nnn。比例仍然无偏,但整批数据只有一份独立随机信息,精度评价需要回到这个联合模型。

上一章充分统计量:压缩数据而不丢参数信息下一章大样本推断:从极限到标准误