极限定理给出的近似,需要落实到主导误差与余项的比较。Delta 方法和 MLE 的正态极限都依赖这一步,导数退化或模型设错时尤其要检查。
1. 变换估计值时的误差传播
平均等待时间估为 4 秒,标准误是 0.4 秒。取倒数得到每秒 0.25,标准误却不能照着取倒数,它的变化由局部斜率决定。平方函数在零点又会出现不同情况:斜率为零,波动仍然存在。局部展开能够说明这些差别,也指出大样本近似在哪一步发挥作用。
在 iid 样本满足 E(X)=μ、0<Var(X)=σ2<∞ 时,大数定律与中心极限定理分别给出
XˉPμ,
第一式说误差会消失;第二式则把缩小的误差放大 n 倍,留下一个不退化的极限形状。因此写成 Xˉ≈N(μ, 时,是把这个极限用于有限样本的近似,不能当作普遍的精确等式。
图 8-1:三个极限工具的分工
设 AndA,B,其中 是常数。Slutsky 定理允许把二者作和、积;若 还可以作比。它不要求每个 下二者独立。这个工具解释了为何能把未知尺度替换成一致估计。
放大误差后观察极限形状
只看 Xˉ 本身,随着 n 增大,它会越来越靠近 μ,极限只剩一个点。乘以 n 相当于调高放大倍数,让正在缩小的误差仍然可见。中心极限定理描述的正是这个形状。
因此,均值趋于常数和标准化误差趋于正态,可以同时成立,它们看的尺度不同。也别顺口说成“原始数据越来越正态”:指数观测仍然右偏,接近正态的是许多独立观测的标准化平均。
伯努利 p=0.01,n=100 提供一个边界检查:P(S=0)=0.99100≈0.366,标准化均值约有 36.6% 的概率停在同一个最左端点。这显然不能仅凭 就当成平滑正态曲线。样本量要与分布形状、稀有程度及所需尾部精度一起判断。
2. 标准误是估计规则的波动尺度
标准误描述估计量抽样分布的标准差,也可以指它的估计。拿均值来说,样本标准差 S 看个体之间散得多开, S/n 才估计平均值的标准误。单位一样,用途不同,代公式前先分清。
若 SPσ>0,则
Sn(X
这次用的是大样本正态极限。如果总体正态,同一个比值在有限样本下精确服从 tn−1;一般总体只有相同的分式,还不能叫它精确 t。
相关观测往往不能使用标准误 S/n。这类数据也可能满足大数定律和中心极限定理,但需要相应的长期方差或结构模型。直方图平滑并不能验证这些条件。
3. 余项相对于主项的量级
Taylor 展开的余项是否可以忽略,取决于它与主项的相对大小。删掉一项若改变了极限,近似就没有依据。下面的随机阶记号用来完成这种比较。
写 Rn=oP(an),表示 R。例如 ,其中 ,则 ,因为 。这里不是说每个样本中的余项都小于某个固定数,而是说超过任意给定相对误差的概率会消失。
写 Rn=OP(an),表示 R 在概率上有界:对任意小的 ,可以找到有限的 ,使足够大的 满足 。例如 ,却不是 ,因为除以该尺度后仍然是非退化的 。
趋零因子与概率有界因子的乘积
若 An=OP(1)、Bn,则 。证明只需把可能出问题的地方分成两块。对任意 与 ,
P(∣AnBn∣>δ)≤P(
M 需要选得足够大以压小第一项;固定这个值后,增加 n 能使第二项变小。这一顺序保证了总概率可任意小,既不要求 An 收敛,也不依赖两项独立。若将 An 换成确定数 n,它已不是 ;虽然 ,乘积却恒等于 1。
有 n(Tn−θ)→ 时,放大后的误差在概率上有界,所以 。若 在真值附近有界,二阶余项至多为常数乘 ,即 。乘上最终尺度 后,它变为 ,因此不会改变一阶极限。
4. Delta 方法:用切线传递误差
设 n(Tn−θ)→,函数 在 处可微。由可微的定义,可以写成
g(θ+h)=g(θ)+g′(θ)h+
在 h=0 处补定义 r(0)=0。用随机误差 h=Tn−θ 代入,并乘 :
n[g(T
第一项有已知的正态极限;一致性使 r(Tn−θ)→P0,上一节的乘积论证使第二项趋零。于是
n[g(Tn)
证明只要求真值处可微。二阶导数有界,确实方便检查余项,但它是充分条件,不能反过来当作唯一条件。还有一种情形: g′(θ)=0 时,一阶极限仍成立,只是退化在零点。下一阶波动还没被它描述出来。
图 8-2:Delta 方法是一把局部尺
实际计算常用 SE(g(Tn))≈∣g。导数的绝对值保证标准误非负,其参数化必须与输入一致,单位也需同步核对。
5. 正参数例:对数与速率变换
假设平均等待时间的估计为 μ^=4 秒,估计标准误为 0.4 秒。对数变换 g(μ)=logμ 的导数为 1/μ,所以对数尺度标准误约为 。这把绝对误差转换为相对尺度上的误差。
严格处理单位时,应对无量纲比值取对数,例如 log(μ/1秒);选择不同基准只改变对数位置,不改变这里的标准误。区间若在对数尺度构造后取指数,会保持正值,但覆盖保证仍取决于所用近似。
图 8-3:对数变换与相对误差
换成指数速率 λ=1/μ,导数为 −1/μ2,标准误约为 0.4/16=0.025 每秒。你可以看到,这一步用导数传播误差,并没有把原标准误也取倒数。
另一例。 伯努利样本比例估计 p2,令 g(p)=p2。当真值在内部且非零时,
SE(p^2)≈2pnp(
实际可代入 p^,但小样本或接近边界时要警惕近似失真。
把一份平均时间报告改成速率报告
25 次独立等待的样本均值为 4 秒,样本标准差为 2 秒。暂且假定大样本近似适用,目标改为速率 λ=1/μ 时,估计值与标准误都需要换算。
2 秒描述个体观测的样本标准差。平均值的估计标准误为 2/25=0.4 秒。
这次只算了局部标准误,并没有证明 25 个样本一定足够。要拿它作推断,还得看模型、近似条件和尾部校准。Delta 方法给了计算路径,精度仍需要检查。
6. MLE 的一致性
当前数据的似然峰值已在第 5 章求出,一致性还要说明它在样本增加时靠近真值。难处是最大点随数据移动,对每个固定参数单独使用大数定律,并不能控制这个移动位置。
设 ℓn(θ)=∑ilogfθ(X,记平均目标函数 。在真分布 下,其总体版本是 。若相关期望有限、模型可识别并具有共同支持,Jensen 不等式给出
M(θ)−M(θ0)=E
最后一个期望是对 fθ 的积分,等于 1。对数严格凹,取等要求这个密度比几乎处处为常数;归一化使常数为 1,可识别性再把“分布相同”变成“参数相同”。因此总体目标在真值处有唯一峰值。Jensen 的支撑线解释可回看概率论 I 第 15 章。
唯一峰值与远处候选的正间隙
下面给出一组足以完成证明的条件。对每个 ε>0,假设
Δε=M(θ0)
前一条件要求:离真值至少 ε 的候选,都在总体目标上落后一个正间隙。后一条件要求样本曲线整段靠近总体曲线。紧参数区间、连续目标和唯一峰值有助于保证前面的间隙,但整段的一致收敛仍要单独验证。
当整段曲线的误差小于 Δε/3 时,任何区间外候选都有
Mn(θ)≤M(θ0)−
区间外候选都无法超过真值处的目标,样本最大点只能留在 ε 邻域。一致误差越界的概率趋零,便得到 θ^n→Pθ0。对整段曲线的控制排除了随 移动的尖峰,这正是逐点大数定律未能保证的部分。
具体模型里也可能有更短的证明。指数速率 MLE 是 1/Xˉ,由 Xˉ→P1/λ 和倒数连续,直接就能得到一致性。能这样算清楚时,无须再绕道验证整段目标函数。
7. 把 MLE 的正态极限完整推出来
下面证明单参数 MLE 的正态极限。观测要求 iid,真值为内点,选定估计已经证明一致,并以趋于 1 的概率满足得分方程。真值附近的对数密度需二次可微,相关求导与积分能够交换;单次得分方差 I1(θ0) 应为正且有限。证明还要控制平均二阶导数在真值附近的变化,这项条件稍后会具体核验。
记单次得分 u(x,θ)=∂θlogfθ(x)、总得分 。在可以交换求导和积分时,,且 ;这些恒等式的证明见第 7 章。
对得分方程用带中间点的中值形式,得到精确等式
0=Un(θ^n
其中 θ~n 位于两者之间。在分母非零的事件上整理:
n(θ^
分子的各项得分 iid、均值零、方差为 I1。总和除以 n 后,由 CLT 得到 。此时的极限方差仍是 ,并非 ,曲率分母尚未计入。
分母若固定在真值处,大数定律给出 −Un′(θ0)/n→PI。实际计算位置却是随机的 ,还需证明这种移动不改变极限。
一种容易检查的条件是:真值某个邻域内存在可积函数 H(X),使
∣∂θu(X,t)−∂θu(X,
于是曲率差的绝对值至多为
nU
第一个因子由一致性趋零,第二个由 LLN 稳定在有限数,曲率差才随之消失。这补上了随机中间点与固定真值之间的一步。它是充分条件,某些模型也能直接用代数证明同样的结论。
现在分母趋于严格正的 I1,接近零的概率消失,就能用 Slutsky 把两部分合起来,不需要它们相互独立:
n(
图 8-4:MLE 的大样本形状
逐条件核验:指数速率模型
对 fλ(x)=λe−λx,x>0,λ>,有 、。由均值 与方差 ,得分均值为零、方差为 。支持不随参数移动,真值为正内点, 已由 LLN 证明一致。
曲率在这里尤其透明:−Un′(λ~)/n=1/λ~。若使用上面的控制条件,在 内,,可取有限常数 。各条件于是都有了具体位置,推出 ,估计标准误为 。
这里得到的仍是分布极限,不能直接说偏差、方差也收敛到极限分布的矩。那还需要尾部控制或单独计算。指数模型可以用 Gamma 逆矩直接算有限样本偏差,第 4 章已把这条计算写出。
Slutsky 定理中的同源数据
标准化均值可以写成
Sn(X
第一个因子由 CLT 趋于标准正态,第二个因为 S→Pσ>0 而趋于常数 1。后者的随机波动最终消失,所以 Slutsky 允许把它们相乘,即使每次都用了同一批数据,也不要求它们独立。
对照第 2 章:精确 t 靠的是正态样本均值和方差独立;这里靠的是尺度估计在极限中稳定。分式虽然一样,保证来自两条不同的路线,使用时要说清走的是哪条。
8. 两个估计一起变换,协方差不能丢
向量估计满足 n(Tn−θ)→ 时,可微标量函数 的一阶变化为梯度与误差的内积,输出渐近方差是 。证明仍需控制余项,线性组合的方差计算则比单变量多出了协方差项,不能省略。
例如想估计两个平均量的比 ρ=μX/μY,μY,每个独立观测单位同时记录 。梯度为 ,故比值估计的方差近似
n1(μY
设 100 个单位给出 xˉ=6,yˉ=3,个体层的方差估计分别为 9、4,协方差估计为 3。比值估计为 2,方差约 (1+16/9,标准误约 0.1202。若误当两个均值独立,便删去了抵消项,标准误会被估成约 0.1667。相关不总是让误差增大,方向取决于变换的梯度;分母接近零时,一阶比值近似也可能失效。
9. 模型设错,点估计稳定也不够
假设仍用指数似然拟合正观测,但真实分布只有均值 μ>0、有限方差 σ2,不一定满足指数分布的 σ2=μ2。同一个优化仍得到 ,它一致估计的是 。这个量可以保留“平均时间倒数”的意义,却不能未经验证就被解释成恒定的瞬时事件速率。
直接由 CLT 和倒数 Delta 方法,
n(Xˉ
因此,更一般的标准误估计为 S/(Xˉ2n)。只有指数模型正确, S 才与 趋于同一尺度,化简回 。同一个优化能给出点估计,并不表示模型内的不确定性公式也必然合适。
前面 25 个观测、均值 4、标准差 2 的例子,如果强行套指数信息,会给标准误 0.25/5=0.05;使用一般均值变换则是 0.025。两者不同来自分布方差的假设不同。这里仅说明原理,不能从一次样本标准差偏小便宣布总体绝不可能是指数分布。
连续变换可以保留一致性,但不退化的一阶正态近似还需要相应导数非零。导数为零时,应寻找主导的高阶项和新尺度;一阶极限退化不等于有限样本完全确定。
10. 一阶导数为零,随机性不会消失
图 8-5:导数为零时的一阶失效
若 g(x)=x2 且真值 θ=0,则 g′(0)=,一阶 Delta 极限退化。但若原观测独立正态、均值为零、方差为 ,则
σ2nXˉ2=
对每个 n 都精确成立。平方误差的尺度是 1/n,形状是卡方;报告“标准误为零,所以完全确定”会丢掉主导的二阶项。
实验:水平切线遗漏的二阶波动
μ=0 时,平方函数的切线水平,一阶标准误为零。平方估计量却可能仍有波动,试着用展开中的下一项判断其尺度。
默认设置为 log、μ=2、SE=.1。“观察平方零点”会切换到退化的一阶情形;保持 μ=0 并缩小 SE,可以对照两种情况下分布宽度的变化。
log 默认的一阶标准误是 .05,接近精确值。但平方零点处,实际分布仍然右偏,宽度也大于零,标准差按 SE² 缩放。切线没捕捉到这部分波动。
一阶 Delta 项是导数乘误差,导数为零后,二阶项成了主要部分。在这里的正态演示模型下,平方值除以 SE² 就服从 χ²₁。
图 8-6:近似需要检查适用性
“超过 30 个样本”不能作为统一的适用门槛。偏斜、重尾或稀有事件可能影响近似,边界和不可识别还可能使推导失效。解析特例、模拟校准与敏感性分析都应结合具体模型使用;模拟只检查设定的模型,不能证明真实数据符合它。
实验:同均值同方差下的正态近似差异
两种标准化均值的理论均值均为 0、方差均为 1。指数样本与稀疏 Bernoulli 样本在 n=30 时,却未必同样接近正态。根据分布的偏斜和格点性质,判断哪一种可能更明显地偏离。
在两种分布之间切换,n=1、5、30、100 展示不同的抽样分布。保持 n 不动,将重复组数从 2000 增至 10000,则可以单独观察模拟精度的变化。
多重复几组,直方图会更稳定;改变 n,才会改变抽样分布本身。稀疏 Bernoulli 在 np 很小时,明显的格点和偏斜仍然在。
iid 和有限方差给出渐近保证,却没有一个统一的 n=30 门槛。比较结果时,也要分开两种误差:精确区间概率与正态概率之差是近似误差;模拟结果与精确值之差,是蒙特卡洛误差。
误差传播的条件与尺度
1估计值为 4、标准误为 0.4。其倒数的一阶标准误约为多少?
2Slutsky 定理在分母趋于非零常数时,仍要求分子与分母对每个样本量都独立。
3固定模型与单次信息,把样本量增加到原来的 9 倍,标准误变成原来的几分之一?填写分母。
11. 练习:近似的依据与适用范围
练习 1|量级判断。 令 Z∼N(0,1)、Rn=Z/n3/4。判断它是否为 ,再判断 与 的表现。
Rn/n−1/2=Z/n1/4→P,所以是。,但 不在概率上有界。对任意固定 ,。同一余项能否忽略取决于最后采用的尺度。
练习 2|解释一个证明漏洞。 有人说:“Mn(θ) 对每个固定 θ 都收敛,所以最大点一定收敛。”指出缺少什么,并用第 6 节的三个间隙量完成修正后的论证。
缺少对整个候选区域的控制,以及真值与远处候选的正间隙。记间隙为 Δε,当一致误差小于其三分之一,远处候选至多达到 M(θ0)−2Δε,真值处至少达到 ;两者仍差三分之一间隙,最大点不能在远处。仅逐点收敛无法保证这两个界对随样本移动的最大点同时有效。
练习 3|完整得分推导。 iid 计数服从 Poisson(λ),真值 λ0>0。推导 MLE、证明一致、分别求得分方差与随机点曲率极限,再给大样本标准误。不能只引用“MLE 通常正态”。
ℓ=∑Xilogλ−nλ+C,内点解为 λ,由 LLN 一致;全零样本概率 ,不妨在闭参数空间将该事件定义为 0。单次得分 ,真值处均值 0,方差 。随机中间点处的平均负曲率为 ,因为两个量分别趋于 、。得分 CLT 与 Slutsky 给 ,标准误估计为 。这份推导逐项对应第 7 节,同时处理了零样本事件。
练习 4|换一个真正的目标。 在上一题中,希望估计一个长度为 2 的未来窗口没有事件的概率 q=e−2λ。给出估计值、渐近方差和标准误公式;窗口单位与速率单位一致。
q^=e−2Xˉ,g。因此 ,标准误估计为 。目标是未来事件概率,随机的是它的估计量;并没有为参数本身构造概率分布。
练习 5|同一单位记录两个量。 80 对观测的均值为 4 与 2,方差估计为 4 与 1,协方差估计为 1.5。求均值比的一阶标准误,并说明把数据配对打乱为何可能改变结论。
代入第 8 节公式,个体级渐近方差为 4/4+16/16−2⋅4⋅1.5/8=0.5,估计标准误 0.5/80。删掉协方差则成为 。配对关系包含两种量共同变化的信息;任意打乱后,计算的不再是原观察机制下的协方差。
练习 6|一阶退化。 对 iid 均值为零、方差为 σ2>0 的非正态观测,说明 nXˉ2/σ2 的极限分布。与正态总体时的结论有什么区别?
CLT 给 nXˉ/σ→d,对连续的平方函数使用连续映射,得到 。非正态总体下一般只是渐近结论;正态总体下对每个样本量都是精确等式。平方函数在 0 处的一阶导数为零,只表示 尺度的极限退化。
练习 7|错误模型下重新报告。 64 个独立正观测有均值 5、标准差 8。用指数似然得到的点估计是什么?比较模型内信息标准误与只基于有限方差的 Delta 标准误,并分别写出它们所估计的对象。
点估计都为 1/5=0.2。指数模型标准误 0.2/8=0.025;一般 Delta 标准误 8/(25⋅8)=0.04。若指数模型正确,参数可解释为恒定速率;仅假设有限均值方差时,目标是总体平均的倒数。后者避免了方差等于均值平方这一限制,但仍需独立观测和合适的大样本近似。
练习 8|分布收敛不控制期望。 令 Wn=n 的概率为 1/n,其余时候为 0。证明 Wn→,并算期望。这对解读渐近正态结论有什么提醒?
对固定 ε>0 和足够大的 n,确有 P(∣Wn∣>ε)=1/n,但 始终不趋零。那些越来越少见的巨大值,仍然撑住了期望。所以从分布极限读误差形状时,别顺带断言偏差和方差也收敛;矩还得另证,或补上尾部控制。
下一章会用标准误构造区间。这里的近似将成为依据:目标、主导误差与余项为什么可忽略,都需要能够在具体模型中说明。