汇总数据能否保留参数信息,取决于给定汇总量后的条件分布。充分性把这个要求写成可证明的性质,条件平均则能据此改进估计。
1. 成功总数保留的信息
1000 次独立且成功概率相同的操作,只留下成功总数,仍足以进行模型内的概率推断。但若要检查用户是否越练越熟,顺序就不能丢。充分性区分了这两种信息需求,也为后面的条件平均提供了依据。
统计量 T 对参数 θ 充分,指给定 T 后,原始样本的条件分布不再依赖 θ,在条件分布的几乎处处意义下成立。它保留模型内关于指定参数的信息,但未必能恢复全部原始记录。
图 6-1:压缩什么信息
完整样本本身总是充分的,充分性并不自动意味着压缩。更有用的表示应简化记录,同时保留指定参数的信息。若 T 充分,且 g 一一对应,则 g(T) 也充分,因为两者能够互相恢复。这类表示可以包含多个分量。
2. 一个可以数清的条件分布
四次独立伯努利试验,成功概率 p∈(0,1)。给定总成功数 S=2,可能序列恰有六种:
1100,1010,1001,0110,0101,0011.
每种序列的联合概率都是 p2(1−p)2,而 Pp(S=。所以每种序列在该条件下的概率都是 ,参数约掉了。
图 6-2:条件分布判断充分性
一般地,对 n 次试验,给定 S=s 后,每个有 s 次成功的序列概率为 1/(sn),与 无关。所以成功总数对 充分。在端点参数处,有些给定事件概率为零;不能对零概率条件直接相除,定义要在条件分布有意义的范围内使用。
实验:给定总数后的序列分布
n=4、s=2 时,1100 是六种可能排列之一。根据刚才约去参数的计算,判断 p 从 0.2 改为 0.8 后,这条序列的条件概率是否改变。
点选序列,在 p=0.2、0.8、0.5 之间切换,比较联合概率与条件概率。s=0 或 s=n 时只剩一条序列,可以检查条件分布退化的情形。
六条序列的条件概率一直是 1/6。n=4、s=2 时,p=0.2 和 0.8 的联合概率、总数概率碰巧因对称而相同;换到 p=0.5,这两项就变了,条件概率还是 1/6。
这组总数相同的序列叫作一条纤维。它们共有因子 pˢ(1−p)ⁿ⁻ˢ,除以总数事件的概率时,这个因子被约掉,只剩 1/C(n,s)。你看到的“不随 p 变化”正发生在这次相除以后。
根据总数生成条件序列
只给定 n=4,S=2,仍能生成条件分布正确的原始序列:在 1100、1010、1001、0110、0101、0011 中等概率抽取一条即可。生成过程无需知道 p。总成功数已知后,剩余顺序不再帮助区分 p。
别把这读成 S 与 p 无关。S 的分布恰恰会随 p 改变;不含 p 的,是给定 S 后的条件分布。参数信息在总数里,约掉参数的是知道总数之后剩下的那部分随机性。
撤掉恒定成功率假设后,结论会改变。设前两次成功率为 p、后两次为 q,1100 的概率是 p2(1−q)2,而 0011 的概率为 (1。总数相同的两份记录,其概率比仍依赖 ;只留总数就丢掉了区分早晚的信息。
3. 连续数据:不能除以一个零概率事件
考虑 n≥2 次 iid 指数等待,速率为 λ>0,总时间记作 T=∑iX。给定 后第一段时间的分布,需要用条件密度求出。因为 ,两个点概率不能直接相除,计算要从联合密度和边缘密度入手。
先看 n=2。从 (X1,X2) 改成 (X,反变换为 ,Jacobian 绝对值为 1,支持是 。联合密度为 ,对 在 积分,得到 。因此
fX1∣T(x∣t)=t
结果里已经没有 λ。总时间给定后,分割点在区间内均匀分布,另一段就被确定为 t−X1。你还可以看到,原来独立的两段在这个条件下反而不独立了。充分性要求条件分布不含参数,并没有要求剩余观测彼此独立。
多段等待时第一段的条件分布
对一般 n,剩余总和 R=X2+⋯+Xn 独立于 ,服从形状 、速率 的 Gamma 分布。这个和分布可在概率论 I 第 9、13 章找到。仍使用 ,得
fX1,T(x,t)=
总和的密度为 fT(t)=λntn−1e,相除得到
fX1∣T(x∣t)=
换元 u=x/t 可检查积分为 1:∫01(n−1)(1−u)。当 ,密度向小值倾斜,因为第一段占得越多,留给其余多个正时间的空间越小。参数依然完全消失。
一个分量的条件分布还不足以证明整个样本的充分性。将前 n−1 个分量一起变换,能够得到正单纯形 x1+⋯+xn−1< 上常数为 的条件密度,最后一个分量由总和确定。这个联合分布才补齐了证明,下一节也可用因子分解完成。
4. 把含参数的部分找出来
本课程的离散与连续模型都具有公共支配测度。因子分解定理在此给出判据:联合概率质量或密度若可写为
fθ(x)=gθ(T(x))h(x),
其中 h 不含未知参数,则 T 充分;在相应条件下反向也成立。支持指示函数必须包括在分解中,因为它可能含参数。
图 6-3:因子分解的职责
在离散情形,因子分解的两个方向可以直接验证。已有分解时,给定 T=t 后有
Pθ(X=x∣T=t)=
共同因子 gθ(t) 被约掉,条件分布无参数。反过来,若 T 已充分,就取 gθ(t)=、,由乘法公式回到联合概率。零概率的条件组单独处理,不作非法除法。
连续情形不能只把上面的求和符号换成积分,因为 T=t 往往是一张低维曲面。上一节特意做变量变换,就是要说清条件密度在哪些坐标下定义。对这些受公共测度支配的通常模型,因子分解定理把相应结论统一了起来。
泊松例。 iid 泊松样本的联合质量为
e−nλλ∑xi∏
看含参数的部分:它只通过总数 T=∑Xi 用到数据,所以总数充分。阶乘部分虽然仍随各条观测变化,却不含 λ,可以放在另一边。
正态例。 均值与方差同时未知时,展开 ∑(xi−μ)2 后,参数相关的数据项通过 ∑xi 和 进入。因此这两个总和组成充分统计量。对 ,它与 可以互相恢复,后者也充分。若方差已知,平方和项可放入不含待估均值的部分,这时只保留总和即可。
5. 支持限制本身也是信息
独立均匀 [0,θ] 样本的联合密度为
θ−n1{maxxi≤θ}1{minxi
取 M=maxXi,把前两项放进 gθ(M),其余放进 h(x,就得到最大值对上界参数的充分性。
图 6-4:均匀模型保留最大值
上下界 a,b 都未知时,支持还要求 a≤minxi,因而需要保留 (minXi。决定充分统计量的依据包括未知参数集合,单凭“均匀分布”这个名称不足以判断。
已经充分的汇总量是否还能合并,可以通过相对似然判断。
均值相同的记录仍含不同方差信息
取两份正态样本 A:3,4,5,B:0,4,8。它们都具有 xˉ=4,但残差平方和分别为 2 和 32。在均值、方差同时未知时,联合密度中分别出现 和 ;两者相对程度仍随 改变。
只拿到平均数,你就无法重做完整记录所支持的方差比较。把平方和也留下,位置和尺度需要的特征才齐了。如果方差事先已知,刚才的差别不再含未知均值,此时才可以少留一些信息。
充分性总是针对指定模型和未知参数。它保留模型内部的参数信息,原始记录中的时间趋势或录入错误则属于诊断问题,未必能由汇总量发现。
6. 最小充分与可恢复的信息
设 T 已充分。如果对任何其他充分统计量 S,都能由 S 算回 T,则称 T 最小充分。换言之,其他任何合格的摘要至少保留了 T 所保留的区分。这里比较的是可恢复的信息,不是数字个数:把两个数字编码成一个数,并没有进一步消除统计信息。
在本课程使用的通常离散与连续模型中,可利用如下判别思路:两份数据 x,y 的似然函数若只差一个不含参数的正比例因子,它们对参数候选的相对比较就完全一致,可以分在同一组。若一个已经证明充分的 T 满足“似然函数成比例,当且仅当 T(x)=T(y)”,它就达到最小充分的划分。涉及零密度时比较整条似然函数的比例关系,不能对零随意相除。
理由是:任何充分统计量 S 若合并了 x,y,由因子分解可知它们的似然比只能是 h(x)/h(y),不含参数;判据于是迫使 T(x)=T(y)。因此在每一组 内, 都有同一个值,从 即可恢复它。以下例子都在普通欧氏或可数样本空间上实施这个判据。
正态模型:两个总和恰好是所需的区分
均值和方差都未知,取两份相同长度的样本,记 A=∑xi−∑yi、B=。联合密度均为正,有
logfμ,σ2(y)
若 A=0,固定方差改变均值,比值会变化,所以必须有 A=0。在此前提下,若 B=0,改变方差又会改变比值,所以还必须有 。反之二者都为零时比值恒为 1。已经由因子分解证明充分的 因而是最小充分的。
如果方差事先已知,B 那一项只用数据和已知常数,就不必保留;留下 A=0 已经足够。你可以对照两次推导,看到改变的是未知参数集合,最小充分的要求也随之变了。
均匀上界:似然为零的范围也参与比较
对两个非负样本,若最大值不同,例如 mx<my,选择 mx≤θ 时,一份似然为正,另一份为零,二者不可能是同一条函数的正倍数。最大值相同时,似然函数相同。因此 最小充分。这次没有求导,而是直接检查了候选参数允许哪些数据出现。
7. Rao–Blackwell:在给定信息后取条件平均
设 Y 是目标 τ(θ) 的估计,二阶矩有限,T 充分。构造
Y∗=E(Y∣T).
因为所选统计量充分,计算条件平均时可选取不依赖未知参数的条件分布。这样得到的 Y∗ 才能由数据实施。全期望公式给出 E(Y∗)=E(Y),所以偏差保持不变。再用全方差公式:
Var(Y)=Var(Y∗)+E[Var(Y∣T)]≥
因此,在平方损失下 MSE 不会增加。原来若无偏,条件平均后仍无偏。这就是 Rao–Blackwell 改进给出的保证。
图 6-5:条件平均降低噪声
从第一条记录改到成功比例。 伯努利模型里,Y=X1 对 p 无偏,却只使用第一条记录。给定成功总数 S=s,各位置的成功概率相同,总和又是 s,因而 。条件平均为 ,原方差 降至 。样本数量未变,减少的是与参数无关的顺序噪声。
一般的条件期望也会降低方差,但还得查能不能算。如果选的 T 不充分,条件分布可能仍含未知参数。纸上得到一个更平滑的表达式,不代表已经有可执行的估计规则。
从估计 p 走到估计两次都成功的概率
目标改为 p2 时,独立伯努利结果的乘积 Y=X1X2 无偏,但只使用前两个位置。全部 n 次试验的成功总数 提供了条件平均所需的信息。
起点的无偏性来自独立性:E(X1X2)=E。其他模型不能未经检查就把期望拆成乘积。
直接将样本比例平方会得到 E[(S/n)2]=p2+p(1−p)/n,多出的正项正是样本比例的方差。这个简洁的代入没有保留无偏性,条件平均必须按条件分布实际计算。
实验:排列变化与条件平均
固定 S=2,重新排列 0/1,判断 X₁ 与 S/n 各自是否变化。一个使用具体位置,另一个只依赖总数。
在同一总数的序列中点选第一位分别为 0 和 1 的排列,两张分布图与方差条会显示差别。增大 n 或改变总数 s,可以检查结论在另一组条件下的表现。
第一位为 1 的序列占 s/n,所以 X₁ 在这些排列中会跳动,条件平均却一直是 s/n。重复抽样时还有 Var(S/n)=Var(X₁)/n。留意界面里的两种方差:某一条纤维内的条件方差,和按纤维概率平均后消除的方差,不是同一个量。
全方差公式把总波动分成了纤维之间和纤维内部两部分。给定充分统计量后再取条件平均,消去的就是内部那份排列噪声。
连续条件平均:估计一段等待超过门槛的概率
在指数模型中,希望估计 q=Pλ(X>c)=e−λc,门槛 c 事先指定。粗估计 无偏,却只使用一个对象。以充分总和 条件化,利用第 3 节已经推导的密度:
E(Y∣T=t)={(1−c
当 t>c,这个结果来自 ∫ct(n−1)t;当总等待连 都不到,第一段不可能超过它。取 ,改进值为 。没有把未知 代入条件分布,也没有重新估计它;全期望已直接保证新规则对 无偏。
风险严格降低的条件
展开平方误差,可以求出风险减少的具体数值:
Eθ[(Y−τ)2]=E
展开交叉项后,对 T 条件化,它等于 E[(E(Y∣T)−τ)E(Y−E(Y∣T)。因此减少的风险正是被平均掉的条件波动。只有当原规则已经几乎处处等于 的函数时,减少量才为零;否则在有正条件波动的参数处严格变好。
推广到对行动 a 为凸函数的损失 L(θ,a),只要行动空间凸、期望存在,条件 Jensen 给 L(θ,E(Y∣T))≤E[L(,再取期望便得到风险不增。平方损失是一个特例。如果行动只能是“通过/不通过”两个离散选项,平均值可能不在行动空间,这条确定性平均法不能原样照搬。
还要查条件平均是否可实施。比如 X1,X2∼N(μ,1),若误选 T=X,会得到 。它看起来方差为零,却含着正要估计的未知答案,你拿数据算不出来。因此,只写出一个条件期望,还不算构造完统计量。
8. 参数推断之外仍需原始记录
图 6-6:充分不等于可以删数据
在恒定概率模型里,总成功数足以估计 p。一段连续失败是否异常,却需要顺序信息;人群差异或录入错误也可能在汇总中消失。用于诊断的数据来源和原始结构仍应保存。
充分也还没等于最优。它的函数可以有偏,方差也可能很大。下一章加上信息不等式和完全性后,会再限定范围,证明哪些估计是最优的。
条件分布与参数信息
1成功总数 S 对恒定概率 p 充分,准确含义是什么?
2给定充分统计量后做条件平均,可以在不增加数据量的情况下使估计方差不增加。
3五次 iid 伯努利试验已知成功总数为 2。第一位成功的条件概率是多少?
9. 练习:充分性与条件平均
练习 1|不同窗口仍能压缩吗。 独立 Xi∼Poisson(λti),各 ti 已知。给出充分统计量和分解;求给定总数 时 的条件分布。
联合质量为 e−λ∑tiλ∑xi,故总数 充分。 与其余总数独立,分别为均值 与 的 Poisson;联合质量除以 的 Poisson 质量,得到 。参数 被约掉,但曝光时长不同使条件位置权重不再相同。
练习 2|连续条件概率。 五次 iid 指数等待,总时间给定为 10 秒。推导第一段超过 2 秒的条件概率,并解释为什么不是 e−2λ^。
条件密度为 4/10(1−x/10)3,在 2 至 10 积分得 (1−2/10)4=0.4096。这是给定总时间后的概率,不是把估计速率代回原始边缘分布。两者条件信息不同,前者还可借全期望构造目标概率的无偏估计。
练习 3|最小充分的不同参数范围。 正态总体均值已知为 0、方差未知。证明 T=∑Xi2 最小充分,而单独的样本均值一般不充分。
密度为 (2πv)−n/2exp[−T/(2v)],因子分解给充分性。两份样本的密度比为 exp[−(T(x),它不依赖 当且仅当两个平方和相同,故最小充分。样本 与 均值同为零但平方和为 2、8,似然比随方差改变,均值不能区分这种信息。
练习 4|支持的两端。 iid Uniform[a,b]、两端未知。说明为什么只留极差 R=maxXi−minXi 不够,并给出一个充分摘要。
(1,2,3) 与 (5,6,7) 极差都为 2,但候选区间 [0,4] 只支持第一份数据。极差丢掉了绝对位置。联合密度为 ,所以两个端点组成充分统计量。
练习 5|换一个非线性目标。 iid 伯努利样本,目标为 p(1−p)。从 X1(1−X2) 开始做条件平均,给出无偏改进,并与 比较。
给定成功数 S=s,先成功后失败的概率为 s/n⋅(n−s)/(n−1),所以改进规则是 。原指示量由独立性无偏,全期望保持这一点。直接代入为 ,其期望为 ,偏低;修正因子为 。
练习 6|量出改进了多少。 对四次伯努利试验,以 X1 估计 p,再条件化为 S/4。在 p=0.3 时算两者风险和减少的风险,并指出交叉项为什么为零。
两条规则都无偏,平方风险等于方差:原来为 0.3⋅0.7=0.21,条件平均后为 0.21/4=0.0525,减少了 0.1575。交叉项对 S 条件化后含因子 E(X,因此为零。减少量对应被平均掉的条件波动。
练习 7|不可实施的“完美估计”。 对两个 iid 指数观测,用 X2 估计平均时间,若只对 T=X1 条件化,会得到什么?为什么不能据此宣称风险降为零?
由独立性有 E(X2∣X1)=1/λ,恰好是未知目标。X 对整个两样本实验并不充分,条件分布仍含参数。所以这次平均虽然写出来了,拿到数据却算不出数值,还没有产生可用的新估计。
保留摘要的依据应包括所用模型、未知参数及充分性证明。若原任务还涉及顺序、趋势或录入问题,原始记录仍有用途,不能凭参数推断中的充分性将它们丢掉。