模型说明要能让别人按同样的规则重做研究。哪些信息被记录下来、哪些已经丢失,会决定后面的推断能走多远。
10 人里有 6 人成功,1000 人里有 600 人成功,两组的成功比例都是 0.6。光看这个数,看不出估计有多稳。换一批人,比例通常会变;小样本尤其容易偏离原来的结果。不过,人数的比较还有个前提:如果这 1000 次记录全来自同一个人反复尝试,就不能直接当成 1000 位不同参与者的数据。每一行代表谁、是怎样收集来的,需要在计算之前弄清楚。

图中的抽样箭头从总体指向样本,推断则沿相反方向寻找总体的信息。样本只留下了部分记录,不确定性也由此产生。后面给出的概率保证,都依赖相应的模型条件。
一次操作是否成功,可以用伯努利模型描述;设备的等待时间需要连续正值模型。到研究测量值怎样随输入变化时,正态线性模型会派上用场。这些情境和数字均为独立设计的教学构造,不代表真实平台表现。
设两份记录都写着“100 次操作,60 次成功”。甲来自随机抽取的 100 位用户,每人首次尝试一次;乙来自一位熟练用户连续尝试 100 次。两个表格的平均数相同,但回答的问题并不相同。甲有机会描述目标用户的首次成功率;乙主要反映一个人在这段时间里的表现,还混入了练习效应。
甲的一行对应一位用户。乙虽然也有 100 行,背后却只有一个人的习惯和练习过程,后面的表现可能受前面的尝试影响。表格多了一行,不一定就多了一份独立信息。 目标人群或采集方式弄错了,标准误算得再精细也回答不了原来的问题。
模型说明需要交代清楚目标人群与采集规则。比如,“新用户”是否包括用过旧版界面的人,会直接影响成功率所描述的对象。这里所有数值场景均为教学构造。
大小写用来区分采集前后。第 次结果尚未出现时,用随机变量 描述;实际记录下来的是小写的 。例如拿到三个观测 ,就可以写出 。随机变量包含可能的结果及其概率规律,这一次的观测值只是其中一次实现。

因此 是随机变量, 是已经算出的数。同样, 在采集前会变化;某次得到 并不意味着估计规则没有随机性。
参数描述总体模型。伯努利分布的参数 是成功概率;正态分布则可以用均值 和方差 来确定。这门课主要使用频率学派框架,参数固定但未知,随机变化来自样本。因此,“估计量的期望”是在同一个参数下,对不同可能样本给出的估计结果取平均。
一次恰好估得准,还不足以判断方法可靠。真实问题中的真值通常未知,眼前这次误差甚至无法直接核对。评价估计规则,需要考察它在重复抽样中的表现。
统计模型可以写成一族分布
是参数空间,列出允许的参数; 则规定每个参数下可能观察到哪些结果,以及它们的概率。写出这族分布后,你就得按这些规定推理,不能只凭“数据看起来差不多”来选公式。
例如 表示 只能取 0 或 1,且 。若把 与 也纳入,则 。它们分别表示必然失败与必然成功。需要求对数和导数的正则论证,常把参数限制到内部 ;必须明确什么时候改变了讨论范围。

这里容易把两个集合混在一起:观测值可以取什么,参数又可以取什么。前者是“观测变量的支持”,后者是“参数空间”。拿泊松模型来说,计数 只能取非负整数,平均计数参数 却可以取正实数。概率、计数和等待时间各有自己的取值限制,写模型时要分别交代。
模型还要能够识别参数:不同参数不能产生完全相同的观测分布。如果记录仪只保存一个测量值的平方,某些模型里的正负方向信息就可能丢失。即使观测无限多,也不能从没有被记录的信息中恢复方向。增加样本量不能修复不可识别的设计。
设真实信号 ,但仪器只记录 ,参数允许正负。因为 ,而 ,所以参数 与 给出完全相同的 分布。无论重复多少次平方记录,两种方向仍无法区分。这比“本次数据碰巧相同”更强:所有可能记录的概率规律都相同。
数据仍能识别 ,例如 就含有这个量。如果领域知识事先限定 ,方向的问题也消失了。这里的“事先”很关键:分析完才任意选正号,不能把方向归功于数据。完整参数不可识别时,它的某个函数仍可能由观测分布确定。
假设团队关心的是“目标用户第一次使用新界面时,无协助完成任务的比例”。这句话里的对象和限制,都要落实到采集规则中。
总体限定为目标范围内尚未使用过该界面的用户。成功指在事先约定的时限内、没有人工提示地完成指定任务。中途改了时限或任务,参数表示的就已经是另一个成功概率了。
给每名入选用户定义一个变量:成功时取 1,否则取 0。取值只有两种,因此伯努利模型是自然候选。参数 表示该抽样机制覆盖的用户首次成功概率,而不是这一次样本里成功人数占比。
说明如何获得联合分布。如果抽样近似独立、实验条件一致,才进一步写成 。由独立性,观察到特定序列的概率为 ;这个乘积不是单靠“每项是伯努利”就能得到的。
如果系统进一步简化记录,只保存“有人成功过”,连尝试人数也丢掉了。1 位用户全部成功,与 100 位中只有 1 位成功,都会留下这句话。两种情况已无法从记录中分辨,更复杂的估计公式也找不回丢掉的人数。
设目标成功概率为 ,成功者的记录保留概率是 ,失败者为 。以 表示记录被留下,条件概率公式给
代入 ,留下的记录成功率是 。样本继续增加,比例会更稳地停在 0.75 附近,离目标 0.6 的差异却还在。若不知道保留概率,仅凭这个比例通常分不开 。完整记录或有关选择过程的信息,才可能帮助区分这些参数。
目标人群构成也会改变参数。假设目标用户中熟练者占 30%、新手占 70%,两类成功率分别为 0.9、0.5,目标总体成功率为 。若样本却各招一半,直接合并的平均目标变成 0.70。分层估计 在各层随机采集、权重已知时可恢复目标;它的方差在两层独立时为 。不能把这个加权规则的精度继续当作一个简单同分布比例来算。
本课程的基础情形是随机样本
iid 表示独立且同分布。同分布要求每个观测遵循同一概率规律;独立性还涉及它们的联合分布,要求知道其他观测后,某个观测的条件概率规律不变。仅满足其中一项,不能使用依赖两者的结论。
来自不同噪声水平的仪器读数可能独立但不同分布。重复测量同一台设备的相邻时刻读数,可能边缘分布相同却相互相关。共享温度、同一用户的习惯、一次故障造成的连续异常,都可能产生相关性。

设每个观测的均值为 、方差为 ,则不论是否独立,;但方差为
独立时协方差项全为零,才得到 。假设每两个观测的相关系数都为 ,则
例如 ,真实方差是独立公式的 倍。按独立样本计算会把标准误算小。此时需要调整抽样设计,或采用处理相关性的方法;在报告末尾加一句“可能相关”,并没有修正计算。
一个固定总体有 个对象,其中 个成功,目标比例 。等概率不放回抽 个,令每次抽中的成功指示为 。每个 都有成功概率 ,但抽到一个成功后,剩余成功比例变为 。
对 ,,减去 得
代入协方差求和公式便有
例如 ,方差为 ,标准差约 0.0602;独立模型会给 0.0693。抽查全体即 时方差为零,因为固定总体的比例已被完整计数。这是抽样设计的结果,与共同扰动造成的正相关恰好方向相反。
成功总数这时服从超几何分布,质量为 。只有当抽样比例足够小、精度要求允许时,才可考虑二项近似。总体有限并不妨碍每次边缘为伯努利,真正改变的是联合分布。
同一环境下第 个读数可以拆成共同部分和各自的扰动:
其中共同扰动 与各自扰动 相互独立、均值为零,方差分别为 和 。于是 :取平均缩小的是各自扰动,共同扰动原封不动地留下。
若总方差 、相关系数 ,就重新得到前面的相关样本公式。即使 很大,方差也仍有 这个下限。解决办法可能是增加独立批次、独立环境或独立用户,而不是在同一个环境里无限重复。
令独立观测的均值方差 等于这些相关读数的均值方差,便能比较两者的精度,得到
时约相当于 个独立观测的均值精度。这里的“有效样本量”只是在这个等相关模型下比较均值方差,不能直接当成所有检验的自由度。
rho=0.1 时,均值方差里有一部分来自共同噪声。结合上式,估计一下记录数不断增加时曲线会靠近什么值。
将滑块设在 n=20、rho=0.1,增加记录数,观察虚实两条曲线的间距。独立情形提供了一个参照。重抽噪声时,那些共享方块会落在同一横坐标上,可以对照它们与各自噪声增量的位置。
同一批里的共享方块位置相同,只有各自的独立噪声增量不同。rho>0 时,均值方差逐渐靠近 sigma²rho,n_eff 的增长也越来越慢。
把这个现象写回模型就是 Xᵢ=mu+sigma√rho Z₀+sigma√(1−rho)Zᵢ。于是 Var(X̄)=sigma²rho+sigma²(1−rho)/n:独立项会被平均掉,共享项还在。这里的 n_eff 只比较当前模型下的均值精度。
统计量是只依赖样本和已知量的可测函数 。样本平均、样本最大值、成功次数都是统计量。若总体均值 未知, 就不是统计量,因为仅靠记录无法算出它。

统计量可以有偏,也可以保留多个分量。完整样本本身就是一个向量统计量,甚至没有压缩数据。选择哪种计算规则,取决于要回答的问题以及其中用得上的样本信息。
例:从计数推到比例。 在独立伯努利模型中,,于是
第一式说长期平均不偏离 ;第二式说每次结果仍有波动。 时,方差为 、标准差约 。将样本量增为 ,标准差减半,而不是变为原来的四分之一。
固定 p=0.6,考虑每批人数由 10 增至 40 的情形。方差公式已经给出了标准差的变化比例,模拟可以把这种收窄显示出来。还有一个容易误读的地方:只抽一批时,经验方差会显示为 0,但这不足以说明估计量没有随机性。
初始化的一批逐人记录可以和理论柱图直接对照。“重做 1000 批”会留下更多抽样结果,n=10 / n=40 按钮用于比较每批人数的影响。p=0 和 p=1 则适合检查分布的端点。
一批记录只在一个比例位置增加频率,重复 1000 批后,空心柱才逐渐接近理论实心柱。n 越大,分布越集中;到了 p 的两个端点,结果只剩一种可能,分布也就退化了。
这和 Var(p̂)=p(1−p)/n 对得上:标准差按 √n 的倒数变化。别把批数和每批人数混在一起——多重做几批会改善模拟近似,却不会改变单批的抽样规则。
计划甲事先规定做 4 次,记录成功总数 ;计划乙一直做到首次成功,记录等待次数 。即使甲恰好出现“失败、失败、失败、成功”,两个计划都得到同一串四次记录,也不能把抽样分布视为相同。
甲的样本空间是所有长度为 4 的二元序列,总数 。乙的样本空间是长度可变、最后一项是首次成功的序列,、。在乙中,成功数恒为 1、样本量随机;在甲中恰好相反,样本量固定、成功数随机。
对这条具体序列,两种设计的似然都与 成比例,因此第 5 章的最大似然会给相同的 。但按重复实验定义的概率、偏差与错误率,需要在各自样本空间里计算。不能因本次似然相同就自动搬用固定样本量的所有保证。第 10 章还会看到,反复查看结果直到显著才停止,需要为整套查看规则控制错误率。

估计规则应对应明确的目标人群、观测单位和记录方式。算出结果后,还要检查异常、相关性以及观测是否落在模型支持内。数据结构与模型不符时,可能需要调整模型或缩小结论范围。不过,用同一批数据反复改模型、挑结论,会改变错误率;第 10 章会处理这个问题。
本课程的通用约定是: 为样本量, 为一般参数, 为估计量, 为样本均值, 为分母 的样本方差, 为对数似然。若使用伽马分布,会明确采用形状与尺度还是形状与速率,避免同一个字母代表相反量。
练习 1|识别真正可回答的目标。 仪器记录 ,、。证明符号不可识别,并给出一个能由 识别的参数函数。
练习 2|丢失记录会把目标推到哪里。 真实成功概率为 0.4,成功与失败记录的保留概率分别为 0.9、0.3。求留下记录中的成功概率;若只增加记录数量,能否修复差异?
练习 3|不放回也能无偏。 固定总体有 100 个对象、30 个成功,随机不放回抽 20 个。求样本成功比例的期望与方差;解释独立性并不是无偏性的必要条件。
练习 4|多批次怎样平均共同扰动。 有 个独立环境,每个环境测 次,模型 ,环境方差 2、个体方差 6,所有不同来源独立。推导全部记录均值的方差,并比较总计 60 次时 与 。
练习 5|目标权重与招募权重。 目标群体中甲类占 80%、乙类占 20%,两类各采 50 人,成功数为 30、45。求直接合并比例与按目标构成加权的比例,并写出后者在层内 iid、两层独立时的方差公式。
练习 6|统计量与理论工具。 均值 未知、标准差已知为 2。判断 、、 是否是统计量。不是统计量的式子为何仍可能有用?
练习 7|停止规则改变了什么。 一个计划固定做 5 次,另一个直到首次成功为止。两次都记录到四次失败后一次成功。写出两种计划的随机变量与样本空间,并解释为什么本次都报 0.2 不证明其重复抽样风险相同。
练习 8|写一份可复核的模型说明。 要估计新用户第一次无协助完成任务的概率。招募方案允许同一人重复参加,而且系统只保存完成记录。请分别修改观测单位、纳入规则、成功标准和记录字段,使目标能够由采集数据回答。
成功比例可以作为估计,但收集人数、未完成和缺失记录的处理规则需要事先确定。失败用户若更容易退出,而退出者又被删掉,留下的比例就可能系统偏高。缺失原因没有查清,直接把剩余人数代入独立样本公式并不能解决偏差。