10 人里有 6 人成功,1000 人里有 600 人成功,两组的成功比例都是 0.6。换一批样本,比例通常会变,小样本尤其容易偏离原来的结果。如果后面那 1000 次全来自同一个人反复尝试,记录之间的关联还会改变计算。
数理统计研究怎样根据样本作出有依据的判断。这里从数据产生方式出发,推导估计规则及其波动,并用区间与检验表达不确定性。最后的线性模型案例会把这些计算放进一份可以复算的报告,残差发现的问题也需要在报告中说明。
如果你已经学过基本概率分布、期望方差、大数定律和中心极限定理,可以从这里继续。建议先完成数学科目的《概率论 I:随机变量、分布、期望与极限定理》。推导会用到微积分、条件期望和基本线性代数;第 12 章的矩阵表达,可以和前面的标量推导对照着读。
刚接触数据分析时,《入门统计与概率》可以作为起点,随后衔接概率论和本课程。正文中的情境与数字均为独立设计的教学示例,用于解释和核对计算,不代表真实研究结果。
例如,设备观察到 5 秒还没有发生事件,这条记录表达的是“等待时间超过 5 秒”。将它误当成恰好等待 5 秒,会写出不同的似然,速率估计也随之改变。课程会把这项差别从记录含义一直算到估计结果。
得到估计以后,还要评价它。无偏的规则未必有更小的平方误差,信息下界也未必能够达到。有关最优性和大样本近似的结论,都在明确的模型与条件下证明。
正文给出定义、论证和完整例题。实验把其中一些关系变为可以操作的过程:在残差页面移动一个观测,拟合中心会随之改变,其他残差也跟着联动。这个现象对应的约束会在正文中推导。
实验直接嵌入课程页,窄屏也能操作,需要更大空间时可用实验的全屏按钮。独立练习的题干保持可见,每道解答单独展开,方便完成推导后核对。
较难的地方会停下来展开。均值与残差的独立性需要联合密度证明,MLE 的正态极限则要控制随机点处的曲率,不能只引用一个分布名称。综合案例里,残差出现弯曲后会重新拟合,也会说明事后选模型对区间和检验的影响。
理论密集的章节可以分几次读。遮住结论重做推导时,某一步若接不上,回到它使用的条件通常比反复背公式更有用。变式练习用来检查这些理由能否带到新的模型中。
图示帮助辨认关系,精确数值以正文推导与交互计算为准。精确分布、渐近结论和模拟观察各有适用范围;看过数据才选择模型的结果,也会保留相应限制。
这门课以频率学派为主线。完成后,可以继续学习多元统计、广义线性模型、贝叶斯推断、非参数方法和随机过程,也可以用这里的估计与检验方法,检查数据分析里的不确定性。