林澈打开南桥市2021年“青年技能跃迁计划”的教学模拟记录,用0和1标记是否稳定就业。线性概率模型预测0.6,表示给定条件下稳定就业的概率为60%,并不是一个人得到“0.6份工作”。二元结果的条件均值本来就是概率。
林澈意识到,线性回归并非只能用于连续结果。对二元结果,它的局限在于可能预测出0到1之外的数值,并存在异方差;Logit或Probit可约束概率范围,线性概率模型则可在适当用途和稳健推断下使用。
然后她看八周内的面试邀请次数。条件均值0.6次同样有意义,但能取平均并不使线性回归自动更合适;计数模型的选择须考虑非负范围、均值形式、观察时长和误差结构,不能仅凭结果是否可取平均决定。
林澈没有立刻打开软件菜单,而是先问一行记录最后留下什么。月收入能落在连续刻度上;稳定工作只有发生或未发生;结业去向是互斥类别;面试邀请是非负整数。它们都能反映项目结果,却不能共享一条解释直线。

她在数据字典里写下“谁、何时、什么算 1、什么算缺失”。这个动作看似朴素,却能阻止把失联青年算成未就业,也能阻止把八周的邀请数和两周的邀请数直接并排。变量定义比模型名字更早决定结论能说到哪里。
对稳定工作,林澈令 (Y_i=1) 表示第 (i) 位青年在六个月内达标,(Y_i=0) 表示未达标。她需要的是在训练、基线测评、通勤和照护条件给定时的就业概率。线性预测可能跑到负数或超过 1,也默认每一小时训练在任何人身上都带来同样百分点变化。
Logit 和 Probit 先把条件组合放到无边界的刻度,再映回 0 到 1。直觉上,机会居中时曲线较敏感,接近两端时能移动的空间较小。林澈先用这种边界感理解模型,再读下面的 Logit 表达式。
左边把概率换成对数赔率,右边便可累加条件;反向换回后,(p_i) 不会离开 0 与 1。Probit 使用另一种平滑映射,常给出相近的方向与排序。林澈不拿两种模型的系数大小硬比,而是比较它们在相同情境下的预测与校准。
林澈提醒团队:概率、赔率和系数不是同一把尺。概率 0.20 表示约五人中一人达标;它的赔率是 (0.20/0.80=0.25)。概率 0.60 的赔率是 1.5,表示成功与未成功约为 3 比 2;它绝不是 150% 的就业概率。
若完成训练的模拟系数为 0.69,(\exp(0.69)) 约为 1.99。准确的话是“在其他模型条件相同的比较下,完成者的就业赔率约为未完成者的 1.99 倍”。林澈随后仍会给出概率情境,因为同一赔率比从不同起点换回去,会变成不同的百分点差。
例如,原本就业概率为 0.20 的青年与原本为 0.70 的青年,即使面对相同的赔率比,能移动的概率空间也不同。前者可能出现更显眼的百分点变化,后者更接近 1 的边界。于是,林澈不把赔率比当成最终结论,而是先说明模型刻度,再把它翻译成几个与南桥服务场景相符的预测概率和差异。

林澈提醒团队,Logit 模型中的系数并不能被直接理解为“概率每增加多少”,尤其是概率的变化受当前条件的位置影响。对于一个连续变量(如通勤距离),概率曲线在不同的基值下斜率可能迥异。她强调,当我们想理解完成训练这种 0/1 条件的影响时,更合理的做法是:保持其余变量不变,先把具体某位青年的“完成训练”设为 0 算一次,再设为 1 再算一次,两者所得概率相减,就是这名青年的边际效应。
她会将这种“切换”方法应用到每一位模拟青年身上,把所有个体的边际效应取平均,得到全体的平均边际效应。这比单纯念系数更贴近业务直觉。林澈通常还会选出几种典型场景,比如基线状态居中、通勤距离较短的人,计算其预测概率如何由 0.31 跳升到 0.47,应解读为提升 16 个百分点。
林澈会提示团队注意,这种边际效应是模型内部的统计关联,只反映在所有其他条件相同的模型设定下,改变 0/1 条件后平均概率的变化。边际效应写法不会让它自动变成因果结论,不能脱离推断策略就主张“实际结果提升了”。
她还强调,在实际汇报中,应将“边际效应”的算法逻辑与具体业务场景结合,向非技术同事描述在何种情境下的预期变化是多少百分点,并同时传递这一结果存在不确定性的含义。这有助于大家以更清晰的概率语言,讨论政策或项目改动的预期影响。
模型跑完后,林澈先看它有没有把较高机会的人大致排在前面,再看它报出的 40% 是否真的对应约四成就业。前者是区分度,后者是校准度;二者都不能被“准确率”取代。若一千名青年中仅七十人就业,永远预测“否”也会显得准确。
她把检查结果带回服务场景,而非只留在输出表中。若一个模型主要靠难以稳定取得的住址预测,或在某些群体中持续失准,它即使排序好也未必适合分配支持。模型可提示需要复核的人,不能替工作人员替当事人作决定。

结业去向若为未就业、短期合同和稳定工作,林澈不能把它们编码为 0、1、2 后当作等距分数。每个人在同一时点只归入一类,模型需要同时给出三类概率,并让它们相加为 1。稳定工作的概率上升时,其他类别必须共同让出份额。
她以未就业作基准,只是为了书写系数,并不表示它不重要。对训练完成、基线居中的青年,模拟预测可能是 0.27、0.31 与 0.42;汇报时应把三项一起展示。若类别有明确顺序,例如证书等级,则应另问有序模型是否更贴近过程。
这里的学习重点是“概率会共同挪动”。若稳定工作概率上升 8 个百分点,短期合同和未就业的份额必须合计让出 8 个百分点,但它们分别让出多少取决于模型和条件。林澈因此避免只挑出一类说“提高了”,而是让读者同时看到三条去向如何重新分配,才能判断变化究竟来自减少未就业,还是只是把短期合同改写成稳定工作。
前面的多项 Logit 和条件 Logit 不是两种可随意互换的编码。前者主要用个人特征解释类别选择;后者利用随备选项改变的属性,例如同一青年到不同班的通勤、上课时段和补贴。数据与识别条件允许时,也可同时纳入选项属性和与类别交互的个人特征。
林澈把训练班整理成“青年—备选项”行:同一青年面对四个班就有四行,其中只有一行是实际选择。她只把当时可见且有资格选择的班放入选择集;满员班或不可见班若被当作正常落选,会把可得性误读成偏好。

八周正式面试邀请的次数只能是 0、1、2、3……这些非负整数,不能出现小数或负数。林澈在分析数据时,若只将其归纳为“有没有被邀请”,则会丢失一次和五次之间的重要差别;而如果简单地把它当作连续的分数变量,又会忽略真正没有邀请的人和少数高频被邀请情况的特殊性。面试邀请次数属于在明确时间窗口内统计的离散事件,应采用相应的统计方法来处理。
在这种计数问题中,描述“预期 0.6 次”其实比精确预测某个人收到几次邀请更有意义。这个预期值反映的是很多背景和条件相似的青年,在相同风险窗口下,平均每人将收到大致多少次邀请。它不是对任何单个人的承诺,也不意味着某个人会收到 0.6 次,而只是表示总体水平。
林澈在整理数据前,首先绘制不同次数(如 0、1、2、3、4 次及以上)的频数柱状图,清楚直观地展示整体分布。她特别关注真零(确实未被邀请)、调查中失联不知道实际情况的人,或实际上未进入求职状态者,确保这些情况不会混合进图表分析,并为后续统计建模做好数据清洗。
此外,林澈还会考察事件发生的时间窗口是否一致,有没有人因为周期短而被低估邀请次数。她对“次数”背后隐藏的机会差异保持敏感,并在报告和讨论中明确指出:计数型数据需要针对其离散性、受限性和暴露窗口等特殊因素进行单独考察,不能简单套用连续变量的思路。

阿宜完整求职八周,得到两次邀请;凯文只被观察两周,得到一次。裸次数看阿宜更多,粗略每周率却分别是 0.25 与 0.50。林澈由此看见一个隐形分母:每个人有多少周真正处于可收到邀请的风险集中。
她把有效求职的周数记作 。当观察窗口翻倍而单位周发生率不变时,预期发生次数也应相应翻倍。因此,在计数率的建模中,会在模型结构中加入 作为固定的“偏移量”来调整暴露机会。其完整的泊松回归模型可表达为:
这里, 表示第 个人在其有效风险窗口内的预期事件发生次数, 是其相关背景变量。若某人的有效求职周数(即暴露量)为零,则说明其并不处于风险集中,这部分人不能直接带入公式,否则 不存在。此时应仔细检查数据收集和纳入标准,明确哪些人应被排除在分析之外。暴露量的设定有助于区分“机会多寡”与“在同等机会下风险高低”,确保后续的比较均建立在单位暴露量的公正基础上。
“偏移量”(offset)的作用是把“机会多少”与“在同样机会下发生得多不多”分开。若某个班的青年只被观察两周,较少邀请未必意味着服务无效;若直接把周数当作普通自变量,模型又会让它像培训完成一样拥有可自由解释的系数。林澈把它固定为暴露量,是为了让比较始终落在单位求职周的率上。
泊松回归是林澈分析面试邀请次数的起点。假设在所有观测条件已知的情况下,用 表示第 个人的预期邀请次数。泊松模型的基本假定是,条件下的均值和方差相等,即
这种“方差随均值同步增长”的特性很适合捕捉相对均匀、偶然性的计数事件,但现实数据常因信息未观察到、青年相互影响、行业景气波动或重复推荐等原因出现更大波动。
泊松回归采用对数连接确保预期次数为正,模型公式为
其中 表示观测的相关背景变量, 为对应系数。若模型包含暴露量 作为 offset(无系数固定纳入,防止解释错位),则
在此结构下, 表示单位暴露量下预期事件次数(即率)的比值。
如果控制模型中的解释变量后,条件方差仍显著大于条件均值(系统性超出泊松假定),则称为“过度离散”。这时可改用负二项回归来建立更加灵活的波动结构,即允许
这里 代表额外波动。但使用负二项前,务必先核查观察窗口设定、遗漏变量和重复记录等问题,确保额外波动不是数据和流程的误差,而是真正的现象。
项目团队问“要准备多少跟进资源”时,林澈给预期次数;问“谁可能一封邀请也没有”时,她给零次概率;问某条件关联多少时,她给率比和情境差。不同输出回答不同问题,不能用一个显著性标记代替所有沟通。
她把实际与预测的 0、1、2、3、4 次及以上放在一起看。若平均值相近,模型却低估零次和高次数,说明它把人群差异压平了。遇到八周十二次的记录,她先核对时间戳、去重规则和招聘周背景,而不是为了好看而删除真实记录。
诊断结果还会反过来改变资源安排问题。若模型持续低估零次邀请,团队需要查的是哪些青年根本没有进入有效的求职渠道;若只低估右尾,则可能是少数青年获得重复推荐、行业招聘潮或记录重复造成的集中。先说清偏离出现在哪一端,才能决定是补充变量、调整分布,还是回到数据流程核查。

林澈有六百名模拟结业青年,想比较是否参加模拟面试工作坊与邀请次数的条件关联。基线测评、既往求职月数和照护负担都在工作坊前记录;有效求职周数来自联系日志。她不把八周后才知道的就业结果放进邀请次数模型。
她的研究句子是:在相同基线测评、既往求职月数和照护负担下,以有效求职周数为暴露量并纳入其对数 offset,参加工作坊者的单位求职周邀请率及对应八周预期次数是否不同?这是一句关联问题;它明确了比较对象、分母和窗口,却没有伪装成随机试验。
林澈最后不再问“哪种回归最厉害”,而是先问结果是什么形状、谁在风险集中、窗口有多长。0/1 需要受边界约束的概率;无序去向需要一整组共同变化的概率;次数需要均值、波动与暴露量一起解释。
你也可以沿着同一条短路线工作:定义一行记录与结果,再选择尊重其形状的模型;把输出译成概率、类别份额、率或预期次数;最后检查校准、频数和适用范围。这样,模型帮助解释南桥青年的机会,而不是用一条方便的直线盖住差异。
当你面对一个新变量时,不妨先停在模型之前:它是一次状态、几种互斥去向,还是一段窗口中的累计事件?这个问题会决定分母、预测范围和最值得检查的偏差。选对结果形状并不能自动获得因果结论,但它让后续的比较至少从一个与资料相称的起点出发。