01 随机过程的语言:把随机变化写成一条时间线
一台设备每小时可能正常、降速或停机;一个账户每天可能增加、减少或保持余额;一个粒子每隔一秒向左或向右走一步。单独看某个时刻,这些都只是随机变量。可一旦把时刻排成顺序,问题就变了:今天的状态会不会影响明天?相隔很远的两个时刻还相关吗?我们观察到的这一条记录,和模型允许出现的其他记录有什么关系?
随机过程就是处理这条“随机时间线”的语言。本章先不急着套马尔可夫性质,而是把对象、索引、状态、样本路径和联合分布分开。后面谈离散时间链时,矩阵里的每一个元素都要回到这里的定义;如果这一步含糊,矩阵乘法很容易变成没有解释的算术。
一条过程包含哪些对象
设
(Ω,F,P)是概率空间,T 是索引集,S 是状态空间。状态空间还配有一族可测集合(σ 代数)S:有限或可数状态时取所有子集,实数状态时通常取 Borel 集。这样,询问“状态是否落在 A 中”就有明确的事件含义。一个随机过程写作
{Xt:t∈T},其中对每个固定的 t,Xt 是从 Ω 到 S 的可测映射,即 A∈S 时,;我们仍称它为随机变量。换句话说,随机结果 一旦确定,所有时刻的取值就同时确定了:
t⟼Xt(ω).这条确定的函数称为一条样本路径。
这里有两个容易混在一起的“变量”。固定 t,Xt 随随机结果变化,是随机变量;固定 ω,Xt(ω) 随时间变化,是一条普通函数。随机过程不是“一个随机变量加上一个时间标签”,而是一族彼此可能相关的随机变量。

把一个很小的模型摆在图里会更清楚:四个样本结果等可能,每行记录一条路径。沿着某一行向右读,你没有换样本结果;固定标作 n=2 的那一列向下读,才是在比较 X2 的不同可能取值。图中 X2 取 0、1 各占两行,所以各有 1/2 的概率。若四行并非等可能,就必须按各行的概率加权,不能直接数行数。
索引集决定“什么时候观察”
常见索引集有两类:
- 离散时间:T={0,1,2,…} 或有限的整数集合。Xn 可以表示第 n 次交易、第 n 天或第 步后的状态。
索引集不是状态空间。n=4 是时刻,X4=2 才是状态;“第四天处于状态 2”同时使用了这两个层次。状态空间也不一定是数字集,例如 S={正常,降速,。为了计算,常把这些状态编号,但编号本身没有概率意义。

图左只在选定时刻给出取值;图右画出时间连续变化的一种路径。右图中的光滑曲线只是例子:连续时间描述的是索引集,绝不保证路径连续,计数过程就可以在事件发生时跳跃。淡色线条不表示置信区间。
离散时间适合记录“每一步发生了什么”;连续时间适合记录“事件在什么时候发生”。同一个系统可以有两种建模:只看每天收盘状态是离散时间过程,记录每次故障和修复的确切时刻则可能是连续时间过程。选哪一种,要看问题需要保留的时间信息。
状态空间也决定问题的形状
状态空间可以是有限集、可数集,也可以是实数的一部分。有限状态过程适合用转移矩阵组织;实值过程常需要讨论密度、协方差函数或路径的连续性。不要因为两个过程都写成 Xt,就假定它们能用同一种工具处理。
例如,令 Yn 表示第 n 天库存量,S={0,1,…,50}。令 表示第 天的温度,。它们都可以是离散时间过程,但第一个适合研究“何时缺货”,第二个可能更自然地研究均值、波动和相关性。
从路径回到分布
给定 t,随机变量 Xt 的分布回答“这个时刻可能在哪些状态”;而有限维分布回答“多个指定时刻的状态怎样联合出现”。对时刻 t1,…,tk,有限维分布由所有可测集合 对应的下列概率描述
P(Xt1∈A1,…,离散状态时可以写成点概率
P(Xt1=x1,…,只知道每个 Xt 的边缘分布,通常不能确定过程。例如只抛一次公平硬币,记结果为 B∈{0,1}。模型 A 规定所有 n 都有 X;模型 B 规定偶数时刻 ,奇数时刻 。每个固定时刻,两者都以 的概率取 0 或 1。可是模型 A 的路径永远不变,模型 B 的路径每步翻转,分别满足 与 。

因此,研究随机系统时,边缘分布只能告诉你“某一帧长什么样”,联合分布还要告诉你“帧与帧怎样接起来”。马尔可夫性质正是在联合分布层面提出一种特殊但非常有用的限制:给定现在,过去对未来不再提供额外信息。
条件概率是连接时间的桥
对离散状态,只在给定历史事件的概率为正时,才直接使用下面的比值型条件概率:
P(Xn+1=y∣X0=x条件中指定了当前和历史,它描述的是已知这些信息以后的预测;数值可能高于、低于或等于无条件概率。若过程具有马尔可夫性质,这个概率将只依赖当前状态 xn:
P(Xn+1=y∣X0这个等式要求对所有正概率的历史都成立。把当前状态告诉我们以后,额外再告诉过去,下一步的条件分布没有改变;它没有宣称未来和过去无条件独立。概率为零的历史不能直接代入概率之比,在一般状态空间中应改用几乎处处成立的条件分布表述。
还要留意时刻 n:马尔可夫性允许今天和明天采用不同的转移规则。若从 x 到 y 的一步条件概率另外还不依赖 n,才称为时间齐次。后面的天气模型会同时作这两项假设。

“马尔可夫”不是“每个时刻都独立”。例如随机游走的相邻状态通常明显相关,但给定当前位置后,下一步不需要知道更早的路径。独立性比马尔可夫性强得多;把两者混为一谈,会错误地删掉条件概率中的当前状态。
过滤:在时刻 n 能知道什么
为了把“过去”写成一个对象,定义自然过滤
Fn=σ(X0,X1,…,它表示只观察到 0 到 n 时刻的全部信息。随着时间增加,信息不会减少:
F0⊆F1⊆F2⊆⋯若一个量在时刻 n 可以由这段历史确定,就说它对 Fn 可测。直观地说,不能用“明天才知道的硬币结果”来决定今天的下注规则。
以两次独立抛公平硬币为例,结果记作 H 或 T,样本空间为 {HH,HT,TH,TT}。抛之前,四种结果还无法区分;第一次见到 H,能确定结果属于 ,却不能判断第二次是否为 ;第二次也看到以后,才能区分四个单独的结果。信息增加时,可区分的组变细,相应的事件集合反而增多。自然过滤记录的是整段已见历史,通常不同于只保留当前状态的 。

若未来的实值量 Y 满足 E∣Y∣<∞,E[Y∣Fn] 表示已知历史后的条件均值。在有限模型里,做法就是把与眼前历史相容的结果收在一起,用条件概率加权求平均。例如看到第一次为 后,第二次为 的指标变量仍以各 的概率取 0 和 1,条件均值是 ;两次都看到以后,这个指标本身已知,条件均值就是已见到的 0 或 1。
马尔可夫性也可以通过这些条件均值表达。对每个有界可测函数 g:S→R,有
E[g(Xn+1)∣Fn]=取 g(x)=1{x∈A},条件均值就变成下一步落入 A 的条件概率。对有限状态,这个等式也能直接验证:把每个下一步状态 y 的 g 乘上条件概率,再求和;马尔可夫性让和式中的概率只通过 依赖历史。若用不受限的 ,还需检查 ,不能对任意函数不加条件地取期望。
一个完整的小模型:带记忆的天气记录
设 Xn∈{S,R} 表示第 n 天的天气,S 为晴,R 为雨。初始日明确记作第 0 天,。假设天气满足时间齐次的马尔可夫模型:今天晴时,明天晴的概率是 ;今天雨时,明天晴的概率是 。另外两个去向由概率和为 1 得到,分别是晴后雨 、雨后雨 。
要算“第 1 天雨且第 2 天晴”,得先知道第 1 天的分布。第 1 天的雨可能来自初始的晴,也可能来自初始的雨。这两个事件互斥,合起来覆盖全部初始状态,所以
P(X1=R)P(X两数相加为 1,第一步分布没有遗漏去向。现在才使用相邻两天的条件概率:
P(X1=R,X它小于 0.36,因为在第 1 天下雨之外又加上了一个要求。若有人得到 0.4×0.4=0.16,就把初始第 0 天的雨概率,误当成了第 1 天的雨概率。
“第 2 天晴”允许第 1 天是晴或雨,需要把两个互斥的联合事件相加:
P(X2=单条完整路径又是另一回事。例如初始就雨、随后仍雨、再转晴这条 R→R→S 路径,概率为 0.4×0.6×0.4=0.096。它只是上面 0.144 的一部分,另一部分是 S 的 。沿路径相乘,合并互斥路径时相加,是下一章矩阵递推的出发点。

把一般参数记为 q=P(X0=S)、a=P(S∣S)、,那么
q1=qa+(1−q)b,q2下方实验同时显示完整路径与合并后的边缘概率。保留 q=0.6,b=0.4,只提高 a,观察 q2 和事件 是否朝同一方向改变。不要急着用“晴更容易持续”代替计算:后一事件必须先经过雨,第 1 天雨的概率会随 减少,因此其概率 反而下降。
恢复默认值,选择 R→R→S,应读到 0.096。改为筛选所有“第 2 天晴”的路径,看加总如何得到 0.656;切换到“第 1 天雨且第 2 天晴”,剩下的两条路径则加总为 0.144。有限次模拟的频率可能偏离这些数,精确概率来自模型的加法与乘法规则。
期望、协方差与时间结构
以下只讨论实值过程,并假设每个时刻都有 E[Xt2]<∞。有限二阶矩保证均值与协方差有定义。均值函数和协方差函数分别记录单时刻水平与跨时刻联动:
m(t)=E[Xt],C(s,t)=Cov(X对实值过程,C(s,t)=E[(Xs−m(s))(Xt。协方差为正,表示一个时刻偏高时另一个时刻倾向偏高;为负则倾向相反。协方差为零只表示线性关系消失,一般不等于独立。
若均值不随时间改变,并且协方差只依赖滞后 h,即
m(t)=μ,C(s,t)=γ(t−s),连同有限二阶矩,这些条件定义了弱平稳过程。对离散时间,常写成 γ(h)=Cov(Xn,Xn+h)。等式只在涉及的时刻都属于索引集时要求成立;在 上使用负滞后时也要留意这一点。特别地,令 可知方差 必须恒定。
这让“第 3 天到第 4 天”和“第 103 天到第 104 天”在均值、协方差意义下可比较,但不能由此推出所有联合分布在平移后相同。后一个要求叫严格平稳,比只检查二阶统计量涉及的信息多;严格平稳若没有有限二阶矩,也不能直接称为弱平稳。
随机游走展示路径与统计量的区别
令 ξ1,ξ2,… 独立,且
P(ξk=1)=p,P(ξk=定义
X0=0,Xn=k=1∑一条路径可能是 0,1,2,1,0,1,…,另一条可能是 0,−1,−2,−1,0,−1,…。它们都是同一个模型的可能结果。期望和方差可以从一步增量算起:,又因 ,有 。期望对有限和具有线性;不同增量独立,交叉协方差为零,所以和的方差等于各项方差之和。这给出
E[Xn]=n(2p−1),Var(Xn这些量描述许多路径合在一起的统计规律。第 n 步的位置只能取 −n,−n+2,…,n,不仅必须是整数,还要与 n 同奇偶。公平游走的均值始终是 0,但第 1 步不可能停在 0,说明均值曲线也未必是一条允许的路径。
相隔两时刻的协方差也能用同一个分解得到。若 m≤n,把 Xn 写成 Xm+。括号里的未来增量与 独立,故
Cov(Xm,X当 0<p<1 时,方差随 n 增长,因此这个从 0 出发的随机游走不是弱平稳过程。取 p=1/2 也无济于事:均值恒为 0 只满足了一部分条件。反过来,增量序列本身的均值恒定,协方差在滞后 0 时为 4p(1−p)、非零滞后时为 0,倒是弱平稳的。状态过程与增量过程要分开检查。
从增量表示可以看出,Xn+1=Xn+ξn+1。给定当前 ,下一步只需知道新的增量;更早的增量已经被当前总和压缩进当前位置。这是马尔可夫建模的典型动机:寻找一个足够描述当前的状态,而不是把全部历史原样带入。
状态里漏掉了什么
面对一个新的随机变化问题,可以把下面几件事写出来:
- 观察单位是什么,是每次交易、每个小时,还是事件发生的连续时刻?这决定索引集。
- 预测对象是什么,是一个有限状态标签、计数,还是实数测量?这决定状态空间。
- 一条路径怎样产生?要说明初始状态和状态之间的随机规则,而不是只列出几个可能序列。
- 题目需要边缘分布、联合分布、条件概率,还是期望与协方差?不同问题调用的对象不同。
- 当前状态是否保留了预测未来所需的信息?若没有,必须扩充状态,例如把“当前库存”和“尚未到货的订单”一起作为状态。
一个好状态的标准不是“看起来简单”,而是“给定它以后,未来问题所需的信息已经足够”。状态过少会让所谓转移概率依赖更长历史;状态过多则增加计算负担。后面学习马尔可夫链,本质上就是在一个合适状态空间上系统利用这个判断。
来看一个与前面两状态天气模型不同的假设系统。今天晴,明天下雨的概率是 0.2;今天是连续下雨的第一天,明天继续下雨的概率是 0.3;若已经连雨至少两天,明天继续下雨的概率是 0.8。这些是模型设定,用来检验状态选择,不是现实天气的经验定律。
取 X0=S,比较到第 2 天的两段正概率历史 S,S,R 与 S,R,R。它们今天都为雨,前者却是首个雨天,后者已有两天雨,于是
P(X3=R若只保留 X2=R,两段历史就混在一起。任何一个单独的“雨后雨概率”都不可能同时等于 0.3 和 0.8,因此这个二状态记录不满足马尔可夫性。
不必把整段历史全带上。将状态改为 Zn∈{S,R1,R2+},分别表示晴、首个雨天、连雨至少两天,下一步规则就确定了:从 以 到 ,否则留在 ;从 以 到 ,否则到 ;从 以 留在 ,否则到 。按设定,更长的连雨天数不会再改变概率,所以不必无限细分状态。
在实验里选这两段历史,比较下一天下雨的概率条。把“首日续雨”和“连日续雨”都设成 0.5,再观察扩充状态是否还给预测带来差别。在这个特定模型中,两类雨状态的下一步粗分类概率相同,晴雨标签已足够。恢复 0.3 与 0.8 后,调节两类雨天在混合记录中的比例:粗略的雨后雨概率随比例改变,却没有改变任何一类历史自己的转移规则。这说明在条件不足时,一个汇总数字会掩盖什么。
继续计算之前
随机过程把“随机”与“随时间变化”放在同一个对象里。固定时间看分布,固定结果看路径;多个时刻一起看联合分布;用过滤表示到某时刻为止可用的信息;用条件概率检验当前状态对未来是否足够。离散时间链的矩阵、首达事件和吸收时间,都只是沿着这条主线继续问得更具体。
自测与练习
1固定一个样本结果 ω 后,t ↦ X_t(ω) 表示什么?
巩固:识别对象与概率层次
- 某仓库每天记录库存量 In,其中 In∈{0,1,…,20}。请指出索引集、状态空间、 所描述的事件,并说明固定样本结果后得到的对象是什么。
索引集是离散时间集合 {0,1,2,…},状态空间是有限集合 {0,1,…,20}。I5 是“第 5 个记录时刻库存为 0”的事件。固定一个样本结果 后, 是一条库存样本路径,而不是一个新的随机变量。
- 已知 P(X0=A)=0.7,P(X1=,,且 。计算 ,并解释为什么不能直接使用 0.2。
第 1 时刻到达 B 有两条按初始状态区分的路径,因此用全概率公式:P(X1=B)=0.7×0.2+0.3×。0.2 只是“初始为 A 时到 B”的条件概率,题目没有给定 ,所以不能把它当作无条件概率。
变式:检查状态是否充分
- 某服务器仅在空闲时接收任务:每个空闲时刻,以 1/2 的概率在下一时刻开始一个新任务,否则继续空闲,各次机会独立。任务服务时间独立地以各 1/2 的概率取 1 步或 2 步;开始服务时记已服务 0 步,服务完成后先回到空闲,不立即替换任务。若只记录“忙/闲”,为什么一般不满足马尔可夫性?给出一种足够的扩充状态。
若当前都记为“忙”,刚开始服务时,下一步完成的概率为 1/2;已经服务 1 步仍忙时,已知服务时长必为 2,下一步完成的概率为 1。这两种可由历史区分的情形被压在同一状态内。因此只看“忙/闲”时,下一步规则仍依赖更早历史。可以把状态扩充为“闲、忙且已服务 0 步、忙且已服务 1 步”;若服务时间还有更多可能值,就记录足以判断剩余服务分布的信息。
- 设 X0 以相等概率取 0 或 1,且 X1=X0。另一个过程 同样以相等概率取 0 或 1,且 。比较 的边缘分布与 。这个例子说明了什么?
两者的第 1 时刻边缘分布都满足取 0、1 各为 1/2,因为对 Y1 来说翻转并不改变均匀分布。可是 P(X1=X,而 。所以边缘分布相同并不能确定时间之间的联合结构,更不能替代对依赖关系的建模。
迁移:把文字问题翻译成过程
- 一条生产线每小时可能处于“正常”“降速”“停机”三种状态。维修员只在停机后工作,且下一小时状态的概率据称只由当前状态决定。请写出过程的索引集与状态空间,给出一个可检验的马尔可夫性陈述,并指出至少一个需要实际检查的数据问题。
可以令 Xn 表示第 n 个小时的状态,索引集为 {0,1,2,…},状态空间为 S=。对每个正概率历史 ,应检查是否有 与历史只通过 发生关系。数据上至少要检查:记录时间是否等长、状态定义是否一致、维修动作是否被遗漏,以及不同历史在同一当前状态下的下一小时频率是否明显不同。若维修员是否在场也影响未来,就应把“维修员状态”纳入状态。
- 令 Xn 为公平随机游走的位置,X0=0,每步以相等概率向左或向右。有人说“期望位置为 0,所以粒子一定会在原点附近”。请计算 E[X 和 ,再解释这句话的问题。
这里 p=1/2,所以 E[X4]=4(2p−1)=0,。期望为 0 只说明许多路径的平均位置在原点,不表示每条路径都靠近原点;第 4 步的位置可能是 ,波动的标准差为 2。要判断“附近”的概率,还需要完整分布或至少方差等信息,不能只看均值。
延伸一步:用信息和协方差作判断
- 独立抛两次公平硬币,F1 表示只看过第一次的全部信息。令 A=1{第一次为 H},。哪个量在 下可测?求 ,并用样本空间分组解释。
A 可测:它在 {HH,HT} 上恒为 1,在 {TH,TT} 上恒为 0。B 在同一组内仍会变化,例如 HH 上为 1、 上为 0,所以 不可测。无论第一次为 还是 ,两次相同都只占相容结果的一半,故 。这个条件均值在每个可辨认组内恒定,可以在时刻 1 确定;未来的实际 值还不能确定。
- 设 Z0,Z1,… 独立同分布,均值为 0、方差为 1,令 Un=。求 的均值,以及滞后为 0、1 和至少 2 时的协方差,判断它是否弱平稳。为何相邻的 不能据此说成独立?
由线性性,E[Un]=0;独立性使不同 Z 的协方差为 0,故 Var(Un)。相邻两项 、 共享一个 ,展开协方差后只留下 。相隔至少 2 时没有共享项,协方差为 0。因此 、,其余滞后为 0;有限二阶矩、均值恒定和只依赖滞后三项都满足,所以弱平稳。相邻项协方差非零,在二阶矩有限的这里已经足以排除独立;平稳从来没有要求各时刻独立。