分类课程智能体AI
文章
订阅
分类课程AI导师
文章
价格
课程进度
11 / 12
上一节特征值、特征向量与对角化下一节奇异值分解与综合应用
自在学

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

公网安备湘公网安备43020302000292号 | 湘ICP备2025148919号-1

关于我们隐私政策使用条款

© 2025 - 2026 株洲市自在学教育科技有限公司 版权所有

公网安备湘公网安备43020302000292号湘ICP备2025148919号-1

数学线性代数 I:向量、矩阵与线性变换正交、投影与最小二乘

正交、投影与最小二乘


本章的问题

前面几章里,我们已经会把线性方程组写成 Ax=bAx=bAx=b,也会从列空间看“有没有解”。这一章处理另一类更常见的问题:数据里有误差,方程太多,bbb 不一定落在 AAA 的列空间里。此时精确解不存在,但我们仍然希望找到最接近的 AxAxAx。

正交和投影给了这个问题一个清楚的几何答案:在能达到的所有向量里,离 bbb 最近的那个点就是 bbb 到列空间的投影。误差向量,也就是残差,会垂直于整个列空间。

本章的主线可以用一句话概括:当 Ax=bAx=bAx=b 没有精确解时,把 bbb 投影到 AAA 的列空间上,求出最接近 bbb 的 Ax^A\hat{x}Ax^,这就是最小二乘解。

平面坐标中向量 a 与向量 b 从同一点出发,标出夹角 θ、b 在 a 方向上的影子、点积公式以及正交、同向、反向三种符号情况。

点积把两个向量的长度、夹角和同向成分联系在一起。


点积、长度与角度

点积先衡量同向程度

两个 nnn 维向量的点积定义为对应分量相乘后相加:

u⋅v=u1v1+u2v2+⋯+unvnu \cdot v = u_1v_1 + u_2v_2 + \cdots + u_nv_nu⋅v=u1​v1​+u2​v2​+⋯+un​vn​

点积不是单纯的乘法。它会比较两个向量在同一方向上的重合程度。若两个向量大致同向,点积为正;若互相垂直,点积为 000;若大致反向,点积为负。

向量的长度由点积给出:

∥u∥=u⋅u\|u\| = \sqrt{u \cdot u}∥u∥=u⋅u​

例如 u=(3,4)u=(3,4)u=(3,4),则

∥u∥=32+42=5\|u\| = \sqrt{3^2+4^2}=5∥u∥=32+42​=5

这和二维解析几何中的距离公式相同,只是现在可以直接推广到更多维。

夹角来自点积公式

点积和夹角之间有一个核心关系:

u⋅v=∥u∥∥v∥cos⁡θu \cdot v = \|u\| \|v\| \cos\thetau⋅v=∥u∥∥v∥cosθ

其中 θ\thetaθ 是两个非零向量的夹角。因此,

cos⁡θ=u⋅v∥u∥∥v∥\cos\theta = \frac{u \cdot v}{\|u\|\|v\|}cosθ=∥u∥∥v∥u⋅v​

这个公式把代数计算和几何角度接起来。只要能算点积和长度,就能判断两个高维向量之间的角度趋势,即使我们已经画不出图。

点积为 000 只说明两个向量正交,不说明其中一个向量一定是零向量。零向量和任何向量的点积都是 000,但谈夹角时通常要求两个向量都非零。

小例子:从点积判断正交

设

u=(3,4),v=(4,−3)u=(3,4),\quad v=(4,-3)u=(3,4),v=(4,−3)

它们的点积是

u⋅v=3⋅4+4⋅(−3)=12−12=0u \cdot v = 3\cdot 4 + 4\cdot (-3)=12-12=0u⋅v=3⋅4+4⋅(−3)=12−12=0

所以 uuu 与 vvv 正交。注意这里不是因为分量看起来“一个正一个负”,而是因为两个方向的乘积贡献正好抵消。


正交与正交基

正交让方向互不干扰

如果两个非零向量 uuu 和 vvv 满足

u⋅v=0u \cdot v = 0u⋅v=0

就称它们正交。二维里这就是垂直;高维里我们仍然使用“正交”这个词,因为它保留了垂直最重要的代数特征。

正交向量 u 与 v 成直角,u+v 为对角线,并标注 u·v=0 与长度平方相加关系。

正交方向互不干扰,因此 ∥u+v∥2=∥u∥2+∥v∥2\|u+v\|^2=\|u\|^2+\|v\|^2∥u+v∥2=∥u∥2+∥v∥2。

当 uuu 与 vvv 正交时,u+vu+vu+v 的长度平方可以拆开:

∥u+v∥2=∥u∥2+∥v∥2\|u+v\|^2 = \|u\|^2 + \|v\|^2∥u+v∥2=∥u∥2+∥v∥2

证明只要展开点积:

∥u+v∥2=(u+v)⋅(u+v)=u⋅u+2u⋅v+v⋅v\|u+v\|^2=(u+v)\cdot(u+v)=u\cdot u+2u\cdot v+v\cdot v∥u+v∥2=(u+v)⋅(u+v)=u⋅u+2u⋅v+v⋅v

由于 u⋅v=0u\cdot v=0u⋅v=0,中间项消失,于是得到勾股关系。

正交基让坐标变成点积

一组基向量如果两两正交,就称为正交基。若每个基向量长度还是 111,就称为单位正交基。

设 q1,q2,…,qkq_1,q_2,\ldots,q_kq1​,q2​,…,qk​ 是一个子空间 WWW 的单位正交基。对于 WWW 中任意向量 xxx,它在这组基下的坐标可以直接用点积得到:

x=(q1⋅x)q1+(q2⋅x)q2+⋯+(qk⋅x)qkx=(q_1\cdot x)q_1+(q_2\cdot x)q_2+\cdots+(q_k\cdot x)q_kx=(q1​⋅x)q1​+(q2​⋅x)q2​+⋯+(qk​⋅x)qk​

普通基下求坐标通常要解方程。单位正交基下,每个坐标就是“xxx 在对应方向上的投影长度”。

左右对比普通基与正交基的坐标分解:普通基需要平行线分解并解方程,正交基通过垂直投影和点积直接得到坐标。

正交基中,向量 xxx 可直接写为 x=(q1⋅x)q1+(q2⋅x)q2x=(q_1\cdot x)q_1+(q_2\cdot x)q_2x=(q1​⋅x)q1​+(q2​⋅x)q2​,点积就是坐标。

Gram-Schmidt 的想法

如果已有一组线性无关向量,可以通过“逐个减去已有方向上的投影”把它们改造成正交向量。以两个向量 v1,v2v_1,v_2v1​,v2​ 为例,先取

q1=v1∥v1∥q_1=\frac{v_1}{\|v_1\|}q1​=∥v1​∥v1​​

再从 v2v_2v2​ 中去掉它沿 q1q_1q1​ 的部分:

u2=v2−(q1⋅v2)q1u_2=v_2-(q_1\cdot v_2)q_1u2​=v2​−(q1​⋅v2​)q1​

最后单位化:

q2=u2∥u2∥q_2=\frac{u_2}{\|u_2\|}q2​=∥u2​∥u2​​

这样得到的 q1,q2q_1,q_2q1​,q2​ 是单位正交的。更高维时重复同样的动作:每来一个新向量,就把它在已有正交方向上的影子全部减掉。


投影:最近的影子

投影到一条直线

先看最简单的情况:把向量 bbb 投影到由非零向量 aaa 张成的直线 span⁡(a)\operatorname{span}(a)span(a) 上。投影向量一定形如 p=cap=cap=ca,问题变成求系数 ccc。

“最近”发生在误差 e=b−pe=b-pe=b−p 垂直于直线时,也就是

a⋅(b−ca)=0a\cdot(b-ca)=0a⋅(b−ca)=0

解得

c=a⋅ba⋅ac=\frac{a\cdot b}{a\cdot a}c=a⋅aa⋅b​

于是

p=a⋅ba⋅aap=\frac{a\cdot b}{a\cdot a}ap=a⋅aa⋅b​a

这个公式非常值得记住。分子 a⋅ba\cdot ba⋅b 测量 bbb 沿 aaa 的同向成分;分母 a⋅aa\cdot aa⋅a 修正 aaa 自身的长度。

向量 b 投影到直线 span(a) 上,得到最近点 p,残差 e=b-p 垂直于 a,并展示 b=p+e 的分解关系。

向量 bbb 在 span⁡(a)\operatorname{span}(a)span(a) 上的投影分解:ppp 是最近的点,e=b−pe=b-pe=b−p 是垂直误差。

投影的关键不是“画一条线段”,而是找到一个分解 b=p+eb=p+eb=p+e,其中 ppp 在目标子空间里,eee 垂直于目标子空间。这个垂直条件会在最小二乘中变成法方程。

例题:投影到一条直线

把

b=(3,5)b=(3,5)b=(3,5)

投影到

a=(2,1)a=(2,1)a=(2,1)

张成的直线上。

先计算公式里的两个点积:

a⋅b=2⋅3+1⋅5=11a\cdot b=2\cdot 3+1\cdot 5=11a⋅b=2⋅3+1⋅5=11a⋅a=22+12=5a\cdot a=2^2+1^2=5a⋅a=22+12=5

投影系数为

c=a⋅ba⋅a=115c=\frac{a\cdot b}{a\cdot a}=\frac{11}{5}c=a⋅aa⋅b​=511​

所以投影向量是

p=ca=115(2,1)=(225,115)p=ca=\frac{11}{5}(2,1)=\left(\frac{22}{5},\frac{11}{5}\right)p=ca=511​(2,1)=(522​,511​)

残差是

e=b−p=(3,5)−(225,115)=(−75,145)e=b-p=(3,5)-\left(\frac{22}{5},\frac{11}{5}\right)=\left(-\frac{7}{5},\frac{14}{5}\right)e=b−p=(3,5)−(522​,511​)=(−57​,514​)

检查垂直条件:

a⋅e=2(−75)+1(145)=0a\cdot e=2\left(-\frac{7}{5}\right)+1\left(\frac{14}{5}\right)=0a⋅e=2(−57​)+1(514​)=0

因此这个 ppp 确实是直线上离 bbb 最近的向量。

投影到一个子空间

如果目标不是一条直线,而是一个由矩阵 AAA 的列向量张成的子空间,投影仍然遵循同一条规则:

b=p+rb=p+rb=p+r

其中 ppp 在 Col⁡(A)\operatorname{Col}(A)Col(A) 中,r=b−pr=b-pr=b−p 垂直于 Col⁡(A)\operatorname{Col}(A)Col(A)。

因为 ppp 在列空间中,所以存在某个 x^\hat{x}x^ 使得

p=Ax^p=A\hat{x}p=Ax^

残差垂直于列空间,等价于残差和 AAA 的每一列都正交。把这些正交条件合在一起,就是

AT(b−Ax^)=0A^T(b-A\hat{x})=0AT(b−Ax^)=0

整理后得到法方程:

ATAx^=ATbA^T A\hat{x}=A^T bATAx^=ATb

列空间 Col(A) 上的投影示意图:向量 b 投影到 p=A x_hat,残差 r=b-p 垂直于列空间,并给出法方程。

从无解方程到最近解:最佳近似 p=Ax^p=A\hat{x}p=Ax^ 位于 Col⁡(A)\operatorname{Col}(A)Col(A) 中,残差 r=b−pr=b-pr=b−p 满足 ATr=0A^T r=0ATr=0。


从无解方程到最小二乘

数据问题为什么常常无精确解

真实数据通常比未知数多。比如用一条直线

y=c+mty=c+mty=c+mt

拟合若干个测量点。每个测量点都会给出一个方程:

c+mti≈yic+mt_i\approx y_ic+mti​≈yi​

如果有 20 个点,就有 20 个方程,但未知量只有 ccc 和 mmm。由于测量误差、模型简化和数据波动,这些点通常不会全部落在同一条直线上,所以精确解不存在。

把所有方程写成矩阵形式:

Ax≈bA x \approx bAx≈b

其中

A=[1t11t2⋮⋮1tm],x=[cm],b=[y1y2⋮ym]A= \begin{bmatrix} 1 & t_1\\ 1 & t_2\\ \vdots & \vdots\\ 1 & t_m \end{bmatrix}, \quad x= \begin{bmatrix} c\\ m \end{bmatrix}, \quad b= \begin{bmatrix} y_1\\ y_2\\ \vdots\\ y_m \end{bmatrix}A=​11⋮1​t1​t2​⋮tm​​​,x=[cm​],b=​y1​y2​⋮ym​​​

最小二乘不是强行让所有方程同时成立,而是选择让总误差最小的 xxx:

min⁡x∥Ax−b∥2\min_x \|Ax-b\|^2xmin​∥Ax−b∥2

也常写成

min⁡x∑i=1mri2\min_x \sum_{i=1}^m r_i^2xmin​i=1∑m​ri2​

其中 rir_iri​ 是第 iii 个残差。

法方程从哪里来

令

r=b−Ax^r=b-A\hat{x}r=b−Ax^

最小二乘解要求 Ax^A\hat{x}Ax^ 是列空间中离 bbb 最近的向量。根据投影的垂直条件,残差必须垂直于列空间:

ATr=0A^T r=0ATr=0

代入 r=b−Ax^r=b-A\hat{x}r=b−Ax^:

AT(b−Ax^)=0A^T(b-A\hat{x})=0AT(b−Ax^)=0

于是得到

ATAx^=ATbA^T A\hat{x}=A^T bATAx^=ATb

这就是最小二乘的法方程。只要 AAA 的列线性无关,ATAA^T AATA 就可逆,最小二乘解可以写成

x^=(ATA)−1ATb\hat{x}=(A^T A)^{-1}A^T bx^=(ATA)−1ATb

法方程求的是最小二乘解,不是原方程 Ax=bAx=bAx=b 的精确解。若 bbb 已经在列空间里,残差为零,两者才会重合。


例题:拟合一条直线

三个点不一定共线

设有三个测量点:

tttyyy
01
12
22

我们用直线

y=c+mty=c+mty=c+mt

拟合它们。矩阵形式是

[101112][cm]≈[122]\begin{bmatrix} 1 & 0\\ 1 & 1\\ 1 & 2 \end{bmatrix} \begin{bmatrix} c\\ m \end{bmatrix} \approx \begin{bmatrix} 1\\ 2\\ 2 \end{bmatrix}​111​012​​[cm​]≈​122​​

线性回归最小二乘示意图,坐标系中有五个数据点、拟合直线和竖直残差线段,标注残差公式与最小化平方残差目标。

残差有正有负,最小二乘法通过最小化平方残差和来衡量总偏离。

用法方程求解

令

A=[101112],b=[122]A= \begin{bmatrix} 1 & 0\\ 1 & 1\\ 1 & 2 \end{bmatrix}, \quad b= \begin{bmatrix} 1\\ 2\\ 2 \end{bmatrix}A=​111​012​​,b=​122​​

先计算 ATAA^TAATA:

ATA=[3335]A^TA= \begin{bmatrix} 3 & 3\\ 3 & 5 \end{bmatrix}ATA=[33​35​]

这里第一列全是 111,所以左上角是 333;第二列是 0,1,20,1,20,1,2,所以右下角是 02+12+22=50^2+1^2+2^2=502+12+22=5。

再计算 ATbA^TbATb:

ATb=[56]A^Tb= \begin{bmatrix} 5\\ 6 \end{bmatrix}ATb=[56​]

第一项是 1+2+2=51+2+2=51+2+2=5,第二项是 0⋅1+1⋅2+2⋅2=60\cdot1+1\cdot2+2\cdot2=60⋅1+1⋅2+2⋅2=6。

解法方程:

[3335][cm]=[56]\begin{bmatrix} 3 & 3\\ 3 & 5 \end{bmatrix} \begin{bmatrix} c\\ m \end{bmatrix} = \begin{bmatrix} 5\\ 6 \end{bmatrix}[33​35​][cm​]=[56​]

得到

c=76,m=12c=\frac{7}{6},\quad m=\frac{1}{2}c=67​,m=21​

所以拟合直线是

y=76+12ty=\frac{7}{6}+\frac{1}{2}ty=67​+21​t

计算预测值和残差:

Ax^=[7653136]A\hat{x}= \begin{bmatrix} \frac{7}{6}\\ \frac{5}{3}\\ \frac{13}{6} \end{bmatrix}Ax^=​67​35​613​​​r=b−Ax^=[−1613−16]r=b-A\hat{x}= \begin{bmatrix} -\frac{1}{6}\\ \frac{1}{3}\\ -\frac{1}{6} \end{bmatrix}r=b−Ax^=​−61​31​−61​​​

这些残差不是全为零,因为三个点并不共线。

残差正交检查

最小二乘解的残差应当垂直于 AAA 的两列。第一列是 (1,1,1)(1,1,1)(1,1,1),第二列是 (0,1,2)(0,1,2)(0,1,2)。检查:

[111][−1613−16]=0\begin{bmatrix} 1 & 1 & 1 \end{bmatrix} \begin{bmatrix} -\frac{1}{6}\\ \frac{1}{3}\\ -\frac{1}{6} \end{bmatrix} =0[1​1​1​]​−61​31​−61​​​=0 [012][−1613−16]=0\begin{bmatrix} 0 & 1 & 2 \end{bmatrix} \begin{bmatrix} -\frac{1}{6}\\ \frac{1}{3}\\ -\frac{1}{6} \end{bmatrix} =0[0​1​2​]​−61​31​−61​​​=0

这说明残差里已经没有任何可以被“常数项方向”和“斜率方向”继续解释的部分。


残差怎么解释

残差不是简单的错误

残差

r=b−Ax^r=b-A\hat{x}r=b−Ax^

表示观测值和模型预测值之间的差。它可能来自测量误差,也可能来自模型太简单。例如用直线拟合明显弯曲的数据时,即使计算完全正确,残差仍会呈现某种结构。

在最小二乘里,残差的特殊之处是它与列空间正交:

ATr=0A^T r=0ATr=0

这句话的含义是:在模型允许的方向里,已经没有一个方向能继续减少平方误差。如果还想让误差更小,需要改变模型本身,而不是只调整当前模型的参数。

残差平方和很小不一定说明模型解释了因果关系。它只说明在当前数据和当前模型形式下,预测值与观测值比较接近。线性代数负责给出最佳近似,数据含义还要回到具体问题中判断。

什么时候要警惕

最小二乘解有一个安静但重要的前提:用平方误差衡量偏离是合适的。如果存在极端离群点,平方会把它们放大;如果误差随时间成串偏向同一边,可能说明模型漏掉了重要变量;如果 AAA 的列几乎线性相关,ATAA^TAATA 会变得难以稳定求解。

这些问题不会推翻投影思想,但会提醒我们:计算结果要配合残差图、数据来源和模型假设一起看。


常见误区

把投影当成缩短向量

投影不是简单地把 bbb 变短。投影必须落在指定的目标子空间里。若目标方向改变,投影也会改变。

把正交理解成只有二维垂直

二维和三维图像能帮助理解,但正交的真正定义是点积为 000。在高维数据里,正交仍然表示两个方向没有点积意义上的重合。

以为最小二乘让每个残差都最小

最小二乘最小化的是残差平方和,不是逐个让每个残差绝对值都最小。某些点的误差可能变大,只要总平方误差变小,整体目标就改善了。


本章小结

点积把长度、角度和方向重合程度放进同一个计算里。正交让不同方向互不干扰,单位正交基让坐标可以直接通过点积得到。

投影把一个向量分解为“目标子空间中的最佳近似”和“垂直于目标子空间的残差”。最小二乘正是这个投影思想在无精确解方程 Ax=bAx=bAx=b 中的应用:求 x^\hat{x}x^,让 Ax^A\hat{x}Ax^ 成为 bbb 在列空间中的投影。

最小二乘解满足法方程:

ATAx^=ATbA^T A\hat{x}=A^T bATAx^=ATb

残差满足:

AT(b−Ax^)=0A^T(b-A\hat{x})=0AT(b−Ax^)=0

这两个式子是一件事的两种写法:最佳近似的误差必须垂直于所有可调整的方向。


练习

练习一:点积与角度

设 u=(1,2,2)u=(1,2,2)u=(1,2,2),v=(2,0,1)v=(2,0,1)v=(2,0,1)。计算 u⋅vu\cdot vu⋅v、∥u∥\|u\|∥u∥、∥v∥\|v\|∥v∥,并判断夹角是锐角、直角还是钝角。

点积为

u⋅v=1⋅2+2⋅0+2⋅1=4u\cdot v=1\cdot2+2\cdot0+2\cdot1=4u⋅v=1⋅2+2⋅0+2⋅1=4

长度为

∥u∥=12+22+22=3\|u\|=\sqrt{1^2+2^2+2^2}=3∥u∥=12+22+22​=3∥v∥=22+02+12=5\|v\|=\sqrt{2^2+0^2+1^2}=\sqrt{5}∥v∥=22+02+12​=5​

因为点积为正,所以 cos⁡θ>0\cos\theta>0cosθ>0,夹角是锐角。

练习二:投影到一条直线

把 b=(4,1)b=(4,1)b=(4,1) 投影到 a=(1,2)a=(1,2)a=(1,2) 张成的直线上,求投影 ppp 和残差 e=b−pe=b-pe=b−p,并检查 eee 是否垂直于 aaa。

先算点积:

a⋅b=1⋅4+2⋅1=6a\cdot b=1\cdot4+2\cdot1=6a⋅b=1⋅4+2⋅1=6a⋅a=12+22=5a\cdot a=1^2+2^2=5a⋅a=12+22=5

所以

p=65(1,2)=(65,125)p=\frac{6}{5}(1,2)=\left(\frac{6}{5},\frac{12}{5}\right)p=56​(1,2)=(56​,512​)

残差为

e=b−p=(4,1)−(65,125)=(145,−75)e=b-p=(4,1)-\left(\frac{6}{5},\frac{12}{5}\right)=\left(\frac{14}{5},-\frac{7}{5}\right)e=b−p=(4,1)−(56​,512​)=(514​,−57​)

检查:

a⋅e=1⋅145+2(−75)=0a\cdot e=1\cdot\frac{14}{5}+2\left(-\frac{7}{5}\right)=0a⋅e=1⋅514​+2(−57​)=0

因此 eee 垂直于 aaa。

练习三:判断最小二乘残差

设

A=[101112],r=[2−10]A= \begin{bmatrix} 1 & 0\\ 1 & 1\\ 1 & 2 \end{bmatrix}, \quad r= \begin{bmatrix} 2\\ -1\\ 0 \end{bmatrix}A=​111​012​​,r=​2−10​​

这个 rrr 能不能是某个最小二乘解对应的残差?说明理由。

最小二乘残差必须满足

ATr=0A^T r=0ATr=0

计算:

ATr=[111012][2−10]=[1−1]A^T r= \begin{bmatrix} 1 & 1 & 1\\ 0 & 1 & 2 \end{bmatrix} \begin{bmatrix} 2\\ -1\\ 0 \end{bmatrix} = \begin{bmatrix} 1\\ -1 \end{bmatrix}ATr=[10​11​12​]​2−10​​=[1−1​]

结果不是零向量,所以这个 rrr 不能是该矩阵下的最小二乘残差。

练习四:写出法方程

用模型 y=c+mty=c+mty=c+mt 拟合数据点 (1,2),(2,3),(3,5),(4,4)(1,2),(2,3),(3,5),(4,4)(1,2),(2,3),(3,5),(4,4)。写出矩阵 AAA、向量 bbb 和法方程,不必求解。

矩阵和向量为

A=[11121314],b=[2354]A= \begin{bmatrix} 1 & 1\\ 1 & 2\\ 1 & 3\\ 1 & 4 \end{bmatrix}, \quad b= \begin{bmatrix} 2\\ 3\\ 5\\ 4 \end{bmatrix}A=​1111​1234​​,b=​2354​​

法方程是

ATA[cm]=ATbA^T A \begin{bmatrix} c\\ m \end{bmatrix} = A^T bATA[cm​]=ATb

进一步算出

ATA=[4101030],ATb=[1440]A^T A= \begin{bmatrix} 4 & 10\\ 10 & 30 \end{bmatrix}, \quad A^T b= \begin{bmatrix} 14\\ 40 \end{bmatrix}ATA=[410​1030​],ATb=[1440​]

所以

[4101030][cm]=[1440]\begin{bmatrix} 4 & 10\\ 10 & 30 \end{bmatrix} \begin{bmatrix} c\\ m \end{bmatrix} = \begin{bmatrix} 14\\ 40 \end{bmatrix}[410​1030​][cm​]=[1440​]
  • 本章的问题
  • 点积、长度与角度
    • 点积先衡量同向程度
    • 夹角来自点积公式
    • 小例子:从点积判断正交
  • 正交与正交基
    • 正交让方向互不干扰
    • 正交基让坐标变成点积
    • Gram-Schmidt 的想法
  • 投影:最近的影子
    • 投影到一条直线
    • 例题:投影到一条直线
    • 投影到一个子空间
  • 从无解方程到最小二乘
    • 数据问题为什么常常无精确解
    • 法方程从哪里来
  • 例题:拟合一条直线
    • 三个点不一定共线
    • 用法方程求解
    • 残差正交检查
  • 残差怎么解释
    • 残差不是简单的错误
    • 什么时候要警惕
  • 常见误区
    • 把投影当成缩短向量
    • 把正交理解成只有二维垂直
    • 以为最小二乘让每个残差都最小
  • 本章小结
  • 练习
    • 练习一:点积与角度
    • 练习二:投影到一条直线
    • 练习三:判断最小二乘残差
    • 练习四:写出法方程

目录

  • 本章的问题
  • 点积、长度与角度
    • 点积先衡量同向程度
    • 夹角来自点积公式
    • 小例子:从点积判断正交
  • 正交与正交基
    • 正交让方向互不干扰
    • 正交基让坐标变成点积
    • Gram-Schmidt 的想法
  • 投影:最近的影子
    • 投影到一条直线
    • 例题:投影到一条直线
    • 投影到一个子空间
  • 从无解方程到最小二乘
    • 数据问题为什么常常无精确解
    • 法方程从哪里来
  • 例题:拟合一条直线
    • 三个点不一定共线
    • 用法方程求解
    • 残差正交检查
  • 残差怎么解释
    • 残差不是简单的错误
    • 什么时候要警惕
  • 常见误区
    • 把投影当成缩短向量
    • 把正交理解成只有二维垂直
    • 以为最小二乘让每个残差都最小
  • 本章小结
  • 练习
    • 练习一:点积与角度
    • 练习二:投影到一条直线
    • 练习三:判断最小二乘残差
    • 练习四:写出法方程