凸性:为什么局部信息能指向全局
在一张地图上,如果两个地点之间的直线始终留在允许通行的区域内,这个区域就有一种很好的几何性质。优化里把这条直线写成凸组合,许多“不会被局部坑住”的结论便有了统一语言。

凸集从线段开始
集合 C 称为凸集,是因为对任意 x,y∈C 与 α∈[0,1],点
z=αx+(1−α)y
仍在 C 中。α=1 时得到 x,α=0 时得到 y,中间值表示两点之间的线性插值。要证明一个集合凸,必须对任意两点和任意权重成立,画一条“看起来没有穿出去”的线还不够。

线性不等式 aTx≤b 描述半空间,半空间的交仍是凸集。因此线性规划的可行域天然凸。若两个可行方案都能执行,那么把它们按比例混合,资源消耗也按同样比例混合,不会凭空超过容量。

凸集运算的理由
若 C,D 凸,则交集 C∩D 凸:取其中两点,它们同时属于 C 和 D,凸组合也同时留在两者。仿射变换 T(x)=M 也保持凸性,因为
T(αx+(1−α)y)=αT(x)+(1−α)T(y)
这个等式说明为什么把变量换坐标、投影到一条直线,通常不会破坏凸结构。
凸函数和弦线
函数 f 在凸域上凸,若满足
f(αx+(1−α)y)≤αf(x)+(1−α)f(y)
右侧是两端函数值的加权平均。图像上,函数图线位于连接两点的弦线下方。平方函数 f(x)=x2 的差值可以直接展开:
αx2+(1−α)y2−[αx
不等式方向和最后的非负平方都来自 α∈[0,1]。若权重跑出这个区间,它不再表示两点之间的混合,结论不能照搬。


一阶支撑不等式
设 f 可微。凸性等价于每个点的切平面都是全局下界:
f(y)≥f(x)+∇f(x)T(y−x).
推导可从一维函数开始。固定 x,y,令 ϕ(t)=f(x+t(y−x))。因为 f 凸, 在 上凸。一维凸函数的右导数单调不减,于是 。代回
ϕ(1)=f(y),ϕ(0)=f(x),ϕ′
就得到不等式。这里不是把多变量结论当黑箱,而是把任意方向压成一条线。

如果 x∗ 是凸函数在凸集上的可行点,且 ∇f(x∗)=0,那么对任意可行 y,上式给出 。这就是凸优化里“局部一阶信息足以证明全局最优”的根本原因。没有凸性时,梯度为零仍可能只是鞍点或局部极大。
Hessian 只是判别工具,不是全部故事
在二阶可微情形,若对定义域内所有 v 都有
vT∇2f(x)v≥0,
则 Hessian 半正定,函数凸。原因是沿任意线段的二阶导数
dt2d2f(x+tv)=
所以每条直线限制都是一维凸函数。反过来,若函数在开凸域上二阶可微且凸,沿任意方向的二阶导数也必须非负。
Hessian 半正定的判断要沿每个方向检查二次型;交互页面中的 Jensen 实验可以把“弦线在图像上方”与代数不等式对应起来。
练习
- 证明单位球 C={x∈Rn:∥x∥2≤1} 是凸集。
取 x,y∈C 与 α∈[0,1]。三角不等式给出 ,所以凸组合仍在 C 中。
- 对 f(x)=−x2 找一个违反凸函数不等式的点对和权重。
取 x=−1,y=1,α=1/2。左侧 f(0)=0,右侧为 ,于是 不成立。它是凹函数而非凸函数。
- 已知 f 凸可微且 ∇f(x∗)=0,为什么不能在非凸函数上直接使用同一结论?
支撑不等式依赖凸性。非凸函数可能在梯度为零处有局部极大或鞍点,例如 f(x)=−x2 在 0 处梯度为零但不是极小点。