K4-B-1

概率论基础 General Probability

Created 2026-06-14Updated 2026-06-27math

  • Description:概率论核心:随机变量与分布、贝叶斯定理、常见分布、多元高斯分布特殊性质(线性变换/边缘化/条件化/信息形式/马氏距离)、信息论基础(熵/KL散度/Fisher 信息)
  • My Notion Note ID:K4-B-1
  • Created:2026-06-14
  • Updated:2026-06-27
  • License转载欢迎:转载请注明作者 Yu Zhang 并附原文出处(yuzhang.io

Table of Contents


1. 随机变量与概率基础

1.1 随机变量(Random Variable)

  • 离散型(Discrete):取值可数,用概率质量函数(PMF) P(X=x)P(X = x) 描述
  • 连续型(Continuous):取值连续,用概率密度函数(PDF) p(x)p(x) 描述;P(aXb)=abp(x)dxP(a \le X \le b) = \int_a^b p(x)\,dx
  • 累积分布函数(CDF)F(x)=P(Xx)F(x) = P(X \le x);连续型 F(x)=xp(x)dxF(x) = \int_{-\infty}^x p(x')\,dx'p(x)=F(x)p(x) = F'(x)

1.2 联合分布与边缘化(Joint Distribution & Marginalization)

p(x,y)=P(X=x and Y=y)p(x, y) = P(X = x \text{ and } Y = y)

边缘化(对其他变量积分/求和):

p(x)=yp(x,y)(离散),p(x)=p(x,y)dy(连续)p(x) = \sum_y p(x, y) \quad\text{(离散)}, \qquad p(x) = \int p(x, y)\,dy \quad\text{(连续)}

2. 期望、方差与协方差

2.1 期望(Expected Value / Mean)

离散有限情形(取值 x1,,xkx_1, \dots, x_k,概率 p1,,pkp_1, \dots, p_k):

E[X]=i=1kxipiE[X] = \sum_{i=1}^k x_i p_i

连续情形XX 有密度 p(x)p(x)):

E[X]=Rxp(x)dxE[X] = \int_{\mathbb{R}} x\,p(x)\,dx

性质:E[aX+b]=aE[X]+bE[aX + b] = aE[X] + bE[X+Y]=E[X]+E[Y]E[X + Y] = E[X] + E[Y](无论是否独立)

2.2 方差(Variance)

Var(X)=E ⁣[(XE[X])2]=E[X2]E[X]2\text{Var}(X) = E\!\left[(X - E[X])^2\right] = E[X^2] - E[X]^2

多元推广:Var(AX)=AVar(X)AT\text{Var}(AX) = A\,\text{Var}(X)\,A^T

Var(X1+X2)=Var(X1)+Var(X2)+2Cov(X1,X2)\text{Var}(X_1 + X_2) = \text{Var}(X_1) + \text{Var}(X_2) + 2\,\text{Cov}(X_1, X_2)

2.3 协方差(Covariance)与协方差矩阵

Cov(X,Y)=E ⁣[(XE[X])(YE[Y])]\text{Cov}(X, Y) = E\!\left[(X - E[X])(Y - E[Y])\right]
  • 方差是协方差特例:Var(X)=Cov(X,X)\text{Var}(X) = \text{Cov}(X, X)
  • 多元推广:Cov(AX1,BX2)=ACov(X1,X2)BT\text{Cov}(AX_1, BX_2) = A\,\text{Cov}(X_1, X_2)\,B^T

协方差矩阵nn 维随机向量 XX,均值 μ=E[X]\mu = E[X]):

Σ=E ⁣[(Xμ)(Xμ)T]Rn×n\Sigma = E\!\left[(X - \mu)(X - \mu)^T\right] \in \mathbb{R}^{n \times n}

Σ\Sigma 对称半正定(PSD);分量线性无关时正定(SPD)。

2.4 相关系数(Correlation Coefficient)

Corr(X,Y)=Cov(X,Y)Var(X)Var(Y)[1,1]\text{Corr}(X, Y) = \frac{\text{Cov}(X, Y)}{\sqrt{\text{Var}(X)\,\text{Var}(Y)}} \in [-1, 1]

Corr=1|\text{Corr}| = 1 → 线性关系;Corr=0\text{Corr} = 0 → 不相关(但不一定独立)


3. 条件概率、贝叶斯与独立性

3.1 条件概率(Conditional Probability)

p(xy)=p(x,y)p(y)p(x \mid y) = \frac{p(x, y)}{p(y)}

3.2 全概率公式(Law of Total Probability)

p(x)=yp(xy)p(y),p(x)=p(xy)p(y)dyp(x) = \sum_y p(x \mid y)\,p(y), \qquad p(x) = \int p(x \mid y)\,p(y)\,dy

3.3 贝叶斯定理(Bayes' Theorem)

p(xy)=p(yx)p(x)p(y)=p(yx)p(x)p(yx)p(x)dxp(x \mid y) = \frac{p(y \mid x)\,p(x)}{p(y)} = \frac{p(y \mid x)\,p(x)}{\int p(y \mid x')\,p(x')\,dx'}
  • p(x)p(x)先验(Prior):观测前对 XX 的知识
  • p(yx)p(y \mid x)似然(Likelihood):给定状态 xx 观测到 yy 的概率
  • p(xy)p(x \mid y)后验(Posterior):观测 yy 后更新的估计
  • p(y)1p(y)^{-1}归一化常数(Normalizer) η\eta,与 xx 无关

离散情形的计算

x:  auxxy=p(yx)p(x),p(xy)=auxxyxauxxy\forall x:\; \text{aux}_{x|y} = p(y \mid x)\,p(x), \qquad p(x \mid y) = \frac{\text{aux}_{x|y}}{\sum_{x'} \text{aux}_{x'|y}}

3.4 独立与条件独立

边缘独立p(x,y)=p(x)p(y)p(x, y) = p(x)\,p(y)

给定 Z=zZ = z 的条件独立p(x,yz)=p(xz)p(yz)p(x, y \mid z) = p(x \mid z)\,p(y \mid z)

p(xy,z)=p(yx,z)p(xz)p(yz)p(x \mid y, z) = \frac{p(y \mid x, z)\,p(x \mid z)}{p(y \mid z)}

注意:边缘独立 ⇏\not\Rightarrow 条件独立;条件独立 ⇏\not\Rightarrow 边缘独立


4. 常见概率分布

4.1 伯努利分布(Bernoulli)

X{0,1}X \in \{0, 1\},参数 p[0,1]p \in [0,1]P(X=1)=pP(X=1) = pE[X]=pE[X] = pVar(X)=p(1p)\text{Var}(X) = p(1-p)

4.2 二项分布(Binomial)

nn 次独立伯努利试验,成功 kk 次:

P(X=k)=(nk)pk(1p)nk,E[X]=np,Var(X)=np(1p)P(X = k) = \binom{n}{k} p^k (1-p)^{n-k}, \quad E[X] = np, \quad \text{Var}(X) = np(1-p)

4.3 泊松分布(Poisson)

单位时间事件次数,参数 λ>0\lambda > 0(平均率):

P(X=k)=λkeλk!,E[X]=λ,Var(X)=λP(X = k) = \frac{\lambda^k e^{-\lambda}}{k!}, \quad E[X] = \lambda, \quad \text{Var}(X) = \lambda

4.4 均匀分布(Uniform)

XU(a,b)X \sim \mathcal{U}(a, b)p(x)=1bap(x) = \frac{1}{b-a}axba \le x \le b),E[X]=a+b2E[X] = \frac{a+b}{2}Var(X)=(ba)212\text{Var}(X) = \frac{(b-a)^2}{12}

4.5 指数分布(Exponential)

等待时间,参数 λ>0\lambda > 0(率):p(x)=λeλxp(x) = \lambda e^{-\lambda x}x0x \ge 0),E[X]=1/λE[X] = 1/\lambdaVar(X)=1/λ2\text{Var}(X) = 1/\lambda^2无记忆性P(X>s+tX>s)=P(X>t)P(X > s+t \mid X > s) = P(X > t)

4.6 正态/高斯分布(Gaussian)

一元高斯,均值 μ\mu,方差 σ2\sigma^2

p(x)=(2πσ2)1/2exp ⁣{(xμ)22σ2},XN(μ,σ2)p(x) = (2\pi\sigma^2)^{-1/2}\exp\!\left\{-\frac{(x-\mu)^2}{2\sigma^2}\right\}, \quad X \sim \mathcal{N}(\mu, \sigma^2)

多元高斯nn 维),均值 μRn\mu \in \mathbb{R}^n,协方差矩阵 Σ\Sigma(SPD):

p(x)=det(2πΣ)1/2exp ⁣{12(xμ)TΣ1(xμ)},XN(μ,Σ)p(x) = \det(2\pi\Sigma)^{-1/2}\exp\!\left\{-\frac{1}{2}(x-\mu)^T\Sigma^{-1}(x-\mu)\right\}, \quad X \sim \mathcal{N}(\mu, \Sigma)

5. 高斯分布的特殊性质(SLAM 关键)

5.1 线性变换封闭性

XN(μ,Σ)X \sim \mathcal{N}(\mu, \Sigma),则 Y=AX+bN(Aμ+b,  AΣAT)Y = AX + b \sim \mathcal{N}(A\mu + b,\; A\Sigma A^T)

5.2 边缘分布(Marginalization)

对联合高斯,分块表示:

[XaXb]N ⁣([μaμb],  [ΣaaΣabΣbaΣbb])\begin{bmatrix} X_a \\ X_b \end{bmatrix} \sim \mathcal{N}\!\left(\begin{bmatrix}\mu_a\\\mu_b\end{bmatrix},\; \begin{bmatrix}\Sigma_{aa}&\Sigma_{ab}\\\Sigma_{ba}&\Sigma_{bb}\end{bmatrix}\right)

则边缘分布 XaN(μa,  Σaa)X_a \sim \mathcal{N}(\mu_a,\; \Sigma_{aa}),只需取对应块。

5.3 条件分布(Conditioning)

给定 Xb=xbX_b = x_b

XaXb=xb    N(μab,  Σab)X_a \mid X_b = x_b \;\sim\; \mathcal{N}(\mu_{a|b},\; \Sigma_{a|b}) μab=μa+ΣabΣbb1(xbμb)\mu_{a|b} = \mu_a + \Sigma_{ab}\Sigma_{bb}^{-1}(x_b - \mu_b) Σab=ΣaaΣabΣbb1Σba(Schur 补形式)\Sigma_{a|b} = \Sigma_{aa} - \Sigma_{ab}\Sigma_{bb}^{-1}\Sigma_{ba} \quad\text{(Schur 补形式)}

5.4 高斯乘积(Product of Gaussians)

两个高斯乘积(归一化前)仍是高斯。信息形式(精度矩阵 Ω=Σ1\Omega = \Sigma^{-1},信息向量 ξ=Ωμ\xi = \Omega\mu):

Ω12=Ω1+Ω2,ξ12=ξ1+ξ2\Omega_{12} = \Omega_1 + \Omega_2, \qquad \xi_{12} = \xi_1 + \xi_2

5.5 马氏距离(Mahalanobis Distance)

dM(x,μ)=(xμ)TΣ1(xμ)d_M(x, \mu) = \sqrt{(x-\mu)^T\Sigma^{-1}(x-\mu)}
  • 欧氏距离的推广,考虑各维度方差与协方差
  • dM2d_M^2 服从 χ2(n)\chi^2(n) 分布(nn 维高斯)
  • SLAM 异常点剔除:dM2>χ0.952(n)d_M^2 > \chi^2_{0.95}(n) 判定为 outlier

5.6 信息矩阵(Information / Precision Matrix)

Ω=Σ1,ξ=Ωμ\Omega = \Sigma^{-1}, \qquad \xi = \Omega\mu

高斯的信息形式(Canonical Form)

p(x)exp ⁣{12(xTΩx2ξTx)}p(x) \propto \exp\!\left\{-\frac{1}{2}(x^T\Omega x - 2\xi^T x)\right\}
  • 多个独立高斯因子乘积:Ωtotal=iΩi\Omega_{\text{total}} = \sum_i \Omega_iξtotal=iξi\xi_{\text{total}} = \sum_i \xi_i
  • SLAM BA:H=JTΩrJH = J^T\Omega_r JΩr\Omega_r 为观测噪声的信息矩阵

6. 信息论基础

6.1 熵(Shannon Entropy)

离散随机变量:

H(P)=xp(x)log2p(x)=E[log2p(x)]H(P) = -\sum_x p(x)\log_2 p(x) = E[-\log_2 p(x)]

log2p(x)-\log_2 p(x) = 最优编码 xx 所需 bits;HH 衡量不确定性(均匀分布时最大)

连续(微分熵):h(p)=p(x)logp(x)dxh(p) = -\int p(x)\log p(x)\,dxlog\log 取自然对数,单位 nats;下文 KL 散度同)

6.2 KL 散度(Kullback-Leibler Divergence)

DKL(PQ)=xp(x)logp(x)q(x)=EP ⁣[logp(x)q(x)]0D_{KL}(P \| Q) = \sum_x p(x)\log\frac{p(x)}{q(x)} = E_P\!\left[\log\frac{p(x)}{q(x)}\right] \ge 0
  • 衡量分布 PP 与参考分布 QQ 的"距离"(非对称:DKL(PQ)DKL(QP)D_{KL}(P\|Q) \ne D_{KL}(Q\|P)
  • DKL=0P=QD_{KL} = 0 \Leftrightarrow P = Q

6.3 互信息(Mutual Information)

I(X;Y)=DKL(p(x,y)p(x)p(y))=H(X)H(XY)0I(X; Y) = D_{KL}\big(p(x,y) \| p(x)p(y)\big) = H(X) - H(X \mid Y) \ge 0

I=0X,YI = 0 \Leftrightarrow X, Y 独立;衡量两变量共享的信息量

6.4 Fisher 信息(Fisher Information)

对参数 θ\theta 的单参数情形:

I(θ)=E ⁣[(θlogp(X;θ))2]=E ⁣[2θ2logp(X;θ)]\mathcal{I}(\theta) = E\!\left[\left(\frac{\partial}{\partial\theta}\log p(X;\theta)\right)^2\right] = -E\!\left[\frac{\partial^2}{\partial\theta^2}\log p(X;\theta)\right]

Cramér-Rao 下界(CRB):任意无偏估计量 θ^\hat\theta 的方差满足

Var(θ^)I(θ)1\text{Var}(\hat\theta) \ge \mathcal{I}(\theta)^{-1}

多参数推广:Fisher 信息矩阵 I(θ)ij=E ⁣[2θiθjlogp]\mathcal{I}(\theta)_{ij} = -E\!\left[\frac{\partial^2}{\partial\theta_i\partial\theta_j}\log p\right]


7. 经典组合概率

7.1 排列(Permutation)

nn 个对象中取 kk 个的有序排列:

P(n,k)=n(n1)(nk+1)=n!(nk)!P(n, k) = n\cdot(n-1)\cdots(n-k+1) = \frac{n!}{(n-k)!}

7.2 组合(Combination)

nn 个对象中取 rr 个的无序组合:

(nr)=C(n,r)=n!r!(nr)!=P(n,r)r!\binom{n}{r} = C(n,r) = \frac{n!}{r!(n-r)!} = \frac{P(n,r)}{r!}

分母 r!r! 消除了顺序(有序排列数 ÷ rr 个对象自身的全排列数)。


References

  • Thrun, S., Burgard, W., & Fox, D. Probabilistic Robotics. MIT Press, 2005 — 贝叶斯滤波、高斯分布在机器人中的应用
  • Bishop, C. M. Pattern Recognition and Machine Learning. Springer, 2006 — 高斯条件化/边缘化的完整推导、信息形式
  • Cover, T. M., & Thomas, J. A. Elements of Information Theory (2nd ed.). Wiley, 2006 — 熵、KL 散度、互信息、Fisher 信息
  • Kay, S. M. Fundamentals of Statistical Signal Processing: Estimation Theory. Prentice-Hall, 1993 — Cramér-Rao 下界与 Fisher 信息矩阵