- Description:概率论核心:随机变量与分布、贝叶斯定理、常见分布、多元高斯分布特殊性质(线性变换/边缘化/条件化/信息形式/马氏距离)、信息论基础(熵/KL散度/Fisher 信息)
- My Notion Note ID:K4-B-1
- Created:2026-06-14
- Updated:2026-06-27
- License:转载欢迎:转载请注明作者 Yu Zhang 并附原文出处(yuzhang.io)
Table of Contents
1. 随机变量与概率基础
1.1 随机变量(Random Variable)
- 离散型(Discrete):取值可数,用概率质量函数(PMF) P(X=x) 描述
- 连续型(Continuous):取值连续,用概率密度函数(PDF) p(x) 描述;P(a≤X≤b)=∫abp(x)dx
- 累积分布函数(CDF):F(x)=P(X≤x);连续型 F(x)=∫−∞xp(x′)dx′;p(x)=F′(x)
1.2 联合分布与边缘化(Joint Distribution & Marginalization)
p(x,y)=P(X=x and Y=y)
边缘化(对其他变量积分/求和):
p(x)=y∑p(x,y)(离散),p(x)=∫p(x,y)dy(连续)
2. 期望、方差与协方差
2.1 期望(Expected Value / Mean)
离散有限情形(取值 x1,…,xk,概率 p1,…,pk):
E[X]=i=1∑kxipi
连续情形(X 有密度 p(x)):
E[X]=∫Rxp(x)dx
性质:E[aX+b]=aE[X]+b;E[X+Y]=E[X]+E[Y](无论是否独立)
2.2 方差(Variance)
Var(X)=E[(X−E[X])2]=E[X2]−E[X]2
多元推广:Var(AX)=AVar(X)AT
Var(X1+X2)=Var(X1)+Var(X2)+2Cov(X1,X2)
2.3 协方差(Covariance)与协方差矩阵
Cov(X,Y)=E[(X−E[X])(Y−E[Y])]
- 方差是协方差特例:Var(X)=Cov(X,X)
- 多元推广:Cov(AX1,BX2)=ACov(X1,X2)BT
协方差矩阵(n 维随机向量 X,均值 μ=E[X]):
Σ=E[(X−μ)(X−μ)T]∈Rn×n
Σ 对称半正定(PSD);分量线性无关时正定(SPD)。
2.4 相关系数(Correlation Coefficient)
Corr(X,Y)=Var(X)Var(Y)Cov(X,Y)∈[−1,1]
∣Corr∣=1 → 线性关系;Corr=0 → 不相关(但不一定独立)
3. 条件概率、贝叶斯与独立性
3.1 条件概率(Conditional Probability)
p(x∣y)=p(y)p(x,y)
3.2 全概率公式(Law of Total Probability)
p(x)=y∑p(x∣y)p(y),p(x)=∫p(x∣y)p(y)dy
3.3 贝叶斯定理(Bayes' Theorem)
p(x∣y)=p(y)p(y∣x)p(x)=∫p(y∣x′)p(x′)dx′p(y∣x)p(x)
- p(x) — 先验(Prior):观测前对 X 的知识
- p(y∣x) — 似然(Likelihood):给定状态 x 观测到 y 的概率
- p(x∣y) — 后验(Posterior):观测 y 后更新的估计
- p(y)−1 — 归一化常数(Normalizer) η,与 x 无关
离散情形的计算:
∀x:auxx∣y=p(y∣x)p(x),p(x∣y)=∑x′auxx′∣yauxx∣y
3.4 独立与条件独立
边缘独立:p(x,y)=p(x)p(y)
给定 Z=z 的条件独立:p(x,y∣z)=p(x∣z)p(y∣z)
p(x∣y,z)=p(y∣z)p(y∣x,z)p(x∣z)
注意:边缘独立 ⇒ 条件独立;条件独立 ⇒ 边缘独立
4. 常见概率分布
4.1 伯努利分布(Bernoulli)
X∈{0,1},参数 p∈[0,1]:P(X=1)=p,E[X]=p,Var(X)=p(1−p)
4.2 二项分布(Binomial)
n 次独立伯努利试验,成功 k 次:
P(X=k)=(kn)pk(1−p)n−k,E[X]=np,Var(X)=np(1−p)
4.3 泊松分布(Poisson)
单位时间事件次数,参数 λ>0(平均率):
P(X=k)=k!λke−λ,E[X]=λ,Var(X)=λ
X∼U(a,b):p(x)=b−a1(a≤x≤b),E[X]=2a+b,Var(X)=12(b−a)2
4.5 指数分布(Exponential)
等待时间,参数 λ>0(率):p(x)=λe−λx(x≥0),E[X]=1/λ,Var(X)=1/λ2;无记忆性:P(X>s+t∣X>s)=P(X>t)
4.6 正态/高斯分布(Gaussian)
一元高斯,均值 μ,方差 σ2:
p(x)=(2πσ2)−1/2exp{−2σ2(x−μ)2},X∼N(μ,σ2)
多元高斯(n 维),均值 μ∈Rn,协方差矩阵 Σ(SPD):
p(x)=det(2πΣ)−1/2exp{−21(x−μ)TΣ−1(x−μ)},X∼N(μ,Σ)
5. 高斯分布的特殊性质(SLAM 关键)
5.1 线性变换封闭性
若 X∼N(μ,Σ),则 Y=AX+b∼N(Aμ+b,AΣAT)
5.2 边缘分布(Marginalization)
对联合高斯,分块表示:
[XaXb]∼N([μaμb],[ΣaaΣbaΣabΣbb])
则边缘分布 Xa∼N(μa,Σaa),只需取对应块。
5.3 条件分布(Conditioning)
给定 Xb=xb:
Xa∣Xb=xb∼N(μa∣b,Σa∣b)
μa∣b=μa+ΣabΣbb−1(xb−μb)
Σa∣b=Σaa−ΣabΣbb−1Σba(Schur 补形式)
5.4 高斯乘积(Product of Gaussians)
两个高斯乘积(归一化前)仍是高斯。信息形式(精度矩阵 Ω=Σ−1,信息向量 ξ=Ωμ):
Ω12=Ω1+Ω2,ξ12=ξ1+ξ2
5.5 马氏距离(Mahalanobis Distance)
dM(x,μ)=(x−μ)TΣ−1(x−μ)
- 欧氏距离的推广,考虑各维度方差与协方差
- dM2 服从 χ2(n) 分布(n 维高斯)
- SLAM 异常点剔除:dM2>χ0.952(n) 判定为 outlier
Ω=Σ−1,ξ=Ωμ
高斯的信息形式(Canonical Form):
p(x)∝exp{−21(xTΩx−2ξTx)}
- 多个独立高斯因子乘积:Ωtotal=∑iΩi,ξtotal=∑iξi
- SLAM BA:H=JTΩrJ,Ωr 为观测噪声的信息矩阵
6. 信息论基础
6.1 熵(Shannon Entropy)
离散随机变量:
H(P)=−x∑p(x)log2p(x)=E[−log2p(x)]
−log2p(x) = 最优编码 x 所需 bits;H 衡量不确定性(均匀分布时最大)
连续(微分熵):h(p)=−∫p(x)logp(x)dx(log 取自然对数,单位 nats;下文 KL 散度同)
6.2 KL 散度(Kullback-Leibler Divergence)
DKL(P∥Q)=x∑p(x)logq(x)p(x)=EP[logq(x)p(x)]≥0
- 衡量分布 P 与参考分布 Q 的"距离"(非对称:DKL(P∥Q)=DKL(Q∥P))
- DKL=0⇔P=Q
I(X;Y)=DKL(p(x,y)∥p(x)p(y))=H(X)−H(X∣Y)≥0
I=0⇔X,Y 独立;衡量两变量共享的信息量
对参数 θ 的单参数情形:
I(θ)=E[(∂θ∂logp(X;θ))2]=−E[∂θ2∂2logp(X;θ)]
Cramér-Rao 下界(CRB):任意无偏估计量 θ^ 的方差满足
Var(θ^)≥I(θ)−1
多参数推广:Fisher 信息矩阵 I(θ)ij=−E[∂θi∂θj∂2logp]
7. 经典组合概率
7.1 排列(Permutation)
从 n 个对象中取 k 个的有序排列:
P(n,k)=n⋅(n−1)⋯(n−k+1)=(n−k)!n!
7.2 组合(Combination)
从 n 个对象中取 r 个的无序组合:
(rn)=C(n,r)=r!(n−r)!n!=r!P(n,r)
分母 r! 消除了顺序(有序排列数 ÷ r 个对象自身的全排列数)。
References
- Thrun, S., Burgard, W., & Fox, D. Probabilistic Robotics. MIT Press, 2005 — 贝叶斯滤波、高斯分布在机器人中的应用
- Bishop, C. M. Pattern Recognition and Machine Learning. Springer, 2006 — 高斯条件化/边缘化的完整推导、信息形式
- Cover, T. M., & Thomas, J. A. Elements of Information Theory (2nd ed.). Wiley, 2006 — 熵、KL 散度、互信息、Fisher 信息
- Kay, S. M. Fundamentals of Statistical Signal Processing: Estimation Theory. Prentice-Hall, 1993 — Cramér-Rao 下界与 Fisher 信息矩阵