概率论基础知识
0.1 坐标变化后的均值方差
设随机变量 X 的均值为 μ,标准差为 σ, a、b 为常数
- 变换后随机变量 \(Y = a + bX\) 的均值:\(E(Y)=a + b\mu\)
- 变换后随机变量 \(Y = a + bX\) 的标准差:\(SD(Y)=|b|\sigma\), 方差则为\(D(Y)=b^2\sigma^2\)
- 均值推导:利用期望线性性 \(E(a + bX)=E(a)+bE(X) =a + b\mu\)
- 方差推导:\(D(a + bX)=D(a)+b^2D(X)= 0 +b^2\sigma^2\),标准差是方差开根号,即\(|b|\sigma\)。
0.2 狄拉克函数
δ 函数可以看作是一个无限窄、无限高,但面积始终为 1 的尖峰。
这里的狄拉克函数\(\delta(\boldsymbol{y} - \boldsymbol{\Psi}(\boldsymbol{x}))\), 挑选了那些 \(\boldsymbol{x}=\boldsymbol{\Psi}^{-1}(\boldsymbol{y})\)。
0.2 The Principles of Diffusion Models
Assuming Ψ is a smooth bijection B.1.1中有大问题。因为双射光滑,与可导严格单调"g'>0 or g'<0"并非IIF。
当"g'=0"时,不满足$$dx/dy = 1 / dy/dx$$, 导数无穷大。 反函数求导法则 (Inverse Function Differentiation Rule)
0.3 向量值函数与标量函数乘积的散度公式
1 VAE
VAE的论文核心就两步。在Bayes的术语下。encoder:x->z, decoder:z->x。
- 给出优化目标,LB。这块讲是不是很清楚,cs236讲的很好。
- 给出优化算法.
VAE的作者在2019年说,VAE最大的贡献是reparam。

根据期望的积分公式,对Z求积分。期望的条件概率为我们所需的条件概率,这里是给出X后的Z的分布。对应encoder,\(p_{\phi}(z|x)\)。
X是常数,所以整个积分后还是\(log P_{\theta}(x)\)。
\(log P_{\theta}(x)\)。可以通过变形,从其他概率中获得 \(log \frac{P_{\theta}(x,y)}{P_{\theta}(z|x)}\)。

根据VAE的推理,对应encoder,\(p_{\phi}(z|x,y)\)。
\(log P_{\theta}(y|x)\)。可以通过变形,从 \(log \frac{P_{\theta}(y,z|x)}{P_{\theta}(z|x,y)}\)。
其中\(P_{\theta}(y,z|x)\) = \(P_{\theta}(y|x,z)P_{\theta}(z|x)\).
Ref
- https://arxiv.org/abs/1906.02691
