半监督学习、GAN、VAE 与变分推断
本笔记可以作为华为AI认证考试的相关章节复习资料。由GPT辅助生成
阅读时建议始终问三件事:这个式子在描述什么?为什么这样写?优化时希望它变大还是变小?
1. 一张图先串起整门内容
这部分内容其实围绕一个共同问题展开:数据不完整、标签不充分,或者模型中存在看不见的变量时,怎样构造一个能训练的目标函数?
半监督学习从“少量标签 + 大量无标签数据”出发;GAN 用对抗训练学习数据分布;CatGAN 把熵和互信息引入分类;MLE 从概率角度解释“什么参数最能解释数据”;EM 处理隐变量导致的难优化问题;变分推断进一步用可计算的分布近似难算的后验;VAE 最后把这些思想放进神经网络,用 ELBO 和重参数化实现端到端训练。
可以把主线记成:
概率基础 → 熵 / KL / JS → MLE → Jensen → EM → 变分推断 / ELBO → VAE → 半监督与一致性方法
2. 数学基础:后面的公式基本都从这里长出来
2.1 求和、平均与连乘
求和:
\sum_{i=1}^{N} a_i
=
a_1+a_2+\cdots+a_N变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
平均:
实例: 假设三次测验成绩分别是 70、80、90,那么求和就是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\bar a
=
\frac{1}{N}\sum_{i=1}^{N}a_i变量解释:
:样本 的算术平均。 :样本总数或求和项总数。 :样本索引。 :第 个数值。
连乘:
实例: 假设三次测验成绩分别是 70、80、90,那么求和就是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\prod_{i=1}^{N}a_i
=
a_1a_2\cdots a_N变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
概率模型里经常出现连乘,是因为独立样本的联合概率可以分解成每个样本概率的乘积。
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
2.2 对数:把乘法变成加法
最重要的性质是:
\log(ab)=\log a+\log b变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
因此:
实例: 例如
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
\log\left(\prod_{i=1}^{N}a_i\right)
=
\sum_{i=1}^{N}\log a_i变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
这正是似然函数通常要取对数的原因:一方面避免大量小概率相乘造成数值下溢,另一方面求导也更方便。
因为对数函数单调递增,所以:
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\mathop{\mathrm{arg\,max}}_{\theta}L(\theta)
=
\mathop{\mathrm{arg\,max}}_{\theta}\log L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
也就是说,最大化似然和最大化对数似然得到的是同一组最优参数。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
2.3 概率、联合概率与条件概率
离散概率分布满足:
\sum_x p(x)=1变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
连续概率密度满足:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\int_{-\infty}^{\infty}p(x)\,dx=1变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
条件概率定义为:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
p(z\mid x)
=
\frac{p(x,z)}{p(x)}变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
于是联合概率可以写成:
实例: 把
怎么理解: 看到
p(x,z)
=
p(z\mid x)p(x)
=
p(x\mid z)p(z)变量解释:
:潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
如果
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
p(x)=\sum_z p(x,z)变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
连续情况是积分:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
p(x)=\int p(x,z)\,dz变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
这一步叫边缘化。EM 和 VAE 的困难,本质上都与这个求和或积分难以直接计算有关。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
2.4 贝叶斯公式
由条件概率和联合概率分解:
p(z\mid x)
=
\frac{p(x\mid z)p(z)}{p(x)}变量解释:
:潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
四个量要分清:
:先验(prior) :似然(likelihood) :证据 / 边缘似然(evidence / marginal likelihood) :后验(posterior)
在 VAE 中,真正想知道的是
实例: 例如做医学检测:
怎么理解: 看到
p_\theta(x)
=
\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
通常不好算,因此才需要另一个分布
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
2.5 期望、方差与蒙特卡洛近似
离散随机变量的期望:
\mathbb E[X]
=
\sum_x x\,p(x)变量解释:
:期望,即按照相应概率分布进行加权平均。 :观测数据 / 输入样本。 :概率分布或概率密度。
连续情况:
实例: 假设抽奖有 50% 概率得到 0 元、50% 概率得到 10 元,那么期望收益是
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mathbb E[X]
=
\int x\,p(x)\,dx变量解释:
:期望,即按照相应概率分布进行加权平均。 :观测数据 / 输入样本。 :概率分布或概率密度。
更一般地:
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mathbb E_{X\sim p}[g(X)]
=
\int p(x)g(x)\,dx变量解释:
:期望,即按照相应概率分布进行加权平均。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
如果积分不好算,但能从
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mathbb E_{X\sim p}[g(X)]
\approx
\frac{1}{N}\sum_{i=1}^{N}g(x_i)变量解释:
:期望,即按照相应概率分布进行加权平均。 :一般函数;在 VAE 中也可表示重参数化映射。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
这就是蒙特卡洛估计。CatGAN 的熵期望、VAE 的重构项估计以及 minibatch 训练,都能看到同一种思想。
均值和方差:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mu=\mathbb E[X]变量解释:
:期望,即按照相应概率分布进行加权平均。 :均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mathrm{Var}(X)
=
\mathbb E[(X-\mu)^2]变量解释:
:期望,即按照相应概率分布进行加权平均。 :方差算子。 :均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\sigma
=
\sqrt{\mathrm{Var}(X)}变量解释:
:方差算子。 :标准差。
一维高斯分布:
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\mathcal N(x;\mu,\sigma^2)
=
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp\left(
-\frac{(x-\mu)^2}{2\sigma^2}
\right)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :样本总数或求和项总数。 :观测数据 / 输入样本。
实例: 例如身高可以近似想成围绕某个平均值波动。如果
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
2.6 i.i.d. 与似然的连乘
如果样本相互独立且来自同一个分布:
p(x_1,\ldots,x_N;\theta)
=
\prod_{i=1}^{N}p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
这就是 MLE 中似然函数写成连乘的直接来源。
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
3. 信息论:熵、交叉熵、KL、JS 与互信息
3.1 信息量与熵
单个事件的信息量定义为:
I(x)=-\log p(x)变量解释:
:互信息或信息量,具体含义由当前公式决定。 :观测数据 / 输入样本。 :概率分布或概率密度。
事件越罕见,
熵就是信息量的期望:
实例: 如果事件 A 的概率是 0.5,事件 B 的概率只有 0.01,那么 B 发生时更“意外”,所以
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
H(X)
=
\mathbb E[-\log p(X)]
=
-\sum_x p(x)\log p(x)变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :概率分布或概率密度。
直观上,分布越均匀,结果越难猜,熵越大;分布越集中,结果越确定,熵越小。
实例: 想象一枚硬币:正反面各 50% 时最难猜,熵较大;如果正面概率是 99%,几乎每次都能猜中,熵就很小。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
3.2 条件熵
给定
H(Y\mid X=x)
=
-\sum_y p(y\mid x)\log p(y\mid x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
再对
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
H(Y\mid X)
=
\mathbb E_X[H(Y\mid X=x)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
3.3 互信息
互信息衡量“知道
I(X;Y)
=
H(Y)-H(Y\mid X)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。
它也可以写成 KL:
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
I(X;Y)
=
D_{\mathrm{KL}}
\left(
p(x,y)\,\|\,p(x)p(y)
\right)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
如果
实例: 如果图像
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
3.4 交叉熵
真实分布为
H(P,Q)
=
-\sum_x P(x)\log Q(x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
多分类 one-hot 标签下:
实例: 若真实类别是“猫”,模型给猫的概率从 0.2 提高到 0.9,那么
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
L_{\mathrm{CE}}
=
-\sum_{k=1}^{K}y_k\log p_k变量解释:
:多分类交叉熵损失。 :类别总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :类别或向量分量索引。 :标签、类别变量或目标值。 :模型预测属于第 类的概率。 :真实标签在第 类上的 one-hot 指示值。 :概率分布或概率密度。
如果真实类别是
实例: 假设有猫、狗、鸟三类,真实类别是狗,对应 one-hot 标签为
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
L_{\mathrm{CE}}
=
-\log p_c变量解释:
:多分类交叉熵损失。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :概率分布或概率密度。
二分类交叉熵:
实例: 假设有猫、狗、鸟三类,真实类别是狗,对应 one-hot 标签为
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
L_{\mathrm{BCE}}
=
-\left[
y\log\hat y
+
(1-y)\log(1-\hat y)
\right]变量解释:
:二分类交叉熵损失。 :模型预测值或预测为正类的概率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。
BCE 并不是随意设计出来的,它就是 Bernoulli 分布的负对数似然。
实例: 真实标签为 1 时,如果模型预测
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
3.5 KL 散度
离散 KL:
D_{\mathrm{KL}}(P\|Q)
=
\sum_x P(x)
\log\frac{P(x)}{Q(x)}变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
连续 KL:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{KL}}(P\|Q)
=
\int p(x)
\log\frac{p(x)}{q(x)}
\,dx变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
它也满足:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{KL}}(P\|Q)
=
H(P,Q)-H(P)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。
关键性质:
实例: 若真实类别是“猫”,模型给猫的概率从 0.2 提高到 0.9,那么
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{KL}}(P\|Q)\ge 0变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。
且一般:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{KL}}(P\|Q)
\ne
D_{\mathrm{KL}}(Q\|P)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。
所以 KL 不是严格意义上的距离。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
3.6 JS 散度
先定义混合分布:
M
=
\frac{1}{2}(P+Q)变量解释:
:minibatch 大小;在 JS 散度中也可表示混合分布。
然后:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
D_{\mathrm{JS}}(P\|Q)
=
\frac{1}{2}D_{\mathrm{KL}}(P\|M)
+
\frac{1}{2}D_{\mathrm{KL}}(Q\|M)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :Jensen–Shannon 散度。 :GAN 的判别器;在距离公式中也可表示距离函数。 :minibatch 大小;在 JS 散度中也可表示混合分布。
JS 是对称的:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{JS}}(P\|Q)
=
D_{\mathrm{JS}}(Q\|P)变量解释:
:Jensen–Shannon 散度。 :GAN 的判别器;在距离公式中也可表示距离函数。
经典 GAN 的理论分析会自然出现 JS 散度。
实例: 如果真实数据分布和生成数据分布越来越接近,它们与中间混合分布
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
4. 神经网络训练里最常见的数学工具
4.1 梯度下降
损失写成:
L=L(\theta_1,\ldots,\theta_m)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
梯度:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\nabla_\theta L
=
\left(
\frac{\partial L}{\partial\theta_1},
\ldots,
\frac{\partial L}{\partial\theta_m}
\right)变量解释:
:关于参数 的梯度。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
梯度下降:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 导数或梯度告诉我们参数发生一点变化时,目标函数会朝哪个方向、以多快的速度变化。
\theta_{t+1}
=
\theta_t
-
\eta\nabla_\theta L(\theta_t)变量解释:
:关于参数 的梯度。 :学习率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
其中
实例: 假设当前参数是 2,梯度是 3,学习率是 0.1,那么下一步参数约为
怎么理解: 导数或梯度告诉我们参数发生一点变化时,目标函数会朝哪个方向、以多快的速度变化。
4.2 链式法则
若
y=f(u),
\qquad
u=g(x)变量解释:
:函数或预测模型。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
则:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\frac{dy}{dx}
=
\frac{dy}{du}
\frac{du}{dx}变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
反向传播本质上就是在计算图上反复使用链式法则。
实例: 例如
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
4.3 Sigmoid 与 Softmax
Sigmoid:
\sigma(t)
=
\frac{1}{1+e^{-t}}变量解释:
:标准差。
Softmax:
实例: 当
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
p_k
=
\frac{e^{a_k}}
{\sum_{j=1}^{K}e^{a_j}}变量解释:
:类别总数。 :维度、参数或类别索引。 :类别或向量分量索引。 :第 个 logit 或分量。 :模型预测属于第 类的概率。 :概率分布或概率密度。
并且:
实例: 若三个 logits 是 1、2、3,Softmax 会把它们转换成三个正数概率,并保证总和为 1;分数 3 对应的类别会获得最大的概率。
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\sum_{k=1}^{K}p_k=1变量解释:
:类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
4.4 MSE 与高斯噪声
均方误差:
L_{\mathrm{MSE}}
=
\frac{1}{N}
\sum_{i=1}^{N}
(\hat y_i-y_i)^2变量解释:
:均方误差损失。 :均方误差。 :模型预测值或预测为正类的概率。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :标签、类别变量或目标值。
如果假设:
实例: 真实值是 10,模型预测 8,单个样本的平方误差是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
y_i
=
f_\theta(x_i)+\varepsilon_i,
\qquad
\varepsilon_i\sim\mathcal N(0,\sigma^2)变量解释:
:从标准正态分布采样的随机噪声。 :方差。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
那么最大化高斯似然等价于最小化平方误差。因此 MSE 可以看成“固定方差高斯噪声假设”下的负对数似然。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
5. 半监督学习
5.1 基本设定
半监督学习同时使用:
- 有标签数据
- 无标签数据
常见总目标可以写成:
\min_\theta
\left[
\sum_{(x,y)\in\mathcal D_L}
L_s(x,y;\theta)
+
\alpha
\sum_{x\in\mathcal D_U}
L_u(x;\theta)
+
R(\theta)
\right]变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :无监督损失的权重系数。 :有标签数据集。 :无标签数据集。 :风险函数或正则项,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
三部分分别负责:
- 有标签样本要预测正确;
- 无标签样本也要提供训练信号;
- 模型不能只靠复杂度死记训练集。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
5.2 两个常见假设
平滑性假设:
x_1\approx x_2
\quad\Rightarrow\quad
f(x_1)\approx f(x_2)变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
流形 / 聚类假设: 高维观测往往集中在更低维的结构上,同一高密度区域中的样本更可能共享标签。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
5.3 常见方法
可以粗略分成五类:
- 生成式方法:SSGAN、CatGAN、半监督 VAE
- 一致性正则:
-Model、Temporal Ensembling、Mean Teacher、Ladder Network - 图方法:GNN、GCN
- 伪标签:Self-training、Noisy Student
- 混合方法:MixMatch、ReMixMatch 等
6. GAN:从二分类到分布匹配
场景例子: 假设训练数据是一批真实人脸。生成器一开始只会生成杂乱像素,判别器很容易判断为假;训练若有效,生成结果会逐渐出现脸部轮廓、五官和纹理。判别器也会同步变严格。GAN 的 loss 因此不像普通分类任务那样要求一路单调下降,更应该结合生成样本质量、两边梯度和训练平衡一起观察。
6.1 经典目标
生成器
经典 minimax 目标:
\min_G\max_D
V(D,G)
=
\mathbb E_{x\sim p_{\mathrm{data}}}
[\log D(x)]
+
\mathbb E_{z\sim p_z}
[\log(1-D(G(z)))]变量解释:
:真实数据分布。 :GAN 中噪声或潜变量 的先验分布。 :期望,即按照相应概率分布进行加权平均。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
判别器希望真实样本的
固定
实例: 可以把生成器想成“造假者”,判别器想成“鉴定者”。鉴定者不断学习识别真假,生成器不断学习制造更像真实数据的样本,两边交替更新。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
D^*(x)
=
\frac{p_{\mathrm{data}}(x)}
{p_{\mathrm{data}}(x)+p_g(x)}变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :GAN 的判别器;在距离公式中也可表示距离函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
代回目标:
实例: 如果某个位置真实数据密度和生成数据密度相同,即
怎么理解: 看到
V(D^*,G)
=
-\log 4
+
2D_{\mathrm{JS}}
(p_{\mathrm{data}}\|p_g)变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :Jensen–Shannon 散度。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :概率分布或概率密度。
因此在理想理论条件下,生成器的目标可以理解为推动
实际训练中常使用 non-saturating generator loss,而不是直接最小化
,因为前者通常能提供更强的早期梯度。
实例: 如果真实数据分布和生成数据分布越来越接近,它们与中间混合分布
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
7. CatGAN:把“真假判别”改造成类别结构学习
CatGAN 的关键不是简单增加一个分类头,而是用熵与互信息约束分类器。
设判别器输出:
p(y\mid x)变量解释:
:观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
对单个真实样本,希望类别明确,因此希望条件熵小:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
H(Y\mid X=x)
=
-\sum_{k=1}^{K}
p(y=k\mid x)
\log p(y=k\mid x)变量解释:
:熵,用来描述概率分布的不确定性。 :类别总数。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
但如果只追求单样本低熵,模型可能把所有样本都塞进同一类。因此还希望整体预测类别分布比较丰富,即边缘熵大。
真实数据的平均预测分布:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
p(y)
=
\mathbb E_{x\sim p_{\mathrm{data}}}
[p(y\mid x)]变量解释:
:真实数据分布。 :期望,即按照相应概率分布进行加权平均。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
对应边缘熵:
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
H(Y)
=
-\sum_y p(y)\log p(y)变量解释:
:熵,用来描述概率分布的不确定性。 :标签、类别变量或目标值。 :概率分布或概率密度。
因此:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
I(X;Y)
=
H(Y)-H(Y\mid X)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。
正好表达了 CatGAN 想要的效果:整体类别丰富,但每个样本的类别判断明确。
对生成器也可以使用同样的互信息思想,让生成样本能够形成明确而多样的类别结构。
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
8. CCGAN:连续条件下的生成
普通 conditional GAN 更适合离散标签;当条件变量本身是连续量时,例如年龄、角度或连续物理属性,直接把每个条件值当成独立类别并不自然。
CCGAN 的核心思路是:在连续标签附近构造“局部条件”,利用相邻标签之间的连续性学习条件生成分布。
风险的一般形式仍然是期望:
R(f)
=
\mathbb E_{(X,Y)\sim p}
[
L(f(X),Y)
]变量解释:
:期望,即按照相应概率分布进行加权平均。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :概率分布或概率密度。
实际数据有限时,用经验风险近似:
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\hat R(f)
=
\frac{1}{N}
\sum_{i=1}^{N}
L(f(x_i),y_i)变量解释:
:经验风险,即训练样本上的平均损失。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
本质上还是“大数定律 + 样本平均近似总体期望”。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
9. MLE:先把“最能解释数据”写成数学
给定 i.i.d. 数据
L(\theta)
=
\prod_{i=1}^{N}
p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
MLE 定义为:
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
\hat\theta_{\mathrm{MLE}}
=
\mathop{\mathrm{arg\,max}}_{\theta}
L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数 的估计值。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
通常改为最大化对数似然:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\ell(\theta)
=
\log L(\theta)
=
\sum_{i=1}^{N}
\log p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :对数似然或单样本损失,具体由上下文决定。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
因此:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\hat\theta_{\mathrm{MLE}}
=
\mathop{\mathrm{arg\,max}}_{\theta}
\ell(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数 的估计值。 :对数似然或单样本损失,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
9.1 正态分布 MLE
若:
x_i\sim\mathcal N(\mu,\sigma^2)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。
则:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
L(\mu,\sigma^2)
=
\prod_{i=1}^{N}
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp\left[
-\frac{(x_i-\mu)^2}{2\sigma^2}
\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
对数似然:
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
\ell(\mu,\sigma^2)
=
-\frac{N}{2}\log(2\pi)
-\frac{N}{2}\log\sigma^2
-\frac{1}{2\sigma^2}
\sum_{i=1}^{N}(x_i-\mu)^2变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :圆周率。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。
求导可得:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\hat\mu_{\mathrm{MLE}}
=
\frac{1}{N}
\sum_{i=1}^{N}x_i变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :均值 的估计值。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。
以及:
实例: 若观测值为 2、4、6,那么高斯均值的 MLE 是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\hat\sigma^2_{\mathrm{MLE}}
=
\frac{1}{N}
\sum_{i=1}^{N}
(x_i-\hat\mu_{\mathrm{MLE}})^2变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :均值 的估计值。 :标准差 的估计值。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。
注意这里是 MLE,所以分母是
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
10. Jensen 不等式:为什么会出现“下界”
如果
f(\mathbb E[X])
\le
\mathbb E[f(X)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :函数或预测模型。
如果
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
f(\mathbb E[X])
\ge
\mathbb E[f(X)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :函数或预测模型。
因为
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\log\mathbb E[U]
\ge
\mathbb E[\log U]变量解释:
:期望,即按照相应概率分布进行加权平均。
EM 和 ELBO 的下界推导,核心都依赖这一点。
实例: 可以把它理解成:先取平均再取对数,与先取对数再平均并不相同。因为
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
11. EM:隐变量让似然难算时怎么办
设观测变量为
\log p_\theta(x)
=
\log\sum_z p_\theta(x,z)变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
或连续情况:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\log p_\theta(x)
=
\log\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
难点是:对数外面包着求和或积分。
引入任意分布
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
\log p_\theta(x)
=
\log
\sum_z
q(z)
\frac{p_\theta(x,z)}{q(z)}变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
利用 Jensen:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
\log p_\theta(x)
\ge
\sum_z
q(z)
\log
\frac{p_\theta(x,z)}{q(z)}变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
右边就是一个下界。
EM 的 E 步令辅助分布等于当前参数下的真实后验:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
q(z)
=
p_{\theta^{\mathrm{old}}}(z\mid x)变量解释:
:上一轮迭代得到的模型参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
M 步固定这个后验,更新参数:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
\theta^{\mathrm{new}}
=
\mathop{\mathrm{arg\,max}}_{\theta}
\mathbb E_{z\sim q(z)}
[
\log p_\theta(x,z)
]变量解释:
:当前更新后得到的模型参数。 :参数为 时观测变量与潜变量的联合分布。 :期望,即按照相应概率分布进行加权平均。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
可以把 EM 记成:
E 步:估计隐变量的后验。
M 步:把这个后验当作权重,重新估计模型参数。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
12. ELBO:VAE 真正优化的东西
场景例子: 把一张手写数字“3”送进 VAE。编码器不会只返回一个固定坐标,而是返回一个潜变量分布,例如某几个维度的均值与方差。随后从这个分布取一个
,解码器尝试重新生成“3”。重构项检查生成结果是否像原图,KL 项则约束这个潜空间不要变成彼此割裂、无法采样的孤岛。
12.1 从边缘似然开始
VAE 真正希望最大化:
\log p_\theta(x)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :概率分布或概率密度。
但:
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
p_\theta(x)
=
\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
往往难以直接计算。
于是引入变分分布:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
q_\phi(z\mid x)变量解释:
:编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
并改写:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\log p_\theta(x)
=
\log
\int
q_\phi(z\mid x)
\frac{p_\theta(x,z)}
{q_\phi(z\mid x)}
\,dz变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
Jensen 给出:
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
\log p_\theta(x)
\ge
\mathbb E_{q_\phi(z\mid x)}
\left[
\log
\frac{p_\theta(x,z)}
{q_\phi(z\mid x)}
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
定义:
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\mathcal L(\theta,\phi;x)
=
\mathbb E_{q_\phi(z\mid x)}
\left[
\log p_\theta(x,z)
-
\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
这就是 ELBO。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
12.2 ELBO 与真实对数似然的精确关系
最值得记住的恒等式是:
\log p_\theta(x)
=
\mathcal L(\theta,\phi;x)
+
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p_\theta(z\mid x)
\right)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
因为 KL 非负,所以:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
\log p_\theta(x)
\ge
\mathcal L(\theta,\phi;x)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :概率分布或概率密度。
这也解释了“Evidence Lower Bound”这个名字。
更重要的是,它告诉我们:最大化 ELBO 一方面提高数据似然,另一方面也会推动近似后验
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
12.3 VAE 常用分解
利用:
p_\theta(x,z)
=
p_\theta(x\mid z)p(z)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :参数为 时观测变量与潜变量的联合分布。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
ELBO 可以整理成:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
\mathcal L(\theta,\phi;x)
=
\mathbb E_{q_\phi(z\mid x)}
[
\log p_\theta(x\mid z)
]
-
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p(z)
\right)变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
两部分分别是:
- 重构项:给定
后,解码器能不能解释 / 重构 ; - KL 项:编码器给出的潜变量分布不要偏离先验太远。
训练代码常最小化负 ELBO:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
L_{\mathrm{VAE}}
=
L_{\mathrm{recon}}
+
L_{\mathrm{KL}}变量解释:
:VAE 的重构损失。 :VAE 中由 KL 散度得到的正则项。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
这里的正负号只是“最大化 ELBO”和“最小化 loss”两种记号约定之间的转换。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
13. VAE:编码器、解码器与重参数化
13.1 编码器
常见假设:
q_\phi(z\mid x)
=
\mathcal N
\left(
z;
\mu_\phi(x),
\mathrm{diag}(\sigma_\phi^2(x))
\right)变量解释:
:编码器给出的近似后验分布。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
编码器不是直接输出一个
实践中通常输出:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\mathrm{logvar}
=
\log\sigma^2变量解释:
:方差。
于是:
实例: 例如方差 logvar 就是
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
\sigma
=
\exp\left(
\frac{1}{2}\mathrm{logvar}
\right)变量解释:
:标准差。
实例: 例如方差 logvar 就是
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
13.2 重参数化
直接写:
z\sim q_\phi(z\mid x)变量解释:
:编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
会让随机采样节点夹在参数
因此改写为:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\varepsilon
\sim
\mathcal N(0,I)变量解释:
:从标准正态分布采样的随机噪声。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
z
=
\mu_\phi(x)
+
\sigma_\phi(x)\odot\varepsilon变量解释:
:从标准正态分布采样的随机噪声。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :逐元素乘法(Hadamard product)。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
随机性被放到与
代码里常写成:
实例: 假设编码器输出
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
z
=
\mu
+
\varepsilon\odot
\exp\left(
\frac{1}{2}\mathrm{logvar}
\right)变量解释:
:从标准正态分布采样的随机噪声。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :逐元素乘法(Hadamard product)。 :隐变量 / 潜变量。
实例: 例如方差 logvar 就是
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
13.3 标准高斯先验下的 KL 闭式
若:
q_\phi(z\mid x)
=
\mathcal N
\left(
\mu,
\mathrm{diag}(\sigma^2)
\right)变量解释:
:编码器给出的近似后验分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
且:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
p(z)=\mathcal N(0,I)变量解释:
:潜变量的先验分布。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :隐变量 / 潜变量。 :概率分布或概率密度。
则:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
D_{\mathrm{KL}}
(q_\phi(z\mid x)\|p(z))
=
\frac{1}{2}
\sum_{j=1}^{d}
\left(
\mu_j^2
+
\sigma_j^2
-
\log\sigma_j^2
-
1
\right)变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :潜变量或向量的维度。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
若用 logvar:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
D_{\mathrm{KL}}
=
-\frac{1}{2}
\sum_{j=1}^{d}
\left(
1+\mathrm{logvar}_j
-\mu_j^2
-\exp(\mathrm{logvar}_j)
\right)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :GAN 的判别器;在距离公式中也可表示距离函数。 :潜变量或向量的维度。 :维度、参数或类别索引。
这是 VAE 代码里最常见的 KL 公式。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
14. AEVB 与蒙特卡洛训练
单样本 ELBO:
\mathcal L(x)
=
-
D_{\mathrm{KL}}
(q_\phi(z\mid x)\|p(z))
+
\mathbb E_{q_\phi(z\mid x)}
[
\log p_\theta(x\mid z)
]变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
如果重构期望不能解析计算,可以采样
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
z^{(l)}
=
g_\phi(x,\varepsilon^{(l)})变量解释:
:从标准正态分布采样的随机噪声。 :变分分布 / 编码器的参数。 :一般函数;在 VAE 中也可表示重参数化映射。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
得到:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\mathbb E_q
[
\log p_\theta(x\mid z)
]
\approx
\frac{1}{L}
\sum_{l=1}^{L}
\log p_\theta(x\mid z^{(l)})变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :期望,即按照相应概率分布进行加权平均。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
因此:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
\bar{\mathcal L}(x)
=
-
D_{\mathrm{KL}}
(q_\phi(z\mid x)\|p(z))
+
\frac{1}{L}
\sum_{l=1}^{L}
\log p_\theta(x\mid z^{(l)})变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
训练中常取
如果完整数据集有
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
\widehat{\mathcal L}_{\mathrm{total}}
=
\frac{N}{M}
\sum_{i\in\mathcal B}
\mathcal L(x_i)变量解释:
:目标函数或证据下界(具体含义由当前小节决定)。 :当前 minibatch 中的样本索引集合。 :样本总数或求和项总数。 :minibatch 大小;在 JS 散度中也可表示混合分布。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
15. 解码分布决定“重构损失长什么样”
这是理解 VAE loss 最容易被忽略的一点:重构损失不是凭感觉挑 BCE 或 MSE,而是由
15.1 Bernoulli 解码器
若
p_\theta(x_i\mid z)
=
y_i^{x_i}
(1-y_i)^{1-x_i}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
负对数:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
-\log p_\theta(x_i\mid z)
=
-
\left[
x_i\log y_i
+
(1-x_i)\log(1-y_i)
\right]变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
这就是 BCE。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
15.2 高斯解码器
若:
p_\theta(x\mid z)
=
\mathcal N
\left(
x;
\mu_\theta(z),
\sigma^2I
\right)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
且
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
-\log p_\theta(x\mid z)
=
\text{constant}
+
\frac{1}{2\sigma^2}
\|x-\mu_\theta(z)\|_2^2变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
所以最大化高斯重构似然等价于最小化平方误差。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
16. 一致性正则化
场景例子: 一张汽车图片经过水平平移、轻微亮度变化或小幅裁剪后,语义仍然是汽车。无标签数据虽然没有告诉模型“正确答案是汽车”,但可以要求模型对原图和扰动图给出接近的预测。这就把无标签数据转化成了训练信号。
核心想法很简单:如果数据增强没有改变语义,模型的预测也不应该大幅变化。
设:
x'=T(x)变量解释:
:对输入施加的数据增强或扰动变换。 :观测数据 / 输入样本。
希望:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
f_\theta(x')
\approx
f_\theta(x)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :观测数据 / 输入样本。
于是定义:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
L_{\mathrm{cons}}
=
D
\left(
f_\theta(x),
f_\theta(T(x))
\right)变量解释:
:一致性正则损失。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :对输入施加的数据增强或扰动变换。 :参数为 的模型函数。 :函数或预测模型。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。
总损失:
实例: 例如把同一张猫的图片轻微裁剪、翻转或加一点噪声,模型前后都应该仍然倾向预测为猫。如果两次输出差很多,一致性损失就会变大。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
L_{\mathrm{total}}
=
L_{\mathrm{sup}}
+
\lambda_{\mathrm{cons}}
L_{\mathrm{cons}}变量解释:
:一致性正则损失。 :有标签数据上的监督损失。 :总训练目标 / 总损失。 :一致性损失的权重系数。 :正则项或某个损失项的权重系数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
如果使用 MSE:
实例: 例如把同一张猫的图片轻微裁剪、翻转或加一点噪声,模型前后都应该仍然倾向预测为猫。如果两次输出差很多,一致性损失就会变大。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
d_{\mathrm{MSE}}
=
\frac{1}{C}
\sum_{k=1}^{C}
\left[
f_k(x_i)-f_k(x_j)
\right]^2变量解释:
:均方误差。 :函数或预测模型。 :向量维度或类别数。 :潜变量或向量的维度。 :样本索引。 :维度、参数或类别索引。 :类别或向量分量索引。 :观测数据 / 输入样本。
如果输出是概率分布,也可以使用 KL 或 JS,但要注意 KL 的方向会影响优化行为。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
17. Ladder Network
Ladder Network 同时利用监督分类与无监督重构。
无监督重构目标可以写成:
\min
\|X-X'\|_2^2变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
隐藏表示:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
H=f(x)变量解释:
:熵,用来描述概率分布的不确定性。 :函数或预测模型。 :观测数据 / 输入样本。
这里存在一个很重要的张力:
- 重构希望隐藏表示尽量保留输入信息;
- 分类希望隐藏表示突出任务相关信息、丢掉无关细节。
Ladder Network 的结构设计就是在这两种需求之间取得平衡。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
18. 正则化:从优化视角和贝叶斯视角理解
一般形式:
L_{\mathrm{total}}(\theta)
=
L_{\mathrm{data}}(\theta)
+
\lambda R(\theta)变量解释:
:总训练目标 / 总损失。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
L1:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
R_{L1}(\theta)
=
\lambda
\sum_j|\theta_j|变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
L2:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
R_{L2}(\theta)
=
\lambda
\sum_j\theta_j^2变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
从 MAP 角度:
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
p(\theta\mid D)
\propto
p(D\mid\theta)p(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :概率分布或概率密度。
取负对数:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
-\log p(\theta\mid D)
=
-\log p(D\mid\theta)
-
\log p(\theta)
+
\text{constant}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :概率分布或概率密度。
因此“数据损失 + 正则项”也可以理解为“负对数似然 + 负对数先验”。
零均值高斯先验对应 L2;Laplace 先验对应 L1。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
19. EM、变分推断和 VAE 到底是什么关系
这三个概念容易混在一起,可以这样分:
EM:当真实后验能够在 E 步算出来时,用真实后验构造紧下界,再更新参数。
变分推断:真实后验算不出来,于是从一个可处理的分布族里找
VAE:把变分分布参数化成神经网络编码器,再用重参数化让整个系统可以通过梯度下降训练。
最核心的共同公式仍然是:
\log p_\theta(x)
=
\mathrm{ELBO}
+
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p_\theta(z\mid x)
\right)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
这条式子几乎可以当成整部分内容的“总公式”。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
20. 几个容易混淆、但考试和实现都很重要的点
20.1 “似然”不是“概率”的另一个名字
写成
20.2 KL 的两个方向不等价
D_{\mathrm{KL}}(P\|Q)
\ne
D_{\mathrm{KL}}(Q\|P)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。
因此看到 KL 时不能只记“让两个分布接近”,还要看谁在前、谁在后。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
20.3 VAE 的 KL 不是“让每个 都等于 0”
KL 约束的是分布。编码器仍然可以让不同输入产生不同的
20.4 重构项的数值形式取决于观测模型
Bernoulli likelihood 对应 BCE;固定方差 Gaussian likelihood 对应平方误差。不能脱离
20.5 ELBO 是下界,不是对数似然本身
只有当:
q_\phi(z\mid x)
=
p_\theta(z\mid x)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
时:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p_\theta(z\mid x)
\right)
=0变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
ELBO 才与
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
20.6 训练 loss 的正负号要看代码约定
理论通常写“最大化 ELBO”,代码通常写“最小化 negative ELBO”。看到符号相反时,先确认优化方向,不要立刻认为公式冲突。
21. 最后用一条推导链复习
从最基础的概率开始:
p(z\mid x)
=
\frac{p(x\mid z)p(z)}{p(x)}变量解释:
:潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
VAE 中分母难算:
实例: 例如做医学检测:
怎么理解: 看到
p_\theta(x)
=
\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
于是引入:
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
q_\phi(z\mid x)变量解释:
:编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
再得到:
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
\log p_\theta(x)
=
\mathrm{ELBO}
+
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p_\theta(z\mid x)
\right)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
因此:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
\log p_\theta(x)
\ge
\mathrm{ELBO}变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :证据下界(Evidence Lower Bound)。 :观测数据 / 输入样本。 :概率分布或概率密度。
而 VAE 的 ELBO:
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
\mathrm{ELBO}
=
\mathbb E_{q_\phi(z\mid x)}
[
\log p_\theta(x\mid z)
]
-
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|
p(z)
\right)变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
为了让编码器可训练,再使用:
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
z
=
\mu_\phi(x)
+
\sigma_\phi(x)\odot\varepsilon,
\qquad
\varepsilon\sim\mathcal N(0,I)变量解释:
:从标准正态分布采样的随机噪声。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :逐元素乘法(Hadamard product)。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
到这里,MLE、Jensen、KL、ELBO、VAE 和重参数化就真正连成了一条线。
实例: 假设编码器输出
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
附录 A:符号速查
| 符号 | 含义 |
|---|---|
| 观测数据 / 输入 | |
| 标签或类别变量 | |
| 隐变量 / 潜变量 | |
| 生成模型、解码器或一般模型参数 | |
| 变分分布 / 编码器参数 | |
| 解码器 / 生成分布 | |
| 潜变量先验 | |
| 真实后验,通常难直接计算 | |
| 近似后验 / 编码器分布 | |
| 期望 | |
| 熵 | |
| KL 散度 | |
| JS 散度 | |
| 均值、方差 | |
| 学习率 | |
| 损失或正则项权重 |
附录 B:原笔记公式索引(去重并统一为 Markdown 块公式)
下面保留原笔记中可识别的独立公式,主要用于查漏。正文已经按知识关系重新组织;这里不再重复逐式解释。
B.1
y=f(x)变量解释:
:函数或预测模型。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.2
\mathbf{x}=(x_1,x_2,\ldots,x_d)变量解释:
:潜变量或向量的维度。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.3
0\le P(A)\le 1变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.4
\sum_x p(x)=1变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.5
p(x)=P(X=x)变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.6
P(a\le X\le b)=\int_a^b f(x)\,dx变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.7
\int_{-\infty}^{\infty}f(x)\,dx=1变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.8
p(x,z)变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.9
p(z\mid x)=\frac{p(x,z)}{p(x)}变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 把
怎么理解: 看到
B.10
p(x,z)=p(z\mid x)p(x)变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.11
p(x,z)=p(x\mid z)p(z)变量解释:
:潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.12
p(x)=\sum_z p(x,z)变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.13
p(x)=\int p(x,z)\,dz变量解释:
:观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.14
p(z\mid x)
=
\frac{p(x\mid z)p(z)}{p(x)}变量解释:
:潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 例如做医学检测:
怎么理解: 看到
B.15
\mathbb{E}[X]
=
\sum_x x\,p(x)变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.16
\mathbb{E}[X]
=
\int x f(x)\,dx变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.17
\mathbb{E}[g(X)]
=
\sum_x p(x)g(x)变量解释:
:一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.18
\mathbb{E}[g(X)]
=
\int f(x)g(x)\,dx变量解释:
:函数或预测模型。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.19
\mathbb{E}_{X\sim p}[g(X)]
=
\int p(x)g(x)\,dx变量解释:
:一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.20
\mathbb{E}_{X\sim p}[g(X)]
\approx
\frac{1}{N}\sum_{i=1}^{N}g(x_i)变量解释:
:一般函数;在 VAE 中也可表示重参数化映射。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.21
\mu=\mathbb{E}[X]变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.22
\mathrm{Var}(X)
=
\mathbb{E}[(X-\mu)^2]变量解释:
:方差算子。 :均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.23
\sigma=\sqrt{\mathrm{Var}(X)}变量解释:
:方差算子。 :标准差。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.24
\mathcal{N}(x;\mu,\sigma^2)
=
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp\left(
-\frac{(x-\mu)^2}{2\sigma^2}
\right)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :样本总数或求和项总数。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.25
p(x_1,x_2)=p(x_1)p(x_2)变量解释:
:观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.26
p(x_1,\ldots,x_N;\theta)
=
\prod_{i=1}^{N}p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.27
I(x)=-\log p(x)变量解释:
:互信息或信息量,具体含义由当前公式决定。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 如果事件 A 的概率是 0.5,事件 B 的概率只有 0.01,那么 B 发生时更“意外”,所以
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.28
H(X)
=
\mathbb{E}_{X\sim p}[-\log p(X)]变量解释:
:熵,用来描述概率分布的不确定性。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.29
H(X)
=
-\sum_x p(x)\log p(x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 想象一枚硬币:正反面各 50% 时最难猜,熵较大;如果正面概率是 99%,几乎每次都能猜中,熵就很小。
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.30
H(Y\mid X=x)
=
-\sum_y p(y\mid x)\log p(y\mid x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.31
H(Y\mid X)
=
\mathbb{E}_{X}
[H(Y\mid X=x)]变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.32
H(Y\mid X)
=
-\sum_x p(x)\sum_y p(y\mid x)\log p(y\mid x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.33
I(X;Y)=H(Y)-H(Y\mid X)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。
实例: 如果只知道“这是一张动物图片”,类别还很不确定;看到具体图像特征后,模型可能给“猫”0.98 的概率,此时剩余的不确定性明显下降,这就是条件熵在表达的东西。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.34
I(X;Y)
=
D_{\mathrm{KL}}
\left(
p(x,y)\,\|\,p(x)p(y)
\right)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 如果图像
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.35
H(P,Q)
=
-\sum_x P(x)\log Q(x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 若真实类别是“猫”,模型给猫的概率从 0.2 提高到 0.9,那么
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.36
H(P)=-\sum_x P(x)\log P(x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.37
H(P,Q)=-\sum_x P(x)\log Q(x)变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 若真实类别是“猫”,模型给猫的概率从 0.2 提高到 0.9,那么
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.38
H(P,Q)-H(P)
=
\sum_x P(x)\log\frac{P(x)}{Q(x)}变量解释:
:熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。
实例: 若真实类别是“猫”,模型给猫的概率从 0.2 提高到 0.9,那么
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.39
D_{\mathrm{KL}}(P\|Q)
=
\sum_x P(x)\log\frac{P(x)}{Q(x)}变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.40
\frac{f(x+\Delta x)-f(x)}{\Delta x}变量解释:
:输入变量的微小变化量。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.41
f'(x)
=
\lim_{\Delta x\to0}
\frac{f(x+\Delta x)-f(x)}{\Delta x}变量解释:
:输入变量的微小变化量。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.42
L=L(\theta_1,\theta_2,\ldots,\theta_m)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.43
\frac{\partial L}{\partial\theta_j}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 导数或梯度告诉我们参数发生一点变化时,目标函数会朝哪个方向、以多快的速度变化。
B.44
\nabla_\theta L
=
\left(
\frac{\partial L}{\partial\theta_1},
\ldots,
\frac{\partial L}{\partial\theta_m}
\right)变量解释:
:关于参数 的梯度。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 导数或梯度告诉我们参数发生一点变化时,目标函数会朝哪个方向、以多快的速度变化。
B.45
\theta_{t+1}
=
\theta_t-\eta\nabla_\theta L(\theta_t)变量解释:
:关于参数 的梯度。 :学习率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 假设当前参数是 2,梯度是 3,学习率是 0.1,那么下一步参数约为
怎么理解: 导数或梯度告诉我们参数发生一点变化时,目标函数会朝哪个方向、以多快的速度变化。
B.46
y=f(u),\qquad u=g(x)变量解释:
:函数或预测模型。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.47
\frac{dy}{dx}
=
\frac{dy}{du}\frac{du}{dx}变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 例如
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.48
\lVert\mathbf{a}-\mathbf{b}\rVert_2^2
=
\sum_{k=1}^{C}(a_k-b_k)^2变量解释:
:向量维度或类别数。 :类别或向量分量索引。 :第 个 logit 或分量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.49
\mathrm{MSE}(\mathbf{a},\mathbf{b})
=
\frac{1}{C}
\sum_{k=1}^{C}(a_k-b_k)^2变量解释:
:均方误差。 :向量维度或类别数。 :类别或向量分量索引。 :第 个 logit 或分量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.50
\sigma(t)=\frac{1}{1+e^{-t}}变量解释:
:标准差。
实例: 当
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.51
p_k
=
\frac{e^{a_k}}
{\sum_{j=1}^{K}e^{a_j}}变量解释:
:类别总数。 :维度、参数或类别索引。 :类别或向量分量索引。 :第 个 logit 或分量。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 若三个 logits 是 1、2、3,Softmax 会把它们转换成三个正数概率,并保证总和为 1;分数 3 对应的类别会获得最大的概率。
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.52
\sum_{k=1}^{K}p_k
=
\frac{\sum_{k=1}^{K}e^{a_k}}
{\sum_{j=1}^{K}e^{a_j}}
=1变量解释:
:类别总数。 :维度、参数或类别索引。 :类别或向量分量索引。 :第 个 logit 或分量。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 若三个 logits 是 1、2、3,Softmax 会把它们转换成三个正数概率,并保证总和为 1;分数 3 对应的类别会获得最大的概率。
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.53
f''(x)>0变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.54
f''(x)<0变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.55
\log\mathbb{E}[U]
\ge
\mathbb{E}[\log U]变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.56
x_1 \approx x_2 \quad \Rightarrow \quad y_1 \approx y_2变量解释:
:观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.57
\hat R(\theta)
=
\frac{1}{N}
\sum_{i=1}^{N}
\ell(f_\theta(x_i),y_i)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :对数似然或单样本损失,具体由上下文决定。 :经验风险,即训练样本上的平均损失。 :风险函数或正则项,具体含义由当前公式决定。 :参数为 的模型函数。 :函数或预测模型。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.58
\min_\theta \hat R(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :经验风险,即训练样本上的平均损失。 :风险函数或正则项,具体含义由当前公式决定。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.59
L_{\text{BCE}}
=
-\left[y\log \hat y+(1-y)\log(1-\hat y)\right]变量解释:
:模型预测值或预测为正类的概率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.60
P(Y=y\mid \hat y)
=
\hat y^{\,y}(1-\hat y)^{1-y}变量解释:
:模型预测值或预测为正类的概率。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.61
\log P(Y=y\mid\hat y)
=
y\log\hat y+(1-y)\log(1-\hat y)变量解释:
:模型预测值或预测为正类的概率。 :标签、类别变量或目标值。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.62
L_{\mathrm{BCE}}
=-\log P(Y=y\mid\hat y)
=-\left[y\log\hat y+(1-y)\log(1-\hat y)\right]变量解释:
:二分类交叉熵损失。 :模型预测值或预测为正类的概率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。
实例: 真实标签为 1 时,如果模型预测
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.63
L_{\text{CE}}
=
-\sum_{k=1}^{K}y_k\log p_k变量解释:
:类别总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :类别或向量分量索引。 :标签、类别变量或目标值。 :模型预测属于第 类的概率。 :真实标签在第 类上的 one-hot 指示值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.64
\mathbf p=(p_1,p_2,\ldots,p_K),
\qquad
\sum_{k=1}^{K}p_k=1变量解释:
:类别概率向量。 :类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.65
\mathbf y=(y_1,\ldots,y_K)变量解释:
:one-hot 标签向量。 :类别总数。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.66
P(\mathbf y\mid\mathbf p)
=
\prod_{k=1}^{K}p_k^{y_k}变量解释:
:类别概率向量。 :one-hot 标签向量。 :类别总数。 :类别或向量分量索引。 :标签、类别变量或目标值。 :模型预测属于第 类的概率。 :真实标签在第 类上的 one-hot 指示值。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.67
L_{\text{MSE}}
=
\frac{1}{N}\sum_{i=1}^{N}(\hat y_i-y_i)^2变量解释:
:模型预测值或预测为正类的概率。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.68
R_{L2}(\theta)=\lambda\sum_j\theta_j^2变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.69
p(\theta\mid D)
\propto
p(D\mid\theta)p(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.70
p(\theta_j)
\propto
\exp\left(-\frac{\theta_j^2}{2\tau^2}\right)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :先验分布的尺度参数。 :维度、参数或类别索引。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.71
R_{L2}(\theta)\propto\sum_j\theta_j^2变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.72
p(\theta_j)\propto\exp(-\lambda|\theta_j|)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :维度、参数或类别索引。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.73
R_{L1}(\theta)\propto\sum_j|\theta_j|变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.74
1583\times128\approx202624变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.75
\log D(x)变量解释:
:GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.76
\min_G\max_D V(D,G)变量解释:
:GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。
实例: 可以把生成器想成“造假者”,判别器想成“鉴定者”。鉴定者不断学习识别真假,生成器不断学习制造更像真实数据的样本,两边交替更新。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.77
\sum_{k=1}^{K}p(y=k\mid x,D)=1变量解释:
:GAN 的判别器;在距离公式中也可表示距离函数。 :类别总数。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.78
H[p]
=
-\sum_{k=1}^{K}p_k\log p_k变量解释:
:熵,用来描述概率分布的不确定性。 :类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.79
\mathbf p=(p_1,\ldots,p_K),
\qquad
\sum_{k=1}^{K}p_k=1变量解释:
:类别概率向量。 :类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.80
H(\mathbf p)=-\sum_{k=1}^{K}p_k\log p_k变量解释:
:类别概率向量。 :熵,用来描述概率分布的不确定性。 :类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.81
H(1,0,\ldots,0)=0变量解释:
:熵,用来描述概率分布的不确定性。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.82
p_k=\frac1K变量解释:
:类别总数。 :类别或向量分量索引。 :模型预测属于第 类的概率。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.83
H(\mathbf p)
=-K\cdot\frac1K\log\frac1K
=\log K变量解释:
:类别概率向量。 :熵,用来描述概率分布的不确定性。 :类别总数。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.84
H[p(y\mid x_i,D)]
=
-\sum_{k=1}^{K}
p(y=k\mid x_i,D)
\log p(y=k\mid x_i,D)变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :类别总数。 :样本索引。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.85
E_{x\sim X}
[H[p(y\mid x,D)]]
=
\frac{1}{N}
\sum_{i=1}^{N}
H[p(y\mid x_i,D)]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.86
\bar p_D(y=k)
=
\mathbb E_{x\sim X}
[p(y=k\mid x,D)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :GAN 的判别器;在距离公式中也可表示距离函数。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.87
\bar p_D(y=k)
\approx
\frac1N\sum_{i=1}^{N}p(y=k\mid x_i,D)变量解释:
:GAN 的判别器;在距离公式中也可表示距离函数。 :样本总数或求和项总数。 :样本索引。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.88
H_X[p(y\mid D)]
=
-\sum_{k=1}^{K}
\bar p_D(y=k)
\log\bar p_D(y=k)变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :类别总数。 :类别或向量分量索引。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.89
\mathbb E_{x\sim X}
[H(p(y\mid x,D))]
=
\frac1N\sum_{i=1}^{N}
\left[
-\sum_{k=1}^{K}
p(y=k\mid x_i,D)
\log p(y=k\mid x_i,D)
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :样本总数或求和项总数。 :类别总数。 :样本索引。 :类别或向量分量索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.90
I(X;Y\mid D)= H_X[p(y\mid D)]-
\mathbb E_{x\sim X}[H(p(y\mid x,D))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.91
E_{z\sim P(z)}
[H[p(y\mid G(z),D)]]
\approx
\frac{1}{M}
\sum_{i=1}^{M}
H[p(y\mid G(z_i),D)]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :minibatch 大小;在 JS 散度中也可表示混合分布。 :样本索引。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.92
\mathbb E_{z\sim P(z)}[g(z)]
=
\int P(z)g(z)\,dz变量解释:
:期望,即按照相应概率分布进行加权平均。 :一般函数;在 VAE 中也可表示重参数化映射。 :隐变量 / 潜变量。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.93
z_i\overset{\text{i.i.d.}}{\sim}P(z)变量解释:
:潜变量或向量的维度。 :样本索引。 :隐变量 / 潜变量。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.94
\frac1M\sum_{i=1}^{M}g(z_i)变量解释:
:一般函数;在 VAE 中也可表示重参数化映射。 :minibatch 大小;在 JS 散度中也可表示混合分布。 :样本索引。 :隐变量 / 潜变量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.95
g(z)=H[p(y\mid G(z),D)]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.96
L_D
=
\max_D
\left[H_X[p(y\mid D)]-
E_{x\sim X}[H[p(y\mid x,D)]]
+E_{z\sim P(z)}[H[p(y\mid G(z),D)]]\right]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.97
H_X[p(y\mid D)]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.98
\mathbb E_{x\sim X}
[H(p(y\mid x,D))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.99
-\mathbb E_{x\sim X}
[H(p(y\mid x,D))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.100
+\mathbb E_{z\sim P(z)}
[H(p(y\mid G(z),D))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.101
L_D
=
\max_D
\left[
H_X[p(y\mid D)]- \mathbb E_{x\sim X}[H(p(y\mid x,D))]
+\mathbb E_{z\sim P(z)}[H(p(y\mid G(z),D))]
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.102
H_G[p(y\mid D)]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.103
\mathbb E_{z\sim P(z)}
[H(p(y\mid G(z),D))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.104
I(Y;G(Z)\mid D)
=
H(Y\mid D)-H(Y\mid G(Z),D)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.105
z\sim P(z),\qquad x_{\text{fake}}=G(z)变量解释:
:GAN 的生成器。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.106
R(f)
=
E_{(x,y)\sim P}
[\ell(f(x),y)]变量解释:
:对数似然或单样本损失,具体由上下文决定。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.107
R(f)
=
\mathbb E_{(X,Y)\sim P}
[\ell(f(X),Y)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :对数似然或单样本损失,具体由上下文决定。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.108
R(f)
=
\iint
\ell(f(x),y)
p(x,y)\,dx\,dy变量解释:
:对数似然或单样本损失,具体由上下文决定。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.109
\hat R(f)
=
\frac{1}{n}
\sum_{i=1}^{n}
\ell(f(x_i),y_i)变量解释:
:对数似然或单样本损失,具体由上下文决定。 :经验风险,即训练样本上的平均损失。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.110
\hat R_n(f)
=
\frac1n\sum_{i=1}^{n}
\ell(f(x_i),y_i)
\approx
R(f)变量解释:
:对数似然或单样本损失,具体由上下文决定。 :经验风险,即训练样本上的平均损失。 :风险函数或正则项,具体含义由当前公式决定。 :函数或预测模型。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.111
c=f(x)变量解释:
:函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.112
h^{(1)}=\rho(W_1x+b_1)变量解释:
:观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.113
h^{(2)}=\rho(W_2h^{(1)}+b_2)变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.114
c=W_3h^{(2)}+b_3变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.115
\hat x=g(c)变量解释:
:一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.116
q_\phi(z\mid x)变量解释:
:编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.117
p_\theta(x\mid z)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.118
p_\theta(x)
=
\int p_\theta(x\mid z)p(z)\,dz变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.119
p_\theta(x,z)
=
p_\theta(x\mid z)p(z)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :参数为 时观测变量与潜变量的联合分布。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.120
p_\theta(x)
=
\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.121
D_{\mathrm{KL}}(P\|Q)
=
\sum_{x\in X}
P(x)
\log
\frac{P(x)}{Q(x)}变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.122
[-\log Q(x)]-[-\log P(x)]
=
\log\frac{P(x)}{Q(x)}变量解释:
:观测数据 / 输入样本。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.123
\mathbb E_{x\sim P}
\left[
\log\frac{P(x)}{Q(x)}
\right]
=
D_{\mathrm{KL}}(P\|Q)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.124
D_{\mathrm{KL}}(P\|Q)
=
\int
p(x)
\log
\frac{p(x)}{q(x)}
\,dx变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.125
D_{\mathrm{KL}}(P\|Q)\ge0变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.126
D_{\mathrm{KL}}(P\|Q)\ne D_{\mathrm{KL}}(Q\|P)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.127
D_{\mathrm{KL}}(P\|Q)
=
-\mathbb E_{x\sim P}
\left[
\log\frac{Q(x)}{P(x)}
\right]变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.128
\mathbb E_P
\left[
\log\frac{Q(X)}{P(X)}
\right]
\le
\log
\mathbb E_P
\left[
\frac{Q(X)}{P(X)}
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.129
\mathbb E_P
\left[
\frac{Q(X)}{P(X)}
\right]
=
\sum_x P(x)\frac{Q(x)}{P(x)}
=
\sum_xQ(x)
=1变量解释:
:期望,即按照相应概率分布进行加权平均。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.130
\mathbb E_P
\left[
\log\frac{Q(X)}{P(X)}
\right]
\le
\log1=0变量解释:
:期望,即按照相应概率分布进行加权平均。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.131
M=\frac{1}{2}(P+Q)变量解释:
:minibatch 大小;在 JS 散度中也可表示混合分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.132
JS(P\|Q)=JS(Q\|P)变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.133
M=\frac12(P+Q)变量解释:
:minibatch 大小;在 JS 散度中也可表示混合分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.134
L(\theta)
=
\prod_{i=1}^{n}
p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 假设模型认为三个已经观察到的独立样本概率分别为 0.5、0.4、0.8,那么这组数据的似然是
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.135
x_1,\ldots,x_n\overset{\text{i.i.d.}}{\sim}p(x;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :潜变量或向量的维度。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 看到
B.136
p(x_1,\ldots,x_n;\theta)
=
\prod_{i=1}^{n}p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.137
L(\theta;x_1,\ldots,x_n)
=
\prod_{i=1}^{n}p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.138
\hat\theta_{\mathrm{MLE}}
=
\mathop{\mathrm{arg\,max}}_\theta L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数 的估计值。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.139
L(\theta)
=
\prod_{i=1}^{n}
f(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :函数或预测模型。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.140
\log L(\theta)
=
\sum_{i=1}^{n}
\log f(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :函数或预测模型。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.141
L(\theta_1)>L(\theta_2)
\Longleftrightarrow
\log L(\theta_1)>\log L(\theta_2)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.142
\mathop{\mathrm{arg\,max}}_\theta L(\theta)
=
\mathop{\mathrm{arg\,max}}_\theta\log L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.143
\log L(\theta)
=
\sum_{i=1}^{n}\log p(x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.144
\hat{\theta}
=
\mathop{\mathrm{arg\,max}}_{\theta} L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.145
\frac{d}{d\theta}\log L(\theta)=0变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :潜变量或向量的维度。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.146
f(x;\mu,\sigma^2)
=
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp
\left[
-\frac{(x-\mu)^2}{2\sigma^2}
\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.147
L(\mu,\sigma^2)
=
(2\pi)^{-n/2}
(\sigma^2)^{-n/2}
\exp
\left[
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)^2
\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.148
p(x_i\mid\mu,\sigma^2)
=
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp\left[-\frac{(x_i-\mu)^2}{2\sigma^2}\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.149
L(\mu,\sigma^2)
=
\prod_{i=1}^{n}
\frac{1}{\sqrt{2\pi\sigma^2}}
\exp\left[-\frac{(x_i-\mu)^2}{2\sigma^2}\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.150
\prod_{i=1}^{n}
\frac{1}{\sqrt{2\pi\sigma^2}}
=
(2\pi\sigma^2)^{-n/2}变量解释:
:方差。 :圆周率。 :样本索引。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.151
\prod_{i=1}^{n}
\exp\left[-\frac{(x_i-\mu)^2}{2\sigma^2}\right]
=
\exp\left[
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)^2
\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.152
L(\mu,\sigma^2)
=
(2\pi\sigma^2)^{-n/2}
\exp\left[
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)^2
\right]变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.153
\log L
=
-\frac{n}{2}\log(2\pi)
-\frac{n}{2}\log\sigma^2
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)^2变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.154
\ell(\mu,\sigma^2)
=
\log L(\mu,\sigma^2)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.155
\log(a^b)=b\log a,
\qquad
\log(e^u)=u变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.156
\ell(\mu,\sigma^2)
=
-\frac n2\log(2\pi)
-\frac n2\log\sigma^2
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)^2变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :圆周率。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.157
\hat{\mu}=\bar{X}变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.158
\bar{X}
=
\frac{1}{n}
\sum_{i=1}^{n}X_i变量解释:
:样本索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.159
\hat\sigma^2
=
\frac{1}{n}
\sum_{i=1}^{n}
(X_i-\bar{X})^2变量解释:
:方差。 :标准差 的估计值。 :样本索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.160
\frac{\partial\ell}{\partial\mu}
=
-\frac{1}{2\sigma^2}
\sum_{i=1}^{n}
2(x_i-\mu)(-1)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.161
\frac{\partial\ell}{\partial\mu}
=
\frac{1}{\sigma^2}
\sum_{i=1}^{n}(x_i-\mu)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.162
\sum_{i=1}^{n}(x_i-\mu)=0变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.163
\sum_{i=1}^{n}x_i-n\mu=0变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.164
\hat\mu
=
\frac1n\sum_{i=1}^{n}x_i
=
\bar x变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :均值 的估计值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.165
v=\sigma^2变量解释:
:方差。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.166
\ell(v)
=
-\frac n2\log v
-\frac{1}{2v}
\sum_{i=1}^{n}(x_i-\mu)^2
+
\text{常数}变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.167
\frac{\partial\ell}{\partial v}
=
-\frac{n}{2v}
+
\frac{1}{2v^2}
\sum_{i=1}^{n}(x_i-\mu)^2变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :对数似然或单样本损失,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.168
-nv+
\sum_{i=1}^{n}(x_i-\mu)^2
=0变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.169
\hat v
=
\frac1n
\sum_{i=1}^{n}(x_i-\mu)^2变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.170
\hat\sigma^2_{\mathrm{MLE}}
=
\frac1n\sum_{i=1}^{n}(x_i-\bar x)^2变量解释:
:方差。 :标准差 的估计值。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.171
u=u(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.172
\hat u=u(\hat\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数 的估计值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.173
E[f(X)]
\ge
f(E[X])变量解释:
:函数或预测模型。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.174
\bar x
=
\lambda x_1+(1-\lambda)x_2变量解释:
:正则项或某个损失项的权重系数。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.175
f(\lambda x_1+(1-\lambda)x_2)
\le
\lambda f(x_1)+(1-\lambda)f(x_2)变量解释:
:正则项或某个损失项的权重系数。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.176
\sum_i p_i=1变量解释:
:样本索引。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.177
f\left(\sum_i p_ix_i\right)
\le
\sum_i p_if(x_i)变量解释:
:函数或预测模型。 :样本索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.178
f(\mathbb E[X])
\le
\mathbb E[f(X)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :函数或预测模型。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.179
\frac{d^2}{dx^2}\log x
=
-\frac1{x^2}<0
\qquad(x>0)变量解释:
:潜变量或向量的维度。 :观测数据 / 输入样本。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.180
\log\mathbb E[U]
\ge
\mathbb E[\log U]变量解释:
:期望,即按照相应概率分布进行加权平均。
实例: 可以把它理解成:先取平均再取对数,与先取对数再平均并不相同。因为
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.181
E[f(X)]
\le
f(E[X])变量解释:
:函数或预测模型。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.182
x=(x_1,x_2,\ldots,x_n)变量解释:
:观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.183
z=(z_1,z_2,\ldots,z_n)变量解释:
:隐变量 / 潜变量。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.184
\log L(\theta)
=
\sum_{i=1}^{n}
\log
\sum_{z_i}
p(x_i,z_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.185
\log p(x;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.186
p(x;\theta)
=
\sum_z p(x,z;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.187
\log p(x;\theta)
=
\log\sum_z p(x,z;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.188
Q_i(z_i)变量解释:
:样本索引。 :隐变量 / 潜变量。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.189
\sum_{z_i}Q_i(z_i)=1变量解释:
:样本索引。 :隐变量 / 潜变量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.190
Q(z)\ge0,
\qquad
\sum_zQ(z)=1变量解释:
:隐变量 / 潜变量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.191
\sum_z p(x,z;\theta)
=
\sum_z
Q(z)
\frac{p(x,z;\theta)}{Q(z)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.192
\sum_z
Q(z)
\frac{p(x,z;\theta)}{Q(z)}
=
\mathbb E_{z\sim Q}
\left[
\frac{p(x,z;\theta)}{Q(z)}
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.193
\log
\sum_{z_i}
Q_i(z_i)
\frac{p(x_i,z_i;\theta)}{Q_i(z_i)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.194
\log
\sum_{z_i}
Q_i(z_i)
\frac{p(x_i,z_i;\theta)}{Q_i(z_i)}
\ge
\sum_{z_i}
Q_i(z_i)
\log
\frac{p(x_i,z_i;\theta)}{Q_i(z_i)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.195
\sum_{i=1}^{n}
\log
\sum_{z_i}
p(x_i,z_i;\theta)
\ge
\sum_{i=1}^{n}
\sum_{z_i}
Q_i(z_i)
\log
\frac{p(x_i,z_i;\theta)}{Q_i(z_i)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.196
\log p(x;\theta)
=
\log
\mathbb E_{z\sim Q}
\left[
\frac{p(x,z;\theta)}{Q(z)}
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.197
\log p(x;\theta)
\ge
\mathbb E_{z\sim Q}
\left[
\log
\frac{p(x,z;\theta)}{Q(z)}
\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.198
\log p(x;\theta)
\ge
\sum_zQ(z)
\log\frac{p(x,z;\theta)}{Q(z)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.199
\mathcal F(Q,\theta)
=
\sum_zQ(z)
\log\frac{p(x,z;\theta)}{Q(z)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.200
\mathcal F(Q,\theta)
=
\sum_zQ(z)\log p(x,z;\theta)
-
\sum_zQ(z)\log Q(z)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.201
H(Q)
=-\sum_zQ(z)\log Q(z)变量解释:
:熵,用来描述概率分布的不确定性。 :隐变量 / 潜变量。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.202
\mathcal F(Q,\theta)
=
\mathbb E_Q[\log p(x,z;\theta)]
+
H(Q)变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :熵,用来描述概率分布的不确定性。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.203
Q_i(z_i)
=
p(z_i\mid x_i,\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.204
p(z\mid x;\theta)
=
\frac{p(x,z;\theta)}{p(x;\theta)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.205
\log p(x,z;\theta)
=
\log p(z\mid x;\theta)
+
\log p(x;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.206
\mathcal F(Q,\theta)
=
\mathbb E_Q
[\log p(z\mid x;\theta)]
+
\log p(x;\theta)
-
\mathbb E_Q[\log Q(z)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.207
D_{\mathrm{KL}}
\bigl(Q(z)\|p(z\mid x;\theta)\bigr)
=
\mathbb E_Q
\left[
\log\frac{Q(z)}{p(z\mid x;\theta)}
\right]变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.208
\log p(x;\theta)
=
\mathcal F(Q,\theta)
+
D_{\mathrm{KL}}
\bigl(Q(z)\|p(z\mid x;\theta)\bigr)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.209
Q(z)=p(z\mid x;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.210
Q_j(z)=p(z\mid x;\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.211
Q_i(z_i)
=
\frac{p(x_i,z_i;\theta)}
{\sum_{z_i'}p(x_i,z_i';\theta)}
=
p(z_i\mid x_i;\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.212
\theta_{j+1}
=
\mathop{\mathrm{arg\,max}}_{\theta}
\sum_{i=1}^{n}
\sum_{z_i}
Q_i(z_i)
\log
\frac{p(x_i,z_i;\theta)}{Q_i(z_i)}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.213
\mathcal F(Q_j,\theta)
=
\mathbb E_{Q_j}[\log p(x,z;\theta)]
+
H(Q_j)变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :熵,用来描述概率分布的不确定性。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.214
\theta_{j+1}
=
\mathop{\mathrm{arg\,max}}_\theta
\mathbb E_{z\sim p(z\mid x;\theta_j)}
[\log p(x,z;\theta)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.215
Q(\theta\mid\theta_j)
=
\mathbb E_{z\sim p(z\mid x;\theta_j)}
[\log p(x,z;\theta)]变量解释:
:期望,即按照相应概率分布进行加权平均。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.216
\theta_{j+1}
=
\mathop{\mathrm{arg\,max}}_\theta
Q(\theta\mid\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.217
\mathcal F(Q_j,\theta_j)
=
\log p(x;\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.218
\mathcal F(Q_j,\theta_{j+1})
\ge
\mathcal F(Q_j,\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.219
\log p(x;\theta_{j+1})
\ge
\mathcal F(Q_j,\theta_{j+1})变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.220
\log p(x;\theta_{j+1})
\ge
\log p(x;\theta_j)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.221
\log p_\theta(x)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.222
p_\theta(x)
=
\int p_\theta(x,z)\,dz
=
\int p_\theta(x\mid z)p(z)\,dz变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.223
p_\theta(z\mid x)
=
\frac{p_\theta(x\mid z)p(z)}{p_\theta(x)}变量解释:
:模型在给定观测 时的真实后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.224
\log p_\theta(x)
=
\log
\int
q_\phi(z\mid x)
\frac{p_\theta(x,z)}
{q_\phi(z\mid x)}
\,dz变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.225
\log p_\theta(x)
=
\log\int p_\theta(x,z)\,dz变量解释:
:参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.226
\log p_\theta(x)
=
\log\int
q_\phi(z\mid x)
\frac{p_\theta(x,z)}{q_\phi(z\mid x)}
\,dz变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.227
\log p_\theta(x)
=
\log
\mathbb E_{z\sim q_\phi(z\mid x)}
\left[
\frac{p_\theta(x,z)}{q_\phi(z\mid x)}
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.228
\log p_\theta(x)
\ge
\mathbb E_{q_\phi(z\mid x)}
\left[
\log
\frac{p_\theta(x,z)}{q_\phi(z\mid x)}
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.229
\mathcal L(\theta,\phi;x)
=
\mathbb E_{q_\phi(z\mid x)}
\left[
\log p_\theta(x,z)
-
\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.230
\log p_\theta(x)
\ge
\mathcal L(\theta,\phi;x)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.231
\log p_\theta(x)
\ge
\int
q_\phi(z\mid x)
\log
\frac{p_\theta(x,z)}
{q_\phi(z\mid x)}
\,dz变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.232
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|p_\theta(z\mid x)
\right)
=
\mathbb E_q
\left[
\log\frac{q_\phi(z\mid x)}{p_\theta(z\mid x)}
\right]变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.233
p_\theta(z\mid x)
=
\frac{p_\theta(x,z)}{p_\theta(x)}变量解释:
:模型在给定观测 时的真实后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.234
D_{\mathrm{KL}}(q\|p_\theta(z\mid x))
=
\mathbb E_q
\left[
\log q_\phi(z\mid x)
-
\log p_\theta(x,z)
+
\log p_\theta(x)
\right]变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.235
D_{\mathrm{KL}}(q\|p_\theta(z\mid x))
=
\log p_\theta(x)
-
\mathcal L(\theta,\phi;x)变量解释:
:模型在给定观测 时的真实后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.236
\boxed{
\log p_\theta(x)
=
\mathcal L(\theta,\phi;x)
+
D_{\mathrm{KL}}
\left(
q_\phi(z\mid x)
\|p_\theta(z\mid x)
\right)
}变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.237
D_{\mathrm{KL}}(q\|p_\theta(z\mid x))\ge0变量解释:
:模型在给定观测 时的真实后验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.238
\mathcal L(\theta,\phi;x)
\le
\log p_\theta(x)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.239
q_\phi(z\mid x)=p_\theta(z\mid x)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.240
\mathrm{ELBO}(\theta,\phi)
=
\mathbb{E}_{q_\phi(z\mid x)}
\left[
\log p_\theta(x,z)
-
\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.241
\mathrm{ELBO}(\theta,\phi)
=
\mathbb{E}_{z\sim q_\phi(z\mid x)}
\!\left[\log p_\theta(x\mid z)\right]
-
D_{\mathrm{KL}}\!\left(
q_\phi(z\mid x)\,\|\,p(z)
\right)变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.242
\mathcal L
=
\mathbb E_q
\left[
\log p_\theta(x,z)-\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :参数为 时观测变量与潜变量的联合分布。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.243
p_\theta(x,z)=p_\theta(x\mid z)p(z)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :参数为 时观测变量与潜变量的联合分布。 :潜变量的先验分布。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.244
\mathcal L
=
\mathbb E_q
\left[
\log p_\theta(x\mid z)
+
\log p(z)
-
\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.245
\mathcal L
=
\mathbb E_q[\log p_\theta(x\mid z)]
+
\mathbb E_q
\left[
\log p(z)-\log q_\phi(z\mid x)
\right]变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.246
\mathbb E_q
\left[
\log p(z)-\log q_\phi(z\mid x)
\right]
=
-\mathbb E_q
\left[
\log\frac{q_\phi(z\mid x)}{p(z)}
\right]变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.247
D_{\mathrm{KL}}
(q_\phi(z\mid x)\|p(z))
=
\mathbb E_q
\left[
\log\frac{q_\phi(z\mid x)}{p(z)}
\right]变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.248
\boxed{
\mathcal L(\theta,\phi;x)
=
\mathbb E_{q_\phi(z\mid x)}
[\log p_\theta(x\mid z)]
-
D_{\mathrm{KL}}
(q_\phi(z\mid x)\|p(z))
}变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.249
q_\phi(z\mid x)
=
\mathcal N
\left(
\mu,\mathrm{diag}(\sigma_1^2,\ldots,\sigma_d^2)
\right)变量解释:
:编码器给出的近似后验分布。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :样本总数或求和项总数。 :潜变量或向量的维度。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.250
p(z)=\mathcal N(0,I)变量解释:
:潜变量的先验分布。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.251
q(z)=\mathcal N(\mu,\sigma^2),
\qquad
p(z)=\mathcal N(0,1)变量解释:
:潜变量的先验分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本总数或求和项总数。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.252
D_{\mathrm{KL}}(q\|p)
=
\mathbb E_q[\log q(z)-\log p(z)]变量解释:
:潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :GAN 的判别器;在距离公式中也可表示距离函数。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.253
\log q(z)
=
-\frac12\log(2\pi\sigma^2)
-
\frac{(z-\mu)^2}{2\sigma^2}变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :圆周率。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.254
\log p(z)
=
-\frac12\log(2\pi)
-
\frac{z^2}{2}变量解释:
:潜变量的先验分布。 :圆周率。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.255
\mathbb E_q[(z-\mu)^2]=\sigma^2变量解释:
:期望,即按照相应概率分布进行加权平均。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.256
\mathbb E_q[z^2]
=
\mathrm{Var}(z)+(\mathbb E[z])^2
=
\sigma^2+\mu^2变量解释:
:期望,即按照相应概率分布进行加权平均。 :方差算子。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.257
D_{\mathrm{KL}}
(\mathcal N(\mu,\sigma^2)\|\mathcal N(0,1))
=
\frac12
\left(
\mu^2+\sigma^2-\log\sigma^2-1
\right)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :GAN 的判别器;在距离公式中也可表示距离函数。 :样本总数或求和项总数。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.258
\boxed{
D_{\mathrm{KL}}(q\|p)
=
\frac12
\sum_{j=1}^{d}
\left(
\mu_j^2+
\sigma_j^2-
\log\sigma_j^2-
1
\right)
}变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :GAN 的判别器;在距离公式中也可表示距离函数。 :潜变量或向量的维度。 :维度、参数或类别索引。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.259
L_{\mathrm{KL}}
=
-\frac12
\sum_{j=1}^{d}
\left(
1+
\log\sigma_j^2-
\mu_j^2-
\sigma_j^2
\right)变量解释:
:VAE 中由 KL 散度得到的正则项。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :潜变量或向量的维度。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.260
\log p_\theta(x)
=
\mathrm{ELBO}(\theta,\phi)
+
D_{\mathrm{KL}}\!\left(
q_\phi(z\mid x)\,\|\,p_\theta(z\mid x)
\right)变量解释:
:模型在给定观测 时的真实后验分布。 :编码器给出的近似后验分布。 :模型对观测 给出的边缘概率 / 边缘似然。 :KL 散度,用来衡量两个概率分布之间的差异。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.261
D_{\mathrm{KL}}\!\left(
q_\phi(z\mid x)\,\|\,p(z)
\right)变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.262
p(\epsilon)
=
\mathcal{N}(\epsilon;0,I)变量解释:
:互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.263
q_\phi(z\mid x^{(i)})
=
N\!\left(
z;
\mu^{(i)},
(\sigma^{(i)})^2I
\right)变量解释:
:标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.264
p(z)=\mathcal{N}(z;0,I)变量解释:
:潜变量的先验分布。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.265
z
=
\mu+\sigma\odot\epsilon变量解释:
:标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :逐元素乘法(Hadamard product)。 :隐变量 / 潜变量。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.266
\varepsilon\sim\mathcal N(0,I)变量解释:
:从标准正态分布采样的随机噪声。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.267
z=\mu+\sigma\odot\varepsilon变量解释:
:从标准正态分布采样的随机噪声。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :逐元素乘法(Hadamard product)。 :隐变量 / 潜变量。
实例: 假设编码器输出
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.268
\mathbb E[\varepsilon]=0,
\qquad
\mathrm{Var}(\varepsilon)=1变量解释:
:期望,即按照相应概率分布进行加权平均。 :方差算子。 :从标准正态分布采样的随机噪声。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.269
\mathbb E[z]
=
\mathbb E[\mu+\sigma\varepsilon]
=
\mu变量解释:
:期望,即按照相应概率分布进行加权平均。 :从标准正态分布采样的随机噪声。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :隐变量 / 潜变量。
实例: 假设编码器输出
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.270
\mathrm{Var}(z)
=
\mathrm{Var}(\sigma\varepsilon)
=
\sigma^2\mathrm{Var}(\varepsilon)
=
\sigma^2变量解释:
:方差算子。 :从标准正态分布采样的随机噪声。 :方差。 :标准差。 :隐变量 / 潜变量。
实例: 若数据是 4、5、6,均值为 5。三个偏差分别为 -1、0、1,平方后为 1、0、1,因此总体方差为
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.271
z\sim\mathcal N(\mu,\sigma^2)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本总数或求和项总数。 :隐变量 / 潜变量。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.272
z\sim
\mathcal N
(\mu,\mathrm{diag}(\sigma^2))变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :样本总数或求和项总数。 :隐变量 / 潜变量。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.273
\mathbb E_{z\sim q_\phi(z\mid x)}
[f_\theta(z)]变量解释:
:编码器给出的近似后验分布。 :期望,即按照相应概率分布进行加权平均。 :变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :用于近似目标分布的辅助 / 变分分布。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.274
z=g_\phi(x,\varepsilon)
=
\mu_\phi(x)+
\sigma_\phi(x)\odot\varepsilon,
\qquad
\varepsilon\sim\mathcal N(0,I)变量解释:
:从标准正态分布采样的随机噪声。 :标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :逐元素乘法(Hadamard product)。 :互信息或信息量,具体含义由当前公式决定。 :一般函数;在 VAE 中也可表示重参数化映射。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
实例: 假设编码器输出
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.275
\mathbb E_{\varepsilon\sim\mathcal N(0,I)}
[f_\theta(g_\phi(x,\varepsilon))]变量解释:
:期望,即按照相应概率分布进行加权平均。 :从标准正态分布采样的随机噪声。 :变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :互信息或信息量,具体含义由当前公式决定。 :参数为 的模型函数。 :函数或预测模型。 :一般函数;在 VAE 中也可表示重参数化映射。 :样本总数或求和项总数。 :观测数据 / 输入样本。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.276
\phi
\to
\mu_\phi,\sigma_\phi
\to
z
\to
f_\theta(z)变量解释:
:标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :隐变量 / 潜变量。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.277
z
=
\mu
+
\epsilon\odot
\exp\left(\frac{\log\sigma^2}{2}\right)变量解释:
:方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :逐元素乘法(Hadamard product)。 :隐变量 / 潜变量。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.278
\text{logvar}=\log\sigma^2变量解释:
:方差。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.279
\sigma^2=\exp(\text{logvar})变量解释:
:方差。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.280
\sigma
=
\sqrt{\sigma^2}
=
\exp\left(\frac12\text{logvar}\right)变量解释:
:方差。 :标准差。
实例: 若方差是 9,那么标准差就是
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.281
z
=
\mu+
\varepsilon\odot
\exp\left(\frac12\text{logvar}\right)变量解释:
:从标准正态分布采样的随机噪声。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :逐元素乘法(Hadamard product)。 :隐变量 / 潜变量。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.282
\bar{L}^{B}(\theta,\phi;x^{(i)})
=
-KL\!\left(
q_\phi(z\mid x^{(i)})
\|p_\theta(z)
\right)
+
\frac{1}{L}
\sum_{l=1}^{L}
\log p_\theta
\left(
x^{(i)}
\mid
z^{(i,l)}
\right)变量解释:
:变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.283
\mathcal L(x)
=
- D_{\mathrm{KL}}(q_\phi(z\mid x)\|p(z))
+
\mathbb E_{z\sim q_\phi(z\mid x)}
[\log p_\theta(x\mid z)]变量解释:
:编码器给出的近似后验分布。 :给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :期望,即按照相应概率分布进行加权平均。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.284
z^{(l)}
=
g_\phi(x,\varepsilon^{(l)}),
\qquad
l=1,\ldots,L变量解释:
:从标准正态分布采样的随机噪声。 :变分分布 / 编码器的参数。 :一般函数;在 VAE 中也可表示重参数化映射。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.285
\mathbb E_q[\log p_\theta(x\mid z)]
\approx
\frac1L\sum_{l=1}^{L}
\log p_\theta(x\mid z^{(l)})变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :期望,即按照相应概率分布进行加权平均。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.286
\bar{\mathcal L}(x)
=
-D_{\mathrm{KL}}(q_\phi(z\mid x)\|p(z))
+
\frac1L\sum_{l=1}^{L}
\log p_\theta(x\mid z^{(l)})变量解释:
:编码器给出的近似后验分布。 :潜变量的先验分布。 :KL 散度,用来衡量两个概率分布之间的差异。 :目标函数或证据下界(具体含义由当前小节决定)。 :变分分布 / 编码器的参数。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :蒙特卡洛采样索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。 :用于近似目标分布的辅助 / 变分分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.287
\mathcal L_{\mathrm{total}}
=
\sum_{i=1}^{N}\mathcal L(x_i)变量解释:
:目标函数或证据下界(具体含义由当前小节决定)。 :总训练目标 / 总损失。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.288
\sum_{i\in\mathcal B}\mathcal L(x_i)变量解释:
:目标函数或证据下界(具体含义由当前小节决定)。 :当前 minibatch 中的样本索引集合。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.289
\widehat{\mathcal L}_{\mathrm{total}}
=
\frac{N}{M}
\sum_{i\in\mathcal B}\mathcal L(x_i)变量解释:
:目标函数或证据下界(具体含义由当前小节决定)。 :当前 minibatch 中的样本索引集合。 :样本总数或求和项总数。 :minibatch 大小;在 JS 散度中也可表示混合分布。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.290
p_\theta(x_i\mid z)
=
y_i^{x_i}
(1-y_i)^{1-x_i}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.291
p_\theta(x_i\mid z)
=
y_i^{x_i}(1-y_i)^{1-x_i}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.292
-\log p_\theta(x_i\mid z)
=
-\left[
x_i\log y_i
+
(1-x_i)\log(1-y_i)
\right]变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.293
L_{\mathrm{recon}}
=
-\sum_i
\left[
x_i\log y_i
+
(1-x_i)\log(1-y_i)
\right]变量解释:
:VAE 的重构损失。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.294
p_\theta(x^{(i)}\mid z)
=
N
\left(
x^{(i)};
\mu'^{(i)},
(\sigma'^{(i)})^2I
\right)变量解释:
:标准差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.295
p_\theta(x\mid z)
=
\mathcal N(x;\mu_\theta(z),\sigma^2I)变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :互信息或信息量,具体含义由当前公式决定。 :样本总数或求和项总数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.296
-\log p_\theta(x\mid z)
=
\text{常数}
+
\frac{1}{2\sigma^2}
\lVert x-\mu_\theta(z)\rVert_2^2变量解释:
:给定潜变量 时生成观测 的条件分布,也就是解码器分布。 :方差。 :均值;在 VAE 中通常指编码器输出的潜变量均值。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.297
\mu=W_7h+b_7变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.298
y=Wh+b变量解释:
:标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.299
y_j
=
\sum_{k=1}^{m}W_{jk}h_k+b_j变量解释:
:维度、参数或类别索引。 :类别或向量分量索引。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.300
\sigma=W_8h+b_8变量解释:
:标准差。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.301
\mu'=W_4h'+b_4变量解释:
:均值;在 VAE 中通常指编码器输出的潜变量均值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.302
\sigma'=W_5h'+b_5变量解释:
:标准差。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.303
x_i\approx x_j变量解释:
:样本索引。 :维度、参数或类别索引。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.304
f(x_i)\approx f(x_j)变量解释:
:函数或预测模型。 :样本索引。 :维度、参数或类别索引。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.305
f(x_i)=f(x_j)=\hat y变量解释:
:模型预测值或预测为正类的概率。 :函数或预测模型。 :样本索引。 :维度、参数或类别索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.306
x'=T(x)变量解释:
:对输入施加的数据增强或扰动变换。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.307
f_\theta(x')\approx f_\theta(x)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.308
L_{\mathrm{cons}}
=
D\bigl(f_\theta(x),f_\theta(T(x))\bigr)变量解释:
:一致性正则损失。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :对输入施加的数据增强或扰动变换。 :参数为 的模型函数。 :函数或预测模型。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。
实例: 例如把同一张猫的图片轻微裁剪、翻转或加一点噪声,模型前后都应该仍然倾向预测为猫。如果两次输出差很多,一致性损失就会变大。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.309
L_{\mathrm{total}}
=
L_{\mathrm{sup}}
+
\lambda_{\mathrm{cons}}L_{\mathrm{cons}}变量解释:
:一致性正则损失。 :有标签数据上的监督损失。 :总训练目标 / 总损失。 :一致性损失的权重系数。 :正则项或某个损失项的权重系数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 例如把同一张猫的图片轻微裁剪、翻转或加一点噪声,模型前后都应该仍然倾向预测为猫。如果两次输出差很多,一致性损失就会变大。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.310
d_{\text{MSE}}
(f(x_i),f(x_j))
=
\frac{1}{C}
\sum_{k=1}^{C}
\left[
f_k(x_i)-f_k(x_j)
\right]^2变量解释:
:函数或预测模型。 :向量维度或类别数。 :潜变量或向量的维度。 :样本索引。 :维度、参数或类别索引。 :类别或向量分量索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.311
f(x_i)
=
(f_1(x_i),\ldots,f_C(x_i))变量解释:
:函数或预测模型。 :向量维度或类别数。 :样本索引。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.312
\lVert f(x_i)-f(x_j)\rVert_2^2
=
\sum_{k=1}^{C}
[f_k(x_i)-f_k(x_j)]^2变量解释:
:函数或预测模型。 :向量维度或类别数。 :样本索引。 :维度、参数或类别索引。 :类别或向量分量索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.313
d_{\mathrm{MSE}}
=
\frac1C
\sum_{k=1}^{C}
[f_k(x_i)-f_k(x_j)]^2变量解释:
:均方误差。 :函数或预测模型。 :向量维度或类别数。 :潜变量或向量的维度。 :样本索引。 :维度、参数或类别索引。 :类别或向量分量索引。 :观测数据 / 输入样本。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.314
\min \lVert X-X' \rVert_2^2变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.315
\lVert X-X'\rVert_2^2
=
\sum_j(X_j-X_j')^2变量解释:
:维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.316
\min\lVert X-X'\rVert_2^2变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 这条公式主要用于定义当前概念。实际使用时先确定每个符号对应的数据或参数,再代入数值或模型输出进行计算。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.317
H=f(x)变量解释:
:熵,用来描述概率分布的不确定性。 :函数或预测模型。 :观测数据 / 输入样本。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.318
\text{总目标} = \text{监督部分}+ \text{无监督部分}+ \text{模型约束}变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.319
-\log P(\mathbf y\mid\mathbf p)= -\sum_{k=1}^{K}y_k\log p_k变量解释:
:类别概率向量。 :one-hot 标签向量。 :类别总数。 :类别或向量分量索引。 :标签、类别变量或目标值。 :模型预测属于第 类的概率。 :真实标签在第 类上的 one-hot 指示值。 :概率分布或概率密度。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.320
L_{\mathrm{CE}}=-\log p_c变量解释:
:多分类交叉熵损失。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :概率分布或概率密度。
实例: 假设有猫、狗、鸟三类,真实类别是狗,对应 one-hot 标签为
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.321
y_i=f_\theta(x_i)+\varepsilon_i, \qquad \varepsilon_i\sim\mathcal N(0,\sigma^2)变量解释:
:从标准正态分布采样的随机噪声。 :方差。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :参数为 的模型函数。 :函数或预测模型。 :样本总数或求和项总数。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.322
p(y_i\mid x_i,\theta)= \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left[-\frac{(y_i-f_\theta(x_i))^2}{2\sigma^2}\right]变量解释:
:方差。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :圆周率。 :参数为 的模型函数。 :函数或预测模型。 :样本索引。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.323
-\log L(\theta)= \text{常数} +\frac{1}{2\sigma^2} \sum_{i=1}^{N} (y_i-\hat y_i)^2变量解释:
:方差。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :模型预测值或预测为正类的概率。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.324
\sum_{i=1}^{N}(y_i-\hat y_i)^2变量解释:
:模型预测值或预测为正类的概率。 :样本总数或求和项总数。 :样本索引。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.325
L_{\mathrm{MSE}}= \frac1N\sum_{i=1}^{N}(y_i-\hat y_i)^2变量解释:
:均方误差损失。 :均方误差。 :模型预测值或预测为正类的概率。 :样本总数或求和项总数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :样本索引。 :标签、类别变量或目标值。
实例: 真实值是 10,模型预测 8,单个样本的平方误差是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.326
R_{L1}(\theta)=\lambda\sum_j|\theta_j|变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :维度、参数或类别索引。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.327
-\log p(\theta\mid D)= -\log p(D\mid\theta)-\log p(\theta)+ \text{常数}变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :GAN 的判别器;在距离公式中也可表示距离函数。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.328
\min_G\max_D V(D,G)= E_{x\sim p_{\text{data}}}[\log D(x)]+ E_{z\sim p_z}[\log(1-D(G(z)))]变量解释:
:GAN 中噪声或潜变量 的先验分布。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以把生成器想成“造假者”,判别器想成“鉴定者”。鉴定者不断学习识别真假,生成器不断学习制造更像真实数据的样本,两边交替更新。
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.329
\log\bigl(1-D(G(z))\bigr)变量解释:
:GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :隐变量 / 潜变量。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.330
V(D,G)= \mathbb E_{x\sim p_{\mathrm{data}}}[\log D(x)]+\mathbb E_{z\sim p_z}[\log(1-D(G(z)))]变量解释:
:真实数据分布。 :GAN 中噪声或潜变量 的先验分布。 :期望,即按照相应概率分布进行加权平均。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。 :观测数据 / 输入样本。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 可以把生成器想成“造假者”,判别器想成“鉴定者”。鉴定者不断学习识别真假,生成器不断学习制造更像真实数据的样本,两边交替更新。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.331
p_{\mathrm{data}}(x)\log D(x)+ p_g(x)\log(1-D(x))变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :GAN 的判别器;在距离公式中也可表示距离函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.332
\frac{p_{\mathrm{data}}(x)}{d} -\frac{p_g(x)}{1-d} =0变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :一般函数;在 VAE 中也可表示重参数化映射。 :潜变量或向量的维度。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.333
D^*(x)= \frac{p_{\mathrm{data}}(x)} {p_{\mathrm{data}}(x)+p_g(x)}变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :GAN 的判别器;在距离公式中也可表示距离函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 如果某个位置真实数据密度和生成数据密度相同,即
怎么理解: 看到
B.334
V(D^*,G)= -\log4+ 2\,JS(p_{\mathrm{data}}\|p_g)变量解释:
:真实数据分布。 :生成器诱导出的生成数据分布。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :GAN 的对抗目标函数。 :一般函数;在 VAE 中也可表示重参数化映射。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.335
H_X[p(y\mid D)]- E_{x\sim X}[H[p(y\mid x,D)]]= I(y;x\mid D)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :观测数据 / 输入样本。 :标签、类别变量或目标值。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.336
H_G[p(y\mid D)]- E_{z\sim P(z)}[H[p(y\mid G(z),D)]]= I(y;G(z)\mid D)变量解释:
:熵,用来描述概率分布的不确定性。 :互信息或信息量,具体含义由当前公式决定。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.337
JS(P\|Q)= \frac{1}{2}KL(P\|M)+\frac{1}{2}KL(Q\|M)变量解释:
:minibatch 大小;在 JS 散度中也可表示混合分布。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.338
JS(P\|Q)= \frac12D_{\mathrm{KL}}(P\|M)+\frac12D_{\mathrm{KL}}(Q\|M)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :minibatch 大小;在 JS 散度中也可表示混合分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.339
JS(Q\|P)= \frac12D_{\mathrm{KL}}(Q\|M)+ \frac12D_{\mathrm{KL}}(P\|M)变量解释:
:KL 散度,用来衡量两个概率分布之间的差异。 :GAN 的判别器;在距离公式中也可表示距离函数。 :minibatch 大小;在 JS 散度中也可表示混合分布。
实例: 假设目标分布认为两个结果各有 50% 概率,而模型却给成 99% 和 1%,两个分布差异很大,KL 会较大;当两者完全一致时 KL 为 0。
怎么理解: 直观上是在比较两个分布是否一致;数值越接近 0,通常说明这里比较的两个分布越接近。
B.340
\sum_{i=1}^{N}a_i=a_1+a_2+\cdots+a_N变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
实例: 假设三次测验成绩分别是 70、80、90,那么求和就是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.341
\bar a=\frac{1}{N}\sum_{i=1}^{N}a_i变量解释:
:样本 的算术平均。 :样本总数或求和项总数。 :样本索引。 :第 个数值。
实例: 假设三次测验成绩分别是 70、80、90,那么求和就是
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.342
\prod_{i=1}^{N}a_i=a_1a_2\cdots a_N变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 连乘常出现在独立样本的联合概率中;取对数后通常会变成求和。
B.343
\log(ab)=\log a+\log b变量解释:
- 本式没有引入新的自由变量;符号含义沿用上一式。
实例: 例如
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.344
\log\left(\prod_{i=1}^{N}a_i\right)
=
\sum_{i=1}^{N}\log a_i变量解释:
:样本总数或求和项总数。 :样本索引。 :第 个数值。
实例: 如果三个独立事件发生的概率分别是 0.8、0.5、0.25,那么它们同时发生的概率可写成
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.345
\mathop{\mathrm{arg\,max}}_{\theta}L(\theta)
=
\mathop{\mathrm{arg\,max}}_{\theta}\log L(\theta)变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。
B.346
\min_{\theta} \left[\sum_{(x,y)\in \mathcal{D}_L} L_s(x,y;\theta)+
\alpha\sum_{x\in X_U}L_u(x;\theta)
+R(\theta)\right]变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :无监督损失的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.347
\min_{\theta}
\left[\sum_{(x,y)\in\mathcal D_L}L_s(x,y;\theta)+ \alpha\sum_{x\in X_U}L_u(x;\theta)+
R(\theta)
\right]变量解释:
:模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :无监督损失的权重系数。 :有标签数据集。 :风险函数或正则项,具体含义由当前公式决定。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :观测数据 / 输入样本。 :标签、类别变量或目标值。
实例: 可以先把求和符号展开成几项来看。例如
怎么理解: 求和符号本身没有额外神秘含义,把它展开后就是普通加法。
B.348
L_{\mathrm{total}}(\theta)= L_{\mathrm{data}}(\theta)+\lambda R(\theta)变量解释:
:总训练目标 / 总损失。 :模型待学习的参数;在 VAE 中通常指生成模型 / 解码器参数。 :正则项或某个损失项的权重系数。 :风险函数或正则项,具体含义由当前公式决定。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 先不要急着背公式;把符号换成一个具体数字、类别或样本,通常就能看清它在做什么。
B.349
L_G =\max_G \left[H_G[p(y\mid D)]-E_{z\sim P(z)}[H[p(y\mid G(z),D)]]\right]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.350
L_G = \max_G \left[H_G[p(y\mid D)]- \mathbb E_{z\sim P(z)}[H(p(y\mid G(z),D))]\right]变量解释:
:期望,即按照相应概率分布进行加权平均。 :熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 理解这类式子时,可以把期望先看成“按概率加权的平均”。实际训练中通常没有办法枚举整个分布,所以会用一个 minibatch 的样本平均来近似它。
怎么理解: 这里不要把期望理解成一次实验必然得到的结果,它描述的是大量重复或整个分布意义下的平均。
B.351
L_D
= \max_D \left[H_X[p(y\mid D)]+E_{z\sim P(z)} H[p(y\mid G(z),D)]\right]变量解释:
:熵,用来描述概率分布的不确定性。 :GAN 的生成器。 :GAN 的判别器;在距离公式中也可表示距离函数。 :蒙特卡洛采样次数或损失函数,具体由上下文决定。 :标签、类别变量或目标值。 :隐变量 / 潜变量。 :概率分布或概率密度。
实例: 读这个式子时,可以先把左边当作“要计算的量”,再按照右边从内到外计算。遇到下标时把它看成第几个样本或第几个维度,遇到求和 / 期望时再把多个结果汇总。
怎么理解: 看到
B.352
\log p_\theta(x)\ge \mathrm{ELBO}(\theta,\phi)变量解释:
:模型对观测 给出的边缘概率 / 边缘似然。 :证据下界(Evidence Lower Bound)。 :变分分布 / 编码器的参数。 :观测数据 / 输入样本。 :概率分布或概率密度。
实例: 可以代入一个简单概率检查它的方向。例如概率从 0.2 提高到 0.8 时,
怎么理解: 概率模型喜欢对数,是因为它既保持大小顺序,又能把乘法变成加法。