

——VAE 式“地基”是怎样建成的?
今天这篇文章,想跟大家聊聊VAE(Variational Autoencoder,变分自编码器)。
但在讲原理之前,先看一组数据。因为一个模型在学术界到底重不重要,引用量不会说谎。
▲图 | 上图中的柱状数据统计于2024年12月。VAE 的原始论文《Auto-Encoding Variational Bayes》在 Google Scholar 上目前被引超过 58,000 次(该数据统计截止 2026‑08),在深度学习奠基性论文中位列第四——而这篇论文已经发表了 13 年。©【深蓝具身智能】编译一个值得注意的趋势:2024 年 12 月它的引用量还是 40,549 次,仅 20 个月后就涨到 58,810 次,增长 45%。
▲图 | (左)VAE系具身智能代表作总被引量(Google Scholar, 2026.08);(右)Stanford 的 ACT / ALOHA(基于 CVAE 做动作生成)2023 年发表时当年被引仅 28 次,2025 年 944 次。这是一条典型的"爆发曲线",与具身智能行业本身的升温曲线完全同步。也就是说:具身智能越火,VAE 系模型被引用得越多。©【深蓝具身智能】编译为什么要选 VAE 这一生成模型来聊?看完数据,答案已经不言自明。
本质上来说,VAE不是单纯的CV基础模型,而是具身智能落地的核心底层工具。
具身智能的核心是让机器人、智能体理解真实世界、建模环境规律、完成实时决策与状态预测,而真实世界的图像、点云、传感时序数据都是高维、冗余、无序的。
VAE的核心价值,正是为具身智能提供了稳定、连续、可解耦、可预测的低维潜空间表征,帮智能体剥离原始数据噪声、提炼环境核心特征、建模世界状态分布。
无论是主流的具身世界模型、机器人动力学预测,还是端到端感知控制算法,几乎都以VAE及其变体为基础基线搭建。
为了让大家能够以最小成本读懂本文,先简单解释一下VAE的来历。
自编码器(本身是个神经网络,读者可以简单地想象为一个全连接网络)的意思是,训练时每一组训练样本特征feature和标签label数据其实都是同样的数据,是镜像。也就是自己给自己编码。
那这样做的意义在于什么呢?
意义是在于提取训练数据的规律,然后在自编码器作为一个神经网络在推理的时候,它可以去用这些规律生成新的输出。
比如说一个自编码器用一百万张人脸图片做的训练,feature是同一个人的一张脸,label也是同一张脸。那么它中间的那些layer里面的参数值就可以认为是一个潜空间,之所以是潜在,因为它不在输入输出层,别人看不见,所以是潜在。
明显中间的那些layers越小越好,越小意味着潜空间越小、对数据规律的压缩能力越强。
这些中间参数代表的潜空间,表示的是人脸生成的规律。
假设我们输入一张很模糊或者不完整的人脸照片,它就可以推理出对应的完美的人脸照片。
变分本来是在变分法里的一个来源,最初用在最速下降线问题里。核心含义是变量的取值不再是数值,而是取函数。
所谓变分是指在一大排候选函数当中去优选最好的函数,就像微积分取y的最大/最小值时,是在x的一大排取值当中找一个最好的取值。
而这里变分是找一个最好的函数作为变分变量的取值。
那么VAE用了什么函数来代替‘点’(一对训练数据)呢?
高斯函数。
而高斯函数也就是正态函数(不是一个函数而是一族函数),区分彼此的是高斯函数的均值与方差,寻找最佳函数就是在寻找一组最佳均值与方差代表的高斯函数。
变分引入高斯函数来代替单独一个‘点’又有什么好处呢?
好处就是这个‘点’换个马甲还是可以被认出来,因为具有了鲁棒性,同时也涵盖了更大的数据空间。
比如,你的身份证照片就是一个‘点’,一旦拍下来就固定了。但是日常生活当中其他人对比身份证和你本人时,可能在发型、饰品,甚至说年龄的变化上,都和身份证上的这个‘点’有微小不同,但是都满足正态分布的偏差范围之内,不会被误认。对于音频也是一样的,即使感冒也听得出来是谁。

VAE
与潜空间的基础地位
VAE(Variational Autoencoder,变分自编码器)是2013年提出的概率式生成神经网络模型,是深度学习领域首个将变分推断、表征学习与生成建模完整融合的通用框架。
针对真实后验分布无法直接计算的问题,通过构造可训练的近似分布,迭代逼近真实概率分布,是VAE模型可训练的主要理论基础。
模型自动从原始高维数据中提取、压缩、重构有效特征,摒弃人工特征工程,自主学习数据底层结构与语义关联。
其核心数学目标是逼近真实数据对数似然 log p(x),解决传统自编码器无概率度量、无法估计数据分布密度的问题。
▲图 | AE(VAE)的最基本的框图,来自网络©【深蓝具身智能】编译
直观地说,
传统模型只能“记住见过的数据”,VAE可以“学会数据的整体分布规律”。
普通编码器是背答案,VAE是学会解题规律,可以自主生成新答案。
它区别于传统确定性自编码器,首次为无监督特征学习引入严格的概率统计约束。
普通自编码器仅学习映射 x→z→x,没有对 z 的分布施加约束,作为中间状态的z散乱没有概率结构,无法采样生成新样本。
VAE 显式建模潜变量的概率分布,补齐了这一核心缺陷。
▲图 | 中间就是潜空间,里面的椭圆是在暗示椭圆形高斯分布函数,来自网络©【深蓝具身智能】编译
普通自编码器的特征点杂乱分散,中间空白区域无意义,无法使用;VAE 把所有特征规整成连续空间。
潜空间是 VAE 模型训练后生成的低维连续向量空间,是高维原始数据的抽象表征载体,效果好于人工定义的固定特征空间。
潜空间由所有潜变量构成,d 为人工设定的潜维度,远小于输入数据维度,例如 64 维、128 维。
可以说潜空间是原始高维数据的“精简信息压缩仓库”,只保留关键变化信息,丢弃冗余像素与噪声。
打个比方:原始图像是完整全像素图片,潜空间是压缩后的核心参数脚本,体积极小但能还原完整视频内容,有点类似于jpg格式。
在生成学习、强化学习、具身智能、计算机视觉等研究方向中,VAE是基础底层模型,大量新型算法都以其架构和损失函数为迭代优化基线。
潜空间表征体系已经成为机器学习数据建模的通用范式,多数数据降维、特征解耦、状态预测任务,多半
都会依托该空间完成建模落地。
相较于GAN(Generative Adversarial Network,生成对抗网络)、扩散模型等后续生成模型,VAE的收敛稳定性更高,成为学术研究的基准性模型。
VAE与潜空间的核心作用
作用一:无损度可控的降维
VAE最核心的基础作用是对高维原始数据做无损度可控的降维处理。原始图像、点云、时序传感数据的冗余信息会被过滤,保留核心语义与结构特征。
普通自编码器学习得到的特征空间离散无规律,无法直接采样使用。
VAE强制约束潜空间后验分布逼近标准正态先验分布
,使得整个潜空间是紧致、连续、处处有效、可高密度采样的向量空间,空间内所有向量都能解码为合理数据。
▲图| AE和VAE的采样对比,(右)VAE约束整个潜空间所有坐标点全部有效,不存在无效区域、空白区域。(左)普通AE空间是散落的星星,只有光点有效;VAE空间是整片均匀夜空,任意位置都能取出有效信息。©【深蓝具身智能】编译
作用二:特征解耦存储
在理想训练状态下,潜空间各维度分量相互独立,单个维度的数值变化仅对应数据单一物理变化因子,例如物体位置、尺度、角度、光照,不耦合其他无关特征。
每一个潜维度单独控制一种特征,修改其一不会影响其他特征。
打个比方,潜空间各维度如同独立旋钮,一个旋钮控制亮度、一个控制大小、一个控制角度,互不干扰。
如果更数学化一点的话,就是潜维度都是彼此正交的。
作用三:特征插值
依托连续的潜空间,模型可以完成特征插值操作:
对两个潜变量做线性插值 ,解码后可生成平滑渐变的全新有效数据样本,不会出现断裂、噪声、无效画面。
两个样本之间可以生成无数平滑过渡的中间样本,变化连续无跳变。
以类比,从白天画面平滑过渡到黑夜画面,不会突然跳变、黑屏、失真,类似视频转场效果。
作用四:大幅降低下游任务的算力成本
在强化学习和具身智能任务中,VAE将高维观测数据转化为低维潜向量,大幅降低策略网络、动力学预测网络的计算维度与训练算力成本。
机器人无需处理百万像素,仅处理几十维向量即可完成决策与规划。
此外,潜空间可为下游任务提供统一的特征输入,规避人工设计特征的主观性与局限性,适配不同场景的自适应特征提取需求。
VAE支持无监督端到端训练,无需大量人工标注数据,能够依托原始数据集自主学习数据分布规律与内在结构。
VAE与潜空间的核心运行原理
VAE整体沿用编码器-解码器架构,整体训练流程依托概率建模与变分近似推理完成,核心分为编码、采样、解码、损失约束四个环节。
▲图 | VAE训练循环:四步构成一次端到端梯度更新©【深蓝具身智能】编译
其核心数学问题是极大化数据对数似然 ,该式无法直接求解,必须引入变分近似。
直接计算数据真实分布难度极高,VAE用可训练的近似分布无限逼近真实分布。
打个比方就是无法直接测量真实地形,那就用可微调的模拟地图不断拟合真实地形。
编码器不直接输出固定特征向量,输入原始数据 x 后,编码器网络 输出对应高斯分布的均值向量 与对数方差向量 ,以此定义单条数据对应的潜变量后验分布。
编码器不输出一个固定点,而是输出一个可信取值范围,包含特征的不确定性。即不给出唯一答案,而是给出答案的合理波动区间。
模型引入重参数化技巧解决梯度回传问题。
直接从高斯分布采样无法求导,因此引入标准高斯噪声,通过变换公式 采样得到潜变量 z ,保证采样操作可参与梯度反向传播。
这一步的本质是把随机采样操作从网络梯度路径中剥离,让模型可以正常训练更新参数。
所有训练数据对应的潜变量后验分布簇,以及全局逼近的标准正态先验分布,共同构成完整的模型潜空间。
潜空间不是训练样本的特征集合,是覆盖所有合理场景的连续数学空间。
就好比不是存储有限照片,而是掌握生成所有同类照片的通用规则。
解码器网络接收潜变量 z,反向映射还原重构原始输入数据。图像任务一般采用高斯输出或伯努利输出,分别对应连续像素取值与二值图像取值,实现从低维抽象表征到高维原始数据的还原映射。
VAE的损失函数为ELBO(Evidence Lower Bound,证据下界),完整公式为:
由重建似然项与KL散度正则项两部分构成,两个约束协同完成模型端到端训练。
ELBO 同时约束“还原准确”和“空间规整”两个目标,缺一不可。重建项保证画得像原图,KL项保证所有画作风格统一、规律连贯。
重建损失对应公式第一项,负责约束解码器输出结果贴近原始输入。
该项数值越高,代表重构误差越小,保证潜变量能够保留数据核心有效特征,避免过度降维导致特征丢失。强制压缩后的表征能够还原原始数据,防止信息丢失。就好像压缩文件后必须能完整解压,不能损坏核心内容。
KL(Kullback-Leibler,库尔贝克-莱布勒)散度正则项对应公式第二项用于约束数据后验分布趋近标准正态先验分布。
针对两个多维高斯分布,其解析解公式为
该损失强制让整个潜空间分布均匀、结构连续,杜绝空间空洞与无效区域。
一句话概括:重建项保证"画得像原图",KL 项保证"所有画作风格统一、规律连贯",缺一不可。
训练完成后,潜空间内任意采样的向量 ,都可通过解码器生成符合原始数据分布的全新样本。
潜空间的全域有效性,是VAE具备生成能力的根本数学依据。
只要在规整后的潜空间内取值,必然生成合理新数据。
好比掌握绘画规律后,任意合理构图参数都能生成正常画作,不会出现乱码画面。
而潜空间的解耦特性,来源于概率约束的空间规整性,训练过程中不同维度的潜参数会自主拟合数据的独立变化因子;
空间规整约束迫使各维度各司其职,自动拆分独立语义;
训练过程自动分工,每个维度专门负责一种特征,互不抢功、互不干扰。
当然,所有潜维度全部正交(独立)是个理想情景,不见得一定可以做到。
从一篇论文到一个家族:VAE 的变体生态
回看开头那组数据,有一个问题值得回答:为什么一篇 13 年前的论文,引用量至今仍在加速增长?
答案藏在其变体生态里。
VAE 衍生模型的迭代体系非常完善——各变体均通过修改 ELBO 公式来强化潜空间的不同特性,同一个基础引擎,通过微调"参数",就能适配不同的研究场景:
▲图 |VAE家族:同一引擎,三种改装,覆盖生成/决策/表征©【深蓝具身智能】编译
β-VAE( Beta Variational Autoencoder ,贝塔变分自编码器):修改损失为 强化解耦——适合可解释性研究。
CVAE (Conditional Variational Autoencoder,条件变分自编码器)引入条件变量建模 ;这是具身智能动作生成的主力(ACT 即基于此)。
VQ-VAE(Vector Quantized Variational Autoencoder ,向量量化变分自编码器)将连续潜空间替换为离散码本空间,成为大模型时代的"tokenizer 标配",把图像、动作压成离散 token 喂给 Transformer。
这个家族的扩展性带来一个结果:
当一个新领域需要"把连续世界离散化/压缩成可计算的表征"时,第一选择几乎总是 VAE 系。
这就是具身智能论文里 VAE 高频的根本原因:
潜动作模型(Genie、LAPA)用 VQ-VAE 蒸馏动作 token;
世界模型(Dreamer、IRIS)用 VAE 系编码器压缩观测;
模仿学习(ACT)用 CVAE 建模多模态动作分布。VAE 不是某一个应用的主角,而是所有这些应用的公共地基
。
▲图 | 比如港大的MSVS-VAE,来自网络©【深蓝具身智能】编译
地基不会过时
写到这里,大概可以给 VAE 下一个准确的判断了:
在生成动作这个具体环节,CVAE 正在被 Diffusion Policy、Flow Matching 等更新的生成范式部分取代;
但在把连续世界压缩成可计算表征这个更基础的环节:tokenizer、潜动作模型、世界模型编码器……VAE 家族依然是事实标准,短期内看不到被替代的迹象。
下一次,当你读到一篇具身智能论文,看到latent space,及其衍生出的toknizer、action chunking这些词时,它们的核心思想都来源于 2013 年那篇研究。
编辑|咖啡鱼
审编|具身君

【深蓝具身智能】的原创内容均由作者团队倾注个人心血制作而成,希望各位遵守原创规则珍惜作者们的劳动成果;未经授权禁止任何机构或个人抓取本账号内容,进行洗稿/训练,否则侵权必究⚠️⚠️