文章摘要
本文介绍了一种名为“探索性建模”的新生成式AI范式,可作为现有模型的第三预训练轴并实现端到端生成。该方法通过增加探索性,在图像、视频和语言任务上持续提升模型性能,实现了6.2倍样本效率、4.1倍计算效率提升,并以最高256倍更少推理计算达到扩散模型的控制任务效果。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了核心细节,并删减了与主题无关的冗余内容。
文章标题:探索式建模:解锁生成模型的第三预训练轴与端到端生成
核心观点: 本文提出“探索式建模”(Explorative Modeling)这一全新的生成式建模范式。它既可以作为现有生成模型的“第三预训练轴”,显著提升其性能;也可以独立使用,实现真正的端到端生成。通过增加“探索”次数,模型在图像、视频和语言等多个领域均获得持续提升,且收益随模型和数据规模的扩大而增长(数据规模扩大时,收益从7%提升至36%;模型参数增加时,收益从13%提升至23%)。具体而言,探索式模型(XMs)实现了6.2倍的样本效率提升、4.1倍的FLOPs效率提升和47%的参数效率提升。此外,探索还能提升模型的泛化能力和端到端程度。作为端到端生成模型,XMs在控制任务上能以最高256倍的计算量优势,达到与扩散模型相当的性能。
核心问题:生成式建模的“平均化”困境
生成式模型面临一个根本问题:当模型被要求生成一个物体(如“一只狗”)时,存在无数个正确答案。如果直接训练模型去预测图像,它会学习输出所有正确答案的“平均值”,结果就是一张模糊的棕色色块。这就像在飞镖游戏中,预测下一个飞镖落点,最优策略是预测靶心,但飞镖几乎从不落在那里。这种“平均化”是直接回归方法无法用于生成式建模的根本原因。
现有解决方案:分解生成过程
当前所有可扩展的生成模型(如自回归模型、扩散模型)都通过将生成过程分解为多个小步骤来解决此问题。每一步只有一个或极少数正确答案,从而避免了平均化。例如,自回归模型逐词预测;扩散模型从噪声开始,通过数百步逐步去噪。这种方法虽然有效,但存在两大弊端:
- 曝光偏差: 模型训练时只学习单步预测,但推理时需运行数百步,其自身不完美的输出会作为后续输入,导致误差累积,生成质量下降。
- 非端到端: 训练和推理过程不一致,模型在推理时被迫处理训练时未见过的分布外数据,违背了深度学习“端到端”的成功原则。
新方案:探索式建模(Explorative Modeling)
既然不能分解生成过程,那么可以分解训练过程。核心思想是改变评分方式:在训练时,模型不是只生成一个预测,而是生成K个候选答案,然后只对其中最接近真实数据的那一个进行训练。这迫使模型去“探索”不同的有效答案,而不是求平均。
- 工作原理: 在每个训练步骤,模型探索K个可能的生成结果与真实数据的匹配,仅对最佳匹配进行梯度更新。
- 效果: 随着探索次数K的增加,模型的预测从“平均化”的模糊结果,逐渐变为真实、多样的数据。例如,一个点变成三个簇,模糊图像变成清晰图像,重复的“the”变成有意义的文本。
- 核心概念:生成表达能力: 探索次数K决定了模型能够“承诺”的不同答案的数量,即模型的“生成表达能力”。这是一个被长期忽视的维度,其重要性堪比模型参数和数据量。参数决定模型能“表示”什么,数据决定模型能“学习”什么,而生成表达能力决定模型能“生成”什么。探索将这一固定能力变成了可扩展的维度。
应用一:作为第三预训练轴
将探索式建模与现有生成模型(如RAE、SiT)结合,无需改变模型架构或超参数,即可带来显著提升:
- 效率提升: 在图像生成任务上,达到相同性能所需的数据量减少6.2倍,计算量(FLOPs)减少4.1倍。
- 收益随规模增长: 随着模型参数和数据量的增加,探索带来的性能提升幅度也持续增长(从13%到23%,从7%到36%),表明它确实是一个独立的、可扩展的预训练轴。
- 提升泛化能力: 探索将原本被视为“噪声”的多目标数据转化为可学习的结构,减少了过拟合,提升了模型在固定数据集上的泛化性能。
应用二:实现端到端生成
探索式建模可以完全替代生成过程的分解,实现真正的端到端模型。在推理时,模型只需一步生成,与训练过程完全一致。
- 机器人行为克隆: 探索式策略(Explorative Policy)仅需一次前向传播,即可达到需要100次前向传播的扩散策略(Diffusion Policy)的性能。
- 世界模型: 探索式世界模型(Explorative World Model)在目标条件世界建模任务上,以平均2.3次前向传播,超越了需要192次前向传播的Diffuser模型。
总结与展望
探索式建模通过一个简单的“for循环”即可实现,为几乎所有面临多答案问题的生成模型(图像、视频、音频、语言模型等)提供了一种提升效率、性能和泛化能力的新方法。其收益大小取决于模型预测面临的有效答案数量,答案越多、规模越大,收益越显著。
未来方向包括“反向探索”(用一个生成结果搜索多个数据点)和“基于梯度的探索”(直接优化寻找最佳潜在变量),有望将生成式建模转变为纯粹的“潜在变量搜索”问题。
核心启示: 我们一直在扩展生成模型的规模和训练数据量,但为何从未扩展过模型“能够生成什么”的能力?探索式建模正是对这一问题的回答。
评论总结
根据评论内容,总结主要观点及论据如下:
正面评价(认可度高)
- 评论1认为若数据真实且可扩展,此前所有图像模型将过时。
- 关键引用:"If their numbers are real and hold up at scale, every image model trained before this is now obsolete."
- 评论3称其为重要进展,可能成为关键发展。
- 关键引用:"This is amazing and I think will probably end up being a pretty important development."
技术讨论与质疑
- 评论5指出该方法整合了旧有思想,但存在训练时需额外前向传播、采样不准确等缺点,并认为在高度条件化图像生成和LLM中适用性有限。
- 关键引用:"K-1 extra forward passes during training... Inaccurate sampling behavior... not entirely sure if this strategy is as generally applicable as the authors are hoping."
- 评论7认为该方法与DeepSeek的GRPO及流匹配中的Minibatch OT高度相似,缺乏新颖性。
- 关键引用:"This is just GRPO (proposed by DeepSeek)... There is a lot of prior work here that the authors neglect to discuss."
- 评论8批评作者对生成建模的理解有误,指出先前方法通过输出分布而非点估计解决模糊问题,而非依赖分解。
- 关键引用:"The author appears to be confused about how generative modelling works... Previous approaches solve this problem by modelling a distribution as output rather than a point."
与现有工作的关联
- 评论9、10、11指出该方法与重要性加权自编码器(IWAE)、离散分布网络(DDN)等高度相似,但作者未充分讨论。
- 关键引用(评论9):"The training method is very similar to Importance Weighted Autoencoders."
- 关键引用(评论10):"This feels extremely close in nature to being a generalisation of discrete distribution networks."
- 评论11认为该方法并非新预训练轴,而是另一种扩展计算的方式。
- 关键引用:"This would be better work if it didnt claim it was a new pretraining axis also. Its another way of scaling compute right?"
平衡性总结:
多数评论认可该方法的潜在价值,但对其新颖性、理论解释及实际适用性提出质疑,并指出与多项已有工作的相似性。正面评价集中于可能带来的突破性影响,而负面评价则强调技术细节缺陷和文献回顾不足。