Hacker News 中文摘要

RSS订阅

单层足够吗?单层Transformer匹配全参数强化学习训练 -- Is One Layer Enough? A Single Transformer Layer Matches Full-Parameter RL Train

文章摘要

研究发现,强化学习对大型语言模型的性能提升高度集中于少数甚至单个Transformer层。仅训练单层即可恢复甚至超越全参数微调的大部分效果,该现象在多个模型、算法和任务领域均稳定存在。

文章总结

强化学习(RL)已成为大型语言模型(LLM)后训练的核心环节,但关于RL适应过程如何在Transformer各层之间分布,目前仍知之甚少。现有方法通常统一更新所有模型参数,隐含地假设每一层对RL后训练所获得的性能提升贡献相似。本研究通过系统性的逐层分析,对这一假设提出了挑战。令人惊讶的是,我们发现仅训练单个Transformer层就能恢复全参数RL训练所带来的大部分性能提升,在某些情况下甚至能超越后者。为量化这一现象,我们引入了“层贡献度”这一指标,用于衡量单独训练某一层所能恢复的全参数RL性能提升比例。在涵盖两个模型系列(Qwen3、Qwen2.5)、三种RL算法(GRPO、GiGPO、Dr. GRPO)以及数学推理、代码生成和智能体决策等多个任务领域的七个模型上,我们观察到了一个高度稳定的模式:RL的性能提升高度集中于少数Transformer层,在许多情况下甚至仅集中于单个层。更引人注目的是,相同的结构模式始终如一地出现:高贡献层集中在Transformer堆叠的中部,而靠近输入和输出端的层贡献则显著较小。由此产生的层排名在不同数据集、任务、模型系列和RL算法之间均保持强相关性。

评论总结

根据评论内容,总结如下:

主要观点: 多数评论者认为,强化学习(RL)后训练主要影响Transformer模型的中间层,而非浅层或深层。这一发现具有直观合理性,并可能带来计算效率提升。

支持观点及论据: - 中间层负责抽象概念操作(评论2、5)。评论2指出:“The middle layers are where the abstract thought and manipulation of concepts is happening.” 评论5补充:“RL is being used to shape high level planning-type direction of the output.” - 冻结非中间层可节省计算(评论3)。评论3称:“If most of the performance gains are hidden in a few middle layers, you can save a massive amount of compute by freezing the rest.” - 与自编码器结构类比(评论1、4)。评论1认为:“transformers are autoencoders on steroids... you need exactly one layer to do so.” 评论4表示:“This is very similar to fine tuning a down stream task in encoder-decoder architecture.”

质疑与补充观点: - 结果可能不适用于指令微调等任务(评论2)。评论2指出:“RL is also used for tasks that aren't about conceptual manipulation... I bet that their result doesn't hold for that.” - 存在训练长度不一致问题(评论8)。评论8提到:“The authors have some inconsistencies with training token length... Most errors are probably responses that didn’t finish before their 3K token limit.” - 对LLM编码器未使用无监督学习表示遗憾(评论7)。评论7称:“I still can't believe that LLM encoders aren't unsupervised learned.”

总体评价: 评论9给予高度认可:“Really good work here, bravo.”