Hacker News 中文摘要

RSS订阅

Show HN:我用强化学习训练了一个代理,它再用强化学习训练模型(花费约1300美元) -- Show HN: I RL-trained an agent that trains models with RL (for ~$1.3k)

文章摘要

本文介绍了一个利用强化学习训练AI代理的完整开源项目。该代理能自主编写训练任务(包括环境、奖励函数、超参数等),并提交到真实GPU进行训练。通过54步训练,奖励从约0.0提升至峰值0.63,并能泛化到未见过的任务族。项目代码、权重等全部开源。

文章总结

好的,这是根据您的要求,对原文进行中文重述和精简后的版本:

AI训练AI:使用强化学习训练一个能编写强化学习训练任务的AI智能体

该项目构建了一个双层强化学习(RL)流水线,其中外层智能体负责为内层模型编写训练任务,而外层智能体本身也通过RL进行训练。

核心机制:

  • 外层循环:训练一个“教练”智能体(基于Qwen3.6-35B-A3B模型,使用LoRA微调)。该智能体的任务是编写完整的训练任务,包括环境、奖励函数、数据集和超参数。
  • 内层循环:执行智能体编写的任务,在真实的GPU(Runpod)上训练一个小型基础模型(Qwen3-0.6B / 1.7B)。
  • 奖励反馈:内层模型在隐藏测试集上的得分,会作为外层循环的奖励信号,用于训练“教练”智能体。

工作流程(一个回合):

  1. 任务描述:给智能体一个训练目标(例如,“教一个小模型解决多跳人物查询”)。
  2. 智能体工作:智能体通过读写文件、调用工具等方式,在沙盒环境中编写训练代码。
  3. 提交任务:智能体提交训练任务,系统会进行验证。验证失败可重试。
  4. 执行训练:验证通过的任务被分发到GPU集群,使用prime-rl框架进行GRPO训练。
  5. 计算奖励:根据验证效率、训练后模型的性能提升以及训练速度,计算一个综合奖励。

奖励设计:

奖励是三个部分的加权和(权重为0.35 / 0.60 / 0.05): * 验证效率:首次提交即通过得满分,每多一次尝试则扣分。 * 任务质量:综合考量训练后模型的绝对得分和相对于未训练基线的提升。 * 训练速度:作为小权重奖励,鼓励更快的训练。

任务与结果:

  • 任务族:设计了6个任务族(如链式计算、多跳查询、字符串处理等),其中5个用于训练智能体,1个(“分流”任务)作为泛化能力测试。
  • 训练过程:经过54步训练,奖励从约0.0提升至峰值约0.63。
  • 关键发现
    1. 分阶段学习:智能体首先学会了如何生成能通过验证的任务(过程可靠性),然后才学会如何生成能训练出更好模型的任务(任务质量)。
    2. 技能泛化:在从未训练过的“分流”任务族上,智能体的表现也随着训练而提升,证明了其泛化能力。
    3. 策略优化:智能体学会了选择更优的基础模型(从偏好0.6B模型转向偏好1.7B模型)和更优的超参数。

基础设施与成本:

  • 基础设施:使用最多16个GPU(主要是A40和RTX 4090)并行执行内层训练任务。外层智能体训练则通过Tinker API进行。
  • 总成本:整个项目(包括实验、基准测试等)总成本约为950英镑(约1275美元),其中GPU计算约605英镑,智能体训练约345英镑。

模型与开源:

  • 训练好的“教练”智能体(LoRA适配器)已开源在Hugging Face上。
  • 项目所有代码、权重、奖励函数、训练脚本等均已开源。

未来改进方向:

  • 允许智能体进行迭代实验,即根据前一次训练结果调整并提交后续任务。
  • 引入更丰富的任务类型,例如训练有状态编码的智能体。

总结:

该项目成功构建了一个“AI训练AI”的闭环系统,证明了通过强化学习,一个智能体可以学会如何为其他AI模型编写有效的训练任务,并且这种能力可以泛化到未见过的任务上。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 项目创新性与可行性(作者Danau5tin,评分None):该项目通过双层RL循环实现AI训练AI:外层智能体(Qwen3.6-35B-A3B)编写训练任务,内层执行GRPO训练小模型。54步外循环后,奖励从0.0升至0.63峰值,成本约$1.3k。关键引用:"The setup is two nested RL loops"、"Episode reward went from ~0.0 to a ~0.63 peak"、"Cost: the headline arc was ~$1.3k all-in"。

  2. 质疑与批评(作者saberience,评分None):质疑系统实际效果和可解释性,认为在复杂RL领域“vibe code”会导致盲目性。关键引用:"When you vibe code a system in a complex area like RL, you basically have zero understanding of what its actually doing"、"It's the blind leading the blind"。

  3. 技术细节讨论(作者callamdelaney,评分None):指出AI训练AI已存在,本项目优势在于提供框架让智能体访问额外计算资源。关键引用:"AI trains AI already, agents are happy to spin up real training pipelines"、"I guess the advantage to your project is that it provides a framework to allow the agent to access extra compute"。

  4. 潜在风险(作者nnevatie,评分None):担忧递归训练可能导致模型退化。关键引用:"I'm curious to whether the recursively trained models degenerate to troglodytes after a couple of generations"。

  5. 其他评论:包括对README中emoji的质疑(bitbasher)、对项目被低估的肯定(RamblingCTO)、对RL术语的询问(normie3000)、以及排版错误指正(tantalor)。

平衡性总结: 评论呈现两极分化:一方面肯定项目创新性和实际成果(成本可控、奖励提升、泛化能力),另一方面质疑其可解释性、潜在退化风险,以及“盲人领盲人”的局限性。项目作者坦诚分享了失败经验,但技术细节仍需进一步验证。