文章摘要
文章探讨了递归自我改进(RSI)的概念,指AI利用自身智能改进训练流程和部署系统,从而提升性能。研究显示,前沿实验室的AI研发速度已显著加快,其中“部署系统”层与模型原始智能同等重要。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,保留了关键细节,并删减了与主题无关的内容。
文章核心:面向自我改进的“缰绳工程”
本文探讨了人工智能领域实现“递归自我改进”(RSI)的一条关键路径:缰绳工程。文章认为,在短期内,AI实现自我改进不太可能直接通过模型重写自身权重,而更可能通过优化其外部的“缰绳”系统来实现。
什么是“缰绳”?
“缰绳”是围绕基础AI模型构建的一整套系统,它负责编排模型的执行过程,决定模型如何思考、规划、调用工具、感知和管理上下文、存储成果以及评估结果。它不仅仅是提示词模板,更接近于一个运行时环境和软件系统设计,其重要性不亚于模型本身的原始智能。
缰绳设计的核心模式
- 工作流自动化:定义一个目标导向的循环(计划-执行-观察/测试-改进),让模型在其中自主运作、测试和迭代,直到达成目标。
- 文件系统作为持久记忆:对于长期任务,模型不应将所有日志和状态都塞进有限的上下文窗口。相反,应将实验日志、代码差异、错误追踪等持久化状态存储在文件中。模型通过读写文件来管理记忆,这本身就是LLM的基础技能。
- 子代理与后台任务:缰绳可以生成多个子代理并行执行任务,或监控后台作业。主代理只需管理一个轻量级的进程管理器,负责启动、检查、取消和合并结果。将子代理的输出存储为文件,而非仅存在于对话上下文中,有助于模型在中断后恢复并复盘。
缰绳优化:从手动到自动
缰绳优化的对象正从简单的提示词,逐步演进到结构化上下文、工作流、乃至缰绳代码本身。文章介绍了一系列逐步自动化的优化方法:
- 上下文工程:如“代理上下文工程”(ACE),将上下文视为一个可演进的“剧本”,通过生成、反思和策展三个组件,动态维护一个结构化的要点列表,而非不断增长的冗长提示。
- 元上下文工程(MCE):将“如何管理上下文”的机制与“上下文中有什么”的内容分离。通过双层优化,在基础层优化任务上下文,在元层进化管理上下文的“技能”。
- 元缰绳(Meta-Harness):将优化目标提升到“决定如何存储、检索和呈现信息的代码”本身。它使用一个编码代理作为“提议者”,在文件系统中搜索和生成新的缰绳候选方案。
- 工作流自动化设计:如“代理系统自动化设计”(ADAS)和“AFlow”,将工作流设计本身视为一个搜索问题。通过元代理或蒙特卡洛树搜索(MCTS)等算法,自动生成和优化工作流图。
自我改进的缰绳
文章强调,代码是定义程序和系统的通用语言。如果LLM能够优化执行代理的代码,它就能触及比手写提示词大得多的设计空间。
- 自教优化器(STOP):一个早期例子,其目标不是直接改进解决方案,而是改进“改进者”本身。实验发现,该过程能发现遗传算法、模拟退火等多种策略,但前提是基础模型必须足够强大。
- 自我缰绳(Self-Harness):通过“弱点挖掘-缰绳提案-提案验证”的循环,让LLM代理改进自身的缰绳。它通过分析失败模式,提出有针对性的、可验证的编辑,并通过回归测试确保改进的有效性。
- 代理缰绳工程(AHE):强调“可观测性”,将缰绳的每个可编辑组件(如系统提示、工具描述、子代理配置等)在文件系统中显式表示,确保每次编辑都有证据支撑,并能追溯到具体的失败原因。
进化搜索
进化搜索是优化缰绳的另一种有效方法,尤其适用于搜索空间大、难以用梯度优化但易于评估的场景。文章介绍了AlphaEvolve、Darwin Gödel Machine (DGM) 等系统,它们通过变异、选择和保留高适应度个体的方式,在代码仓库中进化出更优的缰绳或代理。
未来挑战
尽管取得了进展,但实现完全的递归自我改进仍面临诸多挑战:
- 评估器薄弱:许多研究主张(如新颖性、科学价值)缺乏快速、精确的验证器。
- 上下文与记忆生命周期:如何有效管理长期任务中不断增长的记忆,是缰绳需要解决的核心问题。
- 负面结果:模型训练数据偏向成功案例,导致其难以判断何时该放弃一个假设或报告失败。
- 多样性崩溃:进化循环倾向于利用已知的高回报模式,可能导致解决方案趋同,不利于开放性探索。
- 奖励黑客:自我改进循环会过度优化给定的信号,可能导致过拟合测试或利用评估器漏洞。
- 长期成功:当前的优化目标往往过于短期,难以兼顾代码库的长期健康、可维护性和向后兼容性。
- 人类的角色:人类不应被排除在循环之外,而应提升到更高层级,在正确的抽象层面提供监督和指导,确保技术服务于人类福祉。
评论总结
根据评论内容,总结主要观点如下:
1. 任务适配与学习效率(认可度:中) - 评论1强调理解任务行为对自我改进的重要性,认为存在通用解决方案但尚未出现。 - "The learning can be significantly improved if we understand the behaviour of task and how it should be learned." - "I'm pretty sure a general solution will definitely exist which will do fine, but we are yet to see one."
2. 工程与软科学的性质(认可度:低) - 评论2质疑“工程”标签,认为其更接近软科学。 - "They say engineering but it's more a soft science."
3. 环境改变与自我改进(认可度:中) - 评论4提出通过改变环境而非代理本身实现自我改进,并质疑“自我”的界限。 - "install or build stuff that they can then use... it changes the environment instead of the agent/harness" - "animals and humans do the same thing... without 'self-improvement' with emphasis on the 'self'"
4. 评估器与失败模式(认可度:高) - 评论6强调将评估器置于进化循环之外,并指出不完整检查套件的危害。 - "keeping the evaluator outside the loop that evolves the harness" - "an incomplete check suite that still reports full success... was worse than a weak evaluator"
5. 个人工具开发的价值(认可度:中) - 评论8分享开发个人编码工具的经验,承认效率不高但满足感强。 - "it is satisfying to have long coding sessions using my own tools" - "If anyone wants to argue that it is inefficient writing your own AI coding harness, I wouldn’t disagree."
6. 其他观点(认可度:低) - 评论3("The quest for Torment Nexus continues")和评论5("The simplicity is the point")仅提供简短评论,未展开论述。评论7提及具体应用实践,但未形成独立观点。