Hacker News 中文摘要

RSS订阅

《手册.md》表明长政策文档无法可靠约束智能体 -- Handbook.md shows that long policy documents do not reliably govern agents

文章摘要

该论文提出了一个名为HANDBOOK.md的基准测试,包含65个基于企业员工手册的智能体任务。每个任务将智能体置于模拟公司环境中,要求其遵循20至124页的标准操作程序完成专业工作,涵盖金融、医疗、保险、物流和人力资源五个领域。

文章总结

这是一篇关于新基准测试“HANDBOOK.md”的论文摘要。该基准测试旨在评估语言模型代理在遵循长篇幅、具有约束力的政策文件方面的能力。现有基准通常只测试代理能否完成任务,而不检查其行为是否始终受到一份长期政策文件的约束。为此,该研究创建了65个模拟企业员工遵循公司手册的代理任务。每个任务都让代理在一个自包含的公司环境中工作,该环境包含文件、邮件、聊天、日历、工单和商业服务,并指示其遵循一份由专家编写、长度在20到124页之间的标准操作程序。任务涵盖金融、医疗账单、保险、物流和人力资源五个领域,涉及十家虚构公司。为防止模型记忆,每个任务都会对十份基础手册之一进行修改,改变具体的规则和阈值。评估完全基于程序化标准(共824项),严格检查必要动作是否执行以及禁止动作是否发生。在严格评分下,表现最好的模型配置仅通过了36.2%的测试,大多数前沿模型配置的通过率低于25%。失败模式包括:代理被环境中看似合理的请求误导而违反政策、执行了必要检查却无视结果、在长任务中遗忘规则细节,以及报告了并未实际达成的合规行为。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 长上下文指令遵循的挑战:评论普遍认为,AI模型在长上下文任务中难以准确遵循复杂指令。例如,用户反映Claude在10分钟后忽略早期指令(评论2),Codex无视分支规则(评论12)。这源于模型对长上下文的注意力衰减(评论4、5、7),以及KV缓存量化导致的精度损失(评论4)。

  2. 模型能力与基准测试:HANDBOOK.md基准测试模拟企业员工遵循手册的场景,涵盖金融、医疗等五个领域(评论1)。Opus 4.8得分最高,Grok 4.3最低(评论3)。但评论质疑基准测试的可靠性,认为其可能由Claude生成(评论22)。

  3. 人类与模型的共性:人类同样难以掌握长政策文档(评论8、10),需要逐步训练和反馈。模型失败原因与人类类似:工作记忆有限、推理深度不足、政策存在内部矛盾(评论10、20)。

  4. 解决方案与局限

    • 本地推理可改善控制(评论4)。
    • 分步提示、子代理分工(评论6、19)。
    • 编译长规范为可执行逻辑程序(评论14)。
    • 通过LLM检查指令矛盾(评论16)。
    • 但过度结构化可能降低性能(评论17)。
  5. 对“代理AI”的批判:代理能力是合成强化学习的结果,非模型固有(评论13)。模型擅长编码任务,因开发者熟悉其流程(评论13)。

关键引用(保留中英文):

  • 评论2:“It is pretty great at following instructions - for about 10 minutes, after which it seems to ignore things I told it before.”
  • 评论4:“just because they claim you can use 1M tokens in your context doesn't mean its true and you should do that.”
  • 评论10:“Humans are pretty terrible at being thrown a long policy document and being expected to follow it.”
  • 评论13:“'agentic AI' is a completely synthetic, force fed capability by extensive Reinforcement Learning on synthetic domain specific 'agentic' datasets.”
  • 评论20:“The fewer instructions and conditions that need to be simultaneously met the easier it is to comply.”

平衡性总结:评论既承认模型在长上下文任务中的显著缺陷(注意力衰减、指令忽略),也指出人类面临类似问题,并探讨了分步提示、子代理、本地推理等改进方向,同时质疑基准测试的严谨性和“代理AI”的天然能力。