Hacker News 中文摘要

RSS订阅

Ornith-1.5:从自我支架到自我改进 -- Ornith-1.5: From Self-Scaffolding to Self-Improvement

文章摘要

Ornith-1.5通过自我改进循环,让模型自主提出任务、生成支架并产出解决方案,持续创造学习经验以提升性能。该模型涵盖397B、35B和9B三种规模,在推理、代理和编码任务上表现优异,其中397B版本性能与Claude Opus 4.8相当,9B版本可在移动设备部署并超越更大模型。

文章总结

今日,我们正式发布Ornith-1.5,这是通过端到端自我改进构建基础模型的重要一步。Ornith-1.5将Ornith-1.0中引入的自我支架框架扩展为更完整的自我改进循环:模型能够提出新任务、生成特定任务的支架、并产出解决方案的展开,用于强化学习,从而持续创造新的学习经验,并从中不断进步。

Ornith-1.5涵盖三个模型规模:397B MoE、35B MoE和9B密集模型。该模型专为推理、代理和编码任务中的通用智能而设计,在多个基准测试中,于同等规模的开源模型中达到了最先进的性能。其中,Ornith-1.5-397B在Terminal-Bench 2.1上得分为86.1,在DeepSWE上得分为56.0,与Claude Opus 4.8(85.0和59.0)表现相当,同时超越了类似规模的开源模型,如GLM-5.2(82.7和46.2)和DeepSeek-V4-Flash-0731(82.7和54.4)。另一方面,Ornith-1.5-9B及其量化版本Ornith-1.5-9B-Mobile可轻松部署在iPhone和安卓设备上,同时性能大幅超越Gemma 4-31B和Qwen 3.6-35B等更大规模的模型。

Ornith-1.5通过自我生成任务、支架和解决方案实现自我改进。它扩展了Ornith-1.0,将自我改进循环从支架和展开优化,扩展到联合优化任务生成、支架构建和解决方案展开。系统不再依赖固定的人工策划任务和手动设计的支架,而是持续生成新的训练任务,发现解决这些任务的有效策略,并通过强化学习改进策略。每个训练周期分为三个阶段:给定环境或代码库、任务类型的高级指令以及模型以往的任务解决历史,系统会提出逐步更难的任务,暴露能力差距并不断推动训练前沿。对于每个任务,模型会生成或优化特定任务的支架,包括指令、工具、分解策略和编排方式。基于任务和支架,策略产生解决方案的展开。展开的奖励会反向传播到所有三个阶段,使系统不仅学会生成更好的解决方案,还能生成更有用的训练任务和构建更有效的支架。通过反复训练,这形成了一个封闭的自我改进循环:更强的策略能生成更难、信息量更大的任务;不断演化的支架能发现更好的方式来激发模型能力;更高质量的展开则提供越来越有效的学习信号。

在任务奖励方面,系统使用三个信号:有效性、前沿难度和新颖性。有效性确保任务和支架构成一个有效且可验证的学习环境;前沿难度通过模型自身的展开结果来估计,奖励那些成功率接近目标前沿的任务;新颖性则通过比较任务与之前生成或训练过的任务来减少冗余。这些信号共同鼓励生成有效、可验证、具有挑战性但可学习且足够多样化的任务。

支架和展开奖励方面,支架因提供与任务对齐、忠实于解决方案质量且抵抗奖励黑客行为的评估环境而获得奖励。每个展开则直接由生成的支架评分。任务生成、支架生成和解决方案展开均使用GRPO进行优化,使三个阶段在同一自我改进循环中共同进步。

Ornith-1.5-397B在编码、推理和代理任务的多项基准测试中表现优异,与Claude Opus 4.8等顶级模型相当。Ornith-1.5-35B在编码和代理基准测试中显著优于同尺寸的Qwen 3.6-35B,尽管每token仅激活3B参数,但在代理编码任务上大幅超越Gemma 4-31B和Meta的Muse Glimmer-30B等密集模型。可边缘部署的Ornith-1.5-9B也取得了显著成果,在Terminal-Bench 2.1和SWE-Bench Verified上分别达到47.0和70.6,尽管是紧凑的9B参数模型,但其性能匹配或超越了Gemma 4-31B和Qwen 3.6-35B等更大模型。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 模型来源与开放性:用户关注Ornith-1.5的基础模型来源(是否开源或自研),以及是否计划开源权重。

    • 关键引用:
      • "How is ornith-1.5's base model developed? Is the base model one of the Open weights models, or one pre trained by ornith team from scratch?"(bigcat12345678)
      • "Is this open weights? Or planned to be"(nextaccountic)
  2. 性能与实用性:多数用户对模型性能表示认可,尤其是9B和35B-A3B版本在本地运行的速度与效果。

    • 关键引用:
      • "I've been using the 35B-A3B today... it has been on par with Qwen3.8 27B at a much higher speed"(jonesy827)
      • "Ornith1 (9B) was a really nice model. I have been running it locally"(prometheus1992)
  3. 架构与硬件适配:MoE架构受到好评,但397B模型因体积过大引发担忧。

    • 关键引用:
      • "The MoE architecture makes a huge difference for being able to run these local models on reasonable consumer hardware"(montroser)
      • "397 is just too big for two Sparks even at NVFP4. Wish they had made this just a tiny bit smaller"(colingauvin)
  4. 竞争与市场定位:用户认为市场拥挤,且模型存在身份混淆问题(自称Claude)。

    • 关键引用:
      • "Across five cases it reliably claims to be Claude without being able to name a specific version"(garo-pro)
      • "the scene is crowded, and they don't do serving"(esafak)

平衡性说明
- 正面评价集中于性能、速度与本地运行能力。
- 负面或质疑点包括:模型来源不透明、体积过大、身份混淆、市场定位模糊。
- 中立观点:期待定价与后续发展。