Hacker News 中文摘要

RSS订阅

Ornith-1.0:面向智能体编程的自我改进开源模型 -- Ornith-1.0: self-improving open-source models for agentic coding

文章摘要

Ornith-1.0是一个开源自改进编码模型,提供9B至397B多种规模,在多项编码基准测试中达到顶尖水平。它采用强化学习联合优化代码生成与执行框架,从而发现更优搜索路径并提升解决方案质量。模型采用MIT许可,全球可访问。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。


标题: GitHub - deepreinforce-ai/Ornith-1

核心内容: Ornith-1.0 是一个开源的、具备自我提升能力的编程智能体模型。

主要特点:

  1. 顶尖的编程智能体性能:提供 9B、31B、35B(MoE)和 397B(MoE)四种参数规模的模型。这些模型在 Terminal-Bench 2.1、SWE-Bench 等编程基准测试中,达到了同规模开源模型的顶尖水平。
  2. 自我提升的训练框架:该模型采用强化学习(RL)进行训练,不仅能生成解决方案,还能生成驱动这些解决方案的“脚手架”。通过联合优化“脚手架”和最终方案,模型能发现更优的搜索路径,从而生成更高质量的解决方案。
  3. 开源许可:采用 MIT 许可,全球可访问,无地域限制。

基准测试结果摘要:

  • Ornith-1.0-9B:在多项测试中表现优于 Qwen3.5-9B 和 Gemma4-12B 等模型。例如,在 Terminal-Bench 2.1 上得分为 43.1,SWE-bench Verified 得分为 69.4。
  • Ornith-1.0-35B:性能显著超越 Qwen3.5-35B 和 Gemma4-31B。例如,在 Terminal-Bench 2.1 上得分为 64.2,SWE-bench Verified 得分为 75.6。
  • Ornith-1.0-397B:与 Qwen3.5-397B、DeepSeek-V4-Pro 等更大规模的模型相比,表现极具竞争力。例如,在 Terminal-Bench 2.1 上得分为 77.5,SWE-bench Verified 得分为 82.4。

快速开始指南:

  • 模型类型:Ornith-1.0 是一个推理模型,其回复会包含一个 thinking...response 的推理过程块。服务端配置已支持将思维链和工具调用解析为独立字段。
  • 运行环境要求:需要 Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9 等较新的运行时环境。
  • 推荐采样参数temperature=0.6, top_p=0.95, top_k=20
  • 模型部署:提供了使用 vLLM、SGLang 和 Hugging Face Transformers 三种框架启动 OpenAI 兼容 API 服务的详细命令。所有模型均支持 256K 的上下文窗口。
  • 模型格式:除了标准的 bf16 格式,还提供了 FP8 和 GGUF(量化)格式,以适应不同的硬件和部署需求。
  • API 使用:服务启动后,可通过任何 OpenAI 兼容的客户端(如 Python 的 OpenAI 库)进行调用,支持流式输出和工具调用(function calling)。

智能体使用场景:

  • 框架集成:Ornith-1.0 可无缝集成到 Hermes Agent、OpenHands、OpenClaw 等主流智能体框架中,只需将 API 端点指向本地运行的 Ornith 服务即可。
  • 本地推理:支持通过 llama.cpp 和 Ollama 加载 GGUF 格式的模型进行本地推理。
  • 编程 CLI:针对终端编程智能体进行了优化,可配合 OpenCode 等工具使用。

引用: 如果该工作对您有帮助,欢迎引用。

评论总结

根据评论内容,主要观点和论据如下:

观点一:模型本质是Qwen或Gemma的微调版本,缺乏创新性 - 评论3(S0y)指出:“These are simply benchmaxxed versions of either Qwen or Gemma 4.”(这些只是Qwen或Gemma 4的刷榜版本。) - 评论6(v3ss0n)批评:“Self-Improving bullshit. It is just Qwen 3.5 finetune benchmaxxed.”(自我改进是胡扯,只是Qwen 3.5的微调刷榜版。)

观点二:模型在特定场景下表现良好,但存在局限性 - 评论4(ricardobayes)认可:“Based on my limited usage, it is good, gives creative solutions to coding problems.”(基于有限使用,它很好,能提供有创意的编程解决方案。) - 评论2(CharlesW)引用第三方评测指出:“Poor performer here, only found the one bug that almost every model found... It also performs poorly in a chat without tools, exhibiting an enthusiasm for hallucination.”(表现不佳,只找到了几乎所有模型都能找到的bug;在无工具聊天中表现差,热衷于幻觉。)

观点三:模型信息不透明,存在疑问 - 评论1(kennywinker)质疑:“Can anyone explain what’s the story here? Is this just a re-skinned qwen? Who is deepreinforce-ai and why isn’t this model listed on their website?”(谁能解释一下?这只是Qwen换皮吗?deepreinforce-ai是谁,为什么模型没列在官网上?) - 评论5(anana_)指出:“They keep mentioning a 31B dense model, but there are no benchmarks or weights for it anywhere?”(他们一直提到31B密集模型,但没有任何基准测试或权重发布?)

总结:评论者对模型评价两极分化。部分认为它只是Qwen/Gemma的微调刷榜版,缺乏实质创新;另一部分认可其在编程等任务中的表现,但指出存在幻觉和工具调用问题。同时,模型来源、31B版本信息不透明引发质疑。