文章摘要
Ornith-1.0是一个开源自改进编码模型,提供9B至397B多种规模,在多项编码基准测试中达到顶尖水平。它采用强化学习联合优化代码生成与执行框架,从而发现更优搜索路径并提升解决方案质量。模型采用MIT许可,全球可访问。
文章总结
好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。
标题: GitHub - deepreinforce-ai/Ornith-1
核心内容: Ornith-1.0 是一个开源的、具备自我提升能力的编程智能体模型。
主要特点:
- 顶尖的编程智能体性能:提供 9B、31B、35B(MoE)和 397B(MoE)四种参数规模的模型。这些模型在 Terminal-Bench 2.1、SWE-Bench 等编程基准测试中,达到了同规模开源模型的顶尖水平。
- 自我提升的训练框架:该模型采用强化学习(RL)进行训练,不仅能生成解决方案,还能生成驱动这些解决方案的“脚手架”。通过联合优化“脚手架”和最终方案,模型能发现更优的搜索路径,从而生成更高质量的解决方案。
- 开源许可:采用 MIT 许可,全球可访问,无地域限制。
基准测试结果摘要:
- Ornith-1.0-9B:在多项测试中表现优于 Qwen3.5-9B 和 Gemma4-12B 等模型。例如,在 Terminal-Bench 2.1 上得分为 43.1,SWE-bench Verified 得分为 69.4。
- Ornith-1.0-35B:性能显著超越 Qwen3.5-35B 和 Gemma4-31B。例如,在 Terminal-Bench 2.1 上得分为 64.2,SWE-bench Verified 得分为 75.6。
- Ornith-1.0-397B:与 Qwen3.5-397B、DeepSeek-V4-Pro 等更大规模的模型相比,表现极具竞争力。例如,在 Terminal-Bench 2.1 上得分为 77.5,SWE-bench Verified 得分为 82.4。
快速开始指南:
- 模型类型:Ornith-1.0 是一个推理模型,其回复会包含一个
thinking...response的推理过程块。服务端配置已支持将思维链和工具调用解析为独立字段。 - 运行环境要求:需要 Transformers ≥ 5.8.1、vLLM ≥ 0.19.1 或 SGLang ≥ 0.5.9 等较新的运行时环境。
- 推荐采样参数:
temperature=0.6,top_p=0.95,top_k=20。 - 模型部署:提供了使用 vLLM、SGLang 和 Hugging Face Transformers 三种框架启动 OpenAI 兼容 API 服务的详细命令。所有模型均支持 256K 的上下文窗口。
- 模型格式:除了标准的 bf16 格式,还提供了 FP8 和 GGUF(量化)格式,以适应不同的硬件和部署需求。
- API 使用:服务启动后,可通过任何 OpenAI 兼容的客户端(如 Python 的 OpenAI 库)进行调用,支持流式输出和工具调用(function calling)。
智能体使用场景:
- 框架集成:Ornith-1.0 可无缝集成到 Hermes Agent、OpenHands、OpenClaw 等主流智能体框架中,只需将 API 端点指向本地运行的 Ornith 服务即可。
- 本地推理:支持通过 llama.cpp 和 Ollama 加载 GGUF 格式的模型进行本地推理。
- 编程 CLI:针对终端编程智能体进行了优化,可配合 OpenCode 等工具使用。
引用: 如果该工作对您有帮助,欢迎引用。
评论总结
根据评论内容,主要观点和论据如下:
观点一:模型本质是Qwen或Gemma的微调版本,缺乏创新性 - 评论3(S0y)指出:“These are simply benchmaxxed versions of either Qwen or Gemma 4.”(这些只是Qwen或Gemma 4的刷榜版本。) - 评论6(v3ss0n)批评:“Self-Improving bullshit. It is just Qwen 3.5 finetune benchmaxxed.”(自我改进是胡扯,只是Qwen 3.5的微调刷榜版。)
观点二:模型在特定场景下表现良好,但存在局限性 - 评论4(ricardobayes)认可:“Based on my limited usage, it is good, gives creative solutions to coding problems.”(基于有限使用,它很好,能提供有创意的编程解决方案。) - 评论2(CharlesW)引用第三方评测指出:“Poor performer here, only found the one bug that almost every model found... It also performs poorly in a chat without tools, exhibiting an enthusiasm for hallucination.”(表现不佳,只找到了几乎所有模型都能找到的bug;在无工具聊天中表现差,热衷于幻觉。)
观点三:模型信息不透明,存在疑问 - 评论1(kennywinker)质疑:“Can anyone explain what’s the story here? Is this just a re-skinned qwen? Who is deepreinforce-ai and why isn’t this model listed on their website?”(谁能解释一下?这只是Qwen换皮吗?deepreinforce-ai是谁,为什么模型没列在官网上?) - 评论5(anana_)指出:“They keep mentioning a 31B dense model, but there are no benchmarks or weights for it anywhere?”(他们一直提到31B密集模型,但没有任何基准测试或权重发布?)
总结:评论者对模型评价两极分化。部分认为它只是Qwen/Gemma的微调刷榜版,缺乏实质创新;另一部分认可其在编程等任务中的表现,但指出存在幻觉和工具调用问题。同时,模型来源、31B版本信息不透明引发质疑。