Hacker News 中文摘要

RSS订阅

GPT-5.6 Sol 定价下调50% -- GPT-5.6 Sol Pricing Cut by 50%

文章摘要

OpenAI的GPT-5.6 Sol是其旗舰模型,擅长复杂推理、编程和智能体工作流,尤其在命令行、多步骤编程及长期问题解决方面表现突出。

文章总结

好的,这是根据您提供的英文内容,用中文重新陈述的主要信息,已保留关键细节并删除了与主题无关的内容(如导航栏、页脚、其他模型列表等)。


标题:OpenAI GPT-5.6 Sol - API 定价与基准测试

核心信息:

GPT-5.6 Sol 是 OpenAI GPT-5.6 系列中的旗舰模型。它专为复杂推理、编程和智能体工作流而设计,尤其在命令行操作、多步骤编程任务以及长期问题解决方面表现出色。

关键参数与定价:

  • 上下文长度: 100万 tokens
  • 发布日期: 2026年7月9日
  • 知识截止日期: 2026年2月
  • 输入/输出价格: 每百万 tokens 输入 $2.50,输出 $15.00(目前有50%折扣,即输入 $1.25,输出 $7.50)。
  • 缓存读取价格: 每百万 tokens $0.25(折扣后)。

服务提供商与性能:

该模型可通过多个提供商访问,OpenRouter 会根据用户选择的路由模式(平衡、极速或精确)进行请求分发。

  • OpenAI(官方): 延迟 2.78秒,吞吐量 40 tokens/秒,正常运行时间 99.72%。
  • Azure: 延迟 5.91秒,吞吐量 12 tokens/秒,正常运行时间 99.88%。
  • Azure(美国): 延迟 3.51秒,吞吐量 30 tokens/秒。
  • Azure(欧盟): 延迟 3.96秒,吞吐量 61 tokens/秒。
  • Amazon Bedrock(美国): 延迟 4.00秒,吞吐量 32 tokens/秒。

实际支付价格:

由于缓存和折扣,用户实际支付的平均价格通常低于标价。加权平均输入价格为每百万 tokens $0.94,加权平均输出价格为每百万 tokens $21.85。

基准测试表现:

GPT-5.6 Sol 在多项标准化评估中表现优异,排名超过 OpenRouter 上 96% 至 98% 的模型。

  • 推理能力:
    • GPQA Diamond(研究生级科学推理):94.1%
    • HLE(人类最后的考试):49.5%
    • IFBench(指令遵循):72.7%
  • 编程能力:
    • SciCode(科学计算编程):56.1%
    • Terminal-Bench Hard(智能体编程与终端使用):65.9%
  • 知识能力:
    • AA-Omniscience 准确率:59.4%
    • AA-Omniscience 非幻觉率:7.8%

主要应用场景:

该模型被广泛应用于实际生产环境,主要流量来自以下应用:

  1. Codex: 一个帮助构建和交付产品的编程智能体。
  2. Hermes Agent: 一个开源的、可自我改进的 AI 智能体。
  3. pi: 一个编程智能体。
  4. Claude Code: Anthropic 的智能体编程工具。
  5. OpenClaw: 一个开源的 AI 智能体,可连接消息应用并执行实际操作。

API 快速入门:

开发者可以通过 OpenRouter 的 API(兼容 OpenAI 格式)轻松调用此模型。只需将 API 基础 URL 替换为 OpenRouter 的地址,并使用模型标识符 openai/gpt-5.6-sol 即可。该模型支持流式传输和推理令牌(显示模型的逐步思考过程)。

评论总结

根据评论内容,主要观点和论据如下:

1. 价格战与市场竞争(认可度较高) - 降价后Luna和Sol更具竞争力,但已有更便宜的替代品(如Grok 4.6)。 - 关键引用:Fergusonb "Luna saw a huge jump after the price cut... one of the more competitive models";"there are already cheaper models with Sol's intelligence... Grok 4.6 at $6/m makes it a tougher sell"

2. 模型性能争议(认可度中等) - 部分用户认为Sol 5.6在简单任务上表现不佳,过度复杂化;而5.4更简洁。 - 关键引用:vorpalhex "5.6 to be worse at most simple tasks and frequently over complicate things";"gave the same task to 5.4 and got the small list of checkboxes"

3. 降价范围与动机(认可度中等) - 降价仅限OpenRouter,非OpenAI官方价格;可能为获取用户对话数据或抢占市场。 - 关键引用:OutOfHere "price cut is limited to OpenRouter. It does not apply for the native OpenAI price";josh-wrale "motivated by the value of the thinking traces gleaned from the traffic?"

4. 用户实际体验(认可度较高) - 部分用户认为Sol 5.6能力出色,token消耗少,甚至考虑取消Claude订阅。 - 关键引用:netsec_burn "incredibly capable model and uses far fewer tokens/time thinking";"I think I may cancel my Claude subscription finally"

5. 商业策略与成本(认可度中等) - 降价幅度大暗示原价利润空间高;OpenRouter被Stripe收购后可能调整定价。 - 关键引用:zrhoone "original price might have carried a massive operating margin";dvrp "Stripe has just acquired OpenRouter for >$7B... explains this move"

6. 负面反馈(认可度较低) - 缺乏ZDR功能、担心数据中心过剩等。 - 关键引用:tartakovsky "No ZDR. No dice.";m4rtink "Price wars did wonders... Overgrown datacenters or mounds of GPUs dumped into the harbour?"