Hacker News 中文摘要

RSS订阅

加速GPT-5.6 Sol超快 -- Accelerating GPT-5.6 Sol Ultrafast

文章摘要

Cerebras与OpenAI合作推出Ultrafast Mode服务,由Cerebras驱动GPT-5.6 Sol,每秒输出高达750个token且质量无损,速度比Fable 5快11倍、比Opus 4.8快5倍,解决了速度与智能的权衡问题。

文章总结

今天,Cerebras 与 OpenAI 联合发布了“超快模式”的早期预览。这是 OpenAI API 中率先推出的新服务层级,由 Cerebras 提供技术支持。该模式初期面向特定客户群体开放,后续将逐步扩大使用范围。在超快模式下,GPT-5.6 Sol 每秒可输出高达 750 个令牌,且质量毫无妥协,从而加速您最紧迫、最关键的工作。

前所未有的前沿智能速度

AI 开发者过去常需在速度与智能之间做出取舍。随着模型规模和智能水平的提升,计算和数据移动成本增加,响应时间变慢。用户要么等待高质量结果,要么在更短时间内接受较差结果。

GPT-5.6 Sol 超快模式解决了这一矛盾,将前沿智能引入每一秒都至关重要的产品和流程中。根据 Artificial Analysis 的报告,超快模式下的 GPT-5.6 Sol 输出速度比 Fable 5 快 11 倍,比快速模式下的 Opus 4.8 快 5 倍。

Cerebras 通过“人类最后考试”对超快模式进行了测试。该基准测试包含 2500 个问题,通常只有化学、经济学和文学等领域的博士才能回答。评估中,超快模式下的 GPT-5.6 Sol 在 11 小时 11 分钟内回答了所有问题,而 Claude Fable 5 需要 78 小时 27 分钟(超过三天连续计算)才能得出相同结论。这意味着,超快模式在一个工作日内完成了人类知识前沿的探索,准确率相当,速度却快了近 7 倍。

随着模型能力持续进步,快速推理的应用范围也在扩大。GPT-5.6 Sol 是 OpenAI 在法律简报、金融模型和工程报告方面表现最佳的模型。在衡量经济价值知识工作的 GDP-Val 基准测试中,超快模式实现了 5.6 倍的端到端加速,且质量无下降,展示了更快推理如何加速高价值工作。

高速智能驱动高价值工作

更快的智能改变了个体和组织的可能性。借助超快模式,您可以将智能体置于分秒必争的关键问题路径上。OpenAI 产品负责人 Rohan Varma 表示:“GPT-5.6 Sol 超快模式让 Cerebras 实现了与您思考、编码和协作同步的 AI。我们期待看到超快推理如何改变工作流程和应用。”

超快模式为使用前沿 AI 快速响应信息的组织提供了持续优势。运营网络服务的公司可利用它快速定位并解决生产故障,维护客户信任,防止收入损失,并节省 SLA 中的停机时间。在对抗性、高风险的网络攻击中,超快模式是安全团队快速检测和应对恶意行为、遏制灾难性损失的宝贵工具。

更广泛地说,超快模式开启了与智能体协作的全新方式。它提供实时洞察和更新,让您无需在多个并行会话间切换,即可充分利用智能体。OpenAI 研究员 Jeffrey Wang 指出:“以前我可能需要等几分钟才能完成一项任务,现在任务在我切换注意力之前就完成了。这让我效率大大提高。”

借助超快模式,研究人员和工程师可以将注意力集中在最重要的关键问题上,同时继续使用标准模式处理常规任务。Cerebras 很高兴能为下一波 AI 创新提供动力,提升个体和组织通过响应式 AI 所能达到的成就上限。

突破性创新实现极速

超快模式下的 GPT-5.6 Sol 由 Cerebras 革命性的晶圆级引擎架构驱动,专为前沿 AI 工作负载设计。快速前沿推理本质上是数据移动问题:在 GPU 上,大型模型的推理受限于内存带宽,因为模型权重必须在芯片内存和外部存储之间反复传输,以生成响应中的连续令牌。

Cerebras 采用逆向思维消除这种低效数据移动:在每个晶圆级芯片上封装 44 GB 的 SRAM。权重保留在芯片上,令牌则通过跨晶圆流水线化的模型层不间断流动。这种技术方法随模型规模平滑扩展,为未来前沿模型持续保持速度优势铺平了道路。

超快模式:现已开放有限预览

超快模式下的 GPT-5.6 Sol 今日面向特定客户群体提供有限预览。随着容量增长,访问权限将逐步扩大。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 速度与性能突破(多数认可)

    • 评论7强调GPT-5.6 Sol Ultrafast模式在HLE测试中比Claude Fable 5快7倍("answered all 2,500 HLE questions in 11 hours... Claude Fable 5 needed 78 hours")。
    • 评论4认为速度被低估,Cursor的快速响应使其更实用("I was using Cursor's Composer... just because of how darn fast it was")。
    • 评论8称其"even faster than diffusion LLMs but with Fable-level quality"。
  2. 成本与定价疑虑(部分质疑)

    • 评论3指出无定价信息,可能暗示"if you have to ask... territory"。
    • 评论11担忧快速模式已更贵,Ultrafast可能耗尽配额("running out of my quota in one session")。
    • 评论15预测顶级开发者年推理支出将超5万美元("spending 50k USD+ on inference")。
  3. 技术局限与竞争(少数批评)

    • 评论13指出对比图遗漏Mimo v2.5-Pro("can achieve 1000tok/s... costs under 1/10th of Sol")。
    • 评论16质疑性能是否真正1:1匹配常规Sol("no actually solid statement on performance")。
    • 评论14推测模型参数可能较小("GPT-5.6 Sol is likely a lot smaller than people think")。
  4. 应用场景与影响(中性讨论)

    • 评论10认为编译时间将成为瓶颈("Compilation time will be a genuine bottleneck")。
    • 评论6预测未来本地推理将普及("thumbnail sized... fully local, fully offline")。
    • 评论12好奇"time-sensitive, mission-critical work"的具体用例。

平衡性总结:
评论整体对速度提升表示兴奋,但普遍关注定价不透明、性能一致性验证不足,以及可能带来的成本激增。少数评论指出竞争模型(如Mimo)在性价比上更具优势。