文章摘要
SpaceXAI的Grok 4.6在人工智能分析智能指数上得分为61,与GPT-5.6 Sol并列前沿,仅次于Claude Opus 5。该模型在代理性能上表现突出,且成本显著低于同类前沿模型,输入输出价格仅为Claude Opus 5和GPT-5.6 Sol的60%以下。
文章总结
根据提供的英文文章,以下是用中文重新陈述的主要内容,保留了关键细节,并删减了与主题无关的冗余内容(如重复图片引用和无关链接):
标题:Grok 4.6 重返智能前沿,成本效率领先
SpaceXAI 的 Grok 4.6 在人工智能分析智能指数中得分为 61,与 GPT-5.6 Sol 并列前沿水平,并在代理任务中表现突出,同时成本更低。相比 Grok 4.5,Grok 4.6 的智能指数提升 5 分,较 Grok 4.3 提升 23 分,使 SpaceXAI 重回智能前沿,仅次于 Anthropic。
关键要点: - 智能前沿地位:Grok 4.6 得分为 61,与 GPT-5.6 Sol(最高分)持平,略低于 Claude Opus 5(最高分 63)和 Claude Fable 5(最高分 62),略高于 Kimi K3。 - 代理性能强劲:在 GDPval-AA v2 代理知识工作评估中,Grok 4.6 的 Elo 得分为 1753,仅次于 Claude Opus 5,与 Claude Fable 5 和 Qwen3.8 Max 的置信区间重叠。在 τ³-Banking 多轮客服任务中得分为 50.7%,与 Qwen3.8 Max(51.3%)并列前两名;在 Terminal-Bench v2.1 终端软件任务中得分为 88.4%,与领先模型持平。 - 低成本前沿智能:Grok 4.6 的定价与 Grok 4.5 相同,为每百万输入/输出代币 2/6 美元,比 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)低 60% 以上。每任务成本为 0.84 美元,与 Kimi K3 相同,但智能水平略高,使其在智能与成本效率上处于帕累托前沿。 - 长周期代理工作:在 AA-Briefcase 基准测试中,Grok 4.6 的 Elo 得分为 1577,与 Claude Fable 5 同级,仅次于 Claude Opus 5 系列。其效率突出:平均约 53 轮对话和 0.5B 输入代币完成任务,而 Claude Opus 5(最高配置)需约 103 轮和 2.0B 输入代币。
其他模型细节: - 上下文窗口为 50 万代币(与 Grok 4.5 相同)。 - 缓存命中定价为每百万代币 0.5 美元,高于 Grok 4.5 的 0.3 美元。
代理性能分析:Grok 4.6 在代理任务上的表现优于静态推理。在 GDPval-AA v2 中,其 Elo 得分 1753 仅次于 Claude Opus 5,与 Claude Fable 5 和 Qwen3.8 Max 无显著差异。在 τ³-Banking(50.7%)和 Terminal-Bench v2.1(88.4%)中均处于领先水平,且成本优势使其在所有代理评估中处于帕累托前沿。
成本分析:Grok 4.6 在保持定价不变的情况下实现智能提升,这在智能前沿领域罕见。其每任务成本 0.84 美元,与得分相近的 Claude Opus 5(5/25 美元)和 GPT-5.6 Sol(5/30 美元)相比,输出代币价格优势显著,尤其适用于推理密集型任务。
长周期知识工作:在 AA-Briefcase 基准测试中,Grok 4.6 的 Elo 得分为 1577,与 Claude Fable 5 同级,在评分、演示质量和分析质量上表现均衡。其效率优势明显:平均 53 轮和 0.5B 输入代币,而 Claude Opus 5(最高配置)需 103 轮和 2.0B 输入代币,成本优势远超代币定价本身。
完整结果:人工智能分析智能指数中各项评估的详细数据可参考原文图表。
以上内容保留了文章的核心信息,删除了重复的图片引用和无关链接,使中文陈述更简洁清晰。
评论总结
以下是对评论内容的总结,涵盖主要观点、论据及不同立场,并保留关键引用:
1. 正面评价:性价比与性能优势 - 观点:Grok 4.5/4.6 在订阅价格和 token 使用量上优于 OpenAI 或 Anthropic,尤其适合编码场景。 - 论据:低层级计划即可使用大量 token,结合编排工具效果更佳;SpaceXAI 拥有自有算力和芯片工厂,有望以更低成本提供类似智能。 - 关键引用: - "Cursor, since Grok 4.5, has had an incredible deal for frontier level models... their subscription now goes way further than OpenAI or Anthropic." (satvikpendem) - "SpaceXAI is the only frontier model company that had its own compute/data centres... Grok build is 2-5x faster than Claude Code in my opinion." (small_model)
2. 负面评价:伦理、质量与效率问题 - 观点:Grok 存在数据安全风险(模型曾自称“MechaHitler”)、编码使用率低、训练碳排放高。 - 论据:用户不愿将代码交给有争议的模型;Grok 训练依赖便携式燃气发电机,效率远低于 DeepSeek 等模型。 - 关键引用: - "I’m perpetually surprised people feel comfortable sending their code to an LLM that was made to call itself MechaHitler." (TSiege) - "Grok's training... thanks to its portable gas generators... means the training for this model is dramatically less efficient than models like DeepSeek." (paimapi)
3. 中立/质疑观点:价格、竞争与品牌 - 观点:Grok 价格低廉但性能有限;收购 Cursor 后品牌整合存疑;与 Anthropic 的竞争关系复杂。 - 论据:缓存读取价格从 $0.30 涨至 $0.50;Grok 能完成基础任务但无法推进前沿数学;SpaceXAI 曾向 Anthropic 出售算力,引发竞争动机疑问。 - 关键引用: - "Seems the cache read pricing almost doubled from $0.30 in Grok 4.5 to $0.50 in Grok 4.6." (pzo) - "I'm just wondering why they sold compute to Anthropic if they were planning on still competing in this race?" (rd)
4. 其他讨论 - 观点:Grok 4.5 能力尚可但不及 Fable/Sol 级别;图像/视频生成质量低;用户对品牌更名(Cursor→Grok)持保留态度。 - 关键引用: - "Grok 4.5 is a capable model, although not quite at Fable/Sol levels." (petesergeant) - "part of me wishes they kept the branding... grok bot has no aura." (anr0)