文章摘要
Grok 4.6发布,专注于长时运行代理和复杂交互任务,在多个编程和知识工作基准测试中达到前沿水平,性能匹配GPT-5.6 Sol,即日起在Cursor和Grok Build平台可用。
文章总结
好的,这是根据您的要求,对原文进行的中文重述:
标题:Grok 4.6 发布
核心内容:
今天,我们发布了 Grok 4.6。该版本在 Grok 4.5 的基础上,重点优化了长时间运行的智能体任务,并提升了其在交互式和视觉工作方面的能力。它能处理需要多步骤完成的复杂任务,例如研究主题、分析信息、处理代码库,或将创意转化为成熟的应用程序或工作成果。
在多项智能体编程和知识工作基准测试中,Grok 4.6 达到了前沿水平。在综合九项基准测试得分的“人工智能分析智能指数”上,它与 GPT-5.6 Sol 持平。
训练过程:
Grok 4.6 经历了比 4.5 版本更长的补充训练。训练使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,并采用了改进的优化器和训练方案。这为后续的监督微调和强化学习阶段奠定了更坚实的基础。随后,团队利用 Grok 4.5 重新生成了推理、智能体框架以及 STEM、软件工程和知识工作等领域的监督微调轨迹,并通过模型检查过滤了有问题的轨迹,最终得到的模型性能强劲,行为表现更佳。
能力提升:
在将宽泛的产品创意转化为可用的初版应用方面,Grok 4.6 表现尤为出色。它能研究不熟悉的领域、构建应用结构、实现核心交互,并通过多轮反馈持续优化。在更长的任务轨迹中,模型开始展现出更多的自我测试和验证行为。与 4.5 版本相比,Grok 4.6 在视觉和交互项目上的首次输出质量更高,能够一次性为应用建立结构和视觉语言。
安全与评估:
Grok 4.6 的安全防护措施已根据其能力进行了改进和校准,旨在最大化合法用例的效用和安全性。在漏洞修补、加速工程设计周期和增强人工智能研究等领域,该模型既能提供帮助,又能确保安全。此次部署前的测试范围是迄今为止最广泛的。
性能数据(部分关键指标):
- AA 智能指数: Grok 4.6 得分为 61,与 GPT-5.6 Sol 和 Fable 5 相当。
- CursorBench v3.2: Grok 4.6 得分为 69.9%,领先于 GPT-5.6 Sol (67.2%) 和 Grok 4.5 (66.7%)。
- DeepSWE v1.1: Grok 4.6 得分为 65.9%,高于 Grok 4.5 (54%),但低于 GPT-5.6 Sol (73%) 和 Fable 5 (70%)。
- FrontierCode v1.1: Grok 4.6 得分为 61.3%,领先于 Grok 4.5 (56.6%) 和 GPT-5.6 Sol (60.6%)。
- Terminal-Bench v3.0: Grok 4.6 得分为 26%,低于 GPT-5.6 Sol (34.6%) 和 Fable 5 (34.1%)。
获取方式与定价:
Grok 4.6 即日起可在 Cursor 和 Grok Build 中使用,也可通过 API 及 OpenRouter、Vercel、Cloudflare 等合作伙伴获取。定价为每百万输入 token 2 美元,每百万输出 token 6 美元。此外,还提供速度更快的变体,价格为两倍。为鼓励用户体验,在发布首周,Grok Build 和 Cursor 中的使用量将翻倍。
评论总结
以下是对评论内容的总结,基于主要观点、论据和认可度(评分均为None,故未单独标注),保持不同观点的平衡性,并保留关键引用(中英文)。
主要观点与论据
1. 性能与竞争力提升(正面评价)
- 观点:Grok 4.6在性能上显著提升,接近或超越其他前沿模型(如Fable、GPT-5.6-Sol),且成本更低。
- 关键引用:
- "Fable level performance, faster and significantly cheaper. Wow!"(sergiotapia)
- "Fable-like intelligence, beats GPT-5.6-Sol on most benchmarks, cheaper than Kimi K3 on API"(cjalmeida)
- 认可度:多位用户表示印象深刻,认为Grok成为有力竞争者。
2. 对模型发布时机的质疑(怀疑论)
- 观点:Grok 4.6在DeepSeek-V4-Pro-0813发布后立即推出,且其他实验室在Fable发布后两个月内也推出类似模型,引发对技术来源(如蒸馏、基准测试操纵)的怀疑。
- 关键引用:
- "Just after DeepSeek-V4-Pro-0813 published, is this on purpose?"(zxilly)
- "Anyone else find it weird how within 2 months of Fable releasing all the major labs suddenly had Fable-level models?"(causal)
- 认可度:部分用户认为时间点可疑,但未获广泛支持。
3. 对Grok的负面评价(政治与信任问题)
- 观点:Grok因与马斯克关联而引发信任危机,用户担心数据隐私、政治倾向(如“纳粹AI”标签)及声誉问题。
- 关键引用:
- "I'd literally trust a Chinese AI company with my data over anything Musk is involved with."(nater5000)
- "Nobody wants a nazi AI"(oulipo)
- 认可度:多位用户表达强烈不满,认为Grok因马斯克行为而不可信。
4. 对Grok的正面评价(竞争与尊重)
- 观点:尽管马斯克有争议,但Grok的进步值得尊重,为市场带来健康竞争。
- 关键引用:
- "You may not like Elon, but you must respect him... Competition is good."(sawjet)
- "I think Grok provides healthy competition to the other labs"(Jcampuzano2)
- 认可度:部分用户认可其技术成就,但承认政治因素影响接受度。
5. 对具体功能的反馈(设计、语音模式)
- 观点:Grok 4.6在视觉和交互项目上表现更好,但设计声明需独立验证;语音模式近期变差。
- 关键引用:
- "As a designer, I'm always hesitant to believe these statements until there's independent comparisons"(GenerWork)
- "grok's voice mode got stupid and terse ~2 weeks ago"(nomilk)
- 认可度:用户对功能改进持谨慎态度,并指出具体问题。
平衡性总结
- 正面:性能提升、成本优势、竞争促进。
- 负面:信任危机(数据隐私、政治倾向)、发布时机可疑、功能不稳定。
- 中立:部分用户认可技术但保留意见,强调独立验证的重要性。