Hacker News 中文摘要

RSS订阅

Grok 4.6 -- Grok 4.6

文章摘要

Grok 4.6发布,专注于长时运行代理和复杂交互任务,在多个编程和知识工作基准测试中达到前沿水平,性能匹配GPT-5.6 Sol,即日起在Cursor和Grok Build平台可用。

文章总结

好的,这是根据您的要求,对原文进行的中文重述:

标题:Grok 4.6 发布

核心内容:

今天,我们发布了 Grok 4.6。该版本在 Grok 4.5 的基础上,重点优化了长时间运行的智能体任务,并提升了其在交互式和视觉工作方面的能力。它能处理需要多步骤完成的复杂任务,例如研究主题、分析信息、处理代码库,或将创意转化为成熟的应用程序或工作成果。

在多项智能体编程和知识工作基准测试中,Grok 4.6 达到了前沿水平。在综合九项基准测试得分的“人工智能分析智能指数”上,它与 GPT-5.6 Sol 持平。

训练过程:

Grok 4.6 经历了比 4.5 版本更长的补充训练。训练使用了经过筛选的模型生成数据(用于推理和高级技术概念)、高质量的工程数据,并采用了改进的优化器和训练方案。这为后续的监督微调和强化学习阶段奠定了更坚实的基础。随后,团队利用 Grok 4.5 重新生成了推理、智能体框架以及 STEM、软件工程和知识工作等领域的监督微调轨迹,并通过模型检查过滤了有问题的轨迹,最终得到的模型性能强劲,行为表现更佳。

能力提升:

在将宽泛的产品创意转化为可用的初版应用方面,Grok 4.6 表现尤为出色。它能研究不熟悉的领域、构建应用结构、实现核心交互,并通过多轮反馈持续优化。在更长的任务轨迹中,模型开始展现出更多的自我测试和验证行为。与 4.5 版本相比,Grok 4.6 在视觉和交互项目上的首次输出质量更高,能够一次性为应用建立结构和视觉语言。

安全与评估:

Grok 4.6 的安全防护措施已根据其能力进行了改进和校准,旨在最大化合法用例的效用和安全性。在漏洞修补、加速工程设计周期和增强人工智能研究等领域,该模型既能提供帮助,又能确保安全。此次部署前的测试范围是迄今为止最广泛的。

性能数据(部分关键指标):

  • AA 智能指数: Grok 4.6 得分为 61,与 GPT-5.6 Sol 和 Fable 5 相当。
  • CursorBench v3.2: Grok 4.6 得分为 69.9%,领先于 GPT-5.6 Sol (67.2%) 和 Grok 4.5 (66.7%)。
  • DeepSWE v1.1: Grok 4.6 得分为 65.9%,高于 Grok 4.5 (54%),但低于 GPT-5.6 Sol (73%) 和 Fable 5 (70%)。
  • FrontierCode v1.1: Grok 4.6 得分为 61.3%,领先于 Grok 4.5 (56.6%) 和 GPT-5.6 Sol (60.6%)。
  • Terminal-Bench v3.0: Grok 4.6 得分为 26%,低于 GPT-5.6 Sol (34.6%) 和 Fable 5 (34.1%)。

获取方式与定价:

Grok 4.6 即日起可在 Cursor 和 Grok Build 中使用,也可通过 API 及 OpenRouter、Vercel、Cloudflare 等合作伙伴获取。定价为每百万输入 token 2 美元,每百万输出 token 6 美元。此外,还提供速度更快的变体,价格为两倍。为鼓励用户体验,在发布首周,Grok Build 和 Cursor 中的使用量将翻倍。

评论总结

以下是对评论内容的总结,基于主要观点、论据和认可度(评分均为None,故未单独标注),保持不同观点的平衡性,并保留关键引用(中英文)。

主要观点与论据

1. 性能与竞争力提升(正面评价)

  • 观点:Grok 4.6在性能上显著提升,接近或超越其他前沿模型(如Fable、GPT-5.6-Sol),且成本更低。
  • 关键引用
    • "Fable level performance, faster and significantly cheaper. Wow!"(sergiotapia)
    • "Fable-like intelligence, beats GPT-5.6-Sol on most benchmarks, cheaper than Kimi K3 on API"(cjalmeida)
  • 认可度:多位用户表示印象深刻,认为Grok成为有力竞争者。

2. 对模型发布时机的质疑(怀疑论)

  • 观点:Grok 4.6在DeepSeek-V4-Pro-0813发布后立即推出,且其他实验室在Fable发布后两个月内也推出类似模型,引发对技术来源(如蒸馏、基准测试操纵)的怀疑。
  • 关键引用
    • "Just after DeepSeek-V4-Pro-0813 published, is this on purpose?"(zxilly)
    • "Anyone else find it weird how within 2 months of Fable releasing all the major labs suddenly had Fable-level models?"(causal)
  • 认可度:部分用户认为时间点可疑,但未获广泛支持。

3. 对Grok的负面评价(政治与信任问题)

  • 观点:Grok因与马斯克关联而引发信任危机,用户担心数据隐私、政治倾向(如“纳粹AI”标签)及声誉问题。
  • 关键引用
    • "I'd literally trust a Chinese AI company with my data over anything Musk is involved with."(nater5000)
    • "Nobody wants a nazi AI"(oulipo)
  • 认可度:多位用户表达强烈不满,认为Grok因马斯克行为而不可信。

4. 对Grok的正面评价(竞争与尊重)

  • 观点:尽管马斯克有争议,但Grok的进步值得尊重,为市场带来健康竞争。
  • 关键引用
    • "You may not like Elon, but you must respect him... Competition is good."(sawjet)
    • "I think Grok provides healthy competition to the other labs"(Jcampuzano2)
  • 认可度:部分用户认可其技术成就,但承认政治因素影响接受度。

5. 对具体功能的反馈(设计、语音模式)

  • 观点:Grok 4.6在视觉和交互项目上表现更好,但设计声明需独立验证;语音模式近期变差。
  • 关键引用
    • "As a designer, I'm always hesitant to believe these statements until there's independent comparisons"(GenerWork)
    • "grok's voice mode got stupid and terse ~2 weeks ago"(nomilk)
  • 认可度:用户对功能改进持谨慎态度,并指出具体问题。

平衡性总结

  • 正面:性能提升、成本优势、竞争促进。
  • 负面:信任危机(数据隐私、政治倾向)、发布时机可疑、功能不稳定。
  • 中立:部分用户认可技术但保留意见,强调独立验证的重要性。