Hacker News 中文摘要

RSS订阅

DeepSeek V4 Flash 0731 -- DeepSeek V4 Flash 0731

文章摘要

DeepSeek V4 Flash 0731在ARC-AGI基准测试中取得了新的结果,展示了其在抽象推理任务上的性能表现。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删除了与主题无关的导航、页脚等内容。


标题:DeepSeek V4 Flash 0731 - ARC-AGI 测试结果

来源: ARC Prize 官网

核心内容:

DeepSeek 公司于2026年7月31日发布了其模型 DeepSeek V4 Flash 0731 在 ARC-AGI 基准测试上的结果。该模型提供了三种推理变体(高、中、低)。

在最大努力(Max effort)下,该模型在 ARC-AGI-1 半私有测试集上取得了 89.0% 的得分,每项任务成本为 0.02美元;在 ARC-AGI-2 半私有测试集上取得了 61.4% 的得分,每项任务成本为 0.04美元

验证得分(Verified Scores):

| 变体 | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3 | | :--- | :--- | :--- | :--- | | 最高 (Max) | 89.0% | 61.4% | — | | 高 (High) | 87.0% | 56.0% | — | | 低 (Low) | 84.0% | 46.0% | — |

任务与环境:

页面详细列出了模型在 ARC-AGI-2 公共评估集(120个任务)和 ARC-AGI-1 公共评估集(400个任务)中,每个任务在三种推理变体下的通过/失败情况。表格展示了每个任务的唯一ID及其在“最高”、“高”、“低”三种配置下的测试结果(✓ 表示通过,✗ 表示失败)。

相关链接:

  • 论文: arxiv.org/abs/2606.19348
  • 模型: huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 性价比极高:多数评论认可DeepSeek V4 Flash在性能与成本上的优势。例如,tosh指出“results comparable to GPT-5.6 Luna but cheaper”(结果与GPT-5.6 Luna相当但更便宜),LaurensBER强调“good enough to use it for (almost) everything and cheap enough that the cost are irrelevant”(几乎适用于所有场景,且成本无关紧要)。dcchambers称其“almost at the 'too cheap to meter' level”(几乎达到“便宜到无需计量”的程度)。

  2. 性能与实用性:部分评论认为其性能虽非顶尖但足够实用。mosura推荐用于编程任务,称“It is strong (not Fable strong though) with a much better 'persona' than Opus”(虽不如Fable强,但比Opus有更好的“个性”)。SwellJoe表示“DeepSeek models seem to be generally as good as the benchmarks indicate”(DeepSeek模型通常与基准测试表现一致)。

  3. 成本与价格争议:有评论质疑价格作为衡量标准的有效性。muricula认为“Price is confounded by VC subsidies, economies of scale, and inference optimizations”(价格受风投补贴、规模经济和推理优化影响),antirez建议“Active parameters per token are. Joule would be even better”(每token活跃参数或焦耳更合适)。Havoc提醒“They did recently announce they're increasing prices”(他们最近宣布涨价)。

  4. 技术局限与问题:iagooar指出“tool calling with it is SLOW”(工具调用速度慢),esafak批评“like many Chinese models, it uses a lot of tokens to get work done”(像许多中国模型一样,使用大量token完成任务)。

  5. 行业影响与展望:542458感叹“same performance for 1/20th of the price. Wild how fast this is advancing”(相同性能价格降至1/20,进展惊人)。surprisetalk类比“pareto-style speedrun record charts when a new glitch is discovered”(发现新漏洞时的帕累托式速通记录图),暗示重要突破尚未到来。

平衡性总结: - 正面:性价比突出,实用性强,适合编程等任务,成本低至可忽略。 - 负面:工具调用慢,token消耗大,价格可能上涨,且非前沿模型。 - 中立:价格作为衡量标准有争议,需关注技术细节(如活跃参数、推理优化)。