Hacker News 中文摘要

RSS订阅

DeepSeek-V4-Flash 更新 -- DeepSeek-V4-Flash Update

文章摘要

DeepSeek-V4-Flash API进入公开测试,调用方式不变,只需将模型名设为deepseek-v4-flash。该版本显著增强了智能体能力,多项基准测试结果远超V4-Pro-Preview,并原生支持Responses API格式及Codex适配。

文章总结

2026年7月31日

DeepSeek-V4-Flash 更新

DeepSeek-V4-Flash API 现已正式进入公开测试阶段。API 调用方式保持不变,只需将模型名称设置为 deepseek-v4-flash 即可使用最新版本。

智能体能力显著增强,多项基准测试结果大幅超越 V4-Pro-Preview:

  • Terminal Bench 2.1:82.7
  • NL2Repo:54.2
  • Cybergym:76.7
  • DeepSWE:54.4
  • Toolathlon verified:70.3
  • Agent Last Exam:25.2
  • Automation Bench (Public):25.1
  • DSBench-FullStack:68.7
  • DSBench-Hard:59.6

注1:官方 DeepSeek-V4-Flash 在公开基准测试的代码智能体任务中,采用即将发布的 DeepSeek Harness 最小模式作为框架,使用最大努力级别,top_p=0.95,temperature=1.0。

注2:DSBench-FullStack 为内部全栈开发测试集,DSBench-Hard 为内部编码智能体难题测试集。

官方 V4-Flash 原生支持 Responses API 格式,并专门适配了 Codex。具体配置请参考相关文档。

DeepSeek-V4-Flash-0731 保持与 DeepSeek-V4-Flash-Preview 相同的模型架构和规模,仅进行了重新后训练。

注意:本次更新仅升级了 DeepSeek-V4-Flash API,DeepSeek-V4-Pro API 及 APP/WEB 模型保持不变。

DeepSeek-V4-Pro 的正式版本即将发布。


2026年4月24日

DeepSeek-V4

DeepSeek API 现已支持 V4-Pro 和 V4-Flash,可通过 OpenAI ChatCompletions 接口和 Anthropic 接口使用。访问新模型时,base_url 保持不变,模型参数应设置为 deepseek-v4-prodeepseek-v4-flash

两个旧版 API 模型名称 deepseek-chatdeepseek-reasoner 将在三个月后(2026年7月24日)停止使用。在此期间,这两个模型名称分别指向 deepseek-v4-flash 的非思考模式和思考模式。


2025年12月1日

DeepSeek-V3.2

deepseek-chatdeepseek-reasoner 均已升级至 DeepSeek-V3.2。deepseek-chat 对应 V3.2 的非思考模式,deepseek-reasoner 对应其思考模式。

DeepSeek-V3.2-Speciale

DeepSeek-V3.2-Speciale 通过临时端点提供服务,定价与 V3.2 相同,不支持工具调用,有效期至 2025年12月15日 15:59(UTC 时间)。


2025年9月29日

DeepSeek-V3.2-Exp

deepseek-chatdeepseek-reasoner 均已升级至 DeepSeek-V3.2-Exp。deepseek-chat 对应 V3.2-Exp 的非思考模式,deepseek-reasoner 对应其思考模式。


2025年9月22日

DeepSeek-V3.1-Terminus

deepseek-chatdeepseek-reasoner 均已升级至 DeepSeek-V3.1-Terminus。本次更新在保持模型原有能力的同时,解决了用户反馈的问题,包括:减少中英文混杂和异常字符的出现,以及进一步优化代码智能体和搜索智能体的性能。


2025年8月21日

DeepSeek-V3.1

deepseek-chatdeepseek-reasoner 均已升级至 DeepSeek-V3.1。主要更新包括:混合推理架构(单模型同时支持思考和非思考模式)、推理效率提升(相比 DeepSeek-R1-0528 显著缩短回答时间)、以及智能体能力增强(在工具使用和智能体任务方面取得重大进展)。


2025年5月28日

deepseek-reasoner

deepseek-reasoner 模型升级至 DeepSeek-R1-0528,推理能力显著增强(AIME 2025 提升 17.5 分,GPQA 提升 9.5 分等),前端开发效果优化,幻觉问题大幅减少,并新增 JSON 输出和函数调用支持。


2025年3月24日

deepseek-chat

deepseek-chat 模型升级至 DeepSeek-V3-0324,推理能力大幅提升(MMLU-Pro 提升 5.3 分,AIME 提升 19.8 分等),前端网页开发优化,中文写作水平升级,多轮交互改写、翻译质量和信件写作优化,中文搜索能力增强,函数调用准确性提升。


2025年1月20日

deepseek-reasoner

deepseek-reasoner 是新的 DeepSeek-R1 模型,可通过指定 model='deepseek-reasoner' 调用。


2024年12月26日

deepseek-chat

deepseek-chat 模型已升级至 DeepSeek-V3,API 保持不变。


2024年12月10日

deepseek-chat

deepseek-chat 模型升级至 DeepSeek-V2.5-1210,数学能力(MATH-500 从 74.8% 提升至 82.8%)、编码能力(LiveCodebench 从 29.2% 提升至 34.38%)以及写作和推理能力均有提升,同时优化了文件上传和网页摘要功能的用户体验。


2024年9月5日

deepseek-coder 和 deepseek-chat 升级至 DeepSeek V2.5

DeepSeek V2 Chat 和 DeepSeek Coder V2 合并升级为新模型 DeepSeek V2.5。新模型在通用能力和代码能力上均显著超越前代版本,在写作任务和指令遵循等方面进行了优化,代码生成能力进一步增强。


2024年8月2日

API 推出磁盘上下文缓存技术

DeepSeek API 创新性地采用硬盘缓存,使价格再降低一个数量级。


2024年7月25日

新 API 功能

更新了 /chat/completions 接口,新增 JSON 模式、函数调用、聊天前缀补全(Beta)和 8K max_tokens(Beta);新增 /completions 接口,支持 FIM 补全(Beta)。


2024年7月24日

deepseek-coder

deepseek-coder 模型升级至 DeepSeek-Coder-V2-0724。


2024年6月28日

deepseek-chat

deepseek-chat 模型升级至 DeepSeek-V2-0628,推理能力提升(HumanEval 从 79.88% 提升至 84.76%,MATH 从 55.02% 提升至 71.02%,BBH 从 78.56% 提升至 83.40%),角色扮演能力显著增强。


2024年6月14日

deepseek-coder

deepseek-coder 模型升级至 DeepSeek-Coder-V2-0614,编码能力显著增强,在代码生成、理解、调试和补全方面达到 GPT-4-Turbo-0409 水平,同时具备优秀的数学和推理能力。


2024年5月17日

deepseek-chat

deepseek-chat 模型升级至 DeepSeek-V2-0517,指令遵循能力大幅提升(IFEval Benchmark 从 63.9% 提升至 77.6%),优化了系统提示词部分的指令遵循能力,JSON 格式输出准确性提升(解析率从 78% 提升至 85%,引入正则表达式后可进一步提升至 97%)。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 性能大幅提升,与顶级模型竞争(评分:无)

    • 评论1指出,DeepSeek V4 Flash在Terminal Bench(82.7 vs 78.4)和Toolathlon(70.3 vs 53.1)上超越GPT-5.6 Terra,但在DeepSWE(54.4 vs 69.6)和Agents' Last Exam(25.2 vs 50.4)上落后,双方互有胜负。
    • 评论4强调:“This is actually a HUGE improvement in the model's capabilities rather than just a small tweak.”(这实际上是模型能力的巨大提升,而非小修小补。)
    • 评论10认为:“This 300B model outperforms the previous DS4 Pro preview model (1.8T params)”(这个300B模型超越了之前的DS4 Pro预览版1.8T参数模型),且价格更低。
  2. 性价比极高,适合本地部署(评分:无)

    • 评论2指出:“Dsv4 models are extremely cheap to serve... having fast cheap models getting better is great for the community.”(DSv4模型服务成本极低……快速廉价的模型越来越好,对社区是好事。)
    • 评论3提到:“it's DeepSeek-V4-Flash-284B-A13B... it should just barely run on a single B300”(这是DeepSeek-V4-Flash-284B-A13B,勉强能在单张B300上运行)。
    • 评论11分享:“I use deepseek flash... It's just incredible for the price... still didn't hit even 50 bucks of usage in a month.”(我用DeepSeek Flash……价格令人难以置信……一个月使用费不到50美元。)
  3. 对本地推理和开源生态的积极影响(评分:无)

    • 评论6表示:“This model makes me very optimistic about the future of local inference.”(这个模型让我对本地推理的未来非常乐观。)
    • 评论9说:“This runs at mega-speed on prosumer hardware (2x RTX Pro 6000).”(它在消费级硬件2x RTX Pro 6000上运行速度极快。)
    • 评论2补充:“at least flash can be ran 'at home' with <10k in hardware”(至少Flash可以用不到1万美元的硬件在家运行)。
  4. 潜在问题与担忧(评分:无)

    • 评论5指出:“DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks.”(DeepSeek V4 Flash虽然更便宜,但没有视觉能力,这对智能体任务很重要。)
    • 评论15担忧:“in the deepseek APIs, the cost is leaking all information about codebases to China.”(在DeepSeek API中,成本会向中国泄露所有代码库信息。)
    • 评论14批评命名混乱:“Why not call it V4.1?”(为什么不叫V4.1?)

平衡性总结: - 正面观点:性能显著提升,与GPT-5.6等顶级模型竞争;性价比极高,适合本地部署和低成本使用;对开源生态和本地推理有积极影响。 - 负面/担忧:缺乏视觉能力,可能限制智能体任务;数据隐私风险(代码库信息泄露);命名混乱可能导致混淆。