文章摘要
谷歌发布Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber三款新模型,旨在提升AI代理的令牌效率、降低延迟并增强可靠性。其中3.6 Flash在编码、知识工作和多模态性能上表现更优,输出令牌使用量较前代减少17%。
文章总结
谷歌于2026年7月21日发布三款新型Gemini模型:3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,旨在提升AI代理的构建效率、降低延迟并增强可靠性。
3.6 Flash作为主力模型,在编码、知识工作和多模态任务上表现更优,输出令牌使用量较3.5 Flash减少17%,部分基准测试中降幅高达65%,且价格更低(输入每百万令牌1.50美元,输出每百万令牌7.50美元)。它在DeepSWE基准测试中精度达49%(3.5 Flash为37%),MLE Bench得分63.9%(3.5 Flash为49.7%),OSWorld-Verified计算机使用能力达83.0%(3.5 Flash为78.4%),知识工作基准GDPval-AA v2得分1421(3.5 Flash为1349)。该模型还增强了化学、生物、放射、核及网络攻击领域的Frontier Safety防护。
3.5 Flash-Lite是3.5系列中最快的模型,每秒输出350个令牌,价格低廉(输入每百万令牌0.30美元,输出每百万令牌2.50美元)。它在编码和代理任务上显著优于3.1 Flash-Lite,例如Terminal-Bench 2.1得分54%(3.1 Flash-Lite为31%),GDM-MRCR v2长上下文得分72.2%(3.1 Flash-Lite为60.1%),GDPval-AA v2真实任务执行得分1140(3.1 Flash-Lite为642)。它甚至在某些评估中超越3 Flash,如SWE-Bench Pro得分54.2%(3 Flash为49.6%),OSWorld-Verified得分74.0%(3 Flash为65.1%)。
3.5 Flash Cyber专为网络安全设计,基于3.5 Flash微调,用于高效检测、验证和修复代码漏洞。它通过CodeMender代理协同工作,在CyberGym基准测试中达到前沿水平。该模型将仅通过有限访问试点计划提供给政府和受信合作伙伴,以优先保护关键漏洞,同时防止滥用。
3.6 Flash和3.5 Flash-Lite即日起可通过Google AI Studio、Android Studio、Gemini Enterprise Agent Platform及Gemini应用使用,3.5 Flash-Lite也正在Google搜索中推出。谷歌同时预告,3.5 Pro正在与合作伙伴测试,并已启动Gemini 4的预训练工作。
评论总结
根据评论内容,总结如下:
主要观点与论据:
性能与性价比争议
- 部分评论认为3.6 Flash性能不突出,且价格高于竞品(如GLM-5.2)。
- “It is both less intelligent and more expensive than GLM-5.2”(评分None,作者jgbuddy)
- “3.6 flash is more expensive than GLM 5.2 - but seemingly worse”(评分None,作者mw)
- 另一部分评论指出其效率提升:token效率比3.5高17%,且价格更低。
- “It is 17% more token-efficient than 3.5 and performs significantly better in coding and tool usage benchmarks”(评分None,作者nsbk)
- 部分评论认为3.6 Flash性能不突出,且价格高于竞品(如GLM-5.2)。
缺乏与竞品对比
- 多数评论批评Google仅与自家旧模型对比,未与前沿模型或中国实验室模型比较。
- “Google does not even bother to show benchmarks of these models compared to the frontier and Chinese labs”(评分None,作者velominati)
- “no comparison to other models here”(评分None,作者mw)
- 多数评论批评Google仅与自家旧模型对比,未与前沿模型或中国实验室模型比较。
对Google战略的质疑
- 评论认为Google在AI竞赛中落后,内部士气低落,领导层需调整。
- “Google desperately needs to make some leadership changes within their Gemini team”(评分None,作者kthinckley)
- “I don't want to know what morale is like at DeepMind right now”(评分None,作者mfkrause)
- 评论认为Google在AI竞赛中落后,内部士气低落,领导层需调整。
部分积极反馈
- 有用户认可Gemini在多模态(图像/音频分析)上的优势,并期待3.5 Pro。
- “Gemini has fallen behind in some areas, but is still one of the best multimodal models”(评分None,作者singingtoday)
- 也有用户对3.5 Lite的代理任务能力表示肯定。
- “3.5-lite is the real showpiece here; agentic models of this size are a huge value-add”(评分None,作者youssefarizk)
- 有用户认可Gemini在多模态(图像/音频分析)上的优势,并期待3.5 Pro。
具体问题与批评
- 知识截止日期与实际表现不符(如2025年事件无知)。
- “despite that the knowledge cut off is march 2026 it still knows nothing about 2025”(评分None,作者npn)
- 部分基准测试数据矛盾(如DeepSWE的65% vs 49%)。
- “So which one is it? 65% or 49%?”(评分None,作者dumberquestions)
- 知识截止日期与实际表现不符(如2025年事件无知)。
平衡性总结:
评论整体偏向负面,主要质疑性能、定价策略及缺乏竞品对比;少数正面评价聚焦于多模态能力和特定场景效率提升。用户对Google的AI战略普遍失望,认为其落后于OpenAI、DeepSeek等对手。