Hacker News 中文摘要

RSS订阅

GPT 5.6 Sol 是 OpenAI 发布的最强“视觉”模型 -- GPT 5.6 Sol is the best "vision" model OpenAI ever released

文章摘要

OpenAI发布GPT-5.6系列模型,包括Sol、Terra和Luna。其中Sol在视觉任务上表现最佳,尤其在物体检测和计数方面显著超越前代GPT-5.5。Terra和Luna虽不及Sol,但相比GPT-5.5也有明显进步。

文章总结

好的,这是根据您的要求,对原文主要内容进行的中文重述,已保留关键细节并删减了与主题无关的内容。


标题:GPT-5.6 Sol 是 OpenAI 发布的最强“视觉”模型

上周,OpenAI 发布了 GPT-5.6 系列模型,包括 Sol、Terra 和 Luna。为了评估其视觉能力,我们通过即将发布的 VLM 基准测试对它们进行了检验,该测试涵盖了目标检测、计数、OCR 和数据提取等常见视觉任务。

核心结论: Sol 是 OpenAI 迄今为止发布的最强视觉模型,其进步在目标检测和计数方面尤为显著。Terra 和 Luna 虽不及 Sol,但相比 GPT-5.5 也有明显提升。

目标检测: 这是 GPT-5.6 进步最明显的领域。GPT-5.5 的 mAP@50 得分为 13.8,而 Sol 达到了 46.2,Terra 和 Luna 也分别达到 44.7 和 43.3,将目标检测从主要短板提升为实用能力。Sol 在文档布局检测和密集场景(如药片、鸡蛋)检测中表现良好。为获得最佳检测结果,应提示模型返回图像像素坐标系下的绝对 XYXY 坐标。但 Sol 在处理约 2000x2000 像素或更大的图像时,稳定性会下降,尤其是在低推理能力设置下。提高推理能力可改善稳定性,但会增加 token 使用量、延迟和成本。最实用的解决方法是先调整或裁剪大图像。

目标计数: 整个 GPT-5.6 系列的计数能力都有所提升。Sol 的准确率达到 73.0%,高于 GPT-5.5 的 64.9%,Terra 和 Luna 分别为 67.6% 和 66.2%。Sol 能处理高度重叠的物体以及需要理解规则(如只计算特定区域内的弹孔)的复杂计数任务。然而,在计数泡罩包装中的药片或空槽时,由于重复布局和反光等因素,表现较为困难。

OCR 与数据提取: OCR 性能与 GPT-5.5 持平,Sol 的平均相似度得分为 90.7%,略低于 GPT-5.5 的 91.2%。但在文本提取方面,Sol 得分为 82.5%,低于 GPT-5.5 的 87.6%。Sol 在处理手写笔记和复杂场景中的文字(如轮胎上的序列号、冰球比赛比分)时表现良好,但在读取泡罩包装上小、垂直、低对比度且反光的有效期时仍会失败。

权衡取舍: 视觉能力的提升伴随着更高的 token 使用量。Sol 平均每张图像处理时间接近 10 秒,成本约 2.5 美分;Terra 约 6 秒,成本约 1 美分;Luna 略超 5 秒,成本低于 0.5 美分。Luna 在延迟和质量之间取得了最佳平衡。相比之下,Gemini 3.5 Flash 每张图像成本仅 0.8 美分,且在检测和计数基准测试中仍处于领先地位,是数据密集型工作负载的强力选择。

总结: 通过 GPT-5.6,OpenAI 已大幅缩小了与领先 VLM 的差距。目标检测从弱点变为可用能力,计数能力也全面提升。然而,Sol 仍存在成本、延迟和某些检测不稳定的问题。对于智能体、屏幕理解、文档处理和视觉推理等应用,此次发布使 OpenAI 成为了一个比以往更具竞争力的选择。

评论总结

根据评论内容,用户对GPT 5.6 Sol的视觉能力存在显著分歧,同时Gemini 3.5 Flash在性价比上表现突出。以下是主要观点总结:

1. 正面评价:视觉能力出色,尤其在复杂任务上 - 评论1(weli)认为Sol在UI设计分析上优于Claude,能有效重组页面结构:“Sol does a great job at re-structuring the page into composable units...” - 评论7(logicallee)称赞Sol在识别微弱反射等极端挑战中的表现:“It did very well on an extremely challenging task...” - 评论9(5555watch)提到在超市场景中,Sol能准确识别并定位商品:“Worked marvelously... including the cases where the object wasn't present.” - 评论20(kherud)指出Sol成功转录乐谱:“5.6 Sol nailed the small test case... Fluently reading music requires multiple years of training.”

2. 负面评价:仍存在明显局限,甚至不如传统方法 - 评论2(sscaryterry)认为Sol与其他模型一样“盲目”:“it has no taste, no attention to any sort of detail.” - 评论3(Razengan)抱怨Sol在图像扩展任务中频繁出错:“it constantly keeps getting something wrong no matter what I tell it.” - 评论16(mv4)指出药丸计数任务可用OpenCV轻松解决:“can be easily solved with OpenCV template matching, a technology created 25 years ago.” - 评论19(WarmWash)批评Sol误诊植物病害:“misidentifying the malaise... which only spread the fungus.”

3. 对比Gemini:Gemini 3.5 Flash在性价比上胜出 - 评论10(adroitboss)惊讶于Gemini 3.5 Flash在多数指标上领先:“I didn't expect Gemini 3.5 Flash to top basically every metric.” - 评论18(HarHarVeryFunny)强调Gemini不仅性能更好,成本仅为1/3:“Gemini 3.5 Flash not only outperformed GPT 5.6 Sol, but did so at 1/3 of the cost.” - 评论12(catigula)简单总结:“Still not quite as good as gemini.”

4. 其他关注点:基准测试方法、模型选择与未来方向 - 评论8(iamniels)质疑药丸计数作为基准的合理性:“That is a task which you would perform with OpenCV right?” - 评论11(iamleppert)希望看到Qwen的基准测试:“Where are the Qwen benchmarks in this?” - 评论24(criddell)询问是否有双目视觉基准:“Are any of these vision benchmarks binocular...?” - 评论25(ParanoidShroom)认为Sol作为通用模型表现令人印象深刻,但推理成本仍需优化:“Inference cost and speed does still seem to be below user expectations.”

总结:GPT 5.6 Sol在复杂视觉任务(如UI分析、微弱反射识别、乐谱转录)上表现出色,但在细节处理、图像扩展和传统任务(如药丸计数)上存在明显不足。Gemini 3.5 Flash在多数基准测试中性能更优且成本更低,成为更实用的选择。用户对基准测试方法(如药丸计数)和模型选择(如Qwen)也有进一步讨论。