Hacker News 中文摘要

RSS订阅

GPT-5.6、Grok 4.5、Claude 与 Muse Spark 构建相同的 4 款应用 -- GPT-5.6, Grok 4.5, Claude, and Muse Spark build the same 4 apps

文章摘要

根据用户反馈,文章重新评估了12个AI模型(包括GPT-5.6、Grok 4.5、Claude、Muse Spark等)构建4个应用的能力,每个模型尝试5次,并增加了开源模型对比,改进了评估方法,强调结果非客观但更透明。

文章总结

好的,这是根据您的要求,对原文进行的中文重述,保留了核心细节,并删减了与主题无关的推广性内容。


文章标题: GPT-5.6、Grok 4.5、Claude 和 Muse Spark 构建了相同的4个应用

核心内容:

本文延续了之前对AI模型编程能力的对比评测。在收到读者反馈后,本次评测进行了升级:引入了12个模型(包括GPT-5.6的三个版本、Grok 4.5、Claude Opus 4.8、Claude Fable 5、Meta的Muse Spark 1.1,以及GLM-5.2、Qwen 3.7 Plus、DeepSeek V4 Pro和Kimi K2.6等开源模型),针对4个应用任务,每个模型进行5次尝试,并公开所有原始结果供读者自行判断。

主要改进点: 1. 加入了开源模型作为对比。 2. 每个任务每个模型进行5次尝试,并公布所有结果链接,以展示模型表现的波动性。 3. 明确声明评测并非客观科学结论,仅为观察结果。

评测任务与结果:

任务1:Doom风格射线投射迷宫 * 要求: 第一人称视角,WASD移动,带深度阴影的墙壁,地板和天花板,碰撞检测。 * 结果: GPT系列整体表现最佳。GPT-5.6 Sol表现最稳定、细节最丰富。Grok 4.5在价格上极具竞争力。Muse Spark 1.1在成功运行的尝试中表现令人惊喜,但成功率不高(5次中仅2次成功)。Claude表现低于预期。GLM-5.2所有尝试均无法移动角色。

任务2:3D魔方(打乱+还原) * 要求: 构建彩色3D魔方,带有“打乱”和“还原”按钮,并能显示旋转动画。 * 结果: Claude Fable 5表现最佳,5次尝试全部成功且无瑕疵。GPT-5.6 Sol和Terra表现良好,但Luna版本在打乱后即出现错误。Claude Opus 4.8意外地未能完成一次完美还原。Grok 4.5表现尚可。

任务3:计算器 * 要求: 包含数字、运算符、清除、等于键,支持正确的运算符优先级,外观像真实计算器。 * 结果: Claude系列表现最佳,Opus和Fable均5次全成功,且Fable版本在样式上最受青睐。GPT-5.6 Sol试图过度设计样式(如3D渲染),反而影响了体验。Grok 4.5和GPT-5.6 Luna表现简洁稳定。Kimi K2.6无法处理负数。

任务4:康威生命游戏 * 要求: 网格画布,包含播放/暂停/单步/随机/清除按钮,点击可切换细胞状态,显示动画世代。 * 结果: 此任务相对简单,开源模型表现极佳。Qwen 3.7 Plus和GLM-5.2在极低成本下完成了高质量构建。Grok 4.5表现也不错。这表明开源模型在处理常见、有大量示例代码的任务时,性价比极高。

额外测试:SVG图像生成 * 测试1: 绘制一匹马骑着一个宇航员。 * 结果: Claude Fable 5生成的SVG质量最高,细节丰富且有趣。GPT-5.6系列表现平平,未能清晰呈现马或宇航员。Grok 4.5表现不错。 * 测试2: 绘制埃隆·马斯克和杰夫·贝佐斯观看蓝色起源火箭着陆。 * 结果: Claude Fable 5再次胜出,细节丰富(如贝佐斯的光头反光、着陆台的烟雾)。GPT系列生成结果偏卡通风格。开源模型GLM-5.2和Qwen 3.7 Plus在此任务中也表现出色。

速度与成本对比(简短回答): * GPT-5.6 Luna 速度最快(约1秒),成本极低。 * Qwen 3.7 Plus 速度极快且成本极低。 * DeepSeek V4 Pro 和 GLM-5.2 速度较慢。

总结(TL;DR): 1. 前沿模型在复杂任务上仍具明显优势。 GPT-5.6 Sol(擅长射线投射)和Claude Fable 5(擅长魔方)是本次评测的佼佼者。 2. 前沿模型与开源模型在复杂、新颖任务上存在明显差距。 但在简单、常见的任务(如生命游戏)上,开源模型(如Qwen 3.7和GLM-5.2)能以极低成本表现出色。 3. Grok 4.5 在某些任务上达到了“Opus级别”。 在考虑成本时,它是一个非常可靠的备选模型。 4. Muse Spark 1.1 表现令人惊喜。 整体水平略低于Grok 4.5,但优于其他开源模型,是一个不错的初次亮相。

最终结论: 最新、最贵的旗舰模型并非总是最佳选择。读者可根据自身需求,参考所有原始构建结果进行判断。

评论总结

根据评论内容,总结主要观点如下:

1. 测试方法的价值与局限 - 正面评价:部分评论认为这种“真实应用构建”测试优于传统基准测试,能避免模型“刷分”(benchmaxxing)。例如,评论24指出:“I actually like this methodology of testing AI much better than all the other benchmark tests... other benchmarks are clearly gameable by the Chinese open models.” - 质疑:也有评论认为“一次性提示”构建应用的方式脱离实际。评论18表示:“asking agents to one-shot random apps is nothing like how I actually use AI in software engineering.” 评论22更尖锐:“I think there's approximately zero value in seeing how a model can turn 100 tokens into a 100k... It's not useful in the real world.”

2. 模型表现对比 - GPT-5.6系列:在速度与质量平衡上表现突出。评论2提到:“Terra took 1/2 as much wall-clock time as Sol... Terra quality is usually nearly as good as Sol, but much faster and cheaper.” - 开源模型落后:评论16总结:“OSS models were so behind on most task... (lol at the SVG of the moon without any sign of life by GLM-5.2)” - GLM系列:被指“benchmaxxed”,实际能力不如基准分数。评论3指出:“models like GLM are benchmaxxed and not as close to the frontier as you’d think based on their numbers.” 评论19补充:“GLM isn’t multimodal, that might explain why it did better on the calculator question and not much else.”

3. 文章风格与可信度 - 批评AI写作痕迹:评论6希望文章由人类撰写:“I wish it was written by a human.” 评论13批评语言生硬:“how hard would it have been really to type these two sentences by hand, in your own natural voice?” - 质疑营销意图:评论7认为连续发布类似文章是“desperation”:“two gimmicky 'one-shot prompting shootout' marketing pieces in two days smells like desperation.”

4. 技术细节与改进建议 - 评分标准争议:评论15指出Muse Spark的魔方动画最佳却仅得2/5分:“Muse Spark has the best Rubik's cube by far... yet it gets a 2/5.” - 功能缺失:评论5发现成本符号错误:“The cost seems to be using the wrong symbol: ¢ vs $”;评论20建议表格可排序:“Could you make the tables sortable?” - 提示词缺失:评论17要求公开提示词:“Missing the exact prompts - would love to replicate...”

5. 对AI能力的深层思考 - 知识vs推理:评论9担忧视觉基准测试更多反映知识而非推理:“likely more indicative of knowledge... than of reasoning ability.” - 创新性不足:评论1指出测试应用多为克隆:“the requested apps are essentially all clones of others.” 评论25呼应:“how can any of these really be considered indicators of performance for the 'genuinely novel' when the results are all so similar?”