Hacker News 中文摘要

RSS订阅

选择AI模型:一个提示,11个模型,不同结果 -- Choosing an AI model: one prompt, 11 models, different results

文章摘要

Netlify与OpenRouter合作,通过AI Gateway支持用户项目使用多种AI模型,并扩展了Agent Runners的模型选择,新增Kimi K3、GLM 5.2等前沿开源模型,提供更强大的编码代理功能。

文章总结

好的,这是根据您的要求,对原文进行的中文重述:

标题:更多模型,更多选择:对比11种不同AI模型

Netlify与OpenRouter合作,为用户提供了两项新功能:一是用户项目可通过AI网关调用OpenRouter上的任意模型,从而拥有更广泛的模型选择以适应不同任务和预算;二是扩展了Agent Runners中可用的前沿编码模型,新增了Kimi K3、GLM 5.2和DeepSeek V4等热门开源模型。

Agent Runners是Netlify内的聊天提示框,用于从零开始构建或迭代项目。它内部运行的是完整的编码代理,而非简化版。此前,Netlify支持Claude Agent、OpenAI Codex和Gemini CLI等针对特定提供商优化的模型。现在,为了有效驱动更多新模型,Netlify加入了流行的开源代理OpenCode。

面对更多选择,用户自然会困惑:哪个模型最适合我?是否会错过更好或更具成本效益的选择?为了提供参考,Netlify在一系列模型上运行了相同的提示,并分享了测试结果。

测试方法

Netlify内部使用其开源的AXIS工具进行模型自动评估。AXIS会提供多种测试用例(如构建新网站并迭代),并指示代理和模型执行,然后根据生成网站的功能正确性(而非设计)进行评分。例如,检查网站是否在需要时使用了数据库,是否正确使用了Netlify Database,或者在没有必要的情况下是否避免了过度设计。如果某个模型测试分数落后,就不会在Agent Runners中提供。

本次测试旨在展示使用不同模型构建项目时,在视觉效果和成本上的差异。测试了三个相对简单的用例:

  1. 本地咖啡店网站:初始提示简单,只需静态网站。后续提示要求添加简单的座位预订功能。
  2. 简单的待办事项列表Web应用:允许多用户查看和添加任务,从一开始就需要共享数据库。后续要求支持为每个项目上传照片。
  3. “我能做什么菜”Web应用:用户输入家中食材,应用通过AI推荐食谱。重点检查网站是否正确使用了AI网关。

对于每个用例,文章展示了生成网站的外观,评论了显著问题,并比较了每个模型生成所消耗的积分。所有模型均在Netlify上使用默认设置运行。

场景一:本地咖啡店

第一个提示是:“为一家社区咖啡店构建一个单页网站:包含营业时间、地址、简短菜单和一张照片。除非我自己编辑,否则内容不会改变。”

文章首先展示了一个积分消耗对比表,列出了11个模型三次运行的平均积分消耗,范围从Claude Opus 5的519积分到DeepSeek V4 Flash的2.4积分不等。文章指出,Claude Opus的一次运行消耗了高达1055积分,而免费计划只有300积分。

随后,文章逐一分析了各模型生成的结果:

  • Claude Opus 5:设计精美,细节丰富,但积分消耗高且不稳定。
  • Claude Sonnet 5:细节和内容较少,矢量图形更简单。
  • GPT 5.6 Sol (低努力模式):在基本设计直觉上优于Claude Sonnet,内容更丰富。
  • GPT 5.6 Terra:视觉语言不同,内容更简单,但并非更差,存在一些视觉小问题。
  • Gemini 3.1 Pro:结果非常简陋,仅完成了提示要求。
  • Gemini 3.6 Flash:内容更丰富,但存在重复问题。
  • Kimi K3:在设计任务中表现不突出,更适合复杂的代理任务。
  • Kimi K2.7 Code:设计和内容都非常简单。
  • GLM 5.2:三次运行结果差异很大,积分成本低,值得多次尝试。
  • DeepSeek V4 Pro:结果不理想,存在图片缺失问题。
  • DeepSeek V4 Flash 0731:积分消耗极低,结果参差不齐,其中一次运行效果接近中端闭源模型。

初步结论与展望

文章指出,对于更复杂的项目,评估重点应从设计转向模型是否知道如何使用平台功能、是否严格验证自身工作等。此外,用户需要权衡是选择能自主规划一切的“交钥匙”方案(如Opus),还是选择更简单的模型并通过迭代提示来引导。文章鼓励用户测试不同方法,并预告后续将分享更复杂Web应用用例的测试结果。

评论总结

根据评论内容,总结如下:

主要观点与论据:

  1. 对模型输出相似性的批评(评分:无,作者:isqueiros):评论指出,在简单提示下,不同模型生成的咖啡店页面设计高度雷同,缺乏独特性。关键引用:"it's quite depressing how much alike these all look" 和 "I can't help but strongly feel the AI vibes emanating from that design"。

  2. 对基准测试有效性的质疑(评分:无,作者:plumbsamji、jwr、sceptic123):多位评论者认为,仅凭少量运行(如3次)的测试结果不足以作为模型比较的可靠依据。关键引用:"With only three runs per model, the results are highly sensitive to randomness"(plumbsamji);"any sort of evaluation of benchmark with a sample size of 1 is essentially worthless"(jwr)。

  3. 对简单提示测试实用性的怀疑(评分:无,作者:Systemerror7A69、s4i):评论认为,这种“一次提示”的测试无法反映真实开发场景,因为实际应用中用户会提供更详细、具体的指令。关键引用:"this 'oneshot from a simple prompt' eval is fairly meaningless when it comes to model evaluation itself"(Systemerror7A69);"how often would anyone prompt with very brief instructions"(s4i)。

  4. 对低成本/旧模型输出的偏好(评分:无,作者:horsawlarway、feor):部分评论者更喜欢低成本或旧模型的输出,认为其更简洁、易读,且更少“AI感”。关键引用:"Kimi, GLM, and Deepseek all absolutely run away with the 'Can I quickly read the menu and find the address' challenge"(horsawlarway);"I like the output of the cheaper/older models better... they look less AI-generated"(feor)。

  5. 对基准测试方法的建议(评分:无,作者:arjie、jannishan):评论建议采用更专业的评估方法,如使用LLM作为裁判、建立专业评估机构,或关注任务特定性能。关键引用:"deploy the highest end model you have as a judge for others"(arjie);"we should establish a professional evaluation organization for models"(jannishan)。

平衡性总结: - 支持方:部分评论者认为这种比较有趣且有用(如作者kifler、Schlagbohrer),能直观展示模型差异。 - 反对方:多数评论者质疑其科学性和实用性,认为样本量小、提示简单、缺乏真实场景代表性。 - 中立观点:作者Damjanski简单评价“this is fun!”,作者throwa356262讽刺这是“最容易上HN首页的方法”。