文章摘要
我们搭建了一个绘画竞技场,让AI模型使用彩色铅笔工具在空白画布上作画。测试了GPT-5.6、Claude、Gemini和Grok四个模型,分别临摹《蒙娜丽莎》和《星夜》并完成五个开放式提示,共绘制28幅作品,评估了工具使用、成本、输出效果及自我改进能力。
文章总结
我们搭建了一个绘画竞技场:给AI模型一张空白画布和一套彩色铅笔工具,然后完全放手。模型可以自行设置颜色、笔尖粗细和压力,绘制成批的笔触,用涂抹工具混合颜色,擦除或重置,并通过查看画布来评估自己的作品并决定如何修改。它要么临摹目标图像,要么根据文字提示作画。
我们测试了四个视觉模型——GPT-5.6 Sol、Claude Fable 5、Grok 4.5和Gemini 3.6 Flash——针对两个目标(《蒙娜丽莎》和梵高的《星月夜》,均进行客观评分)和五个开放式提示,共完成28幅画作。我们将介绍工具使用、成本、输出效果,以及模型是否真正改进了作品,最后附上我们的看法。
我们为何进行这些测试
简单说明一下动机,因为上次的AI音乐视频挑战引发了热烈讨论,有人误以为我们在鼓吹模型的创造力或艺术能力。这些并非客观的模型能力测试,而是故意设计的开放式模糊任务。我们坚持这样做的原因:
- 有趣且信息量丰富:观察模型处理松散任务比看基准数字更能直观体现能力。
- 揭示前沿模型与开源模型的差距:廉价的开源模型在大量执行任务上完全可以替代前沿模型,我们会持续报道。但这类任务能真正区分前沿能力与其他模型。Grok 4.5在这项“基础”绘画任务上表现粗糙,而我们尝试的开源模型甚至无法使用,有几个只返回了空白画布(Kimi K3完全开源后可能会改变这一点)。
- 展示长期运行任务的实际成本:Claude Fable 5几乎总是耗时更长、花费更高,但输出却更差。Fable在音乐视频挑战中曾击败GPT-5.6,但这次表现更差且开销更大。根据你的用例,这种权衡很重要。
- 我们热爱讨论:讨论确实很有趣,如果你对设置或新任务有建议,我们会采纳。运行这些测试非常有趣,看到输出结果也令人兴奋。
工具
每个模型都使用完全相同的彩色铅笔工具集:
- plan:用于思考和规划的无操作草稿板。
- view_target:再次查看目标图像。
- view_canvas:渲染当前页面并查看,同时根据目标对画作评分。
- setcolor / setbrush / set_pressure:设置当前铅笔颜色、笔尖宽度和压力(0到1的不透明度,低压力产生柔和色调)。
- draw:一次调用绘制一批标记(笔触、线条、形状轮廓、点)。没有实心填充,色调和颜色通过分层构建,就像真实铅笔一样。
- smudge:混合/柔化矩形区域,类似擦笔。
- erase / clear_canvas:将区域恢复为白色/重置整个页面。
整个框架在github.com/hershalb/canvas-arena开源,你可以指向任何目标图像或文字提示自行运行。
两个目标临摹
模型可以全程查看目标,并根据结构相似性(SSIM)评分。下方显示SSIM分数。
| 蒙娜丽莎(目标) | GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---|---| | | | | | |
完整记录:[GPT-5.6 Sol] · [Claude Fable 5] · [Grok 4.5] · [Gemini 3.6 Flash]
| 星月夜(目标) | GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---|---| | | | | | |
完整记录:[GPT-5.6 Sol] · [Claude Fable 5] · [Grok 4.5] · [Gemini 3.6 Flash]
五个提示绘画
无目标、无评分,只有文字提示和空白页面。
“一位年迈渔夫饱经风霜的脸庞,温暖的午后阳光,深深的皱纹和胡茬”
| GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---| | | | | |
“平静海面上的美丽日落,橙色到紫色的天空,剪影般的地平线”
| GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---| | | | | |
“黑暗背景中玻璃花瓶里的一朵红玫瑰,戏剧性的伦勃朗式布光”
| GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---| | | | | |
“一只虎斑猫蜷缩在午后阳光下的窗台上睡觉”
| GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---| | | | | |
“舒适的 cabin 内部,壁炉燃烧着,温暖的琥珀色光线和柔和的阴影”
| GPT-5.6 Sol | Claude Fable 5 | Grok 4.5 | Gemini 3.6 Flash | |---|---|---|---| | | | | |
关键数据
每个模型七幅画作的平均值和总计。
| 模型 | 画作数 | 平均步骤 | 平均时间 | 总Token数 | 总成本 | 平均SSIM | 总工具调用 | |---|---|---|---|---|---|---|---| | GPT-5.6 Sol | 7 | 29 | 6.2分钟 | 340万 | $7.74 | 6.0 | 116 | | Claude Fable 5 | 7 | 54 | 12.5分钟 | 1460万 | $160.58 | 15.6 | 207 | | Grok 4.5 | 7 | 99 | 4.8分钟 | 3400万 | $9.21 | 4.3 | 354 | | Gemini 3.6 Flash | 7 | 73 | 6.9分钟 | 2770万 | $12.87 | 22.6 | 190 |
工具调用
四个模型以完全不同的方式使用相同的工具集。
GPT-5.6 Sol从未调用setcolor、setbrush或setpressure,而是直接在每次draw调用中设置这些参数,因此其调用几乎全是draw、smudge和viewcanvas。Grok 4.5则相反:其1349次工具调用中65%是setcolor/setbrush/setpressure,因此平均每幅画作需要99步。Claude Fable 5大量使用smudge(123次调用)并频繁审查。Gemini 3.6 Flash是最痴迷的审查者,近三分之一的调用是viewcanvas(每幅画约23次自我审查),和Sol一样从未使用set_*工具。
成本与Token
Claude Fable 5的七幅画作估计花费160美元,大约是GPT-5.6 Sol(7.74美元)、Grok 4.5(9.21美元)或Gemini 3.6 Flash(12.87美元)的20倍。 这并不令人意外。Grok使用的Token最多(3400万),但成本低廉,因为约98%是缓存读取,费率仅为输入费率的一小部分,且Grok的费率是四者中最低的。Gemini也大量依赖缓存读取,因此即使使用2770万Token,成本也保持适中。
模型是否真正改进了?
每次view_canvas都会根据目标重新评分,因此我们可以观察整个运行过程中的进展。两个目标都呈现两种模式:
首先,它们很早就达到平台期。 Claude Fable 5审查了27次蒙娜丽莎,但相似度在第五次审查后基本持平。其次,在所有八次目标运行中,最终画作的得分都低于模型在运行中达到的最佳分数。 GPT-5.6 Sol的蒙娜丽莎峰值SSIM为0.352,最终为0.325;星月夜峰值为0.179,最终为0.130。Gemini 3.6 Flash审查次数最多(每幅画约23次),并达到了整个批次中的最高峰值0.449(蒙娜丽莎),但最终滑落至0.337。更多的审查并未带来更好的最终结果,模型不断修改,反而超越了自身的最佳表现。
客观相似度(目标运行)
SSIM范围0到1,越高越接近目标。RMSE范围0到255,越低越接近目标。
| 模型 | 目标 | 步骤数 | 时间 | 审查次数 | 最终SSIM | 峰值SSIM | 最终RMSE | |---|---|---|---|---|---|---|---| | GPT-5.6 Sol | 蒙娜丽莎 | 44 | 8分41秒 | 7 | 0.325 | 0.352 | 54.2 | | Claude Fable 5 | 蒙娜丽莎 | 86 | 18分58秒 | 27 | 0.286 | 0.289 | 56.9 | | Grok 4.5 | 蒙娜丽莎 | 106 | 4分30秒 | 5 | 0.151 | 0.152 | 95.6 | | Gemini 3.6 Flash | 蒙娜丽莎 | 60 | 5分31秒 | 22 | 0.337 | 0.449 | 51.1 | | GPT-5.6 Sol | 星月夜 | 23 | 5分47秒 | 4 | 0.130 | 0.179 | 37.8 | | Claude Fable 5 | 星月夜 | 43 | 11分30秒 | 12 | 0.153 | 0.176 | 40.9 | | Grok 4.5 | 星月夜 | 58 | 5分51秒 | 3 | 0.039 | 0.039 | 104.9 | | Gemini 3.6 Flash | 星月夜 | 74 | 6分36秒 | 24 | 0.172 | 0.190 | 42.8 |
在原始SSIM上,Gemini 3.6 Flash在两个目标上均得分最高(最终分数和峰值),但其最佳帧与最终帧之间的波动也最大。Gemini 3.6 Flash看起来不错,但肯定不是最接近目标输出的。有趣的是原始分数却更高。一如既往,SSIM衡量的是结构接近度,而非画作在人类眼中的美观程度(见下方看法)。
方法说明
- 四个模型,两个评分目标加五个提示,共28幅画作。所有运行使用相同的彩色铅笔工具集。每个模型均设置为高推理模式。
- SSIM/RMSE通过将两幅图像调整为256x256并比较计算得出。它们衡量结构/像素接近度,而非艺术质量,且仅适用于目标运行(提示没有参考对象可评分)。
- 挂钟时间包括模型自身的思考和工具往返时间。
我们的看法
GPT-5.6 Sol是绝对的领先者。它的星月夜和玫瑰是我们整个批次中最喜欢的作品,考虑到它是在空白画布上一笔一笔画出来的,这令人惊叹。它在几乎所有画作的细节上都击败了其他两个模型,唯一的例外是年迈渔夫。
Grok 4.5在这里基本是垃圾。它很少产出可用的东西,尽管工具使用疯狂,但我目前不会信任它能可靠地理解或判断视觉输出。
Gemini 3.6 Flash肯定比Grok好,成本略高,但将Flash模型与前沿版本比较似乎有些不公平。我确实很期待看到Gemini 4的表现。我们也已经知道,它的Token输出速度令人印象深刻。
Claude Fable 5在质量上排名第二,但成本和耗时最高。对于这个任务,它是三者中最不划算的:速度慢得多,成本高得多(约其他模型的20倍),而输出却跟不上Sol。
评论总结
根据评论内容,总结如下:
主要观点与论据:
技术问题与广告质疑:部分评论指出注册错误(评论1:“Fix this signup error please”),或认为文章是广告(评论2:“I think this is just an ad”)或AI生成(评论15:“Article is AI-written”)。
模型表现对比:多数评论聚焦于不同AI模型的图像生成能力差异。GPT-5.6 Sol被认为表现最佳(评论16:“GPT-5.6 Sol is the knock out here... really human/charming”),而Grok表现最差,被形容为“怪异”“令人不安”(评论11:“Grok ones are so weird that they cross into uncanny and surreal”),甚至建议“拔掉插头”(评论6:“Someone pull the plug”)。有评论质疑为何将Grok与其他模型并列(评论13:“Why include Grok when it is clearly not even in the same category?”)。
成本与效率:评论7指出成本差异惊人(“The difference in cost is pretty incredible”),评论17具体对比了GPT-5.6 Sol与Fable的成本($7.74 vs $161)和token消耗(3.4M vs 14.6M),认为OpenAI在推理效率上创新显著。
艺术性评价:评论8认为部分模型输出“幼稚”,像儿童画作,缺乏光影、折射等艺术理解(“some models understood... shading, reflections... others just drew ‘blue = glass’”)。评论12称Sol最佳,Grok像“修复耶稣画像的人”的作品。
其他建议:评论10建议加入Deepseek、GLM、Kimi等模型;评论9希望看到使用特定工具(如/goal)的结果。
平衡性总结:评论对GPT-5.6 Sol高度认可,对Grok普遍批评,同时指出成本差异和艺术性不足的问题。技术问题(注册错误、广告嫌疑)也受到关注。