给他一张白纸,一盒彩色铅笔工具,然后走开。模型需要自己决定怎么选颜色、笔尖粗细和下笔力度,一笔一笔画出痕迹,再用涂污模糊、橡皮擦除,反复调用 view_canvas 察看成稿,判断哪里要改。这是博客作者搭建的绘画竞技场,用来观察四个前沿视觉模型——GPT-5.6 Sol、Claude Fable 5、Grok 4.5 和 Gemini 3.6 Flash——在完全相同的约束下,是照图临摹,还是按文字描述自由发挥。

28 幅作品就这样产生了:临摹目标是蒙娜丽莎梵高的《星夜》,用结构相似度(SSIM)客观评分;另五个开放提示则只给一句描述,没有参照图,没有分数。但作者很快给讨论定了调子:这不是模型能力的客观测试,而是一场刻意设计成开放、模糊的动手任务。上一次他们让模型做音乐视频,就有人把这理解为推崇模型的创造力。这一次他们再次强调,跑这些实验,是想看看模型在工具使用、策略路径上会走出怎样截然不同的步子。

打开网易新闻 查看精彩图片

工具记录把这差异放大了。GPT-5.6 Sol 从未单独调用 set_color、set_brush 或 set_pressure 这三个设置指令,而是把颜色、笔宽、力度直接写在每次 draw 调用里,所以它的调用几乎都是 draw、smudge 和 view_canvas。Grok 4.5 完全相反:在它的 1349 次工具调用里,有 65% 是在做颜色、笔刷和压力的单独设置,这直接导致它平均每幅画要跑 99 步。Claude Fable 5 则在 smudge 上花了大力气,整整调用了 123 次,频繁涂抹来寻求过渡。虽然 Gemini 3.6 Flash 的调用模式原文没有展开,但同一套工具呈现四种完全不同的调用策略,已经把每个模型的解题性格摊在了纸上。

打开网易新闻 查看精彩图片

临摹任务有客观分数打底,但作者依然没有给出具体数字,只列在图表里。五个开放式提示则像一个小型画展:老年渔夫在午后暖光里布满皱纹的脸,夕阳下从橙到紫的宁静海面,伦勃朗式布光里红玫瑰与深色背景的强烈对比,蜷在午后窗台上眯觉的虎斑猫,还有木屋壁炉里跳动的琥珀色暖光。每个模型在相同的文字前面,交出了属于自己的笔触轨迹。

打开网易新闻 查看精彩图片

这场实验最终没有捧出“最能画”的模型。它更像一次对工具理性边界的好奇观察:当系统不再替模型决定下笔顺序和参数偏好,而只提供一个设置笔工具的沙盒时,模型的“问题解决风格”就变得比画作本身更有信息量。作者顺手把整个测试框架开源在 github.com/hershalb/canvas-arena,任何人都可以指向自己的目标图或提示词,亲眼看它们怎么一笔接一笔地“画”。