一张UI截图丢进去,AI能不能直接吐出能跑的HTML和CSS?Arena.ai上线了Image-to-WebDev Arena,专门测这件事。它评估的是视觉-语言模型解读界面截图、并生成对应网页代码的能力。
这个基准到底在测什么
按Arena.ai的说法,这个基准针对的是多模态模型的一项具体能力:把静态的UI图片,转换成可操作的网页。不是识别图里有什么,而是把图里的界面还原成代码。
评估对象是视觉-语言模型。输入是UI截图,输出是HTML/CSS代码,中间没有人工翻译环节。
排行榜和一次演示
帖子宣布了Image-to-WebDev Arena的上线,同时给出了排行榜链接。榜单之外,还展示了Gemma 4模型对一张测试图像中各种UI元素的解读表现。
演示的重点落在"解读"上——模型看图之后,对界面元素的识别和还原结果被摆了出来。这是这个基准想量化的东西:模型到底看懂了多少。
为什么值得看一眼
UI截图转代码,是设计稿到实现之间最耗人力的环节之一。如果模型能稳定完成这一步,前端工作流里的一段重复劳动就有了替代方案。
但能不能替代,取决于测出来的分数。Image-to-WebDev Arena给出的就是这把尺子:同一张截图,不同模型生成的代码质量差多少,排行榜上见。
目前公开的信息集中在基准上线、排行榜入口和Gemma 4的演示表现上。榜单会怎么排,还得看后续数据。
热门跟贴