九月的大模型圈,有点神仙打架的架势。
海外这边,OpenAI 的 GPT-6 Astra 落地,一堆模型扎堆更新。国内虽然八月已经卷过一轮,但九月依然有能打的选手冒出来。
比如我前不久在测评里提过的字节 Seed-Evolving,最近又迭代到了最新版本。
可能有朋友还不太熟悉这个模型。Doubao-Seed-Evolving 主要面向 Coding 和 Agent 场景,基本上每周都在更新。
它和我们平时接触的大模型有点不一样:没有版本号。
这样做的思路是,字节希望让用户接入的时候只认一个固定的 Model ID,底层能力升了就升了,不用自己去切版本。对大伙来说就是不用盯更新日志,专心用就行
上次我试这个模型是8月,当时它在多模态、Coding这些场景里不见得能打过其他国模。
这次升级,官方说它在长程任务执行、多模态理解、可信调研,还有 Coding 等几个方面都做了优化。
这几个,都是考察模型"能不能真干活"的核心能力。所以看到这个介绍,我专门花了整整一天把 Doubao-Seed-Evolving 测了一圈。
结果发现,现在它不仅能和其他国模 PK,连网友们拿去考 GPT-6 Astra 的题目都做得出来。
Round 1:从一堆碎片里还原图片
Doubao-Seed-Evolving 周级别更新,这节奏抬高了我的预期,所以一上来,我就给它安排了一个高难度任务:判断一张被撕碎的图片原本长什么样、出自哪里,该怎样还原,最后用 HTML 呈现调研过程和结果。
换句话说,就是一次把多模态理解、可信调研和长程执行能力全测一遍。
至于用哪张图片,我特意选了最近网友拿来实测 GPT-6 Astra 的同款,难度拉满。
先说结论,这个任务 Doubao-Seed-Evolving 花了2个多小时完成。的确不算快,但完成质量不错:它识别出了这张图的主视觉,来自一张1995年的唱片封面。
为啥是主视觉呢?因为它核对了这张专辑的封面和内页,发现还有少量碎片的图案没有出现,但大部分能对得上。所以只能说是“以这张专辑封面为主视觉的印刷物”,非常严谨了也是。
我特地去网上人工搜索了一遍,确认有这个专辑,画面和时间也对得上。
仔细扒 Doubao-Seed-Evolving 的工作全流程,发现它拿到原图先给这个任务分成了4个步骤:
分割并建立碎片清单
逐片视觉识别与拼合推理
确认原图身份
输出报告
整个过程里最费劲的,就是分割并建立碎片清单。
我看到 Seed-Evolving 换了好几种方式,才把每个碎片都切出来编上号。然后,它仔细识别每个碎片的文字和图像。有了这些信息后又疯狂检索一通,才给出结论。
在从碎片还原图片的这一步, Seed-Evolving 详细到,把每个碎片应该如何旋转,甚至旋转多少角度都标了出来。
整个过程里,它调用了102次工具,自我核查了6轮。
最后,我让它做了个 HTML 展示自己的结论和任务过程。虽然这步是顺手,但意外发现这个模型的 HTML 审美还挺在线,大家感受一下
Round 2:一张户型图生成3D场景
接下来这个任务,我还是按 GPT-6 Astra 的标准上高难度。
Astra 发布后,全网玩得最嗨的就是构建各种 3D 场景。所以这次任务,我给 Seed-Evolving 发了一张120平米的户型图,让它按图复刻 3D 场景,并能第一视角漫游。
Seed-Evolving 拿到任务后,把工作拆成两步:首先构建 3D 场景的 HTML,接着基于浏览器渲染和交互。
这里面还有很多细节工作。比如拿到户型图后,模型把户型图放大切成了四大块仔细查看,还对每个墙的比例进行了精准扫描,全部看清才开始 3D 建模。
它先构建了东西南北四个墙体,接着做房间细节。做出来之后,它又自己测试、精修了好几轮,才给出结果。
经过这么多精细操作,最后这个成品看起来还挺精致。不仅和户型图的结构对得上,光线也考虑进去了。
不过这个任务花的时间有点久,前后大概得4个小时 —— 毕竟 Seed-Evolving 这次调用了165次工具,修改了26次,其中还包括4次重写。
Round 3:复杂任务调研
这次 Doubao-Seed-Evolving 还在可信调研上下了功夫。针对这个场景,我搞了两道基于真实场景,都需要花式查验才能得出结论的难题。
第一道题:
我明年3月准备从北京搬到斯德哥尔摩,想把家里两只6岁、6公斤左右的猫一起带过去。它只打过狂犬疫苗,其他手续我完全不懂。预算最好别超过3万元,希望它能和我同一天到,最好能进客舱。你帮我查找最新的官方规定,给我一套可执行的方案。如果我的要求实现不了,告诉我要怎么调整。
这个任务基本就是在各种检索、查证。Seed-Evolving 总共派出了7个子 Agent,面向3个不同方向做调研、核验,最后汇总结论。
这三个调研方向,包括不同地方的入境规定、出境的检测流程,还有不同航司的最新宠物⬛政策,覆盖得很全面。
几十分钟后,Seed-Evolving 带着结论回来了。
它告诉我根据各大航司规定,让两只猫同时进客舱是不可能的,所以推荐我选择货仓运输。这个结论和我之前了解过的情况一致,给 Seed-Evolving 上一分。
调查报告也很扎实。不仅直接点出了矛盾点,还把所有航司的方案列出标了推荐选项。
同时,模型还告诉我需要准备的所有事项、倒排的时间线,其他需要牢记的Tips。最后,还附上了资料来源。
接着第二道题。我的要求只增不减,让它做商业选址分析。
Prompt:
我想在上海外滩或者西岸区域开一个200平米以内的咖啡店,预算想控制在50万以内。你帮我看看都有哪些比较好的店铺,以及我的要求能不能满足?如果不能,你要告诉我要怎么调整。评估选址时,你还需要一并考虑目标店铺未来1-3年的生意好不好做,周边的人流量怎么样,一年的毛利大约是多少。
这个任务总共花了一个小时。
核心结论是,我这个预算在西岸开咖啡店更合适,外滩只能开小店,赚的还是辛苦钱。
除了结论,Seed-Evolving 在报告里还给出了板块基本盘、在租样本、方案算账、调整方面、签约尽调清单几个模块。
最后它附上了信息来源:有房天下、安居客、58 同城在租挂牌信息,新闻晨报、劳动报、央广网等媒体报道,另外还有上海市政府门户网站、《2026 中国城市咖啡发展报告》,政府公文做行业资料。
像下面这个在租样本,就来自房天下和安居客最近的信息。
这轮任务的时间依然都花费在搜索和核实信息上。
我看了看,模型总共调用了45次32种不同的工具,光专项复核信息就做了4轮。
Round 4:优化开源小游戏
最后一轮,终于轮到测试 Coding。
当然我没有随随便便跑个网页设计就完事,而是让它从一个开源代码仓库里自己读取信息,再把代码魔改成一个短视频上经常能刷到的小兵打僵尸的游戏。
原始仓库里的效果大概是这样的,能看出还处于原型的状态。
我做了一些角色图,再把仓库链接给它。Seed-Evolving 先通读了一遍背景信息,摸清了游戏机制和需求,就开跑了。
魔改这个游戏总共花了三个小时。整个过程里,Seed-Evolving 依然干活精细,把画面、音效挨个设计并且验证了好几次。
最后输出的结果,声音和画面比起原版不知道精致了多少。
四轮跑下来,再整体说说我觉得 Doubao-Seed-Evolving 这次升级最明显的几个优点。
第一,任务拆解和推进能力都很强。不管是碎片拼图、3D建模还是调研题,它拿到任务之后都能自己拆成合理的步骤,然后一步步往下推。
第二,调研结果可信度高。两道调研题的报告我都仔细看了,信息来源可追溯,结论和我自己之前了解的情况能互相印证。这种"查得到、对得上"的能力,在调研类场景中的确刚需。
第三,多模态理解有实打实的提升。上次8月测的时候,它在这块还不算太能打。这次不管是从一堆碎片里识别文字和图案,还是读懂一张户型图的空间结构再转成3D场景,完成度都明显上了一个台阶。
第四,Coding 的工程完整度不错。毕竟我测的任务不是单点,而是让它从读仓库、理解游戏机制,到魔改、自测、精修,整条链路跑下来。这样测出来, Doubao-Seed-Evolving 交出来的东西是能玩的。
如果非要说不足,那就是有时候它干活太精细了,等待的时间有点长。但如果和等半天结果却不能用相比,我还是愿意等等看⌛️。
总之,从 Agent 长程执行、可信调研、多模态理解,再到Coding能力,至少在我测到的这几个场景里,Doubao-Seed-Evolving 已经是一个真能独立干活,还会认真交活的模型了。
热门跟贴