快科技10月9日消息,SuperCLUE公布了智能体终端编程中文测评榜单,小米MiMo V2.6 Pro拿到综合总分第一。
这份测评重点考察大模型在驱动智能体框架时对中文需求的理解、任务规划、工具调用、文件修改、错误排查与最终交付能力。测评固定使用 Claude Code 作为智能体框架,以此为标准平台,横向对比各模型的核心能力。
榜单里面其余参赛选手中,Kimi、GLM、Hy4排在2到4名。小米MiMo V2.6 Flash位居第五。
小米MiMo V2.6 Pro以1.52元/题取得64.65分得分最高。小米MiMo-V2.6-Flash 以0.67元/题取得53.54分,成本最低。
作为对比,DeepSeek-V4.1-Flash(max) 为50.51分、1.86元/题,Hy4-Preview(high) 为55.56分、11.61元/题。其中,MiMo-V2.6-Pro 的得分高于 Hy4-Preview,每题成本也更低,在本次任务集上呈现出突出的性价比表现。
从本次完整任务流程看,DeepSeek-V4.1-Flash 的时间效率更突出,MiMo-V2.6-Pro 则在较高得分与任务耗时之间展现出较好的综合表现。
很多开发者已经开始把智能体当成写代码的辅助工具,不用从零敲完整程序,主要用来生成脚本、排查报错、改 bug。中文场景下,不少海外大模型对中文指令理解偏弱,国产模型的适配优势就体现出来。
智能体终端编程还处在发展阶段,没有哪个模型可以完全替代程序员。这次榜单也能看出国产大模型的进步,在硬核工程任务上面,已经可以和海外主流产品掰手腕。
打开网易新闻 查看精彩图片
热门跟贴