摘要:为助力行业企业高效开展模型选型与迭代验证,近日,中国电子信息行业联合会人工智能(B端)应用创新推进工作委员会(简称“智进委”)正式发布“Model-Bench 大模型与Agent能力评测平台”,并首期开放面向智能体底座的免费评测服务。现诚邀AI Agent研发团队、行业AI用户团队报名体验。
产业界、应用侧企业,各有关单位:
随着大模型技术向产业端加速渗透,AI Agent作为连接模型能力与业务场景的关键载体,日益成为各行业智能化转型的焦点。然而,面对快速迭代的模型生态和多样化的业务需求,行业企业在模型选型、能力验证与持续迭代过程中,普遍面临评测标准不统一、多维度对比难、业务适配评估缺乏量化依据等现实挑战。
为系统化解决上述痛点,中国电子信息行业联合会人工智能(B端)应用创新推进工作委员会(简称“智进委”)正式发布 “Model-Bench 大模型与Agent能力评测平台”,旨在为产业界提供一套覆盖 “通用基本功 → 垂直领域适配”全链路的模型与智能体能力评测基础设施。现就平台上线及首期评测安排有关事项通知如下:
一、平台定位
Model-Bench平台定位为模型与智能体的 “选型对比”与“持续验证”工具:
通用能力评测帮助技术团队摸清底座基本功,量化评估模型在通用知识问答、逻辑推理、数理计算、指令遵循等维度上的综合表现;领域能力评测帮助行业客户验证智能体在金融、医疗、政务、制造、法律等垂直业务场景下的实际落地效果,让评测真正落到业务价值。平台以标准化私有题库与统一量化评分口径为核心,实现评测结果的可复现、可对比,为企业选型与迭代提供客观数据支撑。
二、首期安排
首期面向产业界开放 AI Agent底座免费评测:
评测维度:通用知识问答、逻辑推理、数理计算、指令遵循
评测方式:零接入成本,无需定制开发,平台一键输出量化评分及能力诊断报告
核心价值:支持多个模型/智能体底座横向对比,为选型决策提供可量化参考
三、适用范围与后续规划
现阶段仅支持“文本输入输出”场景评测,多模态评测能力将后续开放,敬请关注。
平台将持续扩充垂直领域题库与评测维度,覆盖更多行业应用场景。
四、报名方式
诚邀各AI Agent研发团队、行业AI用户团队踊跃报名,快速完成大模型底座能力摸底。扫码下方二维码填写资料报名。
智进委将持续发挥连接技术创新与企业应用落地的桥梁作用,致力于破解B端应用落地难题,为产业界提供更多切实有效的赋能支持。欢迎各有关单位积极参与,共同推动人工智能在产业端的深度应用与价值释放。
中国电子信息行业联合会
人工智能(B端)应用创新推进工作委员会
2026年9月
热门跟贴