公共AI基准测试能告诉你哪个模型在标准任务上表现更好,但选择真正适合你业务的模型,往往需要用自己的数据来检验。独立评测机构Artificial Analysis推出了新平台Optima,让用户基于自己的场景构建自定义基准,比较不同模型的质量、单次任务成本和耗时。 Optima解决了公共评测的一个核心缺陷:公共基准基于预先定义的任务和指标,这些任务不一定符合你的具体使用场景。例如,GDPval-AA和AA-Briefcase这类基准能反映模型的通用能力,却无法回答“哪个模型在处理我公司的客服工单时更省钱”。Optima允许用户上传自己的数据、工作流或场景描述,然后在主流模型上运行对比。 用户可上传多种来源的素材:本地评测数据集、来自Hugging Face的公开数据集,或是Arize、Braintrust、Langfuse等平台的AI代理轨迹。开发者还可以安装一个技能插件,自动收集编程环境和历史会话的信息。如果没有现成数据,用户可以描述预期用途,并提供示例输入和输出。Optima会据此生成测试输入、评估标准和示例任务,用户可以在正式运行前修改或优化。 评分方面,Optima提供两种方式:基于客观标准的评分量表,以及Artificial Analysis在自有基准中使用的成对比较法。后者要求用户对一组回答样本进行偏好选择,Optima再根据这些偏好推导出完整排名。除了模型质量,Optima还将单次任务成本和耗时作为独立的比较维度,帮助用户找到性价比最优的模型。 该平台目前已经上线。Artificial Analysis表示,Optima的目标是让团队摆脱对通用排名的依赖,用真实业务数据获得可操作的模型选择依据。 This is the finalized content.
打开网易新闻 查看精彩图片
热门跟贴