一位开发者想知道自己的模型是否真的变好了,他面对的却不是发几条提示就能回答的问题。他必须把数据集、模型API、评分逻辑、结果存储、对比工具一一接起来。这些环节常散落在脚本、笔记本和日志里,每重跑一次就更难复现、更难排查。单看一个分数,根本说不出是模型变了,还是数据集、提示词、评分器或采样跟着一起变了。
这种评估杂务正是Quantiles这个Apache 2.0开源平台想要简化的。它的命令行工具qt让开发者能在本地快速运行、分析和比对AI评估,无需在零散脚本之间来回拼凑。下面就用Google DeepMind与Google Research整理的SimpleQA Verified基准(1000条提示)做一遍,从安装到结果解析里里外外走通一次。
安装一条命令就够了。在macOS或Linux(x86‑64/Arm64)终端里执行:
curl -fsSL https://cli.quantiles.io/install.sh | bash如果不想直接从网络下载后就运行代码,可以先看一看install.sh的源代码,再决定是否执行。
装上之后,一条命令就能跑通内置基准:
qt run simpleqa-verified这会调用Quantiles内置的演示模型,全程不产生任何费用。这个演示模型会随机生成输出,目的只为了展示完整的评估流水线,并不反映真实的模型表现。如果要用自己的模型做评估,需要参考后文的模型配置说明。
SimpleQA Verified基准由Google DeepMind和Google Research基于OpenAI的SimpleQA重新整理而成,专门解决原始数据中的标签错误、偏题偏差、冗余问题以及支撑证据模糊等毛病。每条样本都包含一个简短的事实性问题(放在problem字段里)、一个参考答案、话题标签、题型元数据以及支持网址。Quantiles集成所使用的数据集是官方版本的fork,会读取其中的problem和answer两列,整个基准仍然是原作者的工作。
执行qt run时,CLI会用本地嵌入模型fastembed把每条回复和参考答案分别编码成向量,然后计算两两之间的余弦相似度。它会记录每条样本的相似度分数,并聚合出整个评测集上的分数分布。这整个过程走完了数据集加载、样本执行、评分、聚合以及评测元数据和指标的存储,并没有调用任何LLM服务商。同时,这一版评测并未使用SimpleQA标准方案中的GPT‑4.1自动打分器,所以输出的相似度指标不能被视为模型在SimpleQA Verified上的真实性能。
如果要评测真正的LLM,就需要配置自己的模型,具体的接入方式要看系统提供的模型配置文档。先用演示模型把整个流水线跑起来,就为后面换上自己的模型、数据集和评分逻辑打好了一个可复现的底子。
热门跟贴