“过去两周,我看到越来越多人发布RTK、Ponytail这类token节省工具的测试结果。这是好事,但每个人用的任务、日志和输出格式都不一样,结果很难相互比较。”Tura维护者Yu在最新博客中写道。

为了解决这个问题,他将自己一直在用的基准框架开源了。这个框架能完成三件事:跑通基准测试流程,把日志和生产物收进统一的结果schema里,再让CI自动索引仓库里新增的任何结果。配套网站会把所有结果转成可对比的图表和详细的运行页面。

打开网易新闻 查看精彩图片

也就是说,如果你是工具开发者,现在可以把你的工具扔进同一套测试里跑一遍,提交结果文件夹作为pull request,CI会自动完成索引。你也能在本地复现评测,确认分数没问题再提交。

“我特别想听到大家对接下来的测试方向有什么建议,以及这个框架在哪些地方可能引入偏差。”Yu补充道。他在文末做了利益相关披露:自己同时维护Tura和这个基准框架。