选大模型像开盲盒?同一道题,不同模型的表现可能天差地别。Martian 新推出的 AI Frontier 仪表盘,想把这笔账算明白——它按任务、质量、实际成本和可靠性来对比各家 LLM,还顺手测了"组合路由"的收益。

核心数据很直观:在 TerminalBench、LiveCodeBench 等 16 个基准上,它的 oracle 路由在同成本下平均降低 54% 误差,或者用低 85% 的 API 成本,就能达到各基准最优模型的质量。引用数据还显示,误差比单一最优 LLM 少 46%。

打开网易新闻 查看精彩图片

说白了,这工具不是让你选"哪个模型最强",而是告诉你"哪个模型最适合这个任务"。把不同模型按场景混着用,可能比死磕一个"全能王"更划算。

打开网易新闻 查看精彩图片

对开发者来说,这相当于多了一个决策参考——省下的成本,或许比想象中多。