Martian 推出 AI Frontier 可靠性榜单,每个数据点运行 10 次,覆盖 16 个基准(含 TerminalBench、LiveCodeBench 等)。当前榜单上,Qwen3.7 Max 可靠性为 96.1%,Claude Opus 4.6 为 94.4%,GPT-5.5 为 93.5%。

打开网易新闻 查看精彩图片