一个名为 slop code bench 的编码评测基准正在成形。Dex Horthy 发文透露,该基准目前对比了 Fable 5.1、Sol 的 med/high/xhigh 三档推理设置,以及 GLM 5.3 的 med/high 两档表现。
评测尚未跑完
打开网易新闻 查看精彩图片
Horthy 明确表示,目前许多 run(测试运行)尚未完成,结果会持续更新。这意味着当前数据只是阶段性快照,最终排名仍有变数。
幕后团队与后续动作
他在文中特别感谢了 GOrlanski 团队搭建该基准。对于关注编码模型选型的开发者来说,这个新基准提供了一个横向对比不同推理强度下模型表现的参考维度。
热门跟贴