每天夜里,Elvis 的 harness 实验都会自动跑一轮评测。内存、工具调用、上下文压缩,任何一处改动都会被丢进这轮评测里过一遍。第二天早上,他要面对的是结果。
这是整个 agent 开发流程里最慢的一段。Elvis 是 @dair_ai 的创始人,做研究、写代码、也教别人怎么搭 AI agent。他每天跑 harness 实验,但读结果这件事,正在吃掉他整个上午。
他先试了仪表盘。仪表盘告诉他通过率掉了,但没告诉他为什么掉。数字摆在那里,原因藏在日志里,而日志得一条一条翻。
23个失败任务,和一条被揪出来的改动
假设昨天通过的 23 个任务,今天全挂了。这 23 条日志,Viktor 会全部看完,把它们追溯到同一个改动上,然后建议把这个改动撤掉。Elvis 要做的,是核对日志,然后拍板。
Viktor 是 Slack 里的一个 AI 员工。他的工作就是夜里把评测结果过一遍,早上把结论摆出来。挖证据的活归 Viktor,决定什么进 harness 的活归 Elvis。
这个分工解决的是一个很具体的痛点:早上打开电脑,先看哪些任务昨天对、今天错,再逐个打开失败日志,判断是自己哪一处改动导致的。仪表盘只能给出通过率的涨跌,给不出因果。而 Viktor 的路径是从失败反推到改动,再给出撤销建议。
不用你问,他先开口
Viktor 还会主动标记问题,不等你发问。对于复杂的评测运行和其他研究任务,这种主动性意味着你不用时刻盯着,也能保持在轨道上。
Elvis 在帖子里向 harness 工程师抛了一个问题:你是每一轮评测都看,还是只在通过率掉下来的时候才看?
这个问题背后是两种工作方式。全看,时间成本高;只看掉下来的,容易漏掉那些通过率没变、但内部已经出问题的改动。Viktor 想切的是中间那块——你不需要全看,但也不该等到通过率报警。
目前 Viktor 提供免费试用,附 100 美元额度,不需要绑卡。Elvis 也提到,感谢团队在这篇帖子上的合作。
热门跟贴