斯坦福大学计算机博士生 Aryaman Arora 在一次访谈中谈到,现在能训练出越来越强的模型,但大家仍然不清楚模型内部的计算过程。可解释性工具要做的,就是把黑箱打开。他以 Anthropic 的 J-space 论文为例,说明模型内部存在一些没有被说出来的推理步骤。

J-space 实验:替换未说出口的概念

打开网易新闻 查看精彩图片

Aryaman 提到,J-space 实验里,如果把模型内部未说出口的概念替换掉,比如把“蜘蛛”换成“蚂蚁”,最终答案会跟着改变。这个结果说明内部推理确实存在,并且会影响输出。他判断,模型如果想把语言建模做好,就必须在内部进行某种逻辑推理。

访谈中区分了思维链和真实的内部推理。思维链有用,但不是最好的窥探手段。可解释性研究目前有两条主要路线:一条是表示工程,用稀疏自编码器或自然语言自编码器,把混乱的隐藏表征映射成可读特征;另一条是因果抽象,先假设特定向量代表某种语言属性,再通过加减向量做干预验证。

可解释性的两类价值

Aryaman 认为可解释性带来两类价值。第一类是建立信任,通过了解失效模式和划分责任来帮助监管。第二类是促进科学理解,提供系统性解释,减少对少数直觉者的依赖。他说,不能永远只依赖少数拥有惊人直觉的人推动整个领域,应该有更系统的方法,为什么某些方法成功、另一些没有成功,背后一定有系统性原因。

访谈还涉及用户建模。模型会根据感知到的对话者调整行为,比如当模型认为对话者是知名 AI 安全研究者时,输出会更加谨慎。这说明模型内部会对用户身份进行推断,并相应调整表现。

幻觉与 Scaling Law

关于幻觉,Aryaman 指出,模型做对时,背后通常存在系统性解释;模型做错时,未必能给出同样清楚的解释。正确答案往往有清晰机制,错误则缺乏这种机制。访谈最后还提到 Scaling Law 的个人领悟、CausalGym 基准,以及引导向量在实际中的局限,例如 Golden Gate Claude 这类方法并不总是有效。