语言模型给出一个答案后,如果你追问它为什么这么答,它会生成一段听起来自信又合理的解释。但这段解释来自同一个模型,并不是对内部实际发生过程的记录,而是对原始答案的二次猜测。NeuronScope试图提供另一种方案:一个命令行工具和MCP服务器,追踪哪些注意力头和MLP神经元真正驱动了模型输出,而不是让模型自己讲述自己。
NeuronScope构建在一个现有的开源模型内部钩子库之上,每条命令都会输出版本化的JSON模式,并通过MCP向AI代理暴露相同的四种操作。项目采用MIT许可证,可通过pip install neuronscope-cli安装,能在CPU上运行GPT-2这类小型模型。实际输出示例:运行neuronscope trace gpt2 "The capital of France is Paris. The capital of Japan is"后,工具会对产生Tokyo这一预测的注意力头和神经元进行排序。
Gartner预计,到2028年可解释AI工具将占LLM可观测性投资的一半,而目前这一比例是15%。但追逐这一转变的资金几乎都流向了托管平台:可解释性研究实验室Goodfire在2月完成了1.5亿美元B轮融资,估值12.5亿美元;Apollo Research同月从慈善资助模式转为风投支持的公益公司。几乎没有钱落到一个能在自己笔记本上对开放权重模型运行的命令上。这正是NeuronScope想填补的空缺。
机制可解释性到底在测量什么
机制可解释性的做法是对前向传播进行插桩,测量哪些组件推动了预测。三个术语承担了大部分含义:注意力头在token位置之间移动信息,按直接logit归因排序可以知道哪个头的输出对最终预测推动最大;MLP神经元在层内对特定特征激活,按激活幅度排序可以知道哪些神经元在关键位置最活跃;激活修补(或消融)是因果测试——将某个组件归零,观察预测实际变化多少,这比单纯说“这个组件很活跃”更有说服力。
这个项目只有三周历史,团队已经弄坏过一次它最主打的功能。文章的大部分内容都在讲这件事。工具本身也在对自己的局限保持诚实。
热门跟贴