至知创新研究院(IQuest Research)与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:
不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。 这套方法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。 至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。 这套方法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。 至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
行业密探


JPG
长图