直接从权重拆解大模型
至知创新研究院(IQuest Research)联合Safe AI Forum、牛津大学、斯坦福大学、清华大学提出稀疏权重分解(Sparse Weight Decomposition,SWD),试图绕开“为理解一个模型再训练一个替代网络”的传统路径,直接从预训练权重中抽取可干预的任务回路。
在机制可解释性研究中,任务回路指一组对模型某项能力有因果作用的内部计算:只保留它们时能力仍在,移除它们时表现下降。此前Transcoder、稀疏特征模块等方法通常要学习新表示,用它近似原模型某层或模块,再对新单元做归因和消融。这类方法有效,但需要额外数据和优化,也可能把原模型行为与替代模块误差混在一起解释。
SWD如何构造“稀疏路径”
SWD的核心是把一个稠密权重矩阵W近似分解为两个稀疏矩阵A和B,即W≈AB。A和B共享的中间维度成为瓶颈单元:一个单元先从输入方向读出标量,再写向输出方向,相当于一条rank-one读写路径。rank-one可理解为用一个输入方向和一个输出方向构成的最小矩阵更新。
方法使用少量校准文本产生层输入,优化分解前后输出误差;求解时交替更新两个因子,用硬阈值控制非零连接数量,并重新拟合保留权重。分解完成后,研究者可以对瓶颈单元评分、排序、选择和消融,而不必再训练独立神经替代网络。与SVD不同,SVD成分通常读写方向稠密;SWD强调每个单元内部连接也要稀疏,因此保留少量单元时也能减少实际活跃连接。
关键结果:数据不到1%,扩展到27B
论文报告了三组核心发现:
- 在单矩阵替换保真度匹配实验中,SWD使用的数据不到Transcoder等训练型基线的1%。
- 在GPT-2、Qwen2.5和Qwen3.5-27B任务回路实验中,SWD通常用更少瓶颈单元和活跃连接达到相同充分性、必要性目标。
- 方法覆盖到Qwen3.5-27B,也扩展到GPT-2 Small全部48个注意力和MLP权重矩阵,并提供zero-data版本。
团队用留出文本交叉熵差值(CE delta)衡量替换后模型是否接近原模型,并辅以KL散度和激活重构误差。在GPT-2 Small第8层mlp.c_proj实验中,SWD用数千个校准token就进入低误差区间,而训练型基线需要约10⁶量级optimizer-replay token。类似趋势也出现在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上。
从单矩阵到全模型与语义单元
在回路抽取上,团队先用一阶任务归因排序候选单元,再构造top-k嵌套回路,在留出集上做充分性和必要性测试。GPT-2 Small的GreaterThan、IOI、Docstring、Gendered Pronoun四项任务显示,SWD达到同等目标时通常比Transcoder和VPD-Recon-CI使用更少单元与连接;换成零消融后优势仍保持,并扩展到Qwen系列模型。
全模型实验中,研究者将GPT-2 Small 12个Transformer block内48个注意力和MLP权重矩阵替换为SWD分解,保留embedding、LayerNorm、非线性函数和输出头。由于跨层误差会累积,他们固定稀疏结构,只微调保留下来的因子值,得到SWD-FT:在连接数量不变时,模型CE从3.90降至3.44,略优于相近非零参数预算下稀疏预训练基线的3.45;前者使用约2,060万个token,后者为28.84亿个token。
论文还展示zero-data SWD:不使用校准文本,直接最小化权重空间Frobenius误差。结果显示,它在权重空间更接近原矩阵;激活校准版则在高稀疏度下更能保持典型文本行为。即便无校准激活,zero-data版本仍可抽取有效任务回路。
行业意义与走向
SWD的价值不只在节省训练数据,而在把可解释性对象从“另一个学出来的替代模块”拉回原始checkpoint。它提供了可评分、可消融、可编辑的稀疏权重路径,并在GreaterThan任务中呈现出与数字、年份、数量相关的高归因单元;单个瓶颈方向还被用于定向提升提示“The opposite of up is”中down相对left的logit margin,且无关提示KL很低。
对普通技术读者而言,这意味着大模型内部机制研究可能更接近工程化:不必总为每层、每个checkpoint重新训练复杂替代表示。未来这一路线能否成为主流,还取决于其在更多模型、更多任务和更严格安全场景中的稳定性。但从论文结果看,直接在权重侧寻找稀疏因果回路,正在成为理解和操控大模型内部计算的一条重要分支。




