在模型规模上,团队将相同的单矩阵替换和回路抽取流程扩展到Qwen2.5-0.5B、1.5B、3B,最终进一步验证至Qwen3.5-27B。
在27B模型的第31层mlp.down_proj上,SWD依然以显著更少的数据达到低CE delta,并以更少的活跃连接达到相当的充分性和必要性目标。
在替换范围上,团队进一步把GPT-2 Small 12个Transformer block中全部48个注意力和MLP权重矩阵替换为稀疏分解,同时保留embedding、LayerNorm、非线性函数和输出头。
由于局部近似误差会跨层累积,团队将SWD作为稀疏初始化,固定所有非零位置,只微调已经保留下来的因子值。得到的SWD-FT在连接数量不变的情况下,将模型CE从3.90降至3.44,略优于相近非零参数预算下稀疏预训练基线的3.45。
更值得注意的是,SWD-FT总计使用约2,060万个token,而稀疏预训练基线达到相近CE使用了28.84亿个token,前者同样不到后者的1%。这使得从现有稠密checkpoint出发构造全模型稀疏干预表面,成为一条极具吸引力的路线。
SWD还提供了一个更彻底的zero-data版本。在GPT-2 Small单矩阵实验中,它完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差。
结果显示,zero-data SWD在权重空间中更接近原矩阵;使用激活校准的SWD则在高稀疏度下更能保持典型文本上的模型行为。
即使完全不使用校准激活,zero-data SWD得到的瓶颈单元仍然能够抽取出有效任务回路。这为逐checkpoint、逐训练阶段追踪大模型内部结构提供了新的可能性。
回路曲线证明了这些单元在因果测试中有效,但机制可解释性还关心另一个问题:这些单元能否呈现出可理解的模式?
团队在GreaterThan任务上,对GPT-2 Small全部9,208个候选mlp.c_proj瓶颈单元进行归因排序,并从第6、8、10层展示六个高排名单元。
随后,他们在独立的WikiText-2文本上收集每个单元的高激活上下文,并由GPT-5.5总结重复出现的语义模式。
六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个更多对应标点、句法和命名实体。
这些语义模式并未参与单元选择,却与GreaterThan所需的数值比较能力形成了明显呼应。
团队还进行了一个独立的定向编辑实验。他们筛选出瓶颈单元c205,并将该单元读方向诱导的rank-one更新施加到原始稠密GPT-2权重上。
在提示词The opposite of up is中,正确答案down相对干扰答案left的logit margin提高了0.216;在七条无关事实提示上,平均末token KL仅为4.02×10⁻⁵。
在相近的正向目标变化下,这个单单元方向测得的副作用低于随机单元和rank-4 LoRA对照。
一个从权重分解中得到的瓶颈方向,因此不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。
为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。
这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。
说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。
问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。
训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。
更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。
至知创新研究院(IQuest Research)与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:
来源:量子位
