返回全部动态

至知研究院提出SWD:直接拆解权重实现大模型可解释性,数据成本不到1%

原标题:至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%

量子位研究质量 83

AI 摘要

至知创新研究院联合Safe AI Forum、牛津大学、斯坦福大学和清华大学提出稀疏权重分解(SWD)方法,直接从预训练权重中分解出可干预的稀疏单元,无需训练替代网络。实验表明,SWD在匹配替换保真度时数据成本不到训练型基线的1%,并在GPT-2、Qwen2.5和Qwen3.5-27B上以更少的瓶颈单元和活跃连接达到任务回路要求。该方法还支持全模型替换和zero-data版本,为大规模模型机制可解释性提供了更轻量的技术路线。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1% 理解大模型,无需再训练一个替代网络 允中 发自 凹非寺 量子位 | 公众号 QbitAI 大模型机制可解释性研究中,一直存在一个颇具反差的现实: 为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。 Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。 这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。 说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。 问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。 训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。 更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。 至知创


发布时间:2026-08-15 14:42
抓取时间:2026-08-15 15:40
来源机构:量子位
阅读原文qbitai.com