拆开权重,给大模型做“脑检”

至知研究院提出直接拆解模型权重的可解释性路线,不再额外训练稀疏替代网络,数据成本降至传统方案的不到1%。
大模型解释,不一定要再训练一个模型
至知创新研究院近日提出一条新的大模型可解释性路线:直接从模型权重中拆出可解释结构,而不是先收集海量激活数据,再训练一套稀疏替代网络。根据 2026 年 8 月公开的信息,这种方法所需的数据成本不到传统稀疏表示方案的 1%,试图把模型解释从一项昂贵的二次训练工程,变成更接近权重分析的问题。
大模型可解释性是研究模型内部表征、计算过程与最终输出之间因果关系的技术方向。它要回答的不是“模型说了什么”,而是“模型为什么会这样说,以及哪些内部结构真正参与了这个判断”。
这项工作的价值不在于又做出了一张更漂亮的神经元热力图,而在于它挑战了当前机械可解释性研究中的一个默认前提:为了看懂原模型,是否必须再训练一个模型。

传统路线的问题:解释模型本身也很贵
机械可解释性是通过分析模型内部组件及其因果作用,解释神经网络如何完成计算的方法。与只观察输入、输出的黑盒评测不同,它会深入注意力头、MLP 层、残差流、神经元和特征方向,寻找能够被验证的内部“电路”。
稀疏自编码器(Sparse Autoencoder,SAE)是目前大模型机械可解释性研究中常见的特征提取工具。它通过重建模型的中间激活,把一个密集向量拆成少量被激活的稀疏特征,从而缓解单个神经元同时承载多个概念的“多义性”问题。
SAE 的基本逻辑并不复杂。研究者先让大量文本通过目标模型,记录某一层或多个位置产生的激活向量;随后用这些激活训练一个编码器和解码器,迫使编码结果保持稀疏;最后再分析每个稀疏特征对应哪些文本、概念或行为。
问题也恰恰出在这里:解释一个已经训练完成的大模型,还要额外准备数据、运行推理、保存激活并优化另一个神经网络。
激活数据的存储开销尤其容易被低估。假设只记录一个宽度为 8192、采用 BF16 格式的残差流向量,每个 token 就需要约 16KB;记录 1 亿个 token 的单层激活,原始数据量已经约为 1.6TB。若同时研究多个层、多个位置或 MLP 中间状态,数据规模会继续成倍增长。
训练成本也不只是一次矩阵分解。SAE 通常要在重建误差、稀疏程度和特征死亡率之间调参,字典规模往往大于原始隐藏维度;目标模型一旦更换版本、层位或训练检查点,原有解释器还可能需要重新训练。
这意味着传统方案实际上包含两套成本:第一套是训练基础模型的成本,第二套是为了理解基础模型而产生的解释成本。对资金充足的实验室来说,这仍然可做;对模型开发团队、安全审计方和高校研究者来说,它会直接限制可解释性分析的覆盖范围。
新路线是什么:把权重本身当作研究对象
直接权重分解是从模型已经学习到的参数矩阵中提取潜在特征、方向或子结构的方法。它不以重新拟合海量激活样本为起点,而是把注意力层和 MLP 层中的权重视为训练结果留下的“计算化石”。
至知研究院这条路线的核心判断是:模型训练过程中形成的稳定功能结构,应当已经编码在权重里。既然权重决定激活如何被投影、组合和写回残差流,那么其中就可能存在能够直接识别的语义方向与计算单元,没有必要先用另一个网络重新学习一遍。
从线性代数角度看,一个权重矩阵可以被近似写成若干方向或低秩分量的组合,例如将矩阵理解为一组“读取方向”与“写入方向”的叠加。模型看到特定输入时,前者负责识别某类模式,后者负责把计算结果写入后续层可使用的表示空间。
这并不等于简单地对权重做一次奇异值分解(SVD)。普通 SVD 优先保留解释方差最大的正交方向,但方差最大不等于语义最清晰,更不等于对模型行为存在可验证的因果作用。真正可用的权重解释方法,还需要处理稀疏性、跨层组合、基变换不唯一以及非线性激活等问题。
公开报道给出的最醒目数字是“数据成本不到 1%”。这个数字意味着,如果传统方案需要处理 100 份规模的激活样本,新方法对应的数据需求不足 1 份;它并不等于总算力、显存占用或墙钟时间都同步下降 99%。
这个口径必须谨慎理解。截至 2026 年 8 月 15 日,公开报道尚未完整披露该比例所对应的模型规模、层数、token 数、基线 SAE 配置和硬件环境,因此更准确的表述应当是“数据成本降至对比方案的不到 1%”,而不是笼统地宣称整个解释流程便宜了 100 倍。
两条路线到底差在哪
直接拆权重与 SAE 并不是简单的替代关系,而是从不同观测对象出发研究同一个模型。前者回答“参数中固化了什么结构”,后者更擅长回答“模型在真实输入上实际激活了什么特征”。
| 对比维度 | 稀疏自编码器(SAE) | 直接权重分解 | 实际影响 | |---|---|---|---| | 主要输入 | 大规模中间激活 | 已训练模型的权重 | 新路线减少激活采集依赖 | | 是否训练替代网络 | 通常需要 | 核心目标是不需要 | 降低额外优化与调参成本 | | 数据需求 | 可能需要数百万至数亿 token | 报道称不到传统方案的 1% | 更适合多层、多版本扫描 | | 关注对象 | 输入分布下出现的特征 | 参数中固化的潜在结构 | 两者观察角度不同 | | 分布敏感性 | 明显受采样语料影响 | 对解释语料依赖较低 | 有利于跨数据集比较 | | 动态行为分析 | 较强 | 仍需结合激活验证 | 权重结构不等于实际调用 | | 工程门槛 | 数据、存储、训练链路较重 | 更偏矩阵分析与结构搜索 | 可降低中小团队入场成本 | | 因果验证 | 需要干预特征并重跑模型 | 同样需要消融、投影或编辑实验 | 不能只凭语义命名下结论 |
权重分解最直接的优势是可扩展性。过去研究者可能只能挑选少数层训练 SAE;如果数据和优化负担确实下降两个数量级,团队就有机会对模型全部层、多个训练检查点乃至多个同架构模型进行系统比较。
SAE 的优势则是贴近模型运行时状态。一个方向即使清晰地存在于权重中,也可能只在极少数输入上被调用;另一个看似次要的方向,则可能因为数据分布和上下文组合而频繁主导输出。只看参数,不观察激活,容易把“模型具备这种能力”误判成“模型正在使用这种能力”。
为什么“不到1%”可能改变开发流程
数据成本下降首先会让可解释性从一次性论文实验转向持续工程。模型团队可以在预训练不同阶段定期拆解权重,观察代码能力、拒答行为、长上下文处理或特定语言表征在何时形成,而不是等模型训练结束后再做一次昂贵的尸检。
模型版本比较也可能因此变得更精细。开发者不再只能比较准确率和损失曲线,还可以追踪一次继续预训练、监督微调或偏好优化究竟改动了哪些内部方向,以及新能力是新增了结构,还是复用了旧有电路。
安全审计是更现实的应用方向。对于欺骗倾向、后门触发、危险知识调用和越狱响应,输出评测只能说明模型在测试集上的表现;权重结构分析则可能帮助研究者定位相关能力落在哪些层、通过哪些方向被读写,并进一步设计消融实验。
模型编辑同样会受益。当前不少模型编辑方法能够改掉单个事实,却可能引发泛化不足或无关知识受损;如果权重分解能提供更清晰的功能边界,编辑就可能从“在参数空间里试错”变成“对特定方向做定点修改”。
开源模型社区可能是短期内最大的受益者。社区通常拿得到完整权重,却未必拥有为数十个层分别采集海量激活、训练解释器的预算;直接分析权重天然符合开源模型可下载、可复现、可横向比较的工作方式。
真正的难题不是拆开,而是证明拆对了
可解释性方法最容易犯的错误,是把一个能被人类命名的模式当成模型真实使用的机制。研究者看到某个分量与“Python 代码”“医学诊断”或“拒绝回答”相关,只能说明二者存在相关性,不能证明该分量导致了对应输出。
因果干预是检验解释是否可靠的关键步骤。一个被标记为“代码特征”的方向,在被抑制后应当稳定降低相关任务表现,同时尽量不破坏普通语言能力;增强该方向则应产生可预测变化,而不是让模型整体退化。
重构保真度也是不能回避的指标。若分解后的结构只能重建权重,却无法重现原模型在损失、生成质量和任务准确率上的表现,那么得到的解释可能只是数学上方便,而不是功能上真实。
特征稳定性决定了方法能否用于跨模型研究。同一模型使用不同随机种子、不同分解超参数后,是否还能找到相近方向;同一架构从 7B 扩大到 70B 参数时,特征是否具有对应关系;不同团队能否复现实验结果,这些问题都比展示几个有趣案例更重要。
非线性会继续限制纯权重分析。Transformer 的实际计算还受到归一化、激活函数、注意力路由、残差叠加和上下文位置影响,单个矩阵中的清晰方向经过多层组合后,未必仍保持相同含义。
基变换不唯一则是另一个理论障碍。神经网络内部表征可以在不改变整体函数的前提下进行旋转、缩放或重新参数化,因此一个看起来直观的分解未必具有唯一性;方法必须证明它找出的特征不是某种坐标选择带来的视觉错觉。
更合理的落地方式:权重负责普查,激活负责取证
直接权重分解最合理的定位不是彻底淘汰 SAE,而是把解释流程重构为“低成本普查、高成本验证”。先扫描全部权重,寻找值得关注的方向和层位,再对少量候选结构采集激活、进行消融并运行行为评测。
这套组合路线可以显著减少盲目采样。传统流程往往先收集大量激活,再期待稀疏字典自动暴露重要特征;新的流程可以先根据权重提出假设,把有限数据预算集中到高风险或高价值区域。
开发团队可以按四步采用这类方法:
- 结构扫描:对注意力和 MLP 权重做统一分解,建立跨层特征索引。
- 语义标注:使用少量代表性样本观察候选方向与输入概念的关系。
- 因果验证:通过抑制、增强、投影和局部权重编辑确认功能作用。
- 回归测试:在通用能力、安全评测和目标任务上检查副作用。
评估结果至少应同时报告五类数字:数据 token 数、额外训练 FLOPs、峰值显存、重构误差和干预后的任务变化。只公布“节省 99% 数据”而不披露解释质量,很难证明这条路线真正优于成熟 SAE。
我们的判断:方向很对,但现在还不是终局
至知研究院这项工作的最大意义,是把大模型解释从“再训练一个足够好的替身”,重新拉回“分析原模型已经学到的结构”。这个问题意识是对的,而且击中了可解释性研究长期存在的工程痛点。
不到 1% 的数据成本如果能在不同模型规模、不同层类型和多个基线上复现,其影响会超过单项跑分提升。它可能让模型解释覆盖全部层和全部版本,也可能让更多没有大规模算力预算的团队参与机械可解释性研究。
但直接拆权重还不能自动等于理解模型。权重描述的是模型能够如何计算,激活描述的是模型在特定上下文中实际如何计算,输出评测描述的则是计算最终产生了什么结果;可靠解释需要把这三层证据闭合起来。
现阶段最值得关注的不是几个被成功命名的特征,而是三项硬指标:权重分解能否重现模型功能、特征能否跨随机种子稳定出现、干预特征能否产生精确且局部的行为变化。只有这三项同时成立,“拆权重”才会从一种分析技巧升级为通用的模型审计基础设施。
至知研究院此前已经在代码模型、推理模型和科学智能方向展开研究,这次切入可解释性也符合其强调工程效率和复杂系统分析的技术路径。相比再做一个更大的基础模型,降低理解现有模型的成本,可能是一件更不显眼、但对行业更有长期价值的事。
参考来源
- Sparse Autoencoders Find Highly Interpretable Features in Language Models:稀疏自编码器用于语言模型特征解释的代表性研究页面,可用于理解 SAE 的技术背景。
- Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet:大规模稀疏特征提取研究,展示传统激活分析路线的能力与工程复杂度。
- 决策过程是魔法还是科学?多模态大模型可解释性综述:从数据、神经元、特征和网络结构等层面梳理大模型可解释性方法。
说明:关于至知研究院新方法的事件信息与“数据成本不到 1%”指标,来自 2026 年 8 月国内公开报道;由于文末链接域名限制,未列出对应报道链接。具体技术结论仍应以研究团队后续发布的论文、代码、完整实验配置和可复现结果为准。



