蒸馏DeepSeek,审查没跟来
一项近期实验显示,把 DeepSeek 的回答蒸馏进 GPT-OSS 后,能力与表达模式可以迁移,原模型的敏感话题拒答倾向却未必随之复制。
蒸馏迁移了能力,却没有完整复制拒答边界
近日,CTGT AI 公布的一项互动实验把 DeepSeek 生成的回答用于训练 GPT-OSS,结果显示:学生模型能够学到教师模型的部分知识、推理路径和表达风格,但没有同步复制教师模型在敏感话题上的系统性拒答行为。截至 2026 年 7 月 30 日,这项实验最值得开发者关注的地方,不是谁又蒸馏了谁,而是它给出了一个很实用的结论——模型能力、回答风格与安全边界并不是一个不可拆分的整体。
知识蒸馏是用教师模型生成的输出训练学生模型,使后者以更低的训练与推理成本复现特定能力的方法。它迁移的不是教师模型参数,也不是完整模型结构,而是训练样本中能够被学生模型统计学习到的输入—输出关系。
审查行为则是模型针对特定人物、事件或政治议题,稳定地拒绝回答、回避事实、改写问题或输出预设立场的行为模式。这里的“审查”不等于所有安全拒答:拒绝提供恶意软件、制毒流程或真实个人隐私,属于通用安全控制;针对本可正常讨论的公共议题进行选择性回避,才是这次实验真正想观察的对象。

这项实验实际上证明了什么
这项实验提供的是“审查不会自动迁移”的案例证据,而不是“蒸馏永远无法迁移审查”的普遍定律。CTGT AI 展示了可直接尝试的模型行为,但公开页面并不是一篇完整的同行评审论文,没有系统披露全部训练样本、敏感问题集合、随机种子、超参数、基线重复次数和置信区间,因此不能把互动体验直接等同于严谨的因果证明。
实验的关键现象是,同一批来自 DeepSeek 的示范数据可以提升 GPT-OSS 对某些任务的完成能力,却没有把 DeepSeek 的拒答边界原样写进学生模型。换句话说,学生学会了老师如何解题,却没有完整接受老师在什么场合必须闭嘴的规则。
这个结果并不反常,因为蒸馏学习到什么,首先取决于训练数据里出现了什么。如果蒸馏数据主要由数学推理、编程、知识问答和一般指令组成,教师模型的敏感话题拒答只占极小比例,那么这些拒答样本在训练梯度中的权重也会很低。学生模型原有的行为先验、系统提示和后训练结果,足以覆盖这部分微弱信号。
更重要的是,拒答边界通常不是单一来源决定的。一个在线模型的最终回答可能同时受到基座模型、监督微调、偏好优化、系统提示、输入分类器、输出过滤器和服务端策略影响,而蒸馏通常只能看到最终文本。教师为什么拒答、是哪一层拦截、如果移除系统提示会怎样,学生模型都无从得知。
能力、风格和策略,本来就是三层东西
模型能力是模型完成推理、编码、检索式回忆和指令执行任务的内在水平。能力可以通过大量高质量示范迁移,因为每一条正确答案都在告诉学生:面对这类输入,哪些中间模式和最终输出更可能有效。
回答风格是模型在措辞、结构、篇幅和推理展示方式上的稳定偏好。风格往往比深层能力更容易蒸馏,只要数千到数万条输出持续使用类似格式,学生模型就可能学会“先分析、再分点、最后总结”之类的表面模式。
行为策略是模型在特定风险、身份或政策条件下决定回答、拒答或部分回答的规则。策略能否迁移高度依赖样本覆盖率,而且它很容易被学生模型已有的对齐结果、部署时提示词与外部审核层覆盖。
| 迁移对象 | 主要载体 | 蒸馏难度 | 对数据覆盖的依赖 | 部署后是否容易被覆盖 | |---|---|---:|---:|---:| | 知识与任务能力 | 正确答案、推理轨迹、工具选择 | 中到高 | 高 | 中 | | 表达与格式风格 | 句式、结构、篇幅、语气 | 低到中 | 中 | 高 | | 安全拒答策略 | 拒答样本、边界案例、偏好对 | 高 | 极高 | 极高 | | 服务端审查规则 | 分类器、关键词策略、输出过滤 | 无法仅靠文本完整迁移 | 不适用 | 不适用 |
这张表解释了为什么“像 DeepSeek 一样推理”和“像 DeepSeek 一样拒答”可以分离。前者通常被反复编码在大量任务样本里,后者可能只在少量话题中出现,甚至根本不属于模型权重,而是部署系统在推理前后追加的控制。
为什么 GPT-OSS 没有照单全收
GPT-OSS 是 OpenAI 发布的开放权重模型系列,开发者可以在本地或自有基础设施上运行、微调并检查其推理行为。开放权重意味着部署者对系统提示、采样参数、微调数据和外围过滤拥有更直接的控制,但不意味着训练数据与完整训练流程全部公开。
学生模型的初始化状态决定了它不会像一张白纸那样机械抄写教师。GPT-OSS 在蒸馏前已经具备自己的知识分布、拒答习惯与指令遵循方式,后续训练更像是在原有地形上修路,而不是把整片地形推平重建。如果新增样本与既有行为冲突,最终变化取决于样本数量、损失权重、学习率和训练持续时间。
敏感拒答样本的稀疏性也会削弱迁移效果。假设训练集中绝大多数样本要求正常回答,只有极少数样本展示政治话题回避,那么优化器更关心的是整体回答质量,而不是复现一个低频边界。即使学生记住了少数拒答模板,它也可能只在相近措辞下触发,换一种语言、换一个时间范围或把问题改成比较题,行为就会消失。
蒸馏数据还会把教师模型的内部决策压缩成一个最终输出。教师返回“无法回答”时,学生看不到拒答来自模型自身判断、隐藏系统提示还是独立审核器;教师正常回答时,学生也不知道这个问题是否曾经被分类器放行。黑盒输出能传递结果,却很难传递完整策略栈。
这也是本次实验比“模型有没有审查”更有价值的地方。它提醒开发者不要把在线产品行为直接等同于模型权重属性,更不能因为某个学生模型学会了教师的推理风格,就推断它继承了教师的全部价值观、安全规则或政治边界。
与 DeepSeek-R1 官方蒸馏路线有什么不同
DeepSeek-R1 的官方蒸馏路线证明了推理模式可以跨模型家族迁移。DeepSeek 曾使用 R1 生成的推理数据训练 Qwen 与 Llama 系列学生模型,并发布 DeepSeek-R1-Distill-Qwen、DeepSeek-R1-Distill-Llama 等模型;这类工作关注数学、代码和复杂推理能力,而不是复制在线产品的完整审核策略。
公开结果已经说明,蒸馏对能力迁移确实有效。DeepSeek-R1 相关资料披露了约 80 万条训练样本,其中包含约 60 万条推理样本和约 20 万条非推理样本;其核心做法是把教师模型的验证、反思和长链条解题模式放进后训练数据。学生模型因此学到的是“如何一步步找到答案”,而不是教师模型所有场景下的产品政策。
| 路线 | 教师模型 | 学生模型 | 主要目标 | 对审查迁移的预期 | |---|---|---|---|---| | DeepSeek 官方蒸馏 | DeepSeek-R1 | Qwen、Llama 等 | 数学、代码与复杂推理 | 不是主要训练目标 | | CTGT AI 近期实验 | DeepSeek | GPT-OSS | 观察能力与拒答行为是否绑定 | 结果显示未完整迁移 | | 安全策略蒸馏 | 带明确策略的教师或偏好模型 | 任意可训练学生模型 | 复制允许、拒绝与边界规则 | 需要高覆盖率边界数据 | | 产品级审核复现 | 完整线上系统 | 本地开放权重模型 | 复制端到端产品行为 | 仅靠回答文本通常不够 |
两条路线共同指出,蒸馏不是模型克隆。学生模型可以在某些基准上接近教师,甚至在适合自身结构的任务上超过教师,但这不表示它拥有相同的世界知识、鲁棒性、工具能力、安全策略或长尾表现。
“没有迁移”也可能只是评测没测出来
审查行为的测量必须使用成组对照问题,而不能依赖几个截图。一个合格的测试集至少应覆盖直接提问、同义改写、多轮上下文、角色扮演、跨语言表达、历史与现实对照,以及要求引用来源和仅做文本分析等不同形式。
拒答率是模型在一组本应可回答的问题中给出拒绝、回避或无关回答的比例。开发者还应同时记录有效回答率、事实准确率、立场偏移率和改写后的行为一致性,否则模型用空泛套话绕开问题,也可能被错误统计为“已回答”。
审查迁移率可以理解为学生模型新增拒答中,与教师模型拒答边界一致的比例。评测时至少需要四组结果:未蒸馏 GPT-OSS、蒸馏后 GPT-OSS、教师 DeepSeek,以及采用相同系统提示的控制组。没有蒸馏前基线,就无法判断学生的拒答究竟来自教师数据,还是 GPT-OSS 本来就会这样回答。
重复实验同样不可省略,因为微调结果会受随机种子、样本顺序与解码参数影响。温度、top-p 和推理强度变化都可能把一次正常回答变成拒答;如果只展示单次输出,模型的随机波动会被误读成稳定策略。
因此,CTGT AI 的结果更适合被视为一个可验证的研究假设:蒸馏能够选择性迁移能力,而不会必然迁移教师的全部审查边界。它还不足以支持更强的说法,例如“任何敏感行为都无法蒸馏”或“GPT-OSS 天生不受审查”。
对开发者最直接的启示
开发者可以把教师模型当作能力数据生成器,但不能把它当作完整安全规范。教师输出适合提供推理示范、任务分解和高质量答案,真正的产品边界仍应通过独立策略数据、红队测试和部署层控制建立。
训练数据配比比教师品牌更重要。使用同一个 DeepSeek 教师模型,两支团队只要在问题分布、拒答样本比例、数据清洗与损失权重上不同,就可能得到能力相近、行为边界完全不同的学生模型。所谓“DeepSeek 蒸馏模型”只能说明数据来源,不能概括最终模型的全部行为。
本地部署也不会自动消除模型偏差。开放权重减少了不可见的服务端控制,让团队能够替换系统提示并审计输出,但预训练语料、后训练偏好和微调数据中的倾向仍然保留在权重里。可控性提高不等于模型天然中立。
企业验收蒸馏模型时应把能力与策略拆成两套测试。能力侧可以看数学、代码、知识问答与业务任务成功率;策略侧则要检查过度拒答、危险内容放行、政治与文化偏差、隐私泄露和跨语言一致性。把两者压缩成一个总分,往往会掩盖“能力提高、可用性下降”或“拒答减少、风险上升”的问题。
建议至少保留以下四类对照:
- 同一学生模型蒸馏前后的差异,用于测量真实增量。
- 教师与学生在相同问题集上的差异,用于定位未迁移行为。
- 有无系统提示和外围过滤的差异,用于区分权重与产品策略。
- 不同语言、改写方式和多轮上下文的差异,用于检查行为是否稳定。
这不是“去审查”的万能方案
蒸馏 DeepSeek 到 GPT-OSS 并不是一条可靠的自动去审查流水线。它之所以没有复制某些拒答,很可能是因为相关行为在数据中不够密集、拒答来自模型外部,或者 GPT-OSS 原有对齐覆盖了教师信号;只要改变数据构成和训练目标,学生模型仍然可能学会同类拒答。
反过来,审查没有迁移也不一定是好消息。学生模型如果连合理的危险内容限制、隐私保护和违法操作拒答也一起丢失,部署风险会明显增加。真正有用的目标不是让模型“什么都答”,而是让拒答边界透明、可测试、与应用场景匹配。
这项实验最终揭示的是大模型后训练的模块化趋势。知识、推理、风格和安全策略可以来自不同教师、不同数据集与不同优化阶段,开发者不必接受一个教师模型的整套行为包袱;但每拆开一层,也意味着团队需要自行承担评测、合规和安全责任。
截至目前,更稳妥的判断是:蒸馏可以高效搬运教师模型反复展示的能力,却不会自动复制教师背后的完整治理系统。对做模型微调的人来说,这既是机会,也是警告——你获得了重新设计行为边界的空间,也失去了把责任推给教师模型的借口。
参考来源
- OpenAI GPT-OSS 官方 GitHub 仓库:提供 GPT-OSS 的模型实现、运行说明与官方技术信息。
- DeepSeek-R1 官方 GitHub 仓库:介绍 R1 训练方法、蒸馏模型与公开评测结果。
- DeepSeek-R1 Hugging Face 模型合集:提供 DeepSeek-R1 及相关蒸馏权重的模型卡与文件。
- OpenAI GPT-OSS Hugging Face 主页:提供 GPT-OSS 开放权重模型及模型卡信息。


