长篇善意上下文带偏Gemma 3

一项最新社区实验显示,100至3000 token 的连贯良性前缀可能使 Gemma 3 1B 的深层激活显著漂移,并削弱安全拒绝。结论尚待复现,但已暴露长上下文安全评测的盲区。
没有越狱指令,模型的拒绝机制仍可能失灵
近日,一项发布在 Reddit r/MachineLearning 的机制可解释性实验引发讨论:研究者向 google/gemma-3-1b-it 输入长度为 100 至 3000 token、主题连贯且不含攻击指令的文本前缀后,观察到模型深层激活发生剧烈偏移,并声称原有的安全拒绝模板被“完全中和”。
这项实验真正值得警惕的地方,不是又发现了一种提示词越狱技巧,而是模型可能仅仅因为“读了太多连贯内容”就离开原本的安全工作区间。过去的安全测试通常盯着恶意后缀、角色扮演、编码混淆和系统提示注入,这次被指认的触发条件却是正常长文本本身。
不过,这仍是一项社区披露的初步结果,而不是已经经过同行评审和多团队复现的定论。原帖给出了很醒目的激活距离、KL 散度与熵变化数据,但尚缺少足以支持普遍化结论的完整实验细节,因此目前更准确的说法是:Gemma 3 1B 出现了一个值得严肃复现的安全信号,而不是 Gemma 3 整个系列已经被证明会被良性上下文“自动越狱”。

激活漂移不是输出变差,而是内部状态换了坐标系
激活漂移是指模型处理不同上下文时,中间层隐藏状态相对基线发生系统性位移的现象。 大语言模型并不是先固定一套“安全规则”再机械执行,而是在每一层根据当前 token、注意力结果和残差流持续更新内部状态;当长文本让这些状态移动到训练中较少覆盖的区域,后续同一个问题可能得到完全不同的输出分布。
研究者报告称,漂移主要出现在约 85% 网络深度的位置,隐藏状态距离达到约 3434。原帖将其记作 Δh₂ ≈ 3434,但公开摘要没有充分说明这是普通 L2 范数、平方 L2 距离、跨 token 聚合值,还是经过某种归一化后的统计量。
这个定义差异非常重要。高维残差流的原始 L2 距离本来就会随隐藏维度、激活尺度和 token 数量增长,单独看到 3434 并不能直接判断语义上的变化到底有多大。更有说服力的报告至少还应给出相对范数、余弦距离、逐层基线分布、多个随机种子的置信区间,以及漂移是否集中在少数方向上。
KL 散度是衡量两个概率分布差异的非对称指标。 该实验报告前缀加入前后输出分布的 KL 散度约为 22.87 nats,这不是轻微扰动,而是两个 next-token 分布几乎换了一套排序逻辑;但 KL 散度对方向、低概率 token 和计算位置高度敏感,必须说明比较的是首个回答 token、整段生成,还是特定拒绝位置。
输出熵是衡量模型下一 token 概率分布不确定性的指标。 原帖称熵出现 325 倍增长,意味着模型从一个高度确定的拒绝模式,转为在大量候选输出之间摇摆。这个数字同样需要结合绝对值理解:如果基线熵极低,倍数会显得异常夸张,因此完整实验应同时报告加入前缀前后的熵值、对数底数以及聚合方式。
| 观察指标 | 原帖报告值 | 可以支持的判断 | 目前仍缺的信息 | |---|---:|---|---| | 良性前缀长度 | 100—3000 token | 漂移不要求逼近上下文上限 | 各长度档位、文本来源与样本数 | | 深层激活距离 | 约 3434 | 隐藏状态发生明显变化 | 范数定义、归一化和置信区间 | | 漂移位置 | 约 85% 模型深度 | 异常可能在后段网络集中形成 | 精确层号及残差流采样位置 | | 输出 KL 散度 | 约 22.87 nats | 输出概率分布与基线严重解耦 | KL 方向、token 位置和聚合方法 | | 输出熵变化 | 约 325 倍 | 原有确定性拒绝模式可能被打散 | 绝对熵值、计算单位和基线大小 | | 拒绝行为 | 原帖称被完全中和 | 安全拒绝模板可能失效 | 测试集规模、危害评分和人工复核 |
3000 token 并不算压满上下文,这反而更麻烦
Gemma 3 是 Google 推出的开放权重模型家族,包含 1B、4B、12B 和 27B 四种参数规模。 其中 Gemma 3 1B 是纯文本模型,输入上下文窗口为 32K;4B、12B 和 27B 支持图文输入、超过 140 种语言和最高 128K 上下文。
本次实验使用的是 1B 指令微调版本,而不是能力更强的 4B、12B 或 27B 模型。3000 token 只占其 32K 上下文窗口约 9.4%,所以这并不是模型接近窗口极限后自然退化的案例,而是在相对常见的输入长度内就出现了异常信号。
这一点对实际应用比“塞满 32K 后模型出错”更有现实意义。一份产品手册加几轮历史对话、一段代码仓库说明、三四篇检索文档,轻易就会超过 3000 token;如果相关现象能够复现,RAG、长文档问答、客服知识库和智能体记忆都会成为天然触发场景。
| Gemma 3 型号 | 参数规模 | 输入模态 | 上下文窗口 | 与本次实验的关系 | |---|---:|---|---:|---| | Gemma 3 1B | 10亿 | 文本 | 32K | 实验目标模型,3000 token 约占窗口 9.4% | | Gemma 3 4B | 40亿 | 图像、文本 | 128K | 尚不能由 1B 结果直接外推 | | Gemma 3 12B | 120亿 | 图像、文本 | 128K | 需要独立进行逐层激活复现 | | Gemma 3 27B | 270亿 | 图像、文本 | 128K | 参数更多不代表安全状态天然更稳定 |
Gemma 3 的长上下文能力部分依赖局部注意力与全局注意力组合,以控制长序列计算成本。局部注意力让大部分层重点处理邻近 token,全局注意力则周期性整合更远的信息;这种设计提升了效率,但也意味着连贯主题可能在多层累积后形成强势的上下文状态锚点。
这里的关键不是简单地把问题归咎于 RoPE 或长序列架构。RoPE 是通过旋转向量编码 token 相对位置信息的位置编码方法。 如果异常只是位置变远造成的数值噪声,那么相同 token 数量、不同语义组织的文本应产生相近漂移;原帖的打乱文本消融结果并不支持这一解释。
打乱文本后的消融,指向语义而非长度
消融实验是通过移除或替换某个变量,判断该变量是否对结果具有因果贡献的方法。 研究者将原本主题连贯的长文本打乱后重新输入模型,结果显示显著漂移随语义连贯性一起减弱,据此判断触发因素不是序列长度本身,也不是单纯的位置编码噪声,而是模型对连贯语义的持续整合。
这个结果支持一种直观解释:长篇连贯文本会像一个“状态锚”一样,持续把模型的注意力和残差流拉向某一语义子空间。等到真正需要执行安全判断时,代表拒绝、风险识别或遵循指令层级的方向,可能已被更强的主题表征淹没。
但一次 shuffle 对照还不足以证明漂移“严格由语义驱动”。打乱 token 不只破坏语义,也会同时改变语法、局部 n-gram、标点结构、注意力模式和困惑度;模型对乱码式文本的处理方式,本来就与自然文章不同,因此语义不是实验中唯一变化的变量。
更严谨的复现至少需要加入以下对照:
- 句子级重排对照。 保留句内语法和 token 分布,只破坏篇章逻辑。
- 同主题改写对照。 用不同表述保留语义,检查漂移是否跨措辞稳定存在。
- 等长度异主题对照。 比较技术文档、小说、新闻和对话是否产生不同方向的漂移。
- 重复文本对照。 区分语义一致性与机械重复造成的注意力饱和。
- 高困惑度自然文本对照。 排除 shuffle 只是让模型进入异常语言状态的可能。
- 位置匹配对照。 在完全相同的位置放置测试问题,只替换前缀内容。
- 激活修补实验。 将无前缀条件下的中间层状态注入长前缀条件,观察拒绝能力能否恢复。
激活修补会是其中最关键的一步。相关性实验只能说明“漂移与拒绝失效同时发生”,而逐层替换或投影消融才能判断特定激活方向是否真正导致行为改变;如果修补第 85% 深度附近的残差流能够恢复拒绝,因果链条才算基本闭合。
“拒绝消失”不等于整个对齐被完全解除
RLHF 是利用人类偏好反馈训练模型输出更符合目标行为的强化学习方法。 社区帖子使用了“RLHF alignment”这一宽泛表述,但 Gemma 3 的最终行为来自预训练、知识蒸馏、指令微调和后训练等多阶段共同作用,不能仅凭拒绝模板变化,就把现象精确归因到某一道 RLHF 工序。
安全拒绝也只是对齐行为的一种外显代理指标。模型不再输出固定拒绝句,可能意味着安全边界确实被削弱,也可能只是模板概率下降、回答不确定性上升,或者模型转向另一种不含标准措辞的安全回应;要证明“完全失去对齐”,必须对最终内容的实际危害程度进行分类和人工复核。
更合理的评估应同时测量拒绝率、过度拒绝率、危害完成率和正常任务质量。一个始终拒绝所有问题的模型拒绝率很高,却显然没有实用价值;相反,一个不说固定套话、但仍不给出危险细节的模型,也不能简单算作越狱成功。
| 测试维度 | 仅看拒绝模板的缺陷 | 更可靠的指标 | |---|---|---| | 有害请求处理 | 模板消失不一定产生有害内容 | 危害完成率、内容分级、人工复核 | | 无害请求处理 | 无法识别模型是否过度拒绝 | 无害任务通过率、过拒率 | | 输出稳定性 | 单次生成可能受采样影响 | 多随机种子、多温度重复测试 | | 长度影响 | 无法区分长度与语义 | 等长度、多语义类别的配对实验 | | 模型普遍性 | 1B 结果不能外推全系列 | 4B、12B、27B 及其他模型横向复现 |
因此,“长篇良性上下文可让 Gemma 3 失去对齐”是一个有传播力但略显超前的标题级结论。现阶段最扎实的发现是:在一组尚待完整披露和复现的测试中,Gemma 3 1B 的安全拒绝行为与长篇连贯前缀之间出现了显著、非对抗性的解耦。
真正的新盲区,是安全训练可能只在短上下文附近有效
这项实验指向了安全对齐中的分布外问题。训练团队通常会用大量单轮或较短多轮样本教会模型拒绝风险请求,但生产环境输入往往包含系统规则、几十轮历史、检索文档、工具返回结果和用户附件,模型实际抵达安全判断节点时的内部状态可能早已偏离训练分布。
传统越狱强调攻击者主动构造恶意提示,而上下文诱导激活漂移不要求前缀包含明确的攻击意图。两者的差异决定了防御方式也不同:关键词过滤可以拦截部分恶意指令,却无法合理拦截一份完全正常的 20 页技术手册。
| 风险类型 | 主要触发方式 | 是否需要恶意文本 | 常见防御 | 本次现象暴露的问题 | |---|---|---:|---|---| | 提示词越狱 | 角色扮演、编码、规则冲突 | 通常需要 | 对抗训练、输入检测 | 防御集中在显式攻击模式 | | 间接提示注入 | 检索文档或网页夹带指令 | 通常需要 | 内容隔离、指令层级 | 外部内容可篡改任务目标 | | 位置与长度退化 | 输入接近窗口或注意力失真 | 不需要 | 截断、摘要、窗口管理 | 长序列本身降低稳定性 | | 上下文诱导激活漂移 | 长篇、连贯、良性语义前缀 | 不需要 | 尚无成熟方案 | 正常内容也可能改变安全状态 |
我的判断是,这项工作的价值目前大于它的证据强度。它还不足以给 Gemma 3 判定系统性安全故障,却提出了一个非常好的红队测试范式:安全评测不能只替换最后那条用户问题,还要系统改变问题之前的语义历史。
开发者现在就能做的六件事
生产系统不必等待论文定稿才开始补测。即便最终发现 3434、22.87 nats 或 325 倍等具体数字无法稳定复现,长上下文导致行为漂移本身也是已有应用必须面对的工程问题。
- 把前缀长度纳入安全回归测试。 同一组风险与无害任务至少应在 0、500、1000、3000、8000 token 前缀下分别运行,而不是只测裸问题。
- 把语义类型纳入测试矩阵。 技术文档、小说、客服记录、代码、医学资料和多轮对话应分开统计,因为相同长度不代表相同内部状态。
- 不要把固定拒绝句当作唯一安全指标。 系统应检测输出是否实际提供危险能力,而不是只搜索“我不能帮助”一类模板。
- 在进入高风险任务前压缩历史。 摘要并非万能,但可减少无关语义持续占据注意力;原始文档仍应保留在隔离的数据层,而不是无限拼进对话。
- 将检索内容与控制指令明确隔离。 RAG 文档应被标记为证据而非指令,系统策略也应在关键步骤重新声明,避免长文档成为唯一的状态锚。
- 对高风险输出增加独立判定层。 生成模型的内部安全状态可能漂移,因此不能让同一个模型既生成内容又独自裁决内容是否安全。
部署 Gemma 3 1B 的团队尤其应该优先执行这套测试。1B 模型适合端侧和低成本任务,但容量较小也可能意味着任务表征、安全表征与长上下文语义更容易争夺有限的隐藏空间;这只是一种待验证的机制假设,不能反过来推断大模型一定安全。
接下来要看三件事
第一件事是独立团队能否复现原始数字。复现需要公开前缀文本、测试问题、聊天模板、模型权重版本、推理精度、采样参数、激活采样点和统计脚本,否则不同实现之间很容易出现数量级差异。
第二件事是现象能否跨模型规模成立。如果 Gemma 3 4B、12B 和 27B 在相同实验下没有明显漂移,那么问题可能与 1B 容量、训练配方或特定层结构有关;如果多个规模乃至其他模型家族都出现相似结果,它才会上升为长上下文对齐的通用问题。
第三件事是漂移能否被因果干预和训练修复。真正有效的改进可能不是再添加一批短拒绝样本,而是在后训练阶段随机加入长篇良性前缀,让模型学习在不同内部状态下维持一致政策,或直接约束关键层的安全方向不随上下文剧烈旋转。
这项初步实验提醒开发者,对齐更像模型在特定状态下形成的一种行为习惯,而不是烧进权重后永远不变的保险丝。长上下文能力让模型读得更多,却也让模型在回答前走过更长的内部路径;安全工程接下来必须关注的,正是它走到终点时还在不在原来的轨道上。
参考来源
- Reddit:Context-Induced Activation Drift 讨论帖:本次激活漂移实验的社区披露,包含主要指标与 shuffled-text 消融结论。
- Hugging Face:google/gemma-3-1b-it 模型页:Gemma 3 1B 指令微调模型的权重、模型卡和使用限制。
- Hugging Face:Gemma 3 介绍:整理 Gemma 3 各参数规模、输入模态及上下文窗口信息。
- Hugging Face Papers:Gemma 3 Technical Report:Gemma 3 技术报告索引,介绍模型架构、训练方式和能力评估。
- Hugging Face:Gemma 3 激活空间安全方向消融研究:社区对 Gemma 3 安全相关激活方向和正交投影编辑的另一项实践,可作为机制分析背景阅读。



