Noisegate 开源:给不可信 Agent 加一道隐私闸门

Noisegate 将差分隐私放到 AI Agent 与敏感数据之间,以查询预算、结果扰动和审计机制限制数据外泄。它不是万能沙箱,但为防范 Agent 通过连续查询拼出底层数据提供了新的工程化思路。
Noisegate 开源:给不可信 Agent 加一道隐私闸门
Noisegate 近日开源,试图用一道差分隐私网关,把不可信 AI Agent 与真实数据库隔离开来。项目瞄准的不是传统意义上的模型训练隐私,而是一个越来越现实的运行时问题:当 Agent 可以自主生成查询、反复调用工具并观察结果时,怎样避免它通过大量看似正常的请求,一点点还原用户、员工或业务数据?
Noisegate 是一个面向不可信 AI Agent 的差分隐私查询网关。它位于 Agent 与数据源之间,对查询进行约束、对聚合结果加入经过校准的随机噪声,并持续核算隐私预算,从而降低单条记录是否存在于数据集被推断出来的概率。
这一路线值得关注,因为它没有假设 Agent 会“听话”。它接受一个更接近 2026 年 Agent 应用现状的前提:模型可能遭遇提示词注入,第三方 Skill 可能夹带恶意指令,Agent 也可能在长任务中偏离目标;安全边界因此不能只写在系统提示词里,而要落到模型无法自行绕过的基础设施上。

Agent 的危险不只在“查了什么”,还在“查了多少次”
AI Agent 是能够自主规划步骤、调用外部工具并根据执行结果继续行动的软件系统。与只回答一次问题的聊天机器人不同,Agent 可以连续发起数十次甚至数百次数据库查询,并根据上一次结果调整下一次查询。
连续查询让传统权限控制暴露出一个缺口:每一条请求都可能合法,但组合起来却能泄露敏感信息。假设一个分析 Agent 被允许查询“某地区用户的平均医疗支出”,它先查询 101 人的平均值,再排除一名目标用户查询剩余 100 人的平均值,两次结果相减后,就可能推算出目标用户的支出。
这个问题不能只靠删除姓名、手机号等直接标识符解决。去标识化数据仍可能通过年龄、邮编、职业、时间和行为轨迹等准标识符重新关联到具体个人;当 Agent 还能自动尝试不同过滤条件时,重识别过程甚至可以被批量化。
权限系统解决的是“谁能访问哪张表、哪一列”,差分隐私解决的则是“观察输出后,能在多大程度上判断某一条记录是否参与计算”。两者并不互相替代:前者限制访问面,后者限制从合法输出中获得的个体信息。
Noisegate 的判断是对的:面对不可信 Agent,敏感数据不应以原始查询结果直接返回。真正可执行的安全边界,应当是一个掌握查询规则、噪声机制和预算账本的独立网关,而不是一句“不要泄露隐私”的提示词。
差分隐私不是随便“撒点噪声”
差分隐私是一种可量化的隐私保证:当两个数据集只相差一条个人记录时,同一算法在两个数据集上产生任意输出的概率应足够接近。其核心目标是让观察者难以从结果判断某个个体是否在数据集中。
差分隐私通常用 ε(epsilon)和 δ(delta)描述。ε 表示隐私损失上限,数值越小,两个相邻数据集的输出越难区分,隐私保护越强;δ 表示允许隐私保证失效的极小概率。严格的 ε-差分隐私可写成:
$$ P[M(D) \in S] \le e^{\varepsilon} P[M(D') \in S] $$
其中,$D$ 与 $D'$ 是只相差一条记录的相邻数据集,$M$ 是随机化机制,$S$ 是任意一组可能输出。近似差分隐私会在右侧再加入 $\delta$,以容纳极低概率的例外情况。
噪声大小不能拍脑袋决定,而要根据查询敏感度和隐私参数计算。查询敏感度是单条记录加入或删除后,查询结果可能发生的最大变化;例如,对取值已被限制在 0 到 1 之间的数据求和,其全局敏感度不超过 1。若输入没有边界,一个异常大的值就可能让敏感度失控,噪声机制也随之失去可信保证。
这也是 Noisegate 与“给结果加一个随机数”的本质区别。一个有效的差分隐私网关至少要控制输入边界、查询类型、分组规模、噪声分布、随机数来源、预算消耗和重复查询,否则所谓隐私保护很容易退化成视觉效果。
Noisegate 把隐私预算做成 Agent 无法忽略的硬约束
隐私预算是系统允许一次主体、一次会话或一个数据集累计消耗的隐私损失额度。每次查询会消耗一部分预算,查询越多、要求结果越精确,累计隐私损失通常越高;预算耗尽后,网关必须拒绝继续查询,或者要求进入新的授权流程。
这一步对 Agent 场景尤其关键。单次带噪结果可能看不出真实值,但如果允许 Agent 对同一统计量重复查询 1 万次,再对结果取平均,独立随机噪声会被逐渐抵消。一个只负责加噪、却不记录查询次数和累计隐私损失的系统,挡不住这种平均攻击。
差分隐私的组合定理正是在处理这个问题。简单组合下,连续执行 ε₁、ε₂直至 εₙ 的多个机制,整体隐私损失上界可按 ε₁+ε₂+…+εₙ 累计;更先进的会计方法可以给出更紧的上界,但不会让重复查询变成“免费”。Noisegate 的价值不只在噪声本身,更在于把累计成本变成网关层的强制规则。
从项目定位看,Noisegate 形成了一条相对清晰的防线:
- 拦截查询:Agent 不直接连接底层敏感数据库,请求先经过网关。
- 限制查询形态:只允许可分析、可计算敏感度的统计查询,避免任意原始行读取。
- 约束数据范围:对数值进行裁剪或限定上下界,避免极端值破坏敏感度。
- 执行差分隐私机制:根据查询类型、敏感度和 ε 等参数对结果加入校准噪声。
- 核算隐私预算:按主体、会话或数据集记录累计消耗,在额度用完后拒绝请求。
- 保留审计记录:为后续调查异常查询、策略命中和预算变化提供证据。
这套机制更像数据库前方的“统计安全阀”,而不是一个新的大模型防火墙。它不需要理解 Agent 的每一段自然语言推理,只需要确保 Agent 最终能拿到的数据满足可验证的输出约束。
它与权限、脱敏和沙箱不是同一种工具
Noisegate 最容易被误解为数据库脱敏组件,但它与常见安全方案解决的是不同问题。下面的对比更能说明它在 Agent 技术栈中的位置。
| 方案 | 主要控制对象 | 能否阻止合法查询的组合泄露 | 是否提供量化隐私上界 | 对结果准确性的影响 | 适合场景 | |---|---|---:|---:|---:|---| | RBAC/ABAC 权限控制 | 表、列、行和用户身份 | 较弱 | 否 | 通常无 | 限制谁能访问哪些资源 | | 静态脱敏 | 姓名、证件号等字段 | 较弱 | 否 | 取决于脱敏方式 | 测试数据、低风险展示 | | 查询白名单 | SQL 结构与操作类型 | 中等 | 否 | 通常无 | 阻止任意 SQL 和危险操作 | | 执行沙箱 | 文件、网络、进程和系统调用 | 较弱 | 否 | 通常无 | 限制 Agent 的工具执行能力 | | 差分隐私网关 | 查询输出与累计隐私损失 | 较强 | 是 | 有,取决于 ε 和数据规模 | 向不可信 Agent 提供聚合分析能力 |
差分隐私网关的优势是可以给出数学意义上的隐私边界,而不是依赖攻击者“猜不到”。它尤其适合计数、求和、均值、比例和直方图等聚合任务,也适合用户规模较大、允许一定统计误差的分析场景。
差分隐私网关的代价则是答案不再完全精确。数据量越小、分组越细、ε 越低,噪声相对真实信号越明显;如果一个业务要求精确找出“昨晚支付失败的那一位用户”,差分隐私显然不是正确工具,因为任务本身就在定位个体。
因此,Noisegate 不是权限系统、沙箱或提示词注入检测器的替代品。更可靠的部署方式是分层防御:身份与权限决定 Agent 可以请求什么,查询网关限制请求结构,差分隐私约束结果泄露,执行沙箱限制外部动作,审计系统则把每次调用与最终行为关联起来。
真正难的地方,是定义“邻接关系”和预算归属
Noisegate 是否有效,首先取决于系统如何定义相邻数据集。记录级差分隐私通常把“增加或删除一行”视为一个人的变化,但现实业务中一个用户可能对应数百条订单、定位或聊天记录;如果只保护单行,攻击者仍可能从同一用户的其他记录推断其行为。
用户级差分隐私把一个用户贡献的全部记录视为一个隐私单元,因此保护更符合人的直觉,但敏感度和所需噪声通常也更高。对企业部署而言,“一行”还是“一个用户”并非数学细节,而是决定保护承诺是否成立的产品决策。
预算归属同样不能只绑定一次 Agent 会话。如果攻击者可以新建会话、切换 Agent 身份或让多个子 Agent 并行查询,单会话预算会被轻易绕过;预算至少要与稳定的用户身份、数据集版本、查询目的和时间窗口建立关系。
缓存也是不可忽略的一层。对于语义等价的重复查询,复用同一个带噪结果可以避免攻击者通过多次采样平均掉噪声;但缓存键若只按 SQL 字符串生成,Agent 可能通过改写条件顺序、别名或等价表达式绕过。网关需要对查询做规范化,甚至识别查询之间的重叠关系。
小分组抑制也应成为默认能力。即使输出经过加噪,当某个分组只包含 1 至 3 人时,结果的业务风险与统计误差都会显著上升;工程系统通常需要设置最小分组阈值,或者把稀疏类别合并为“其他”。不过,阈值本身也不能通过精确错误信息暴露真实人数。
开源项目的意义大于当前成熟度
Noisegate 最重要的意义,是把差分隐私从训练阶段拉到 Agent 的工具调用边界。过去谈 AI 隐私,焦点常放在训练数据是否被模型记忆、微调时是否采用 DP-SGD,或者日志是否脱敏;但一个连接生产数据库的 Agent,即使底层模型从未见过企业数据,也可能在推理阶段直接泄露数据。
运行时差分隐私和训练时差分隐私保护的是两条不同链路。DP-SGD 通过裁剪单样本梯度并加入噪声,限制训练样本对模型参数的影响;Noisegate 这一类网关则限制在线查询结果对单个数据主体的暴露。前者不能自动保护 Agent 访问的实时数据库,后者也不能消除模型参数中的训练数据记忆。
但必须泼一点冷水:一个开源网关不等于一套已经通过生产验证的隐私系统。差分隐私实现容易在边界条件上出错,包括使用不安全的伪随机数、敏感度计算错误、允许无界输入、预算并发扣减竞态、异常响应泄露真实值,以及日志意外保存未加噪结果。
更关键的是,形式化隐私保证依赖完整威胁模型。如果数据库管理员、网关运维者或日志平台本身不可信,仅在返回给 Agent 的最后一步加噪并不足够;如果 Agent 还能通过另一个工具访问原始数据,Noisegate 也只是纸面上的唯一出口。
因此,当前更合理的评价是:Noisegate 提供了一个方向正确、适合研究和原型验证的安全边界,但企业不应仅凭“支持差分隐私”几个字就直接处理医疗、金融或人事数据。上线之前至少需要独立代码审计、隐私参数评审、攻击测试、并发预算测试,以及对所有旁路数据通道的盘点。
哪些团队现在就值得试
数据分析 Agent 是 Noisegate 最直接的适用对象。企业可以让 Agent 回答“本周退款率是否异常”“哪个地区的活跃度下降最快”“不同版本的崩溃率如何变化”,同时不允许它读取原始订单、设备标识或单个用户轨迹。
多租户 SaaS 平台也值得关注这类网关。即使行级权限已经隔离租户,Agent 自动生成的复杂查询仍可能触碰租户内部的个人数据;差分隐私可以再增加一层面向个体的输出保护,但前提是预算账本不能跨租户混用。
安全研究团队则可以把 Noisegate 当成 Agent 数据外泄评测的实验底座。测试重点不应只是“能否生成正确统计结果”,而应包括重复查询、差分查询、语义改写、并发请求、身份轮换、子 Agent 分裂和错误消息侧信道。
不适合使用 Noisegate 的场景也很明确:客服查询某个用户的订单、风控调查具体交易、运维定位单台设备故障,以及任何必须返回精确个体记录的流程。这些任务需要严格授权、目的限制、审批和审计,而不是用随机噪声掩盖一个本就需要精确回答的问题。
Agent 安全正在从“约束模型”转向“约束能力”
Noisegate 反映出 2026 年 AI Agent 安全的一条重要变化:行业开始把模型视为不稳定甚至不可信的执行主体,而不是值得托付全部安全规则的决策核心。提示词可以声明政策,却不能充当强制访问控制;模型可以解释为什么不应泄密,却仍可能被恶意网页、文档或 Skill 改写下一步行动。
能力约束是把安全规则放在 Agent 无法修改的外部系统中。文件系统沙箱限制它能读写哪些目录,网络策略限制它能连接哪些主机,工具权限限制它能执行哪些动作,而差分隐私网关限制它能从数据库输出中学到多少个体信息。
Noisegate 的产品判断因此比“再做一个提示词防火墙”更扎实。它没有承诺识别所有恶意意图,而是让部分危险查询即使成功执行,也难以得到足以识别个人的精确结果;这种不依赖模型自觉的防线,才更接近成熟基础设施。
不过,差分隐私从来不是免费午餐。预算设置过松,隐私保证形同虚设;设置过紧,Agent 得到的答案又可能无法支持决策。Noisegate 接下来真正需要证明的,不只是能够添加噪声,而是能否在真实工作负载中给出可解释的参数建议、稳定的预算会计和可接受的统计效用。
对开发者而言,Noisegate 现在最值得借鉴的不是某个单独组件,而是一条架构原则:不要让拥有自主循环能力的 Agent 直接面对敏感数据。把查询能力收口到独立网关,再用权限、差分隐私、预算和审计共同约束输出,至少比寄希望于模型“记得保密”可靠得多。
参考来源
- Noisegate:面向不可信 AI Agent 的差分隐私网关:项目源代码、设计说明与最新开发进展。

