Abliteration把移除护栏做成生意

Abliteration.ai推出面向企业和研究团队的无默认安全拒答模型服务,试图把“移除模型护栏”从社区改模技术变成可调用产品,同时用Policy Gateway重新加上权限、配额和审计控制。
Abliteration把“移除模型护栏”做成生意
Abliteration.ai正在把一件过去主要发生在开源社区里的事商业化:移除大模型默认的安全拒答机制,并将处理后的模型以服务形式提供给企业、红队和安全研究团队。
这家公司在2026年9月3日被TechCrunch报道后受到关注。它的核心主张并不复杂:如果攻击者可以使用没有默认限制的模型,防守方也应该拥有同等能力,用于漏洞研究、攻击模拟、代理测试和安全评估。问题在于,Abliteration.ai提供的不只是一个可下载的模型文件,而是一套包含模型服务和企业策略控制面的产品。
**Abliteration是通过识别并削弱模型内部与“拒答行为”相关的表示方向,降低模型默认拒绝特定请求的技术。**它通常不需要完整重新训练模型,而是通过残差流分析、推理时干预或权重正交化修改模型行为。
这让它站到了当前AI产品趋势的反方向:主流闭源模型正在不断提高高风险能力的访问门槛,而Abliteration.ai则把“不要替用户说不”作为卖点。不过,它并不是简单地宣称“任何内容都能生成”,公司仍然表示不会提供儿童性虐待内容或自残相关内容,产品目前也不支持图像和视频生成。

不是训练一个新模型,而是改写模型的行为边界
**大模型护栏是围绕有害请求进行拒答、降级或内容过滤的一组训练和推理机制。**它们可能来自监督微调、偏好优化、分类器、系统提示词,以及部署层的输入输出审核。Abliteration主要针对的是模型内部已经形成的拒答倾向,而不是把所有安全组件都从产品中删除。
这项技术的理论基础来自对Transformer残差流的观察。模型每一层都会把注意力模块和MLP模块的输出写入残差流,后续层再基于这些表示继续计算。研究者发现,在部分模型中,有害指令和无害指令触发的激活之间存在相对稳定的差异方向;这个方向与模型是否拒答存在相关性。
简单理解,模型内部可能存在一条“拒绝通道”。当输入被判断为危险请求时,若干层会沿着这条方向增强表示,最终让模型输出拒答。Abliteration做的事情,就是先用一批有害和无害指令收集激活,再计算两类激活的平均差异,估计出拒答方向,最后在推理过程或模型权重中削弱这条方向。
常见方法大致分为两类:
- 推理时干预:模型运行过程中,实时计算各层输出在拒答方向上的投影,并减去这部分投影。它更像给模型装了一个运行时滤镜,修改可以撤销,也便于实验比较。
- 权重正交化:直接调整向残差流写入信息的权重矩阵,让相关模块难以继续写入拒答方向。这种方式会生成一个永久修改过的模型副本,不需要每次推理都额外做干预。
这种处理的吸引力在于成本低、速度快。它通常不需要再投入大规模训练数据,也不用重新跑完整的偏好优化流程。但低成本不等于没有代价:模型的拒答行为并不一定只由一个方向决定,强行消除某些表示,可能同时损伤事实判断、指令遵循、推理稳定性和输出质量。
公司卖的不是“裸模型”,而是两层产品
Abliteration.ai当前的产品结构可以概括为“无默认拒答的模型服务,加一层由客户定义的治理网关”。这也是它和社区里直接发布修改模型的最大区别。
第一层是处理后的模型服务。补充资料显示,公司已推出名为abliterated-model-large-v2的模型,并称其基于Z.ai发布的开放权重模型GLM-5.3,通过正交化处理降低内置拒答机制,同时保留推理、编程和代理能力。这里需要强调,GLM-5.3及其具体开放权重状态属于公司和相关报道中的说法,开发者在实际接入前仍应以模型卡、许可证和权重发布页面为准。
第二层是Policy Gateway。**Policy Gateway是面向企业LLM应用的策略控制平面,用于统一执行权限、配额、隐私处理和审计规则。**它提供政策即代码、用量配额、个人信息脱敏、合规日志,以及面向不同工作流的密钥和权限范围管理。
这套设计看上去有些矛盾:既然客户需要无默认限制的模型,为什么又要在外面加一层护栏?答案是,模型默认拒答和企业自定义政策并不是一回事。
以安全公司为例,主流模型可能拒绝生成用于漏洞验证的攻击链、恶意样本分析或钓鱼页面复现,即使请求者已经获得授权。企业真正需要的往往不是“什么都能做”,而是“在指定项目、指定人员、指定环境里做指定事情”。Policy Gateway试图把决定权从模型提供商手里交给部署方:安全团队可以允许某类网络测试,禁止真实目标操作;允许生成合成数据,禁止输出真实个人信息;允许红队代理访问隔离环境,禁止访问生产系统。
从产品逻辑看,这比单纯发布一个“去护栏模型”成熟得多。模型能力负责扩大可做的事情,网关负责限定谁能做、在哪里做、做了什么以及出了问题如何追踪。
Abliteration.ai与主流模型的差异
**Abliteration.ai的核心差异不是模型一定更聪明,而是把安全拒答的默认决策权交给了部署方。**这意味着它与Anthropic、OpenAI、Google等闭源模型的竞争维度并不完全相同。
| 对比维度 | Abliteration.ai | 主流闭源模型服务 | 社区自改模型 | |---|---|---|---| | 默认安全策略 | 降低模型内置拒答,允许企业自行制定边界 | 由供应商统一设置并持续更新 | 通常由发布者决定,透明度不一 | | 主要用户 | AI红队、网络安全实验室、研究团队、政府及承包商 | 通用企业应用和开发者 | 本地部署用户、模型研究者 | | 控制方式 | 模型服务加Policy Gateway | 平台安全策略、权限和审核机制 | 本地运行时自行管理 | | 审计和配额 | 产品强调策略日志、配额、PII脱敏 | 通常具备成熟的企业控制台 | 取决于用户自行搭建 | | 能力边界 | 更适合被主流模型拒绝的授权安全任务 | 通用能力强,风险任务限制更严格 | 能力和安全性差异较大 | | 主要风险 | 误用门槛降低,模型行为可能不稳定 | 过度拒答、供应商政策变化 | 缺少责任主体和治理工具 | | 定价信息 | 截至2026年9月3日,公开资料未给出完整统一价格 | 通常按输入输出量、套餐或企业合同计费 | 主要承担本地算力成本 |
这家公司能否形成规模,取决于它能不能证明两件事。
第一,移除拒答后,模型是否仍然保持原有能力。如果只是让模型更愿意回答,却让代码质量、工具调用和长链路推理明显变差,那么它更像是一次模型改造实验,而不是企业级产品。社区讨论中已经出现“模型变笨”或安全机制移除不彻底的反馈,这说明abliteration并非对所有模型都同样有效。
第二,Policy Gateway是否足够可信。企业不会仅因为模型“不说不”就把它接入安全生产环境。它们更关心细粒度授权、隔离执行、操作回放、日志留存、数据不外泄,以及出现越权行为后能否追责。换句话说,Abliteration.ai必须证明自己能把“模型少拒答”的收益,转化成“系统可控”的工程能力。
“攻击者和防守者工具对等”是个有争议的判断
**Abliteration.ai的商业叙事建立在一个有争议的安全前提上:防守方需要与攻击者拥有相近的模型能力。**这在网络安全领域并非没有道理。
安全研究员需要复现攻击者如何构造恶意代码、编写社会工程话术、分析漏洞利用链,才能验证检测系统是否有效。红队也需要让代理执行完整任务,观察模型能否发现权限边界、错误处理和工具调用中的薄弱点。如果模型在最关键的一步直接拒绝,评估结果可能只说明供应商的策略拦截成功,而不能说明目标系统本身安全。
但“工具对等”不等于“风险对等”。防守团队通常拥有授权范围、项目流程和审计义务,攻击者则不需要遵守这些规则。一旦无默认限制的模型服务被广泛提供,滥用者获得的可能是更低的试错成本、更快的代码生成速度和更强的自动化能力。尤其当模型具备浏览、执行代码、调用工具和持续记忆能力时,风险不再是生成一段文字,而是完成一条可执行工作流。
这也是外界担忧的核心:Policy Gateway是企业客户可以主动配置的控制面,但它不能自动替代法律责任、网络隔离和人工审批。一个有配额的危险操作仍可能造成损害;一份留存完整的日志,也无法阻止事故发生。
它真正瞄准的是“被过度拒答”的专业场景
**Abliteration.ai最有机会落地的场景,是经过授权但经常被通用模型误判的专业任务。**这些场景包括网络安全红队、恶意软件逆向分析、攻击检测数据集生成、模型安全评估、代理系统压力测试,以及需要大量边缘案例的合成数据生产。
补充资料显示,公司希望通过兼容OpenAI接口的服务生成训练数据、偏好对、评估集、标注数据集和边缘案例。对安全团队来说,这种能力的价值在于批量构造“模型通常不愿回答”的测试样本,再观察检测器、策略引擎和代理系统是否真的有效。
不过,企业采用时应把“无默认拒答”与“无限制生产环境权限”严格分开。合理的部署方式应当包括:
- 在隔离网络或沙箱中运行高风险任务,不直接连接生产系统。
- 根据项目、用户、工具和目标资源设置最小权限。
- 对网络访问、文件写入、代码执行和外部消息发送分别审批。
- 对输入输出进行个人信息、凭证和真实目标地址检测。
- 记录完整的提示、工具调用、模型响应和人工审批链路。
- 使用专门的安全评测集验证模型是否出现能力退化或异常行为。
- 将模型版本、权重来源、许可证和供应链风险纳入变更管理。
这些措施听起来像企业安全常识,但恰恰决定了Abliteration.ai是一个可控的研究工具,还是一个把高风险能力直接商品化的灰色入口。
技术上并不等于“移除了所有护栏”
**Abliteration只能削弱特定模型中的部分拒答机制,不能证明模型已经变成完全无约束系统。**模型仍可能因为训练数据、系统提示词、服务端过滤器、上下文限制或工具权限而拒绝请求。
另一方面,拒答也不是一个单独的开关。模型在训练中学到的安全行为可能分布在多层网络和多个特征中,所谓“拒答方向”往往是统计意义上的近似。消除它可能带来三类副作用:
- 能力退化:模型在编程、推理或事实回答上的表现下降。
- 行为不稳定:同一请求在不同温度、上下文长度或语言下表现不一致。
- 安全边界错位:模型不再拒绝本应拒绝的内容,但仍可能在其他高风险请求上错误拒绝,形成一种不透明的随机性。
因此,评估这类模型不能只看“拒答率下降了多少”。更有意义的指标包括任务成功率、代码执行正确率、工具调用越权率、幻觉率、跨语言一致性、长上下文稳定性,以及在明确授权和未授权场景中的区分能力。
OpenAI Hub判断:产品方向聪明,风险定价还没完成
Abliteration.ai值得关注的地方,不是它发现了一个神奇的“解锁按钮”,而是它看到了一个真实的市场缺口:安全研究和通用AI平台的风险策略之间,确实存在错位。一个面向大众的模型服务必须谨慎,但安全团队做授权测试时,过度拒答同样会降低工作效率。
它把“模型少拒答”和“企业可治理”拆成两层,是比单纯上传模型权重更合理的商业化路径。特别是策略即代码、配额、PII脱敏和合规日志这些能力,才是企业采购时真正会问的问题。
但我们对它的判断仍然偏谨慎。第一,公开资料尚未给出完整价格、吞吐、延迟、上下文长度和第三方评测数据,暂时无法判断它与主流模型或本地部署方案相比是否具有成本优势。第二,基于正交化的模型修改可能损伤原始能力,abliterated-model-large-v2需要独立、可复现的基准测试,而不能只用“更少拒答”证明成功。第三,无默认限制能力一旦进入代理和工具调用场景,风险会从内容审核问题升级为系统安全问题。
所以,Abliteration.ai更像是一个正在成形的“高风险模型基础设施”品类,而不是一个简单的模型供应商。它能否成为企业安全团队的标准工具,最终取决于三项硬指标:模型能力是否保真,策略网关是否真正可控,以及公司能否建立清晰的客户准入、滥用响应和责任边界。
截至2026年9月3日,Abliteration.ai已经把“移除模型护栏”从开源社区实验推进到了商业服务层面。对开发者来说,它提供了一个值得研究的方向;对企业来说,它更像一把需要锁在隔离环境里的手术刀,而不是可以随手接入生产系统的通用模型。
参考来源
- FailSpy/abliterator|GitHub:开源社区中较具代表性的abliteration实现,可用于理解拒答方向识别和权重处理的基本思路。
- Abliteration无法解锁模型,同时还让它们变笨|Reddit:LocalLLaMA社区关于abliteration效果、能力退化和评测问题的讨论,反映了实际使用中的争议。
- Hugging Face:开放权重模型、模型卡和许可证信息的主要检索平台,具体模型状态应以发布者页面为准。



