三值 LLM 撞过 1.58-bit 门槛

最新研究试图把三值大模型的有效精度继续压低,在权重仅取 -1、0、+1 的前提下,重新处理量化误差、激活值和推理效率。它离“低成本替代全精度模型”还有距离,但已经把极低比特量化从概念验证推向了工程竞争。
三值 LLM 撞过 1.58-bit 门槛:极低比特量化还能保住模型能力吗?
2026 年 9 月 17 日,三值大模型再次成为量化领域的焦点。 最新论文《Breaking the 1.58-bit Barrier for Ternary LLMs》围绕一个看似已经触底的问题展开:当模型权重只允许使用三个离散值时,能否进一步降低存储和计算开销,同时不让语言理解、数学推理和代码能力一起坍塌?
这不是又一次普通的 INT4 或 INT8 压缩更新。三值量化是把模型权重限制为 -1、0、+1 三个取值的压缩方式。 三个状态对应的信息熵为 log₂3,约等于 1.585 bit,因此行业通常把它简称为 1.58-bit。与 INT4 仍然保留 16 个整数状态不同,三值模型几乎把每个权重都变成了“向左、无作用、向右”三种选择。
论文的意义不在于把“1.58”这个数字再改小一点,而在于重新审视三值模型的能力边界:极低比特模型的核心瓶颈已经不是存储,而是量化误差如何穿过几十层甚至上百层 Transformer,并最终破坏模型的推理轨迹。

1.58-bit 为什么曾经被视为一条硬门槛?
1.58-bit 曾经被视为三值 LLM 的“理论甜点位”,因为它在压缩率和表达能力之间取得了最低限度的平衡。 传统模型的权重通常以 FP16 或 BF16 保存,每个参数占 16 bit;即便采用常见的 INT8,也需要为每个参数保留 8 bit。三值权重则只需要表达三个状态,理论上可以把权重本体压缩到约 1.58 bit。
但这里有一个容易被忽略的细节:模型文件的实际占用不会等于“参数量乘以 1.58 bit”。 量化系统还需要保存缩放因子、分组信息、零点、激活值以及部分高精度层。工程实现中,三值模型通常还会使用 bit packing,把多个权重打包进机器字长,并为不同权重块保留 scale 参数。因此,1.58 bit 更准确地说是权重编码的理论平均值,而不是端到端推理时的真实精度。
以 7B 参数模型为例,纯 FP16 权重约占 14 GB,纯 INT4 权重约占 3.5 GB,理论上的 1.58-bit 权重约占 1.38 GB。如果只看权重,三值化相较 FP16 可以节省约 90% 的存储空间;如果把运行时缓冲区、KV Cache 和缩放参数算进去,实际节省比例会明显低于这个数字。
更大的问题来自模型能力。普通后训练量化在 INT8 上通常接近无损,在 INT4 上往往仍然可用,但直接压到 2 bit 或 1.58 bit 时,复杂推理能力很容易先于语言流畅度消失。 模型仍然能够生成语法正确的句子,却可能在数学题的中间步骤、代码中的边界条件或多轮指令的约束关系上出现系统性错误。
从 BitNet 到今天:三值模型并非凭空出现
BitNet b1.58 是三值 LLM 进入主流研究视野的关键工作。 微软研究团队在 BitNet 系列中提出 BitLinear 等结构,让模型从训练阶段就适应低比特权重,而不是把一个已经完成训练的 FP16 模型强行压缩成三值版本。
这种方法与 GPTQ、AWQ 等主流后训练量化方案的区别很大。后训练量化是在模型训练完成后做压缩,量化感知训练则是在训练过程中让模型适应未来的低精度表示。 前者成本低、部署快,但面对 1.58-bit 时误差通常难以控制;后者更容易守住能力,却需要重新训练或至少进行大规模适配。
公开实验曾显示,在 3B 级别上,BitNet b1.58 的困惑度可以接近同规模 FP16 LLaMA,同时在特定 GPU 测试中实现约 2.71 倍推理速度、3.55 倍 GPU 显存节省;矩阵乘法能耗则下降约 71.4%。这些数据非常诱人,但也必须加限定词:这类收益依赖专用的三值算子、硬件后端和测试设置,不能直接等同于所有消费级 GPU 或 CPU 都能获得同样加速。
| 方案 | 权重表示 | 典型优势 | 主要问题 | |---|---|---|---| | FP16/BF16 | 16-bit 浮点 | 精度稳定、生态成熟 | 显存和带宽成本高 | | INT8 | 8-bit 整数 | 通用性强,精度损失通常较小 | 压缩率有限 | | INT4 | 4-bit 整数 | 当前部署主流,工具链成熟 | 极难任务可能出现精度下降 | | 1.58-bit 三值 | -1、0、+1 | 权重极小、乘加可简化 | 需要专用内核,量化误差敏感 | | 二值模型 | -1、+1 | 理论计算和存储成本更低 | 表达能力与训练稳定性压力更大 |
这篇新论文真正试图突破什么?
《Breaking the 1.58-bit Barrier for Ternary LLMs》关注的“门槛”,本质上是三值模型的可扩展性和有效精度,而不是简单宣布一个更低的数字。 当权重已经只剩三个状态后,继续降低平均比特数,往往意味着更激进的编码、更少的辅助参数,或者让部分层承担更高的误差。
从模型设计角度看,突破 1.58-bit 需要解决至少三个问题。第一,权重离散化不能只看单个参数,而要看整层矩阵乘法的误差。 一个权重从 0.12 变成 0,似乎只损失了 0.12;但当数百万个类似误差在注意力投影层中累积时,误差会改变 token 之间的相对关系,最终影响模型的下一词预测。
第二,缩放因子不能被当作无关紧要的附属信息。 三值权重通常需要通过 scale 恢复数值幅度,例如用一个块级或通道级缩放因子把 -1、0、+1 映射回不同范围。如果 scale 过粗,压缩率好看但误差大;如果 scale 过细,精度更好却会增加额外存储和访存成本。
第三,极低比特模型需要同时处理权重和激活值。 只把权重压成三值,并不意味着整个推理过程都是 1.58 bit。激活值通常仍以 FP16、BF16 或更高精度计算,KV Cache 也可能采用 INT8、FP8 或 FP16。于是,真正的系统收益取决于三值矩阵乘法能否减少内存带宽瓶颈,而不是只看模型文件大小。
论文目前最值得关注的方向,是它把“突破”从单纯的参数压缩问题,扩展成了训练、校准、编码和硬件执行的联合优化问题。如果三值模型仍然需要大量高精度补偿层,所谓低比特优势就会被打折;如果能把补偿机制限制在少量关键模块,才有机会形成完整的部署方案。
为什么推理模型尤其难量化?
推理模型的量化难度高于普通聊天模型,因为它的能力不仅存在于最终答案,也存在于中间生成过程。 一个通用文本模型可能只需要保持局部语言统计规律,但数学和代码模型还要维持变量状态、步骤顺序、条件分支以及长距离依赖。
此前的 ScaleQ-1.58 研究已经给出一个重要信号:三值后训练量化的校准数据,必须覆盖模型真正要执行的思维模式。 该方法提出 AYOT,也就是让高精度教师模型先生成推理轨迹,再把问题、推理过程和最终答案一起用于校准。
公开结果显示,ScaleQ-1.58 使用约 400 万个校准 token,就让三值 Qwen3-1.7B 在四项数学和编程任务上达到此前 BitNet b1.58 2B4T 性能的 90.52% 以上;三值 Qwen3-4B 相对对应基线获得了 8.97 个百分点的绝对提升。这组结果说明,三值化失败不一定是模型容量不足,也可能是校准样本没有告诉量化器“哪些中间计算不能丢”。
从 256K 增加到 16M 校准 token 时,相关实验中的推理任务准确率仍持续提高,尚未观察到明确平台期。这意味着三值 PTQ 的效果可能仍然受校准预算强烈影响,但也意味着“只用几百条通用文本做量化”已经不适合推理型模型。
极低比特模型,究竟能不能保住能力?
答案是:在受控任务和专门训练下可以,在通用场景中还不能简单视为无损替代。 三值 LLM 已经证明自己可以在困惑度、基础语言任务和部分数学代码基准上接近全精度模型,但“接近”并不代表所有能力都等价。
首先,基准测试可能放大三值模型的优势。当测试任务与训练或校准数据分布接近时,量化器更容易保住这些任务所需的表示。 但在长上下文、多语言、工具调用、罕见知识和开放式规划上,极低比特模型的误差可能更难被标准评测捕捉。
其次,模型规模会改变结论。BitNet 相关研究曾观察到,随着模型从 3B 扩展到更大规模,三值模型的能力与效率关系可能变得更有利。 直观地说,小模型的每一个参数都承担更多功能,量化误差更容易造成能力损失;大模型拥有更多冗余表示,可以用其他路径补偿被离散化的权重。
但规模扩大也会带来新的现实问题。一个 30B 三值模型虽然权重可能比 7B FP16 模型更省,但它仍然需要更大的计算吞吐、更长的上下文缓存和更复杂的调度。 “模型文件更小”不自动等于“端到端延迟更低”,尤其是在没有专用三值指令集的硬件上。
与 INT4 相比,三值模型值得现在就用吗?
对大多数开发者而言,INT4 仍然是今天更稳妥的选择,三值模型则更像面向特定硬件和边缘场景的长期路线。 INT4 已经拥有 GPTQ、AWQ、GGUF、TensorRT-LLM 等较成熟的工具链,主流 GPU、CPU 和 NPU 都有相应支持;三值模型则需要专用 kernel 或针对 bit packing 优化的推理引擎。
| 维度 | INT4 模型 | 1.58-bit 三值模型 | |---|---:|---:| | 单参数理论权重占用 | 4 bit | 约 1.58 bit | | 相对 FP16 权重节省 | 75% | 理论约 90% | | 工具链成熟度 | 高 | 中低,依赖专用实现 | | 通用任务稳定性 | 较好 | 依模型和校准方法而定 | | 低功耗设备潜力 | 高 | 更高,但需要硬件配合 | | 适合当前快速部署 | 是 | 需验证 |
如果目标是把 7B 或 14B 模型塞进消费级显卡,INT4 往往已经能解决问题。只有当内存带宽、离线推理能耗或无 GPU 部署成为主要瓶颈时,三值模型的额外收益才足以抵消生态不成熟的成本。
边缘设备可能是三值 LLM 最有希望的第一批落地场景。在手机、路由器、工业控制器或本地机器人上,功耗和内存带宽常常比峰值算力更重要。 如果三值矩阵乘法可以直接映射到 CPU 的位运算、专用 NPU 或 FPGA 逻辑中,那么模型不必频繁搬运大块浮点权重,低延迟和低功耗优势才会真正显现。
这次更新对开发者意味着什么?
三值 LLM 的价值正在从“压缩模型”转向“重新设计推理系统”。 开发者不能只下载一个量化文件,然后用普通 FP16 后端运行并期待速度提升;需要确认模型是否使用了匹配的三值 kernel、是否支持目标硬件、scale 如何存储,以及激活值和 KV Cache 采用什么精度。
实践中至少要检查四项指标:
- 真实内存占用:不要只看权重大小,要把运行时缓冲区、KV Cache 和框架开销算进去。
- 每 token 延迟:批量大小为 1 和高并发场景的结果可能完全不同。
- 任务级准确率:困惑度接近不代表数学、代码和工具调用能力接近。
- 长上下文稳定性:低比特误差可能在短文本中不明显,却在 32K 或更长上下文中逐步放大。
建议把三值模型当成一个需要重新验收的模型版本,而不是普通的文件格式转换。在生产环境中,至少应建立 FP16、INT4 和三值版本的回归集,覆盖事实问答、结构化输出、函数调用、代码执行和长文本总结。 如果三值模型只在困惑度上表现漂亮,却在关键业务指标上掉点,压缩收益很可能不值得。
OpenAI Hub 判断:门槛被推开了,但还没有被彻底跨过
我们认为,这项研究最重要的贡献是证明 1.58-bit 并非固定终点,而是一条可以继续优化的系统边界。 它推动研究者从“能不能把权重变成三值”转向“如何让三值权重在不同模型、任务和硬件上稳定工作”。
不过,当前证据还不足以支持“1.58-bit 已经全面取代 INT4”的结论。三值模型的优势在理论内存、专用算子和低功耗推理上非常明确,但在通用硬件适配、后训练量化稳定性和开放任务能力上仍有明显不确定性。 特别是新论文的最终价值,还要看后续是否提供公开权重、可复现实验、真实硬件数据以及跨模型规模的对比。
更现实的判断是:未来的高效 LLM 不会只有一种精度,而会采用混合精度。 注意力投影、输出层、路由层或少数敏感层可能保留 4 bit、8 bit 甚至 FP16;大部分线性层使用三值权重;激活值和 KV Cache 则根据上下文长度与硬件特性独立选择精度。
这条路线如果成熟,模型部署将从“选择一个全模型精度”变成“为每一类算子选择最划算的表示”。三值 LLM 的真正突破,不是把每个参数都压到 1.58 bit,而是让模型能力、内存带宽、算力和功耗之间出现新的可调空间。 对今天的开发者来说,可以开始关注并测试;对生产部署来说,INT4 仍然是更可靠的默认答案。
参考来源
- 《Breaking the 1.58-bit Barrier for Ternary LLMs》相关研究:2026 年 9 月发布的三值 LLM 研究,本文讨论的核心论文。
- Microsoft BitNet GitHub 仓库:BitNet、BitNet b1.58 及相关推理实现的公开代码与资料。
- Hugging Face:1.58-bit LLM 极致量化实践:介绍将现有模型微调为三值权重模型的方法与工程背景。



