AI 快讯1-bit Bonsai跑上AI眼镜
模型上新

1-bit Bonsai跑上AI眼镜

2026-09-24T12:04:44.696Z
1-bit Bonsai跑上AI眼镜

高通与 PrismML 将约 20 亿参数的 1-bit Bonsai 视觉模型部署到骁龙 AR1 Gen 1,AI 眼镜由此可以离线识图问答。官方称其内存占用仅为传统 4-bit 模型的四分之一,文本生成速度提升至约 2 倍。

20 亿参数视觉模型,开始在眼镜里直接推理

高通与 PrismML 在 2026 骁龙峰会上展示了运行于骁龙 AR1 Gen 1 智能眼镜平台的 1-bit Bonsai 视觉模型,这个约 20 亿参数的模型可以不连接云端,直接完成识图、问答、翻译与环境理解。根据 IT之家 9 月 24 日报道,该模型基于 PrismML 此前发布的 Bonsai 1.7B 版本构建,通过把主要权重压缩到 1-bit,显著降低模型存储、内存带宽和推理能耗。

这次演示最值得关注的地方不是又一副加入语音助手的 AI 眼镜,而是多模态模型第一次以相对完整的形态进入这一功耗和内存都极为苛刻的设备。手机尚且可以提供数 GB 内存和持续数瓦的功耗,眼镜却要同时容纳摄像头、显示、连接、音频和传感器,还必须控制镜腿温度与电池重量;能在这里跑起来的模型,才真正接近全天候端侧助手。

Bonsai 是 PrismML 推出的低比特端侧模型家族,目标是在尽量保留模型能力的同时,把权重压缩到手机、眼镜等消费硬件可以承受的范围。 此次眼镜版本被称为约 2B 模型,而技术基础来自 Bonsai 1.7B;这两个数字并不必然矛盾,前者可能采用总参数量或近似口径,后者则对应此前版本及语言主干的命名口径。

骁龙 AR1 Gen 1 智能眼镜运行 1-bit Bonsai,通过摄像头识别物体并在本地生成回答的示意图

1-bit 不是把普通模型粗暴压成黑白

1-bit 量化是一种用约 1 个二进制位表示每个模型权重的极低精度压缩方法,常见形式是让权重主要取正负两个离散值。 对比之下,FP16 每个权重需要 16 bit,常见 4-bit 量化则需要约 4 bit,因此 1-bit 在理想情况下只有 4-bit 权重体积的四分之一、FP16 的十六分之一。

量化感知训练是让模型在训练或再训练阶段提前适应低精度误差的方法。 从 FP16 压到 INT8 通常不会造成灾难性损失,但继续压到 1-bit 后,每个权重几乎只剩方向信息,普通的训练后量化很容易让模型能力明显崩塌;Bonsai 的关键并不是文件打包技巧,而是让模型在极低比特约束下重新适应权重分布。

以 20 亿参数粗略估算,不计算缩放因子、视觉编码器和运行时开销时,不同精度的理论权重体积大致如下:

| 权重精度 | 每权重理论位数 | 2B 权重理论体积 | 相对 4-bit 体积 | 主要代价 | |---|---:|---:|---:|---| | FP16 | 16 bit | 约 4 GB | 4 倍 | 内存、带宽与功耗最高 | | INT8 | 8 bit | 约 2 GB | 2 倍 | 质量通常较稳,但对眼镜仍偏重 | | 4-bit | 4 bit | 约 1 GB | 1 倍 | 端侧模型常用方案 | | 1-bit | 1 bit | 约 250 MB | 约 1/4 | 对训练、算子与硬件适配要求极高 |

理论权重体积不等于应用运行时的实际内存占用。 模型还需要保存分组缩放参数、激活值、视觉特征、运行时缓冲区和 KV Cache,因此不能简单地把这次模型理解成只占 250 MB;官方所称的内存降至传统 4-bit 模型的四分之一,更准确地说是同参数规模下的低比特权重与相关推理资源优势,而不是整套眼镜应用的总内存必然缩小 75%。

KV Cache 是自回归模型为已生成上下文保存注意力键值状态的缓存。 用户与眼镜连续对话、摄像头不断输入新画面时,KV Cache 和视觉特征也会持续消耗内存,所以 1-bit 首先解决的是最大的静态权重问题,却不会让所有运行成本都按相同比例消失。

内存只是第一层,带宽和发热才是眼镜的硬约束

官方给出的核心指标包括同等内存可容纳约 4 倍参数、内存占用约为传统 4-bit 模型的四分之一,以及文本 Token 生成速度提升至约 2 倍。这个提升符合端侧推理的基本规律:当芯片不必反复从内存搬运大体积权重时,单位 Token 的数据传输量会下降,计算单元等待内存的时间也会缩短。

内存带宽是处理器单位时间内从内存读取和写入数据的能力,它往往比峰值算力更决定端侧大模型的生成速度。 大语言模型逐 Token 解码时,需要反复读取大量权重;把 4-bit 权重进一步压到 1-bit,理论上可以把主要权重流量降至四分之一,但最终速度不会线性提升 4 倍,因为解包、缩放、激活计算、视觉编码和调度仍然存在。

骁龙 AR1 Gen 1 是高通面向轻量智能眼镜设计的平台,重点不是手机级峰值性能,而是在受限功耗下处理摄像头、音频、连接与端侧 AI。 将 Bonsai 放到这一平台的价值,是证明 1-bit 推理不只可以在高端手机或桌面 GPU 上做技术展示,也能进入散热空间更小、续航要求更严的可穿戴设备。

不过,官方披露的速度数据仍然缺少几个决定体验的关键条件,包括测试时的上下文长度、视觉输入分辨率、首 Token 延迟、每秒 Token 数、持续运行功耗,以及所谓 2 倍速度具体以哪个 4-bit 模型和运行时为基线。在这些数据公开之前,这更像一次很有方向性的系统验证,而不是可以直接横向比较的完整 benchmark。

AI 眼镜真正需要的是随时可用,而不是峰值智商

端侧视觉问答的价值不在于回答一道复杂数学题,而在于摄像头看到内容后,设备能否在几百毫秒到数秒内给出足够可靠的结果。对于眼镜,识别眼前商品、朗读标识、翻译菜单、寻找物品和提供操作提示,通常不需要数百亿参数模型的全部知识,却非常在意延迟、隐私、弱网可用性与电池消耗。

这次展示覆盖的典型场景包括:

  • 眼前物体识别可以摆脱网络往返。 用户询问桌上的物品或设备按钮时,图像无需先上传服务器再等待响应。
  • 文字翻译可以在旅行与弱网环境中持续工作。 菜单、路牌和说明书等内容可以由眼镜端侧完成识别与解释。
  • 环境问答可以获得更稳定的交互延迟。 用户针对当前画面追问位置、类别或操作步骤时,不会因为移动网络抖动而中断。
  • 免手操作可以避免持续唤醒手机。 语音、摄像头和本地模型形成闭环后,眼镜才有机会成为独立入口,而不是手机通知的另一块屏幕。

本地推理是指输入数据、模型计算和结果生成主要在用户设备上完成,而不是把原始内容发送到远程服务器处理。 对 AI 眼镜来说,这一点比手机更重要,因为摄像头天然会接触面孔、家庭环境、屏幕内容和地理位置;端侧处理至少可以减少原始画面上传,为隐私合规提供更清晰的技术边界。

云端模型仍然会在复杂推理和知识覆盖上明显领先,因此合理的产品形态不会是完全抛弃云端,而是由本地模型承担高频、低延迟和隐私敏感任务,在用户允许且网络可用时再把复杂问题交给云端。Bonsai 的意义正是扩大本地路径可以覆盖的任务比例。

| 方案 | 响应延迟 | 离线可用 | 隐私边界 | 模型能力上限 | 主要问题 | |---|---|---|---|---|---| | 1-bit Bonsai 端侧视觉模型 | 不需要网络往返,延迟更稳定 | 是 | 图像可留在设备内 | 受约 2B 参数与端侧算力限制 | 极低比特可能带来识别和推理损失 | | 传统 4-bit 端侧模型 | 同样支持本地推理,但内存压力更高 | 是 | 图像可留在设备内 | 同内存下参数规模约为 1-bit 的四分之一 | 更占内存、带宽和电量 | | 云端多模态模型 | 受上传速度和服务负载影响 | 否 | 通常需要上传图像或特征 | 可使用更大模型与更多工具 | 网络依赖、成本与隐私压力更高 |

1-bit 的代价最终还是模型质量

1-bit 模型的最大风险不是跑不起来,而是跑起来以后在细粒度视觉识别、空间关系和事实准确性上不够可靠。眼镜面对的现实画面比标准测试集更混乱,逆光、运动模糊、小字号文字、遮挡和广角畸变都会放大量化误差,而错误回答还可能直接影响用户行动。

PrismML 更大尺寸 Bonsai 模型的公开资料提供了一个参考,但不能直接当作这款 2B 视觉模型的成绩。以 Bonsai 27B 的 Hugging Face 模型卡为例,1-bit 版本约为 3.9 GB,公开综合分为 76.11;三值版本约为 5.9 GB,综合分为 80.49;Qwen3.6-27B FP16 约为 54 GB,综合分为 85.07。这说明极低比特确实能换来惊人的体积收益,但模型能力并不会无损保留。

| Bonsai 27B 相关版本 | 权重占用或文件规模 | 公开综合分 | 与 FP16 的关系 | |---|---:|---:|---:| | 1-bit Bonsai 27B | 约 3.9 GB | 76.11 | 体积极小,能力损失更明显 | | 三值 Bonsai 27B | 约 5.9 GB | 80.49 | 用更多空间换取更高质量 | | Qwen3.6-27B FP16 | 约 54 GB | 85.07 | 质量基准,端侧部署成本高 |

这组数据只能证明 Bonsai 路线在语言模型上的压缩效率,不能证明眼镜版本也有相同的能力保留率。视觉编码器结构、训练数据、视觉 Token 数量和端侧算子都不同,高通与 PrismML 仍需公布这款模型在 OCR、视觉问答、物体识别、幻觉率和连续视频理解上的专项结果。

社区反馈也指出了当前生态兼容性的现实成本:部分 Bonsai 1-bit 模型虽然采用 GGUF 等常见封装,仍可能需要 PrismML 适配过的 llama.cpp 分支才能执行对应的 1-bit 算子。相关 LocalLLaMA 讨论显示,低比特格式如果不能被主流运行时和硬件后端原生支持,模型文件再小,也会被部署复杂度抵消一部分价值。

这不是眼镜版 ChatGPT,但方向比堆功能更重要

这次合作还不能说明 AI 眼镜已经获得成熟的全天候视觉助手。官方目前展示的是模型能够在骁龙 AR1 Gen 1 上本地运行,以及内存和文本生成速度层面的优势,但产品化还要解决唤醒耗电、摄像头常开功耗、模型幻觉、麦克风隐私提示、持续散热和多轮上下文管理。

真正决定 1-bit Bonsai 能否进入量产产品的指标至少还有五项:

  1. 首 Token 延迟必须足够短。 眼镜助手如果要等待数秒才开口,本地推理的体验优势会迅速消失。
  2. 持续功耗必须以整机数据衡量。 单次推理省电不代表摄像头、NPU、内存和音频链路常开后仍能支撑全天使用。
  3. 视觉准确率必须按真实场景评估。 OCR、小目标、复杂光照和运动状态比静态演示图更能暴露问题。
  4. 错误回答必须有可控边界。 涉及导航、药品、设备操作等高风险任务时,模型应主动表达不确定性。
  5. 运行时必须进入主流生态。 如果每一种 1-bit 权重都依赖专用分支,开发者很难承担长期维护成本。

这次发布最明确的信号,是端侧模型竞争正在从单纯比较参数量,转向比较单位内存能够提供多少可用能力。4-bit 曾经是移动端部署的甜点位,而 Bonsai 正试图证明 1-bit 可以成为眼镜、耳机和小型机器人等设备的新选择。

我们的判断是,1-bit Bonsai 暂时不会替代云端多模态模型,却可能成为 AI 眼镜真正可用的关键底座。它牺牲了一部分模型质量,换来了约四分之一的 4-bit 内存占用、约 2 倍文本生成速度以及更低的数据传输压力;对于服务器,这只是成本优化,对于戴在脸上的设备,这可能是能不能量产的区别。

参考来源

相关推荐

查看全部