AI 快讯Om AI推3B端侧VLX模型
模型上新

Om AI推3B端侧VLX模型

2026-08-10T04:03:37.916Z
Om AI推3B端侧VLX模型

Om AI近日发布端侧原生VLX模型,参数规模仅3B,定位物理世界视觉感知。据公开报道,该模型在部分测试中超过英伟达、谷歌同类方案,重点不是堆参数,而是让视觉模型真正跑在设备上。

Om AI推3B端侧VLX模型,瞄准物理世界视觉感知

Om AI近日发布了一款端侧原生视觉语言模型VLX,参数规模为3B,目标是让设备直接理解摄像头看到的物理世界,而不是把视频或图片上传到云端再等待结果。

VLX是一类能够同时处理视觉输入与语言指令的视觉语言模型。与主要负责图片问答的通用VLM不同,Om AI此次强调的是端侧原生和物理世界感知:模型需要在手机、机器人、可穿戴设备、智能摄像头等本地硬件上运行,并持续理解空间、物体、动作、距离和环境变化。

这款模型最值得关注的地方,不是3B这个参数数字本身,而是它试图回答一个长期被大模型行业回避的问题:当模型离开数据中心,进入一个算力、内存、电量都受限的真实设备后,究竟还能不能稳定地看懂世界。

Om AI 3B端侧原生VLX模型运行在机器人、智能眼镜和手机等设备上的概念示意图

3B模型为什么值得讨论

3B模型是指拥有约30亿参数的神经网络模型。它通常比7B、14B甚至更大规模的模型更容易部署到本地设备,但在复杂推理、长上下文和开放域知识方面往往需要做出取舍。

过去几年,视觉语言模型的竞争逻辑很简单:更大的视觉编码器、更长的上下文、更强的云端GPU,以及更多图像和视频数据。这样的路线可以快速拉高实验室评测成绩,却很难直接迁移到端侧。一个模型即使在数据中心里表现出色,也可能因为显存占用、首帧延迟、持续运行功耗和散热问题,无法进入手机、机器人或智能眼镜。

Om AI的思路更接近端侧原生设计:从模型结构、训练任务到推理路径,都围绕设备上的持续感知进行优化,而不是先训练一个云端大模型,再通过压缩、量化和裁剪把它塞进终端。

这两者的差别,可以类比为造一辆城市电动车和把一辆重型卡车改造成电动车。后者未必不能跑,但车身、能耗和传动结构决定了它很难真正适应城市道路;前者从一开始就围绕续航、转弯半径和低速响应设计。

端侧原生,核心不只是本地运行

端侧原生模型是从架构和训练阶段就以本地设备部署为目标的模型,而不是单纯将云端模型压缩后放到终端上。

这一定义非常重要。很多所谓端侧AI,实际采用的是云端模型蒸馏、低比特量化或小模型替代方案。这些方法依然有价值,但它们通常是在模型训练完成后才考虑设备限制。端侧原生则更进一步:模型要从一开始就理解低功耗芯片的计算方式、有限内存的缓存策略,以及连续摄像头输入带来的实时性要求。

对于视觉感知来说,端侧原生至少涉及四个层面:

  • 输入侧优化: 不把每一帧画面都当成全新图片处理,而是关注前后帧之间发生的变化,减少重复计算。
  • 视觉编码效率: 在保持物体、动作和空间关系信息的同时,降低视觉特征的数量,避免视觉编码器成为推理瓶颈。
  • 语言与动作对齐: 模型不只回答这是什么,还要理解在哪里、正在发生什么,以及下一步是否需要采取动作。
  • 硬件协同: 针对手机NPU、边缘GPU、机器人计算模块等不同硬件进行量化和算子优化,让理论速度可以转化为实际帧率与延迟。

因此,3B并不等于简单的小模型。真正的难点是:在较小参数规模下,模型是否保留了足够的空间理解能力,能否在动态场景中持续工作,并且在错误判断时提供可控的置信度。

从看图问答转向理解物理世界

传统视觉语言模型最常见的演示,是上传一张照片,询问画面中的物体、文字或人物。它们擅长静态图像描述,却不一定擅长处理真实环境中的连续变化。

物理世界视觉感知是让模型理解现实空间中物体、动作、位置、时间和因果关系的能力。例如,模型不仅要识别桌上有一个杯子,还要知道杯子位于机械臂右前方约30厘米处;不仅要判断有人走进房间,还要区分这个人是在靠近设备、拿走物品,还是只是从背景经过。

对端侧设备而言,以下几个能力比单次图片问答更关键:

  1. 空间关系理解。 能够区分前后、左右、远近、遮挡和相对位置。
  2. 时间连续性理解。 能够比较连续画面,判断一个物体是新出现、正在移动,还是已经离开视野。
  3. 小目标与细节识别。 能够在低分辨率、复杂光照和部分遮挡下识别按钮、标签、工具和障碍物。
  4. 动作与意图判断。 能够把人的手势、物体移动和环境变化联系起来。
  5. 语言指令落地。 能够把拿起红色物体、避开地上的箱子等自然语言转换为可执行的视觉目标。

这也是VLX与普通图片描述模型之间的分水岭。图片描述追求把画面说对,物理世界感知则要求模型在时间和空间中持续做对判断。

据报道,3B VLX在部分测试中超过英伟达与谷歌方案

据近日公开报道,Om AI将这款3B VLX与英伟达、谷歌的相关视觉方案进行了对比,并宣称其在部分物理世界感知测试中取得领先表现。

需要注意的是,目前公开材料并未完整披露所有测试集、硬件环境、量化位宽、输入分辨率、延迟、功耗以及各项具体分数。因此,超过英伟达和谷歌这一结论,更适合被理解为特定任务和特定端侧场景下的结果,而不是3B模型已经全面击败所有更大规模视觉模型。

模型评测中,硬件和任务定义会显著影响最终结论。一个模型在视频动作识别上领先,不代表它在OCR、复杂图片问答或开放域视觉推理上同样领先;一个模型在统一GPU服务器上吞吐量更高,也不意味着它在手机NPU或机器人芯片上延迟更低。

| 对比维度 | Om AI 3B VLX | 云端大型视觉模型 | 传统端侧视觉模型 | |---|---|---|---| | 参数规模 | 约3B | 通常更大,具体规模视产品而定 | 通常较小或任务专用 | | 部署位置 | 目标是手机、机器人、可穿戴设备等端侧 | 主要依赖数据中心 | 端侧部署 | | 主要能力 | 物理世界视觉感知、视觉语言交互 | 综合视觉理解、复杂推理 | 检测、分类、分割等固定任务 | | 数据依赖 | 可在本地处理视觉输入 | 通常需要上传至云端 | 本地处理 | | 实时性 | 重点优化连续感知和低延迟 | 受网络往返和服务器负载影响 | 通常较好 | | 灵活性 | 通过语言指令适配不同任务 | 灵活性高 | 依赖预先定义的任务 | | 主要短板 | 复杂推理和开放域知识可能受限 | 成本、隐私、网络和延迟 | 泛化能力与交互能力有限 |

如果Om AI披露的测试方法足够严谨,那么它的意义并不在于用3B模型替代所有云端大模型,而在于证明:针对真实设备重新设计的小模型,可以在特定视觉任务上击败参数更大、但没有针对端侧场景深度优化的方案。

为什么物理世界感知必须走向端侧

端侧视觉模型是直接在本地设备处理摄像头、图片或视频输入的AI模型。它的价值首先来自实时性、隐私和可靠性,而不只是节省云端推理费用。

第一,端侧能显著降低交互延迟。机器人避障、智能眼镜识别路牌、手机辅助拍摄和工业设备异常检测,都不适合等待网络请求完成。对于需要连续感知的场景,延迟不是一次请求的耗时,而是模型能否跟上现实变化的问题。

第二,端侧可以减少隐私暴露。摄像头看到的画面往往包含人脸、家庭环境、办公文件、工厂流程和位置信息。将原始视频持续上传云端,会带来合规、存储和数据泄露风险。本地完成初步识别,只上传必要的结构化结果,能够减少敏感数据离开设备的机会。

第三,端侧具备离线可用性。地下车库、山区、飞机、工厂内网和网络拥堵环境都可能让云端服务失效。对于机器人和工业设备而言,断网时无法识别障碍物并不是体验问题,而是安全问题。

第四,端侧更适合高频任务。云端模型适合复杂、低频、需要强推理能力的请求;端侧模型则更适合持续运行的基础感知。两者并不是互相替代,而是可以形成分工:本地模型负责低延迟筛选和实时响应,云端模型只处理少量复杂问题。

3B规模的现实边界

3B模型的最大优势是部署成本较低,但它不可能在所有任务上同时达到云端大模型的水平。

对于实时物体识别、场景描述、简单空间关系和固定领域的视觉指令,3B模型可能已经足够。对于多步视觉推理、长视频理解、复杂表格分析、专业医学影像以及需要大量外部知识的任务,更大模型仍然具有明显优势。

此外,端侧模型的有效能力不仅由参数规模决定,还取决于以下因素:

  • 视觉编码器的设计是否适合低分辨率和动态输入;
  • 训练数据是否覆盖真实世界中的遮挡、反光、运动模糊和极端光照;
  • 模型是否经过设备级量化,而不是只在服务器上测试浮点版本;
  • 推理框架是否调用了NPU、DSP或专用视觉加速单元;
  • 是否公布真实端到端指标,而不是只报告理论TOPS或单项准确率。

其中,端到端指标尤其关键。开发者真正关心的是设备能否稳定达到目标帧率,首帧延迟是多少,连续运行30分钟后是否降频,模型占用多少内存,以及在低电量模式下是否仍可用。

如果没有这些数据,3B模型的端侧优势仍然停留在方向判断,而不是可直接采购和部署的工程结论。

对开发者意味着什么

Om AI这次发布,对开发者最直接的启发是:视觉模型的竞争正在从单纯的准确率竞争,转向任务、设备和系统协同优化。

过去做一个视觉应用,通常是调用云端视觉接口,再围绕返回结果编排业务流程。未来在机器人、智能硬件和工业场景中,开发者需要重新考虑模型应该放在哪里:哪些判断必须在本地完成,哪些问题可以交给云端,哪些原始视频根本不应该离开设备。

一个更现实的端云协同架构可能是三层:

  • 设备端小模型: 负责持续感知、目标检测、简单指令和安全相关判断。
  • 边缘节点模型: 负责同一空间内多设备协同、视频汇总和中等复杂度推理。
  • 云端大模型: 负责跨场景分析、知识检索、复杂规划和模型迭代。

在这个架构中,3B VLX的价值不是替代云端,而是成为设备的视觉操作系统。它负责把连续、嘈杂、未经整理的现实画面,转化成更高层的事件和状态,例如发现有人靠近、桌面上缺少某个工具、前方存在可移动障碍物等。

这类模型一旦稳定,应用边界会比单纯的聊天机器人更广。智能眼镜可以在本地识别标牌和物体,家用机器人可以理解家庭空间变化,工业摄像头可以在断网时完成初步异常判断,汽车座舱也可以减少对云端的依赖。

Om AI这次发布真正押注的是什么

Om AI押注的不是更大的模型,而是更适合物理世界的模型形态。

从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。对于物理世界AI来说,现实世界的输入是持续的、混乱的、低延迟的,并且经常受到网络、功耗和隐私约束。把一个依赖云端的模型缩小,并不一定能解决这些问题;重新围绕端侧感知设计,才可能建立新的产品基础。

但这款3B VLX能否成为真正的开发者基础设施,还要看后续信息是否完整,包括模型权重或部署方式、支持的芯片平台、量化版本、真实设备跑分、功耗数据、许可协议以及是否提供可复现实验。

截至2026年8月10日,Om AI公开释放的信号已经足够明确:端侧视觉模型正在从演示功能走向独立的模型赛道。3B参数不是终点,却可能是一个重要的工程甜点位——在足够小的计算预算下,换取比传统专用视觉模型更强的泛化和语言交互能力。

我们的判断是,这款VLX值得关注,但暂时不宜用3B击败大模型这样的标题替代完整评测。真正决定它市场价值的,不是实验室里多赢了几个百分点,而是能否在一台真实的手机、机器人或智能眼镜上,连续运行、低延迟响应,并在复杂环境中少犯关键错误。只有做到这一点,端侧原生才不是模型宣传语,而会成为物理世界AI的基础能力。

参考来源

  • Hugging Face:开源模型、数据集与模型部署生态,可用于后续查询VLX是否公开权重及相关实现。
  • GitHub:开源代码与端侧推理框架发布平台,可用于跟踪Om AI后续是否公布部署工具、量化版本和评测脚本。

相关推荐

查看全部