AI 快讯智元WITA-Omni登顶音视频榜
模型上新

智元WITA-Omni登顶音视频榜

2026-07-28T13:03:32.645Z
智元WITA-Omni登顶音视频榜

智元WITA-Omni Preview以85.21分登顶Daily-Omni,在八项指标中拿下六项第一。成绩说明具身模型正从看图问答转向声画时序推理,但榜单领先仍不等于机器人已具备可靠的现实操作能力。

智元把具身模型卷到了音视频时序理解第一

智元机器人自研的具身原生全模态大模型 WITA-Omni Preview,近日以 85.21 分登上 Daily-Omni 音视频理解榜首,并在八项细分指标中的六项取得第一。Daily-Omni 官方 GitHub 仓库已于 2026 年 7 月 26 日更新榜单,智元则在 7 月 28 日对外公布了这一结果。

**WITA-Omni Preview 是智元面向机器人实时交互开发的闭源具身全模态模型。**它的目标并不只是回答视频里发生了什么,而是同时接收声音、画面和语言信息,判断事件顺序与声画对应关系,再进一步生成语音、动作和表情等具身输出。

这次成绩值得关注,不只是因为智元排在了千问、Gemini、豆包和英伟达模型之前,更因为 Daily-Omni 测试的并非传统图像问答。它考察的是模型能否把一段视频里的声音和画面放在同一条时间轴上理解,而这恰好是机器人进入真实环境后绕不开的能力。

Daily-Omni榜单前三名及WITA-Omni八项成绩对比图

85.21分领先,但优势并没有拉开一个代际

**Daily-Omni 是一个评估多模态模型音视频联合推理与跨模态时间对齐能力的基准。**它使用真实开放环境中的音视频素材,通过视听问答检查模型能否识别声画对应关系、事件先后顺序、上下文变化以及需要综合多个模态才能得出的结论。

按照 Daily-Omni 官方仓库 7 月 26 日公布的数据,WITA-Omni Preview 的平均分为 85.21,领先第二名 Qwen3.5-Omni-Plus 0.53 分,领先 Gemini 3.1 Pro Preview 2.42 分。

| 模型 | 开放情况 | 音画对齐 | 比较判断 | 上下文理解 | 事件顺序 | 推断 | 推理 | 30秒 | 60秒 | 平均分 | |---|---:|---:|---:|---:|---:|---:|---:|---:|---:|---:| | AGIBOT X-Lab WITA-Omni Preview | 闭源 | 86.13 | 89.31 | 81.87 | 84.64 | 85.06 | 85.71 | 83.62 | 87.09 | 85.21 | | Qwen3.5-Omni-Plus | 闭源 | 84.42 | 88.55 | 82.72 | 83.67 | 84.67 | 86.05 | 83.44 | 86.20 | 84.68 | | Gemini 3.1 Pro Preview | 闭源 | 83.61 | 86.26 | 79.79 | 82.35 | 81.17 | 84.57 | 81.76 | 84.00 | 82.79 |

**WITA-Omni Preview 的优势主要集中在对齐、比较、事件顺序、推断以及长短视频处理上。**它在音画对齐、比较判断、事件顺序、推断、30 秒视频和 60 秒视频六项指标上排名第一;Qwen3.5-Omni-Plus 则在上下文理解和推理两项上领先。

**0.53 分的平均分差距意味着这是一场近距离竞争,而不是压倒性胜利。**WITA-Omni Preview 相比 Qwen3.5-Omni-Plus 的相对领先幅度约为 0.63%,其中比较判断只高出 0.76 分,事件顺序高出 0.97 分,30 秒项目甚至只高出 0.18 分。智元已经进入第一梯队,但还不能据此断言其整体全模态能力与第二名存在代际差距。

**60 秒项目反而是 WITA-Omni Preview 最值得观察的一项成绩。**它在该项取得 87.09 分,比自身 30 秒项目高出 3.47 分,也比 Qwen3.5-Omni-Plus 高出 0.89 分。长视频通常会带来更长的依赖链、更多干扰事件和更复杂的声画对应关系,这一结果至少说明模型没有随着输入变长而明显失去时间线索。

Daily-Omni测的不是会不会看视频,而是能否对上时间

**音视频时序对齐是让模型判断某个声音在何时发生、由什么对象产生,以及它与前后视觉事件有什么关系的能力。**普通视频问答可能只要求识别画面里有一条狗,时序问答则会继续追问:狗叫发生在门打开之前还是之后,叫声来自画面内还是画面外,人物回头是否由这次声音触发。

**传统图文模型可以通过抽帧获得物体和场景信息,却容易丢掉连续事件之间的时间关系。**如果把一分钟视频均匀抽成十几张图片,模型可能看见杯子、桌面和碎片,却不知道杯子是先被碰倒再摔碎,还是碎片本来就位于地面。加入音频后,玻璃碰撞声、人物惊呼和脚步靠近的先后顺序,又形成了另一条需要同步处理的时间轴。

**真实机器人比视频问答更依赖这种毫秒到秒级的跨模态对应。**家庭机器人听到身后传来玻璃破裂声,需要先定位声音,再转头确认画面,判断是否有人受伤,最后决定靠近、提醒还是停止当前动作。前台接待机器人则需要区分用户是在对它说话,还是在与同行者交谈,并在对方话音结束后选择合适的响应时机。

**Daily-Omni 的价值在于把全模态模型从单一识别任务推向了联合判断任务。**图像识别回答的是看见什么,语音识别回答的是听见什么,而音视频联合推理回答的是两者是否属于同一事件、谁先谁后、是否存在因果或语义关联。后者才更接近机器人在开放环境里的感知需求。

不过,**Daily-Omni 仍然是离线音视频问答基准,而不是机器人闭环操作测试。**模型在榜单上答对事件顺序,不代表它能在真实硬件上稳定完成转头、抓取、避障和对话,也没有直接证明其端到端延迟、算力占用、传感器适配和异常恢复能力。把 85.21 分直接翻译成机器人已经会干活,会高估这次成绩。

Thinker–Talker–Actor是这次发布真正想讲的故事

**Thinker–Talker–Actor 是智元提出的具身全模态架构,即由同一个原生模型统一处理思考、语音表达和物理动作表达。**其中 Thinker 负责理解环境与形成决策,Talker 负责生成语音,Actor 则负责动作和表情等具身输出。

**这一设计是在 Thinker–Talker 范式上增加了面向物理世界的 Actor。**一般全模态聊天模型已经能够看、听、说,但语音通常仍是最终输出;机器人还必须决定何时转身、看向谁、点头还是摆手,以及动作与语气如何配合。WITA-Omni 的主张,是把动作和表情提升到与语音并列的一级输出,而不是在语言模型外再挂一套独立动作脚本。

**原生端到端设计试图解决多个模块串联产生的信息损耗和时延。**传统机器人交互链路往往是语音识别转文字、视觉模型输出标签、语言模型形成回答、语音合成生成声音,最后由规则系统选择动作。每一层都在压缩上一层信息,例如语音转写可能丢掉犹豫、打断和情绪,视觉标签可能丢掉注视方向,动作模块也未必知道某句话应该配合什么表情。

**统一模型的理想状态是让语音、动作与表情共享同一份上下文和时间线。**例如机器人说出请往这边走时,手臂引导动作不能提前数秒结束,也不能等整句话说完后才开始;用户中途插话时,模型还要同时停止说话、收住动作并转移视线。这类问题本质上不是多生成一个动作序列,而是多个输出通道的同步调度。

**WITA-Omni Preview 的榜单表现为这套架构提供了感知侧证据,但尚未完整证明输出侧能力。**Daily-Omni 主要测量模型是否理解音视频及其时间关系,并不直接评价动作自然度、语音与肢体同步误差、连续打断恢复或硬件控制稳定性。Actor 是否真正进入统一端到端闭环,还要看后续公开演示、真机测试和 WITA Omni 1.0 的部署表现。

千万小时级数据,重点不只是规模

**智元称 WITA-Omni 在中训练阶段使用了千万小时级的开源及自有多模态数据。**这里的千万小时级是官方对数据规模的量级描述,并未同步披露精确小时数、去重比例、音视频长度分布、数据授权构成以及训练算力,因此暂时无法据此计算模型的数据效率。

**中训练是位于通用预训练和任务微调之间的能力强化阶段。**它通常在已有文本、视觉底座上继续加入大规模目标模态数据,使模型获得音频理解、视频时序建模或跨模态对齐能力。对 WITA-Omni 而言,这一阶段的目标是从强文本和强视觉底座,进一步升级为能听见、看懂并进行音画联合推理的模型。

**公开音视频数据最大的缺口不是内容数量,而是真实互动结构。**网络视频经常经过剪辑、配乐和后期配音,声音未必与画面同期发生;公开视频也很少完整标注谁在说话、何时被打断、人物朝向如何变化、动作在语音前还是语音后启动。用这类数据训练视频问答模型没有太大问题,但要训练实时具身交互模型,时间关系就可能失真。

**智元为此构建了以人为中心的高质量全模态交互数据集。**按照官方说法,这套数据保留了声音、画面、语言、动作和表情之间天然的时序关系,目标是补齐轮次切换、响应时机以及动作和表情监督。相比单纯增加公开视频数量,这类同步采集数据更可能决定机器人是否表现得自然。

**高质量同步数据也可能成为具身模型比参数规模更重要的壁垒。**语言模型可以从互联网获得大量文本,机器人交互数据却需要多传感器同步、真人参与、动作捕捉、隐私处理和质量筛选,采集成本高得多。模型架构容易被论文复现,包含真实互动节奏的数据却很难从公开网页重新获得。

这次第一名仍有三个需要保留的判断

**第一,当前榜单前三名都是闭源模型,外界无法独立检查其权重和训练数据。**WITA-Omni Preview 尚未公开模型参数、推理成本、上下文长度、输入分辨率、音频采样策略和部署硬件要求,开发者也无法在相同设备上复现实测结果。对于 Preview 模型,榜单成绩更像能力预告,而不是已经可规模化使用的产品说明书。

**第二,Daily-Omni 仓库明确注明,Gemini、豆包和千问的本轮评测结果由智元提供。**这不等于结果无效,因为榜单维护方已经接收并发布了相关数据;但从严格评测角度看,由参赛方提交自身及竞争模型结果,与榜单团队在统一环境下独立复测仍有区别。后续如果能公开评测配置、提示词、采样参数和多次运行方差,85.21 分的可比性会更强。

**第三,单一榜单无法覆盖具身智能的全部能力。**Daily-Omni 偏重音视频问答和时序对齐,而真正的具身系统还需要空间定位、动作规划、物体可供性判断、力控、长期记忆、安全约束和实时响应。一个模型可能准确说出杯子何时掉落,却未必能在杯子滑出桌面前伸手接住它。

**WITA-Omni Preview 当前最大的缺失项是可部署指标。**智元尚未随榜单结果公开首字延迟、打断响应时间、语音与动作同步误差、单位会话算力消耗及真机连续运行成功率。智元此前给出的产品路线是三季度发布 WITA Omni 1.0,并把交互时延压缩到 500 毫秒以内;能否达到这一指标,比榜单再提高零点几分更影响实际体验。

具身模型的竞争焦点正在从识别准确率转向交互节奏

**WITA-Omni Preview 登顶释放出的明确信号,是具身模型开始争夺音视频时序理解的榜首。**过去一年,多模态模型竞争主要集中在图像识别、文档问答、视频总结和实时语音;进入机器人场景后,厂商必须继续处理谁在何时做了什么,以及模型应该在什么时刻说话和行动。

**时序理解会成为全模态聊天模型与具身模型之间的一条分界线。**聊天模型可以在用户说完后等待一秒再回答,机器人却可能因为一秒延迟错过递接物品、避让行人或回应注视的窗口。对物理 AI 来说,正确答案只是下限,在正确时间输出正确动作才是完整能力。

**智元这次领先的含金量在于方向选得准,而不是分差足够大。**85.21 分证明其音视频联合理解已经处于 Daily-Omni 第一梯队,六项第一也表明优势并非只来自某一个偶然指标;但领先第二名仅 0.53 分、模型仍处于 Preview、结果尚缺少完整部署数据,决定了这更像一次有说服力的技术卡位,而不是竞争已经结束。

**下一阶段真正值得开发者关注的是模型能否从榜单进入真机闭环。**如果 WITA Omni 1.0 能在 500 毫秒以内完成听、看、想、说和动作调度,同时支持自然打断、多人对话与长期稳定运行,那么 Thinker–Talker–Actor 才会从架构口号变成产品能力。反过来,如果 Actor 仍主要依赖外部规则或独立控制模型,WITA-Omni 就更接近一个为机器人优化的优秀全模态理解模型。

结论

**WITA-Omni Preview 的 85.21 分标志着中国具身智能公司已开始在专门的全模态基准上正面竞争。**它超过 Qwen3.5-Omni-Plus 和 Gemini 3.1 Pro Preview,并在八项指标中的六项领先,说明智元对音画对齐、事件顺序和长视频时序关系进行了有针对性的强化。

**这次登顶最重要的意义,是把机器人模型的评价标准从会看会听推向何时理解、何时回应和何时行动。**Daily-Omni 只验证了其中的理解部分,WITA-Omni 仍需通过真机时延、动作同步、复杂环境泛化和长期稳定性测试完成剩下的证明。榜单第一是一个不错的起点,但对于具身智能,物理世界最终才是最难刷的榜。

参考来源

相关推荐

查看全部