SeedRealtime让豆包边看边聊

字节跳动发布原生音视频全双工模型 SeedRealtime,并在豆包 App 全量上线。它的关键进步不是多识别一种输入,而是让模型能持续看、持续听,并在合适时机主动开口。
字节把原生音视频全双工模型装进了豆包
字节跳动 Seed 团队今天(2026 年 8 月 5 日)发布原生音视频全双工大模型 SeedRealtime,并宣布该模型已在豆包 App 全量上线。用户将豆包更新至最新版本后,可以在对话框中选择“打电话”,进入视频通话界面直接体验。
**SeedRealtime 是一个以统一架构处理音频、视频和文本连续流,并支持模型与用户同时感知、表达和打断的实时多模态模型。**它不只是给语音助手增加摄像头,而是试图把“看见什么”“听见什么”“什么时候说话”放进同一套推理过程里。
字节将这次发布概括为“边看、边听、边说”,实际对应三个更具体的问题:模型能否联合理解画面和声音,能否持续观察并主动提醒,以及能否像真人一样判断该接话、停顿还是保持沉默。
这三个问题决定了实时助手究竟是一个响应更快的聊天框,还是一个真正能参与现场任务的协作者。

全双工的重点不是更快,而是允许交流重叠
**全双工交互是指用户和模型可以在同一时间持续发送与接收信息,而不必严格轮流完成一整轮表达。**传统语音助手通常遵循“录音结束—语音识别—大模型生成—语音合成—播放回答”的串行流程,任何一环等待过久,都会让对话像在使用对讲机。
全双工模型面对的现实环境要复杂得多。用户可能说到一半改口,摄像头中的物体可能突然移动,旁边的人可能插入一句话,电视和空调还会持续制造背景声;与此同时,模型既要继续理解这些变化,也要判断用户是否仍在表达,以及自己的回答是否应该被中止。
因此,“边说边听”并不等于模型一直抢话。真正有价值的全双工能力,恰恰是模型知道什么时候不该说:用户只是换气时不要抢答,旁人在远处聊天时不要误触发,用户发出“等等”时则应立即停下。
SeedRealtime 的产品价值也主要体现在这里。相比单纯压缩首字延迟,正确判断发言权的收益更直接,因为一次错误打断足以破坏整段对话,即使模型随后给出的答案完全正确。
统一架构正在替代“模型流水线”
**级联模型是把语音识别、视觉理解、语言生成和语音合成等模块串联起来完成对话的系统。**这类方案容易搭建和调试,每个模块也可以独立替换,但信息经过多次转换后会损失语气、节奏、视听对应关系,并不断累积延迟。
SeedRealtime 采用统一架构原生融合音频、视频和文本,并直接面向连续多模态信息流进行交互。按照字节公布的信息,它不是先把声音全部转成文字、再截取一张图片交给语言模型,而是让模型持续接收带有时间顺序的声音与画面。
两类方案的差别可以概括为下表:
| 对比维度 | SeedRealtime 原生全双工方案 | 传统级联方案 | |---|---|---| | 输入形式 | 连续音频、视频与文本信息流 | 音频、图像先由不同模块处理 | | 信息融合 | 在统一架构内联合建模 | 依赖模块间传递文本或结构化结果 | | 时序理解 | 可结合声音和画面变化理解前后关系 | 容易把视频降格为若干静态截图 | | 对话节奏 | 模型持续判断接话、停顿和打断时机 | 常依赖端点检测与固定规则 | | 环境干扰 | 可结合说话人、画面和上下文综合判断 | 单个模块容易被噪声或旁人语音触发 | | 工程特点 | 交互自然度上限更高,但训练与部署复杂 | 模块成熟、可替换性强,但延迟逐层累积 | | 当前落地 | 已在豆包 App 全量上线 | 广泛用于传统语音助手与客服系统 |
统一架构的意义不是把几个模型简单塞进同一个服务,而是尽量减少模态转换造成的信息损耗。用户说“把那个放到左边”时,“那个”需要画面定位,“左边”需要空间理解,语气可能表明用户还没说完,而目标物体在视频中的移动又会改变答案;这些信号很难靠一份静态转写文本完整保留。
不过,字节目前没有公开 SeedRealtime 的模型规模、训练数据构成、端到端延迟、推理成本和上下文长度。统一架构究竟覆盖到什么程度、工具调用是否仍依赖外部模块、视频输入采用怎样的采样策略,也尚无论文或技术报告提供可复现细节。
第一项突破是让声音和画面互相消歧
**音视频联合理解是指模型利用同一时间段内的声音、画面及其时序关系,共同判断用户的真实意图。**它比“上传图片后提问”更难,因为视频不是一组互不相关的图片,而是持续变化的事件。
同音词消歧是最直观的应用。用户在厨房、车间或户外说出发音相近的词时,单靠语音识别可能得到多个候选答案;如果镜头正对着相关物体,视觉场景就能成为额外证据。反过来,画面中存在多个相似目标时,用户的语言描述和语气又可以帮助模型确定指代对象。
时序指代则更考验模型。用户说“刚才掉下来的那个”“等红灯亮了提醒我”或“它第二次出现时告诉我”,模型不能只理解当前帧,还要把语言中的“刚才”“等到”和“第二次”对应到视频事件的时间线上。
这种能力在教程指导、设备巡检和无障碍辅助场景中尤其有用。模型可以一边观察用户操作,一边听用户描述问题,并根据步骤进展继续指导,而不必让用户频繁截图、上传和重新解释上下文。
第二项突破是从被动问答转向主动提醒
**主动交互是指模型在持续感知环境后,可以根据预设目标或上下文变化主动发起表达,而不必等待用户再次提问。**字节给出的典型例子是,当画面中的关键目标出现或状态发生变化时,SeedRealtime 可以主动提醒用户。
主动能力会明显扩大 AI 助手的使用边界。做饭时,用户可以让模型观察锅内状态;组装设备时,模型可以发现零件方向错误;直播或视频会议中,模型也可能在特定人物、物品或信息出现时给出提示。
SeedRealtime 还支持在表达过程中调用工具。工具调用让模型不只是描述眼前发生了什么,还能把感知结果连接到搜索、计时、记录或其他任务执行环节,从“看懂现场”进一步走向“协助完成任务”。
主动表达同时也是风险最高的部分。模型如果漏掉关键变化,只是一个不够可靠的观察员;模型如果频繁误报,则会迅速变成制造干扰的通知机器。真正可用的主动助手需要明确触发条件、置信度阈值和中止机制,而不是把所有视觉变化都说出来。
隐私问题也会随着持续感知被放大。摄像头和麦克风长期开启时,产品需要向用户清楚说明数据是否上传、保存多久、是否用于训练,以及旁观者的声音和画面如何处理;字节本次发布信息尚未给出这部分更细的技术说明。
第三项突破是更自然地判断说话时机
**对话节奏建模是指模型根据语音内容、停顿、语气、环境声音和视觉状态,实时判断用户是否说完以及自己何时回应。**这项能力听起来不如视觉理解醒目,却最直接影响用户是否愿意持续使用。
字节公布的端到端人工评测显示,SeedRealtime 相比级联模型将音视频对话节奏问题减少了一半。这里的节奏问题包括用户尚未说完就被抢断、用户已经结束表达但模型迟迟不回应,以及背景杂音或旁人闲聊导致模型误触发。
“减少一半”是这次发布中最重要的量化结果,但它仍不足以完成横向比较。字节没有公开评测样本数量、测试语言、噪声环境、对照模型名称、评审一致性和绝对错误率,因此外界目前只能确认相对改善,不能判断它在统一标准下是否领先其他实时多模态产品。
绝对值的缺失会影响开发者判断。假设级联方案每 100 轮出现 20 次节奏问题,减少一半意味着降至 10 次;如果原本只有 4 次,则意味着降至 2 次。两种结果的相对降幅都是 50%,但产品体验和工程意义并不相同。
字节还表示,SeedRealtime 单次对话能够完整、顺畅交流的概率有明显提升,但没有给出具体百分比。现阶段更稳妥的结论是:SeedRealtime 已证明统一音视频建模能够改善轮次控制,但领先幅度仍需要公开基准或第三方测试验证。
豆包全量上线比发布一个 Demo 更重要
**规模化落地是指模型能力不只停留在实验演示,而是进入面向大量真实用户的正式产品。**SeedRealtime 已在豆包 App 全量上线,这使字节能够收集远比实验室更复杂的交互分布,包括方言、弱网、低照度、镜头抖动、多人说话和不同手机的收音差异。
真实流量会迅速暴露演示视频里看不到的问题。实验环境中,用户会正对麦克风、清晰发音并把目标放在镜头中央;现实中,用户可能边走边拍、突然切换话题,还会把“嗯”“等一下”“不是这个”混入连续操作。
豆包也为 SeedRealtime 提供了一个明显的分发优势。实时音视频模型需要用户授权摄像头和麦克风,仅靠技术展示很难建立使用习惯,而已有用户规模的消费级应用能够直接把能力放进熟悉的“打电话”入口,降低体验门槛。
这次上线暂时更像一次产品能力发布,而不是开发平台发布。字节尚未公布独立模型接口、企业部署方案、调用价格、服务等级协议或开发者评测工具,因此开发者目前无法准确评估将 SeedRealtime 集成进自有应用的成本。
SeedRealtime真正要解决的是“在场感”
**在场感是指模型能够持续理解用户所处环境、跟随事件变化,并以符合现场节奏的方式参与互动。**过去的多模态模型擅长回答“这张图里有什么”,实时全双工模型则要回答“现在发生了什么、接下来是否需要提醒、此刻该不该说话”。
SeedRealtime 的方向判断是对的,因为实时助手的竞争已经从单次回答质量转向连续交互质量。一个知识更丰富但总抢话的模型,在视频陪练、操作指导或无障碍辅助中,可能不如一个能力稍弱但节奏稳定的模型实用。
SeedRealtime 的短期优势是落地速度,而不是已经被充分证明的模型领先。它已经进入豆包真实产品,形成从模型、应用到用户反馈的闭环;但缺少公开论文、标准化跑分、延迟数据和成本信息,也意味着外界暂时难以复现或验证其技术边界。
下一阶段值得关注的指标将不再只是“能不能边看边说”。开发者更需要知道端到端首响应延迟是多少、打断生效需要多少毫秒、多人环境误触发率是多少、连续视频会话能维持多久,以及每分钟音视频推理成本是多少。
如果字节随后开放开发者能力,SeedRealtime 最有机会率先进入视频客服、AI 陪练、远程维修、智能硬件和视觉辅助等场景。如果它只停留在豆包内部功能,这次发布的意义仍然成立,但影响范围会更多局限于消费级助手体验。
现阶段的结论很清楚:SeedRealtime 不是给豆包增加了一个“会看视频”的功能,而是把实时多模态交互的重点从识别内容,推进到了管理注意力、发言权和现场节奏。它是否代表行业最强水平还缺少公开数据,但它已经把原生音视频全双工模型送进了普通用户可以直接使用的产品入口。
参考来源
- IT之家:字节跳动 SeedRealtime 音视频全双工大模型发布,已上线豆包 —— 整理了 SeedRealtime 的官方发布信息、三项核心能力、人工评测结论及豆包体验入口。



