AI 快讯Vidu S2把视频变成实时系统
模型上新

Vidu S2把视频变成实时系统

2026-09-16T05:07:57.772Z
Vidu S2把视频变成实时系统

生数科技于9月15日发布Vidu S2,推出S2-Avatar与S2-Editing两款模型,分别支持720p实时互动数字人、视频流实时编辑,并进一步探索左右眼同步的空间视频。

Vidu S2把视频变成实时系统:互动、修改、空间视频一次升级

生数科技在9月15日正式发布Vidu S2,并于发布当天开放在线体验。与上一代主要解决“让数字人动起来、说起来”不同,Vidu S2这次把视频模型推进到了持续处理阶段:模型不再只接收一张图片或一段提示词后生成一条视频,而是持续接收用户、摄像头和源视频流的输入,在画面播放过程中继续响应变化。

Vidu S2是生数科技面向实时视频生成、实时视频编辑和空间视频探索推出的一组模型,当前包括S2-Avatar与S2-Editing两条产品线。前者负责实时生成可互动的数字角色,后者负责对持续输入的视频流进行实时修改。

这不是一次简单的分辨率升级。S2把实时视频里的三个核心问题放到了一起:画面能不能足够快地返回,长时间生成能不能保持稳定,以及用户的新指令能不能只影响后续内容而不破坏已经发生的动作和镜头。对视频模型来说,这比单次生成一段十几秒视频要难得多。

Vidu S2实时互动数字人、实时视频编辑和空间视频能力示意图

一次发布两款模型,覆盖“生成”和“修改”

S2-Avatar是Vidu S2面向实时互动数字人的模型,支持根据人物图片、文本或音频生成持续表演的视频角色。S2-Editing则是面向输入视频流的实时编辑模型,可以在视频播放过程中修改风格、服装、人物主体和背景。

| 模型 | 核心能力 | 输入方式 | 主要输出 | 更适合的场景 | |---|---|---|---|---| | S2-Avatar | 实时互动数字人生成 | 人物参考图、文本、音频、互动指令 | 最高720p、25~42 FPS实时视频 | 虚拟主播、数字客服、互动角色、直播 | | S2-Editing | 视频流实时编辑 | 摄像头画面或源视频流、编辑指令、参考图 | 持续修改后的视频流 | 换装、换人、换背景、风格转换、虚拟拍摄 | | S2-Avatar [Offline] | 非实时数字人批量生成 | 图片、文案、音频 | 动作时间点可控的口播视频 | 内容生产、批量营销、课程和资讯视频 |

这套拆分很有必要。实时互动数字人和实时视频编辑看起来都在“实时生成视频”,但它们面对的约束并不一样:S2-Avatar要保持人物身份、语音和动作的一致性,同时及时接住新的参考图;S2-Editing则必须保留原视频的姿态、运动轨迹、镜头变化和时间顺序,只修改用户指定的内容。

换句话说,S2-Avatar更像是让模型在舞台上持续表演,S2-Editing更像是给正在播放的电影换演员、换服装或换场景,而且不能让演员突然变形,也不能让镜头轨迹断掉。

S2-Avatar:从“会说话”走向“持续表演”

S2-Avatar是支持实时互动数字人生成的模型,它能够根据用户输入持续生成角色视频,并在生成过程中接收新的视觉参考和指令。

相比Vidu S1,S2-Avatar最直接的升级是输出分辨率从540p提升到720p,实时输出帧率达到25~42 FPS。25 FPS已经接近常见影视内容的播放节奏,42 FPS则更适合需要更顺滑反馈的互动场景。不过,实时系统的帧率不能只看峰值,更要看长时间运行时是否稳定,以及输入发生变化后能否尽快反映到画面里。

S2-Avatar还扩大了可控制的动作范围。上一代实时互动数字人的重点更多是说话、表情和上半身动作,而S2开始处理舞蹈等幅度更大的全身表演。全身动作会带来更多遮挡、肢体交叉和快速位移,也更容易暴露视频模型在身体结构、服装边缘和身份一致性上的问题。

更重要的是,用户可以在生成过程中继续加入人物、服装、道具或场景参考图。实时互动因此不再是“开始前设置一次,之后只能等待结果”,而更像一个持续可控的表演系统:角色穿着一套衣服跳舞,用户临时加入另一张服装图,后续画面可以逐步切换;场景中出现新的道具参考,角色也可以在后续动作里使用它。

这种能力的难点在于“只改该改的地方”。如果新参考图一进入,模型连人物脸型、动作节奏和镜头位置都一起重置,互动就会变成不断跳剪的幻灯片。S2的技术路线显然试图把新输入限定在后续生成片段中,让已发生的动作和画面保持连续。

从应用角度看,S2-Avatar最现实的价值不在于替代所有真人视频,而在于降低实时角色内容的制作成本。虚拟直播、游戏NPC、数字客服、沉浸式导览和互动教育,都需要角色能够根据用户输入即时反应,而不是提前渲染几百种固定回答。

S2-Editing:真正改变的是“正在播放的视频”

S2-Editing是支持持续视频流实时编辑的模型,它可以接收摄像头或源视频流,并让新的编辑规则即时作用于后续画面。

这是本次发布中最值得关注的能力。过去的视频生成和编辑工具通常采用“上传视频—等待处理—下载结果”的离线流程,用户可以换风格、换衣服或换背景,但每次修改都要等模型处理完整段视频。S2-Editing把这条链路改成了流式处理:视频一边输入,修改一边发生。

它支持的编辑方向包括换装、人物替换、风格转换和背景修改。更关键的是,模型会尽量保留原视频的姿态、肢体运动、镜头轨迹和时间顺序。用户不是重新生成一段“类似的视频”,而是在原有视频的时间线上替换指定内容。

例如,创作者可以先用手机拍摄一段真人走进房间的视频,再让系统把人物换成虚拟角色,同时保留走路的节奏和镜头运动;也可以把普通街景实时变成赛博朋克风格,或者在直播过程中切换服装和背景。对于虚拟拍摄来说,这种能力比单纯的文生视频更接近工作流工具,因为输入本身就是导演或演员已经拍出的动作。

实时编辑的核心挑战不是“能不能改变画面”,而是“改变之后还能不能保持时间一致性”。如果每一帧都独立编辑,人物的衣服纹理会闪烁,背景会漂移,脸部身份会在相邻画面之间变化。S2需要在速度和稳定性之间做取舍:既要快速处理新输入,又要利用前后帧信息避免画面抖动和内容漂移。

从产品定位看,S2-Editing对短视频创作者、直播团队和影视预演的价值可能高于普通消费者。它可以把“后期制作”中的一部分调整提前到拍摄现场完成,让创作者即时看到不同人物、服装和场景方案。对于广告和虚拟制片团队,实时预览本身就能减少反复拍摄和沟通成本。

当然,实时并不意味着所有编辑都已经达到最终交付质量。复杂遮挡、快速运动、多人同框、细小文字和手部动作,仍然是视频模型容易出错的区域。S2更像是把视频编辑从离线渲染推进到交互式预览,最终成片是否需要再次高质量渲染,取决于具体场景和画质要求。

空间视频:从单目画面走向左右眼画面

空间视频是为左右眼分别提供具有细微视差的两组画面,从而让观看者感知物体远近、场景深度和人物与背景之间空间关系的视频形式。

Vidu S2对空间视频的探索,建立在S2-Avatar和S2-Editing之上。实时生成的数字角色可以转换为空间视频,摄像头输入的视频也可以先被实时编辑,再转换为适合VR头显观看的左右眼画面。

对于S2-Avatar,系统的基本路线是先生成普通单目视频,再估计每一帧的深度信息,将中心视图向相反方向水平偏移,合成同步的左眼和右眼画面。这样做的优点是可以复用单目实时生成链路,不需要一开始就直接生成双目视频;代价则是深度估计和遮挡补全会成为新的误差来源。

空间转换中最容易出问题的位置是物体边缘和新暴露区域。当画面向左或向右偏移后,原本被前景物体挡住的区域可能第一次暴露出来,系统必须补上这些空洞。如果补全内容不合理,用户在头显中会看到破碎边缘、重复纹理或背景穿帮。

另一个问题是深度稳定性。单帧深度估计可能在相邻帧之间轻微波动,普通视频里不一定明显,但放到左右眼画面中就会变成立体抖动。模型需要对连续帧的深度进行时序稳定,否则用户可能感到画面晃动、空间关系不自然,甚至产生眩晕。

S2-Editing提供了两条空间视频处理路径。第一条是先对普通单目视频进行实时编辑,再将结果转换为左右眼画面;第二条是对已有双目视频,将左右视图横向拼接后在一次推理中共同编辑,完成后再重新拆分为左右眼视频。

这两条路径分别对应不同的输入条件:第一条适合普通摄像头和单目素材,第二条更适合已经拥有双目视频的VR内容生产。它们的共同目标是避免左右眼画面被模型改成两个不一致的版本,否则人物服装、面部细节或背景结构在左右眼之间出现差异,就会破坏立体观感。

空间视频现在仍然是视频模型与XR硬件之间的前沿交叉地带。对Vidu S2来说,空间能力未必意味着已经完成了成熟的VR内容生产工具,但它至少说明模型厂商正在把“生成一段平面视频”之外的显示形态纳入设计。随着头显、混合现实设备和摄像头透视能力发展,能够理解深度、保持时序并实时修改现实画面的模型,可能比单纯追求更高分辨率更有应用价值。

69天迭代,速度背后是技术路线变化

从Vidu S1论文于2026年7月3日提交,到Vidu S2论文于9月10日公开,前后约69天。这个迭代周期非常短,但S2并不是在S1基础上简单增加几个按钮,而是把控制对象从固定数字人扩展到动态参考图和完整视频流,把输出从540p提升到720p,并把实时链路延伸到左右眼同步的空间视频。

Vidu S2技术报告将系统面对的问题概括为速度、稳定性和控制精度之间的平衡。速度决定用户是否能获得实时反馈;稳定性决定长时间运行时画面会不会逐渐崩坏;控制精度则决定新指令是否只改变目标内容,并在正确的时间点影响后续画面。

这三个指标往往互相牵制。提高生成质量通常需要更大的计算量,而更大的计算量会增加延迟;让模型更积极地响应新指令,可能破坏原有时序;为了维持动作连续性而使用更多历史帧,又会增加上下文处理成本。实时视频模型真正难的地方,正是要在每一帧都做出近似“在线决策”,而不是一次性生成完再慢慢修正。

据公开技术资料,S2-Avatar在实时数字角色生成基准StreamAV-Bench的九项指标中取得了对比结果中的领先表现,S2-Editing也在多项视频编辑基准测试中超过部分对比模型。不过,这些结果主要来自团队公开的技术报告,具体测试设置、硬件环境、延迟统计和对比模型版本,仍应以原始报告为准,不能直接等同于所有真实生产场景中的效果。

Vidu S2的另一个特点是发布后直接开放在线体验,而不是长期停留在申请制研究预览阶段。对于开发者和深度用户来说,这意味着模型的价值可以更快通过真实素材检验:复杂动作是否稳定,换装是否会改变脸,长视频编辑是否会漂移,空间转换是否会造成明显眩晕,这些都不是一段官方演示视频能够完全回答的。

它和传统视频生成工具的差别在哪里?

Vidu S2与传统文生视频工具的最大区别,是它把“时间”从输出结果变成了输入条件。

传统工具通常围绕一次性任务设计:用户给出提示词或参考图,模型生成一段视频,用户再通过修改提示词重新生成。Vidu S2则强调持续输入,模型需要记住已经发生的动作和镜头,并把新指令接到当前时间线之后。

这使它更接近实时图形系统,而不是单纯的视频生成器。实时图形系统关注帧率、延迟、连续性和交互反馈;S2同样必须处理这些问题,只不过画面内容由生成模型负责。

| 对比维度 | 传统离线视频生成 | Vidu S2实时链路 | |---|---|---| | 输入方式 | 文本、图片或完整任务 | 连续视频流、参考图和实时指令 | | 修改方式 | 重新生成整段或重新剪辑 | 新规则作用于后续画面 | | 主要指标 | 单段质量、镜头效果 | 延迟、帧率、时序稳定性、控制精度 | | 互动方式 | 生成完成后查看结果 | 生成过程中持续调整 | | 空间视频 | 通常需要额外处理 | 纳入实时生成和实时编辑流程 |

这也是Vidu S2最有价值的地方:它没有只把模型做成“更会生成”的黑盒,而是试图让用户在生成过程中持续介入。

对开发者和内容团队意味着什么

对开发者而言,Vidu S2值得关注的不是某个单点特效,而是视频模型正在从任务型接口转向状态型、流式系统。未来的应用可能需要维护角色状态、场景状态、参考素材和时间线,而不是每次调用都从零开始生成。

对内容团队而言,S2-Editing可能首先成为实时预览工具。拍摄时快速测试换装、换背景和风格,能够缩短创意验证周期;真正需要高分辨率交付时,再对关键片段进行离线精修。这种“实时预览+离线成片”的组合,比要求实时模型一次性达到最终电影级质量更现实。

对直播和互动产品而言,S2-Avatar的关键考验则是端到端延迟。720p和25~42 FPS听起来很有吸引力,但用户最终感受到的是从输入指令、语音或动作发生,到角色画面做出回应之间的总等待时间。只有模型推理、网络传输、音视频编解码和前端播放共同压低延迟,实时互动才不会变成“看起来实时,实际上隔着几秒”。

空间视频则需要更谨慎地看待。它给数字人、虚拟拍摄和混合现实带来新的想象空间,但头显设备覆盖、双目一致性、深度稳定性和内容分发标准,都会影响实际落地。Vidu S2先把单目实时视频转换为空间视频,是工程上较务实的探索;如果未来要进入更复杂的VR内容生产,还需要更强的三维一致性和原生双目生成能力。

OpenAI Hub判断:Vidu S2的突破在“连续控制”,不是单纯画质

Vidu S2目前最值得肯定的地方,是它抓住了视频模型下一阶段的真实瓶颈:用户不只是想生成一段好看的视频,还想在视频生成过程中继续控制它。

S2-Avatar把数字人从固定脚本播放器推进到持续互动角色,S2-Editing则把视频后期的一部分能力前移到实时输入阶段,空间视频能力又把这套链路连接到VR和混合现实设备。三者组合起来,构成的是一个“持续感知—持续生成—持续修改”的视频系统。

但它也不应被包装成已经解决实时视频的一切问题。复杂动作、多人场景、遮挡关系、长时间身份一致性、双目深度稳定,以及实时输出质量与最终成片质量之间的差距,仍然需要真实用户持续测试。尤其是25~42 FPS属于输出帧率指标,不等于所有输入场景都能以同样稳定的端到端延迟运行。

我们的判断是:Vidu S2的行业意义大于“又一个视频模型发布”。它把视频生成的产品形态从一次性创作工具,推向了可持续交互的媒体引擎。短期看,最有机会落地的是数字人直播、虚拟拍摄和实时视频预览;中期看,S2-Editing与空间视频的结合,可能成为混合现实内容生产的重要基础能力。

Vidu S2已经开放在线体验。对于开发者和深度用户来说,现在最值得测试的不是官方演示里最顺滑的片段,而是连续输入、快速换参考图、全身动作、长时间编辑和左右眼转换这些真正能暴露系统边界的场景。视频模型的下一轮竞争,可能不再只是“谁生成得更像”,而是“谁能在用户不断改变主意时,仍然保持画面稳定地往前走”。

参考来源

  1. Vidu S2 相关讨论与资料检索|知乎 —— 汇总Vidu S2发布、实时编辑和空间视频相关公开信息。
  2. Vidu S2 相关技术资料检索|GitHub —— 用于核对公开项目、技术报告和社区实现线索。
  3. Vidu S2 相关讨论检索|Linux.do —— 参考开发者和深度用户对模型体验及实时视频能力的讨论。

本文信息截至2026年9月16日。模型性能、可用性和开放范围可能随产品更新而变化。

相关推荐

查看全部