AI 快讯Vivix把视频生成做成实时互动
模型上新

Vivix把视频生成做成实时互动

2026-07-25T06:02:58.765Z
Vivix把视频生成做成实时互动

Vivix发布A1与W1两款近30B激活参数模型,以统一流式架构实现音视频持续生成、低于1秒响应和原生打断。真正的看点不是生成更快,而是视频模型第一次开始像游戏引擎一样持续接收输入。

Vivix把视频生成做成实时互动

7月24日,Vivix灵动时刻正式发布首个实时互动模型体系,推出Vivix-A1与Vivix-W1两款有效激活参数接近30B的模型。 A1面向可实时操控的AI角色,W1面向持续生成、随时改写的互动剧情;两者都试图打破传统视频模型“输入一次、生成一段、结束后再修改”的工作方式。

这不是又一个把文生视频压到几秒钟的速度竞赛。

实时互动模型是一类在持续生成音视频的同时,仍能不断接收语音、文字、图片、点击和触控输入,并据此改变后续内容的生成模型。 它与传统视频生成最大的差别,不是单段视频要等10秒还是1分钟,而是生成过程不再封闭:用户可以中途说“让角色转身”“换一个镜头”或者上传一张参考图,模型无需推倒重来。

按照Vivix披露的数据,这套系统在消费级显卡环境下可实现300—600毫秒首帧渲染延迟、低于1.7秒的端到端响应,以及300—900毫秒的原生打断响应。其推理引擎单卡吞吐超过10000 video tokens/s,官方测试口径下实时推理成本低于每小时1美元。

Vivix-A1数字角色与Vivix-W1互动剧情的实时生成界面,展示语音输入、流式视频和低延迟打断

A1负责“做人”,W1负责“讲故事”

Vivix-A1是一个面向交互式AI角色的实时全双工多模态模型。 所谓全双工,是指模型输出声音和画面的同时,输入通道仍保持开启,用户不需要等角色说完或动作结束才能插话。

A1的目标也不只是让数字人对口型。Vivix展示的角色可以行走、转身、跳舞、改变姿态、表达情绪,并尝试接近或拿起物体;当运营人员在直播中发出语音指令时,角色可以在不中断视频流的情况下改变动作和表达。

完整全身生成是A1相较常见数字人的核心差异。 传统数字人产品通常由语音识别、语言模型、语音合成、口型驱动和预制动作等模块串联而成,优势是链路成熟、行为可控,缺点是各模块分别决策,动作、声音和表情容易出现明显的拼接感。角色一旦离开固定机位,复杂度还会迅速上升。

A1则把语音语义、声学特征、环境声音、图像参考、手势、身体运动和视频输出放进同一个多模态生成循环。它不必先把所有语音转换成文本,再交给语言模型规划动作,而是可以让声学与视觉信号直接影响角色后续行为。

Vivix-W1是一个面向实时互动叙事的流式音视频生成模型。 用户给出“外星人入侵地球”一类初始提示后,W1会持续生成带有镜头切换、人物对白、环境音和剧情推进的故事;生成开始以后,用户仍可以通过语音、文字、图片、点击或触控改变走向。

W1的意义在于,它生成的不是一段已经封口的视频,而是一条持续延伸的时间线。用户中途要求“让外星人转而帮助主角”,后续人物反应、对白和镜头都应随之变化,而不是从预先制作的分支中切换素材。

A1与W1的分工反映了实时生成的能力层级。 A1先解决单个角色的身份、动作、声音和物体交互,W1再解决多角色、多镜头与事件节奏的调度。可以把A1理解为演员,把W1理解为同时负责编剧、导演、摄影与声音设计的生成系统。

| 模型 | 主要定位 | 输入方式 | 输出内容 | 当前开放状态 | |---|---|---|---|---| | Vivix-A1 | 实时AI角色、数字主播、虚拟陪伴 | 语音、文字、图片及持续环境信号 | 全身角色、动作、表情、语音与视频 | 已作为本次核心能力上线,开放申请体验 | | Vivix-W1 | 互动剧情、实时短剧、生成式娱乐 | 语音、文字、图片、点击、触控 | 多角色、多镜头、对白、环境音与连续剧情 | 现阶段以Demo展示,后续逐步开放 |

统一流式架构,才是这次发布的重点

统一流式架构是一种把多模态输入、时序状态和音视频输出放进同一条持续生成链路的模型架构。 这里的“统一”不是简单把多个模型装进同一个产品界面,而是让不同模态共享生成状态;“流式”则意味着模型一边接收输入,一边向前生成,而不是等完整条件到齐后一次性计算。

目前主流高质量视频模型大多采用clip-based生成方式。模型先接收一段完整提示,在固定时间窗口内统一规划,再生成一个数秒或十几秒的视频片段。双向Attention可以同时看到窗口中的前后信息,因而更容易照顾整体构图和动作连贯性,但生成开始后很难自然插入新条件。

Vivix选择的因果时序生成更接近语言模型逐token向前写作。 当前画面只能依赖已经生成的历史状态,不能偷看未来帧;新输入可以随时进入系统,并影响尚未生成的内容。这种路线天然适合互动,但会把长期一致性的压力全部交给模型。

两类架构的差异可以概括为:

| 技术路线 | 生成方式 | 中途加入指令 | 全局一致性 | 典型适用场景 | |---|---|---:|---:|---| | 固定片段视频生成 | 收齐条件后整体规划固定时长片段 | 困难,通常需要重新生成 | 相对更容易保证 | 广告素材、影视镜头、短视频制作 | | ASR+LLM+TTS+数字人级联 | 多个模型依次处理语音、文本、声音和画面 | 支持,但模块间存在等待与误差 | 依赖工程编排和预制资产 | 客服、导览、固定机位数字人 | | Vivix统一流式生成 | 因果时序持续生成音视频 | 原生支持,响应低于1秒 | 需要在线维护身份与场景状态 | AI角色、互动短剧、生成式游戏 |

流式生成最难解决的不是第一秒,而是第一百秒。 角色衣服颜色、物体位置、人物关系和空间结构都必须作为状态持续保留;一次微小错误还可能沿时间轴不断积累,最终表现为人物变脸、物体消失或场景结构漂移。

Vivix称其把多模态参考注入、因果时序建模和流式状态维护整合进同一架构,让图片、语音和文字不只在第一帧生效,而是能在后续生成中持续发挥作用。这一设计方向是合理的,但目前公开材料尚未给出超长时段一致性曲线、状态缓存开销以及不同并发规模下的延迟变化。

从8步压到2步,速度不是靠简单少算几次

MJD是Vivix提出的多维联合蒸馏框架,全称为Multidimensional Joint Distillation。 它的目标是把视频扩散模型约8步的去噪过程压缩至2步,同时尽量保留运动幅度、画面细节和长期时序稳定性。

视频扩散模型通常需要4—8步甚至更多去噪计算,每一步都要运行体量可观的神经网络。直接把8步砍成2步,理论计算量可以显著下降,但不同去噪阶段承担的任务并不相同:早期更偏向确定语义和整体结构,中期建立运动关系,后期补足细节与纹理。

MJD的思路是按不同去噪阶段承载的能力进行联合压缩,而不是机械删步。 Vivix表示,W1-Turbo在内部评测中经过2步推理后,仍能维持8步基线的运动表现和长期稳定性。这个结论决定了实时视频能否成立,因为对于近30B激活参数的模型,多执行一次去噪都可能直接增加数百毫秒延迟。

不过,官方目前没有公布足够完整的MJD论文、训练配方和可复现权重。2步扩散是否在复杂运动、快速镜头切换和长时间互动中保持同等质量,仍需要开发者实测以及第三方基准验证。

NVFP4量化把近30B模型塞进实时预算

NVFP4是一种面向NVIDIA Blackwell架构的4位浮点计算格式,用更低数值精度换取更高吞吐和更低显存占用。 Vivix没有在训练完成后简单执行后量化,而是以Blackwell NVFP4 GEMM作为目标推理路径,让模型在训练阶段就适应4-bit数值分布。

语言模型的量化误差往往主要影响当前token及其后续概率分布,而视频扩散的误差会在去噪步骤与时间轴两个方向上传播。某一帧出现的细小偏差,可能在几十帧后演化成角色身份或背景结构变化,因此视频模型对低比特量化更敏感。

Vivix为此加入了针对去噪误差的校正机制。 按照官方披露,其FP4推理相较BF16基线实现了“近乎无损”的生成质量,同时把单卡吞吐提升至超过10000 video tokens/s。这里的video token是视频经过时空压缩后的内部表示单元,并不等同于一帧画面,也不能直接与语言模型token吞吐横向比较。

两款模型采用8×8×4的时空压缩率,即在空间与时间维度上把原始视频压缩成更少的潜变量token。压缩率越高,实时生成需要处理的token越少,但细节、快速运动和小物体信息也越容易丢失。Vivix必须在压缩器重建质量、模型计算量与连续生成稳定性之间取得平衡。

近30B指的是有效激活参数,而不是官方已经披露的完整总参数量。 如果模型采用稀疏专家结构,有效激活参数只代表单次前向计算实际使用的参数规模,不能据此推断全部权重大小。官方也尚未说明“消费级显卡”测试所使用的具体GPU型号、显存容量和并发设置,因此成本数据暂时更适合作为工程目标,而不是部署承诺。

延迟已经可用,但画质还没有取代离线视频模型

Vivix当前最有说服力的指标是交互延迟,而不是单帧画质。 官方给出的首帧渲染延迟为300—600毫秒、端到端延迟低于1.7秒、原生打断响应为300—900毫秒。作为参照,传统多模态互动方案通常要依次经过语音识别、语言模型、语音合成和数字人渲染,任何一环排队都会拉长响应。

| 指标 | Vivix官方披露结果 | 实际意义 | |---|---:|---| | 首帧渲染延迟 | 300—600毫秒 | 用户发出指令后较快看到画面开始变化 | | 端到端延迟 | 低于1.7秒 | 从输入到完整可感知响应的总等待时间 | | 原生打断响应 | 300—900毫秒 | 生成过程中插话后,模型改变行为的速度 | | 单卡吞吐 | 超过10000 video tokens/s | 支撑连续音视频生成的内部处理能力 | | 扩散去噪步数 | 约8步压缩至2步 | 直接减少单次生成的模型计算次数 | | 实时推理成本 | 低于1美元/小时 | 官方测试口径,不等于最终产品售价 |

这些数字已经跨过实时互动的基本门槛,但尚不足以证明系统能稳定服务大规模用户。 开发者还需要关注P95与P99延迟、并发吞吐、冷启动时间、长会话显存增长、网络抖动处理以及安全审核带来的附加等待。平均延迟低并不代表直播高峰期仍能维持同样体验。

Vivix也承认,A1在复杂快速运动和精细物体交互上仍有改进空间,W1实时版本的视觉质感与头部离线视频模型存在差距。这并不意外:离线模型可以花更多去噪步骤反复修正画面,实时模型必须在下一帧播放前给出结果。

因此,拿W1与高质量离线文生视频模型做静态画质对决并不公平。 W1真正的竞争对象更接近游戏引擎、实时数字人系统和生成式互动平台;它卖的不是某个10秒镜头有多精致,而是内容能否在播放过程中响应用户。

这套架构真正可能改变什么

实时模型会把AI内容的基本单位从“文件”变成“过程”。 过去生成式视频的交付物是一段MP4,用户观看的是已经完成的结果;在Vivix设想的场景中,交付物是一条持续运行、可以被干预的生成流。

这种变化会优先影响三类产品:

  • 数字直播与虚拟员工: 角色可以离开固定机位,根据现场语音改变动作、商品展示和情绪表达。
  • 虚拟陪伴与教育: AI角色不仅回答问题,还能通过身体动作、场景变化和物体操作参与互动。
  • 互动短剧与生成式游戏: 用户不再只从A、B、C三个预制选项中选择,而是可以用自然语言改变剧情方向。

对游戏行业而言,W1更像一个概率化的视频世界模拟器,而不是传统3D引擎的直接替代品。 传统引擎的优势是状态确定、碰撞可计算、规则可验证;生成式视频的优势是内容创建速度快、视觉表达自由。只要物理一致性、可控性和长期记忆没有解决,它更适合叙事娱乐和轻交互内容,而不是要求精确操作的竞技游戏。

对数字人行业而言,A1的冲击可能比W1更快出现。 数字人直播对像素级画质的容忍度较高,却非常看重延迟、自然打断和动作丰富度。只要成本真能控制在每小时1美元量级,并支持稳定并发,A1就可能削弱传统动作库、口型模块和渲染管线的价值。

OpenAI Hub判断:方向成立,证据还需补齐

Vivix这次发布值得关注,因为它交付的是一条从模型、蒸馏、量化到推理引擎的完整实时链路。 2-Step Diffusion、NVFP4适配和超过10000 video tokens/s的单卡吞吐并非孤立跑分,而是在共同服务同一个目标:让近30B激活参数模型赶在下一帧之前完成计算。

但这仍是一款处于早期开放阶段的产品。A1已经提供申请体验,W1主要以Demo形式展示;模型权重、完整技术报告、训练数据构成、详细基准方法和商业价格表均未全面公开。Vivix-Bench包含1000个样本的人工评测,但在缺少公开样本、盲测流程和第三方复现的情况下,结果仍应视为官方证据。

判断实时互动模型是否真正可用,不能只看精心挑选的演示视频。 更关键的问题包括:角色连续运行30分钟后是否保持身份,用户频繁打断是否导致状态错乱,多人同时说话时能否正确归因,以及精细物体交互失败后能否恢复。

Vivix至少把问题从“能不能生成实时视频”推进到了“实时视频是否足够稳定、便宜和可控”。如果后续公开测试能够验证其延迟与成本数据,那么这条统一流式路线可能会成为视频生成继画质竞争之后的下一条主赛道。

参考来源

相关推荐

查看全部