AI 快讯JoyAI视频模型开源:边播边改
模型上新

JoyAI视频模型开源:边播边改

2026-08-05T03:04:20.783Z
JoyAI视频模型开源:边播边改

京东开源JoyAI-Video-Edit,在720P下达到每秒30帧模型推理速度,并支持任意时长流式编辑。它真正值得关注的,不只是实时改视频,还有低成本合成机器人训练数据的潜力。

京东今天(2026年8月5日)宣布开源自研实时流式视频编辑模型 JoyAI-Video-Edit。这款模型可以在视频持续播放时同步修改人物、物体、场景和画面风格,在720P分辨率下达到每秒30帧的模型推理速度,并宣称支持任意时长的稳定流式编辑。

**实时流式视频编辑是指模型不必等待整段视频处理完成,而是按照视频帧持续接收、编辑并输出画面。**它与目前常见的“上传素材—等待生成—查看结果—重新修改”模式不同,更像给正在播放的视频接上一层可实时响应的生成式滤镜。

这次发布的重点是“开源”,而不只是模型首次亮相。JoyAI-Video-Edit相关能力在今年7月已经被媒体报道,8月5日的新进展则是京东正式开放模型,让开发者可以进一步研究、部署和验证其流式编辑能力。

JoyAI-Video-Edit实时流式视频编辑示意图,左侧为连续输入的视频帧,中间为文本编辑指令,右侧为同步输出的修改后画面

720P、30帧,刚好跨过“能实时播放”的门槛

**JoyAI-Video-Edit最关键的性能数字,是720P分辨率下每秒30帧的模型推理速度。**30fps是常见网络视频、影视素材和直播画面的基础帧率,如果模型只能每秒处理10帧,即使单帧效果不错,输出也会出现明显卡顿;达到30fps,才意味着模型输出有机会跟上普通视频的播放节奏。

这个数字比单纯宣称“实时”更有价值,但仍不能直接等同于完整系统的端到端30fps。模型推理之外,实际应用还要叠加视频解码、文本或视觉条件编码、帧间缓存、内容安全检测、视频编码和网络传输等环节。京东目前公开的信息没有给出测试所用GPU型号、显存占用、批处理大小和端到端延迟,因此“720P 30fps”应理解为模型侧吞吐指标,而不是任意设备都能获得的最终体验。

**实时视频编辑同时受吞吐和首帧延迟约束。**每秒30帧说明系统长期运行时能够跟上视频速度,但直播和交互式创作还关心用户发出指令后多久能看到第一帧变化。如果首帧需要等待数秒,模型依旧适合离线创作,却很难称得上真正的现场互动工具。

京东暂未公布首帧延迟、指令切换延迟和长时间运行的显存曲线,这些参数将决定JoyAI-Video-Edit究竟更适合专业工作站、云端集群,还是有机会进入消费级显卡环境。对于开发者来说,30fps是一个足够亮眼的起点,但不是部署结论。

“任意时长”比30帧更难,也更有产品价值

**任意时长流式编辑是指模型不预设固定视频片段上限,可以随着输入视频持续到达而连续处理。**这里的“任意时长”并不意味着模型可以在有限硬件上无限保留全部历史帧,而是意味着系统不需要把整段视频一次性装入显存,也不受传统视频扩散模型几秒或几十秒窗口的硬性限制。

长视频编辑的真正难点是时间一致性。模型把一件黑色外套改成红色并不难,难的是人物转身、被遮挡、离开画面再回来之后,衣服的颜色、纹理和款式仍然保持一致;场景替换同样如此,路牌、窗户和背景建筑不能每隔几秒随机变化。

**流式模型必须在有限上下文中保存足够稳定的视觉状态。**如果保存全部历史帧,显存和计算量会随视频长度增长;如果只看最近几帧,模型又容易忘记前面的角色和编辑设定。工程上通常需要滑动窗口、压缩后的历史特征、关键帧记忆或状态缓存来平衡一致性与成本,但京东目前披露的信息没有展开JoyAI-Video-Edit采用了哪一种具体机制。

“任意时长”因此应该被理解为没有固定的分钟级输入上限,而不是完全不存在漂移。模型连续运行30分钟、2小时甚至一整场直播后,角色身份、物体纹理和局部编辑区域能否稳定保持,仍需要仓库中的演示、评测脚本和社区复现来验证。

它不是把剪映或Premiere做快一点

**JoyAI-Video-Edit改变的是视频编辑的交互单位,而不是简单缩短传统渲染时间。**传统非线性编辑软件以时间线、图层、蒙版和关键帧为核心,创作者先明确选区和参数,再让软件执行;流式生成式编辑则允许用户用自然语言持续改变正在出现的内容。

例如,创作者可以在人物行走过程中连续更换服装,而不必逐帧绘制蒙版;直播团队可以把真实街道转成动画世界,并在镜头移动时持续生成新背景;家装应用可以在用户拍摄房间时即时替换沙发、墙面和灯光,让设计预览从静态效果图变成动态走查。

**边播边改最适合输入内容不可提前确定的场景。**影视后期通常拥有完整素材,等待几分钟并非致命问题;直播、远程导购、实时预览和机器人视觉数据处理则面对不断到来的画面,无法先收齐视频再编辑。JoyAI-Video-Edit的产品价值,主要来自这类“未来帧尚不存在”的任务。

这也意味着它短期内不会取代成熟的视频剪辑软件。精确到像素的遮罩、可回溯的参数调整、复杂时间线管理和确定性输出,仍然是传统工具的优势;JoyAI-Video-Edit更像一个实时生成层,可以成为直播软件、虚拟制作系统和专业剪辑工具中的新模块。

京东称OpenVE-Bench领先,但完整数字仍需公开验证

**OpenVE-Bench是面向开放域视频编辑任务的通用评测基准,用来衡量模型对编辑指令的遵循程度、画面质量和时间一致性。**据京东披露,JoyAI-Video-Edit在该评测中超过现有流式编辑方法,并在全局风格、局部替换、局部删除和字幕编辑等任务中表现突出。

京东还将JoyAI-Video-Edit与SANA Streaming、LiveEdit和Xmax-X2.0等代表性流式视频编辑模型进行了比较,并称整体效果全面领先。不过,现阶段公开报道没有列出每个模型的完整分项得分、测试硬件、推理参数和置信区间,因此“全球领先”仍主要是官方结论,而不是已经被独立复现的行业共识。

| 模型 | 定位 | 已披露实时能力 | 长视频能力 | 本次公开比较结论 | |---|---|---:|---|---| | JoyAI-Video-Edit | 实时流式视频编辑 | 720P、30fps模型推理 | 官方称支持任意时长稳定流式编辑 | 京东称OpenVE-Bench整体领先 | | SANA Streaming | 流式生成与编辑代表模型 | 本次资料未披露统一口径数据 | 本次资料未披露 | 被纳入对比,官方称JoyAI领先 | | LiveEdit | 实时视频编辑代表模型 | 本次资料未披露统一口径数据 | 本次资料未披露 | 被纳入对比,官方称JoyAI领先 | | Xmax-X2.0 | 流式视频编辑代表模型 | 本次资料未披露统一口径数据 | 本次资料未披露 | 被纳入对比,官方称JoyAI领先 |

**这张对比表最重要的信息,是目前只有JoyAI-Video-Edit给出了明确的720P 30fps数字,而不是可以据此计算它领先竞品多少。**不同模型如果使用不同GPU、分辨率、帧数、量化方式和质量配置,速度数据没有直接可比性。真正有说服力的比较,需要统一硬件和输入条件,同时公开画质、指令遵循、时间一致性、吞吐及首帧延迟。

开发者接下来应重点检查四项内容:

  1. 开源范围:是否同时包含模型权重、推理代码、训练或微调代码,而不仅是演示程序。
  2. 许可证:是否允许商业部署、模型修改和输出内容商用,以及是否存在特定行业限制。
  3. 复现条件:720P 30fps使用了什么GPU、数值精度和并行策略,需要多少显存。
  4. 评测透明度:OpenVE-Bench的测试配置、提示词、随机种子和完整分项结果是否可复现。

机器人训练可能比内容创作更早体现商业价值

**具身智能数据合成是利用生成或编辑模型构造机器人训练视频,以减少真实机器人采集成本的方法。**机器人学习抓取、搬运、开门和工具操作,需要大量包含动作轨迹、物体位置及环境变化的视频,但真机采集速度慢、成本高,危险和少见场景更难重复录制。

JoyAI-Video-Edit可以把人手操作视频转换为机械手或机械臂操作素材,并在尽量保留物体位置、空间关系和动作轨迹的基础上,替换场景、物体及机器人形态。一段“人手拿起杯子”的视频,可以扩展成不同机械臂、不同杯子、不同桌面材质和不同光照条件下的训练样本。

**这种做法的优势是保留真实动作结构,同时扩大视觉分布。**完全从零生成机器人视频容易出现接触关系错误,例如夹爪尚未碰到物体,物体就已经移动;基于真实操作视频做受控编辑,则有机会继承原始轨迹中的时序和空间约束。

合成数据的风险同样不能忽略。视频看起来合理,不代表其中的深度、力学接触和关节状态正确;如果模型在遮挡区域生成错误结构,机器人可能学到视觉上连贯、物理上不可执行的动作。因此,JoyAI-Video-Edit更适合用于增加外观、背景和机器人形态的多样性,而不能直接替代带有传感器、关节角和力反馈信息的真实采集数据。

开源让“实时”从演示指标变成可检验命题

**JoyAI-Video-Edit现阶段最有含金量的突破,是把720P视频编辑推进到每秒30帧,并试图解除固定片段长度限制。**如果社区能够在公开硬件上复现这一结果,它会把生成式视频编辑从离线工具推向直播、虚拟制作、交互设计和具身智能数据生产。

它当前最大的未知数也很明确:30fps究竟依赖多大的算力,首帧延迟是多少,连续运行后会不会发生角色和纹理漂移,以及完整开源许可证是否允许商业部署。缺少这些信息时,JoyAI-Video-Edit更像一个技术方向已经成立、产品成本尚待确认的模型。

**“边播边改”比“又一个视频生成模型”更值得关注。**视频生成模型解决的是从无到有,实时流式编辑解决的则是人与动态内容如何持续互动;前者已经进入画质和时长竞赛,后者仍处于交互范式刚刚成形的阶段。京东这次开源,至少让这场竞争从宣传视频进入了开发者可以动手验证的阶段。

参考来源

相关推荐

查看全部