AI 快讯智象推出物理导向视频模型
模型上新

智象推出物理导向视频模型

2026-09-15T13:06:27.591Z
智象推出物理导向视频模型

智象未来发布 HiDream-O1-Video-1.0,主打原生全模态与物理规律建模。相比只追求画面好看的视频生成器,它试图让视频中的物体运动、空间关系和连续动作更可信。

智象推出 HiDream-O1-Video-1.0,视频生成开始比拼“物理感”

9月15日,智象未来(HiDream.ai)发布首款原生全模态视频生成模型 HiDream-O1-Video-1.0。这款模型的核心卖点不是单纯把画面做得更清晰,而是让视频中的物体运动、空间关系、动作衔接和因果变化更符合现实世界的物理规律。

**HiDream-O1-Video-1.0 是一款以物理规律建模为重点的原生全模态视频生成模型。**它试图解决当前视频模型最容易露怯的问题:单帧看起来很漂亮,但一旦进入连续运动,人物的手脚、物体的位置、镜头空间和前后状态就开始漂移。

这次发布的意义在于,智象未来没有把视频模型当作一条孤立的产品线,而是将其放进了自己正在搭建的原生全模态世界模型路线中。此前,智象已经推出 HiDream-O1-World 和 HiDream-O1-Embodied,分别面向可交互世界生成与具身智能。HiDream-O1-Video-1.0 更像是这条路线在视频创作侧的落地版本:先让模型能够稳定地理解和生成动态世界,再谈更复杂的交互和执行。

HiDream-O1-Video-1.0生成物理规律导向视频的概念配图

视频生成的下一个瓶颈,不是分辨率

**视频生成模型的物理一致性,是指视频中的运动、碰撞、遮挡、重力、形变和空间关系在时间维度上保持合理。**这与“单帧画质”是两件事。

过去一段时间,视频模型的竞争主要围绕几个直观指标展开:生成分辨率、视频时长、镜头运动、人物美感和文本跟随能力。但对开发者和专业用户而言,真正决定视频能不能用于生产的,往往是另一组指标:人物能否保持身份一致,物体能否在镜头切换后仍处于正确位置,手部动作能否完成,液体和布料是否按照合理方式运动,以及前后镜头之间是否存在可解释的因果关系。

这也是现有视频生成器的共同短板。模型可以生成“一个人把杯子放在桌上”的画面,却不一定能稳定完成“人拿起杯子、转身、走到桌边、放下杯子”这一串连续动作。它可能让杯子突然改变形状,也可能让手指穿过杯壁,甚至在镜头运动之后让桌子和人物发生空间错位。

原因并不复杂。大多数视频生成模型本质上仍然是在学习视觉数据中的统计关联。模型知道“人”和“杯子”通常会一起出现,也知道“手靠近杯子”经常对应“拿杯子”,但它未必真正建立了物体质量、受力关系、遮挡顺序和三维空间之间的内部表示。

**物理规律导向的视频生成,核心不是让模型背诵更多画面,而是让模型学习画面变化背后的状态转移。**换句话说,模型需要回答的不只是“下一帧长什么样”,还要判断“为什么下一帧会变成这样”。

HiDream-O1-Video-1.0 的技术路线:从视频生成走向世界建模

智象未来此次发布的模型,延续了公司此前强调的原生全模态技术路线。原生全模态架构是指文本、图像、视频、音频、动作和空间关系等信息在模型内部使用统一的表示空间进行理解和生成,而不是先由多个相互独立的模型处理,再把结果拼接起来。

据公开资料,智象自研的 UiT(Unified Transformer)架构会将不同模态信号统一编码到共享 Token 空间。这种做法的价值在于,模型可以更直接地建立“文字描述—视觉状态—动作变化—空间结果”之间的联系。

例如,传统文本到视频系统接收到“一个红色小球从斜坡滚下并撞击木块”时,重点可能是生成一段符合视觉统计的画面。而原生全模态模型理论上可以同时处理文本中的动作关系、视频中的运动轨迹、物体之间的空间位置,以及碰撞之后的状态变化。它不一定每次都能正确模拟物理过程,但训练目标已经从“生成像视频的东西”向“生成一个会按照规则变化的场景”移动。

这条路线也解释了为什么智象未来连续推出 World、Embodied 和 Video 三类模型。视频是动态世界的视觉表达,世界模型需要对场景进行长期推演,具身模型则进一步要求系统把预测结果转化为机器人动作。三者底层都依赖对时间、空间和物理状态的理解。

三个值得关注的能力方向

**第一,时空一致性决定视频能否连续观看。**时空一致性是指人物、物体和场景在连续帧以及镜头切换后仍保持稳定身份、位置和结构。对于短视频广告、分镜预演和游戏过场动画而言,这比单帧截图是否惊艳更加重要。

如果一个角色在第1秒穿着黑色外套,第3秒突然变成白色;如果镜头从正面切到侧面后,房间布局发生变化;如果一个被遮挡的物体重新出现时形状已经改变,那么这段视频就很难直接进入生产流程。HiDream-O1-Video-1.0 将时空一致性放在物理规律导向的框架中,说明其目标并非只优化画面审美,而是试图降低这类连续性错误。

**第二,动作与物体交互是检验模型能力的硬指标。**人物走路、奔跑、转身等动作已经是视频模型的常见能力,但抓取、推动、碰撞、堆叠和穿越等涉及交互的动作更难生成。

视频里的物体交互至少包含三层关系:人物的意图、动作的轨迹,以及物体受到影响后的结果。一个人推箱子时,手臂需要与箱子发生正确接触,箱子需要沿合理方向移动,人物身体还要呈现出相应的发力姿态。如果只有其中一层成立,观众仍然会感觉画面“不对”。

**第三,长时程推演决定模型能否服务复杂内容生产。**长时程推演是指模型在较长时间范围内维持场景状态,并根据前序事件生成后续变化。它不仅是把视频时长从几秒拉长,更要求模型记住人物、物体和环境此前发生了什么。

智象此前发布的 HiDream-O1-World 已经将长时程时空一致性和物理一致性作为重点。根据公开评测信息,该模型在 WBench 最新榜单核心 Navi 分榜平均分为 80.9,物理维度得分 73.3,位列该维度第一,一致性维度得分 88。需要强调的是,这些数据属于 HiDream-O1-World 的评测结果,并不是 HiDream-O1-Video-1.0 的性能成绩。新视频模型的独立评测数据、生成时长、分辨率和具体开放方式,目前仍需要以官方后续信息为准。

它与普通视频生成器有什么不同

**普通视频生成器更像“视觉导演”,而物理规律导向模型更接近“视觉导演加场景模拟器”。**前者擅长安排构图、色彩和镜头氛围,后者还需要考虑场景中每个对象如何随着时间变化。

这并不意味着 HiDream-O1-Video-1.0 会取代所有主流视频模型。对于广告概念片、情绪短片和艺术化镜头,审美风格、镜头控制和出片速度仍然是更重要的指标。物理一致性只有在复杂动作、产品展示、连续叙事和可交互场景中才会真正体现价值。

| 对比维度 | 传统视频生成模型 | HiDream-O1-Video-1.0 的主打方向 | 对用户的实际影响 | |---|---|---|---| | 生成重点 | 画面质量、风格和镜头感 | 画面质量与物理规律结合 | 连续动作更有机会直接使用 | | 时间一致性 | 主要依赖时序建模和提示词约束 | 强调长时程状态与空间关系 | 减少人物、物体前后漂移 | | 物体交互 | 容易出现穿模、错位和形变 | 强调碰撞、动作和结果的合理性 | 更适合产品演示和动作场景 | | 输入方式 | 以文本、图像为主 | 延续原生全模态路线 | 有望结合动作、视频等上下文 | | 当前信息完整度 | 多数产品参数较明确 | 独立评测和商业细节仍待披露 | 不宜仅凭宣传语判断最终效果 |

从产品判断上看,智象的差异化方向是清楚的:不跟所有厂商一起争夺“谁能生成更梦幻的镜头”,而是押注“谁能让镜头里的世界更稳定、更可信”。这条路线的商业价值可能不如一眼可见的画质升级,但对影视工业、游戏制作和机器人仿真更重要。

对开发者和内容团队意味着什么

**对于内容团队,物理一致性提升的直接价值是减少返工,而不是让创意自动完成。**目前视频生成仍然很难一次生成可直接交付的长片段。即便模型能够处理更合理的运动,导演、剪辑师和设计师仍需要拆分镜头、控制角色设定、筛选结果并进行后期合成。

但如果模型能稳定完成“动作发生—物体响应—镜头保持连续”这一链条,工作流会发生变化。团队可以先用模型制作动态分镜,再把可用片段交给后期处理;游戏团队可以快速生成不同物理状态下的场景草案;广告公司则可以更快验证产品与人物、道具之间的互动方式。

**对于游戏和虚拟世界开发者,视频模型的价值在于降低动态内容原型制作成本。**传统方式需要建模、绑定、动画、灯光和渲染多个环节。视频模型不能直接替代完整的资产生产,但可以帮助团队快速测试镜头、动作和叙事节奏。如果它进一步与可编辑的世界模型结合,就有机会从“生成一段视频”走向“生成一个可继续修改的动态场景”。

**对于具身智能团队,物理导向视频模型可以成为训练数据和环境预测模块的一部分。**智象此前发布的 HiDream-O1-Embodied 已面向机器人在真实环境中的物理感知、动态预判和任务执行,并在 RoboColiseum 的 Robustness 子榜单取得 0.692 平均分。这个成绩属于具身模型,不代表新视频模型的机器人能力,但能看出智象正在尝试把视觉生成、世界预测和动作执行放进同一条技术链路。

在理想情况下,视频模型可以生成不同光照、材质、遮挡和物体状态下的动态样本,用于扩充训练数据;世界模型负责理解环境并推演未来;具身模型则把推演结果转化为动作。三者如果真正打通,模型就不只是“会生成视频”,而是能帮助机器理解现实世界。

现在还不能忽略的限制

**目前最需要谨慎的是,不要把“物理规律导向”直接等同于“真实物理模拟器”。**生成模型即使在视觉上表现出合理运动,也不一定具备可验证的质量、速度、摩擦力和碰撞计算能力。它生成的是符合训练分布的结果,而不是严格意义上的工程级仿真。

**HiDream-O1-Video-1.0 的实际竞争力仍取决于可验证参数。**包括支持的输入模式、单次生成时长、输出分辨率、帧率、镜头控制能力、角色一致性、是否支持局部重绘和首尾帧控制,以及产品开放范围和计费方式。这些信息如果没有统一测试,单凭发布描述很难与 Veo、Sora、Kling、Runway 等产品做出公平结论。

**物理一致性也不是视频生成的唯一评价标准。**模型还需要在文本遵循、审美质量、人物手部、镜头可控性、生成速度和内容安全之间取得平衡。一个运动非常合理但画面平淡的模型,未必适合广告创作;一个画面极具风格但动作不稳定的模型,也不适合产品演示。真正有竞争力的产品,必须让这些指标同时达到可用水平。

因此,现阶段更准确的判断是:HiDream-O1-Video-1.0 展示了智象未来在视频生成领域的明确技术取向,但它是否能进入全球 AI 视频模型第一梯队,还需要等待公开样片、第三方盲测和开发者实际使用反馈。

OpenAI Hub 观点:从“生成画面”到“生成可解释的变化”

HiDream-O1-Video-1.0 最值得关注的地方,不是又多了一款文本生成视频工具,而是视频模型的竞争重点正在从静态画质转向动态世界理解。

过去,用户问的是“这段视频好不好看”;接下来,专业用户会更多追问“这个世界能不能保持一致”“这个动作有没有因果关系”“镜头里的物体是否真的存在于同一个空间”。这意味着视频模型将逐渐从一次性内容生成器,转向内容生产、世界模拟和具身智能基础设施。

智象未来已经通过 HiDream-O1-World、HiDream-O1-Embodied 和 HiDream-O1-Video-1.0 形成了相对完整的产品叙事:World 负责构建和推演世界,Video 负责表达动态变化,Embodied 负责让智能体在物理环境中行动。现在看,这条路线的技术想象力很大;但能否成立,最终仍要靠模型在复杂场景中的稳定性,以及开发者是否能真正把它接入工作流。

对普通创作者来说,可以先把它理解为一个更重视“动作可信度”的视频模型;对开发者来说,更值得观察的是它是否提供可控的时空状态、动作条件和场景编辑能力;对 AI 行业来说,这次发布释放出的信号是明确的:下一轮视频模型竞争,可能不再只是分辨率、时长和风格,而是谁更接近一个能够持续运行的世界模型。

参考来源

注:本文发布时,HiDream-O1-Video-1.0 的完整技术报告、第三方独立评测、详细规格和开放范围尚未完全公开。文中涉及 HiDream-O1-World 与 HiDream-O1-Embodied 的评测数据,均为对应模型的数据,不应视为 HiDream-O1-Video-1.0 的直接成绩。

相关推荐

查看全部