MiniMax把AI视频推到实时

MiniMax 与 fal 联合推出 H3 Max,5 秒 768p 视频模型侧生成不到 3 秒、吞吐量约为 H3 的 35 倍。速度超过播放速度后,AI 视频首次具备直播互动和实时内容供给的商业基础。
MiniMax把AI视频推到实时:5秒视频不到3秒生成
**MiniMax 与 AI 推理基础设施公司 fal 最近联合推出 H3 Max,把一段 5 秒、768p 视频的模型侧生成时间压缩到 3 秒以内。**按公开数据计算,它的吞吐量约为原版 MiniMax H3 服务的 35 倍,视频还没播放完,系统已经可以开始准备下一段内容。
这不是一次常规的“快了百分之几十”。
**当视频生成速度超过视频播放速度,生成式视频就从离线创作工具变成了潜在的实时内容系统。**过去用户需要提交提示词、等待几分钟、挑选结果再重新生成;现在模型有机会一边播放、一边根据弹幕、点击和用户行为生成后续画面,AI 直播、互动广告和动态游戏剧情因此获得了可行的技术底座。

H3 Max是什么:不是更大的H3,而是更快的H3
**H3 Max 是 fal 基于 MiniMax 开源视频模型 H3 进行后训练和推理优化的实时视频生成版本。**它的重点不是继续堆高分辨率或拉长单段视频,而是缩短每一段视频从输入条件到完成推理的时间,让模型能够进入直播、交互和在线服务场景。
**后训练是指在基础模型完成大规模训练后,再针对特定任务、数据分布或部署目标进行优化。**放到 H3 Max 上,这意味着模型不必从头训练,而是围绕短视频实时生成重新调整质量、速度与显存开销之间的平衡,再结合 fal 的推理系统压缩执行时间。
**吞吐量是单位时间内系统能够完成的生成任务数量。**fal 给出的约 35 倍吞吐量并不等同于所有用户都能获得 35 倍更低的端到端延迟,但它意味着同样一组计算资源可以更快地完成任务,或者在并发增加时维持更高的供给能力。
MiniMax 在 2026 年 7 月底发布 H3,并宣布开放模型;公开报道显示,H3 在三周内获得约 2400 万次下载。H3 本身更偏向商业级多模态创作,支持文本、图片、音频和视频输入,可输出最高 2K、最长 15 秒的音画内容,并覆盖视频编辑、动作迁移、品牌信息呈现等任务。
**H3 Max 对 H3 的取舍非常明确:用分辨率和部分控制能力换取实时速度。**标准版 H3 可以输出 2K,H3 Max 当前最高为 768p;H3 Max 支持首尾帧参考,但暂不具备标准版的主体参考模式。对于电影级后期和高分辨率广告母版,这些限制很明显;对于直播画面、信息流广告预览和互动内容,768p 往往已经够用。
| 对比项 | MiniMax H3 Max | MiniMax H3标准版 | |---|---|---| | 产品定位 | 实时、交互式短视频生成 | 商业级高质量视频创作 | | 典型生成速度 | 5秒视频模型侧不到3秒 | 公开对比中明显更慢 | | 相对吞吐量 | 约为H3服务的35倍 | 作为对比基准 | | 最高分辨率 | 768p | 2K | | 最长内容能力 | 当前重点是5秒短片段 | 最长15秒音画内容 | | 参考控制 | 支持首帧、尾帧参考 | 支持更完整的主体参考等能力 | | 更适合的场景 | AI直播、互动广告、动态剧情、实时预览 | 广告成片、电商素材、设计制作、视频编辑 | | 核心优势 | 延迟低、供给速度快 | 清晰度高、控制能力更完整 |
“3秒出片”需要拆开看
**H3 Max 的“不到 3 秒”主要指模型执行和推理基础设施侧的生成时间,不等于用户每次点击后都能在 3 秒内看到成片。**真实产品还要经过请求提交、任务调度、排队、文件编码、存储分发和网络传输,任何一个环节都可能增加延迟。
公开实测中,一段 5 秒视频从提交提示词到拿到最终文件约耗时 7 秒,其中包含任务通信、排队以及以 1 秒为间隔的状态轮询。这个结果并没有否定 3 秒推理,反而说明实时产品的下一个瓶颈已经从模型本身转移到了完整服务链路。
**端到端延迟是用户发出请求到最终结果可播放之间的总时间。**商业产品最终应当优化的是端到端延迟,而不是只展示 GPU 内部的推理耗时,因为用户感知不到模型在哪一步完成,只会感知按钮按下之后等待了多久。
**实时因子是生成耗时与内容播放时长的比值。**如果 5 秒视频在 3 秒内生成,实时因子就是 0.6;数值低于 1,意味着理论上可以在上一段播放结束前准备好下一段。按满负载理想情况计算,系统每分钟最多可生成约 20 个 5 秒片段,而连续播放每分钟只消耗 12 个片段,理论产能余量约为 1.67 倍。
这也是 H3 Max 最值得重视的数字。
**“生成比播放快”成立的前提,是队列、编码、传输和内容审核不会把总延迟重新推到 5 秒以上。**如果端到端仍需 7 秒,单路串行生成就无法持续供应无缝直播,产品需要通过预生成、并行任务、剧情分支缓存和播放缓冲来消化延迟。因此,3 秒代表实时商业化的入口,而不是一个已经解决所有工程问题的终点。
质量没有因为提速直接崩掉
**H3 Max 的价值不只是快,而是在显著提速后仍维持了可用的视频质量。**截至 2026 年 8 月底的公开榜单信息,H3 Max 在 Artificial Analysis 的带声音视频评测中,图生视频获得约 1202 Elo,位列第一;文生视频获得约 1235 Elo,排名第三,仅落后于 Wan 3.0 和 Gemini Omni Flash。相关报道还显示,它在 Design Arena 的图生视频项目中排名第一。
**Elo 是通过模型两两对战和用户偏好投票估算相对强弱的评分系统。**它适合反映“多数人更喜欢哪个结果”,但不能代替针对人物一致性、物理规律、文字准确率和品牌合规性的专项测试,而且榜单会随新模型、投票量与评测规则持续变化。
H3 Max 生成的样片已经能够维持较完整的主体结构、镜头运动和基本物理连贯性。在耳机广告测试中,系统分别生成地铁、健身房、书桌和户外等场景,再由 MiniMax Design 将多个片段组合成广告成片;与标准版 H3 相比,速度优势足以显著缩短素材试错周期。
**快速预览比一次生成最终成片更符合商业设计的真实流程。**广告团队通常不会只生成一次,而是会在构图、角色、运镜、产品露出和文案节奏上反复调整;如果单次等待从几分钟压到几秒钟,一小时内可验证的创意数量可能从个位数增加到几十个。
不过,768p 仍然限制了 H3 Max 直接交付高规格广告母版的能力。更现实的工作流是先用 H3 Max 快速探索创意和镜头,再将选中的方案交给 H3 标准版、超分辨率工具或传统后期流程完成最终制作。
真正的新场景是AI直播,而不是更快做广告
**AI 实时直播是指画面并非提前完整制作,而是在播放过程中根据观众输入持续生成后续视频。**fal 工程师 Rehan Sheikh 已经把 H3 Max 接入 Twitch,系统在播放当前片段时生成下一片段,从而形成理论上可以无限延续的“跨次元电视”。
fal 随后的 H3 Max Live 实验进一步允许观众在聊天室输入提示指令,几秒后让新的角色、场景或剧情要求进入画面。节目没有固定成片,也不必预先确定总时长,只要模型持续供给片段,内容就能继续演化。
**这种交互把观众从评论者变成了剧情输入端。**传统直播中的弹幕只能影响主播行为,H3 Max 这类系统则可以让弹幕直接改变世界观、镜头和角色,例如让侦探剧突然切换到太空站,让电商虚拟主播立即演示另一种商品使用场景,或者让游戏 NPC 根据玩家投票生成新的支线剧情。
一周内出现多个相似的 AI 直播实验,也说明这不是单个开发者的偶然创意。当基础能力跨过实时阈值,过去不成立的产品形态会自然出现,正如低延迟语音模型催生实时语音助手一样,低延迟视频模型也会催生原生的实时视觉应用。
商业化路径已经出现,但账还没有算完
**H3 Max 最直接的商业价值是提高创意迭代次数,而不是立即替代整条影视生产线。**广告、电商和游戏团队可以先把它用于脚本预演、分镜试拍、动态素材 A/B 测试以及个性化广告,再逐步进入面向消费者的实时内容。
可能最早落地的场景包括:
- **互动广告:**用户点击不同商品卖点后,系统即时生成对应使用场景,而不是跳转到固定视频。
- **电商展示:**同一件服装可按用户选择生成不同环境、动作和搭配预览。
- **游戏剧情:**NPC 根据玩家行为即时生成过场动画或支线片段。
- **虚拟直播:**弹幕决定角色、地点、画风和剧情走向,系统持续生成后续画面。
- **创意预演:**导演、设计师和品牌团队在会议中直接修改提示,几秒后查看动态方案。
- **个性化教育:**系统根据学习进度生成不同解释场景,让抽象知识变成即时演示。
**实时生成的成本模型与离线创作完全不同。**离线工具可以让用户等待并在失败后重试,直播系统则必须持续占用推理资源,还要为高峰并发、备用片段和安全审核保留余量;即使单段生成成本较低,连续运行数小时后的总成本仍可能很高。
作为参照,标准版 H3 的公开价格是 2K 视频每秒 0.8 元,生成 5 秒约需 4 元,生成 15 秒约需 12 元。H3 Max 的实时业务不能只比较单片价格,还要计算每小时内容成本、并发观众数、失败重生成率、审核开销以及 CDN 分发成本。只有当每小时综合成本低于互动广告收入、订阅收入或用户留存收益,实时视频才算真正成立。
**内容审核也会成为实时视频的硬约束。**预生成视频可以在发布前逐帧检查,实时生成则要求安全系统在几秒内识别违法内容、名人冒用、商标侵权和不适宜画面,同时不能让审核延迟破坏连续播放。对公开直播而言,安全分类器的速度和召回率可能与视频模型本身同样重要。
速度是不是护城河,要看能否变成系统能力
**单纯把某个模型跑快并不是长期护城河,因为量化、蒸馏、缓存和推理编译最终会被竞争对手跟进。**H3 Max 更重要的意义,是 MiniMax 的开放模型与 fal 的推理基础设施形成了联合优化:模型结构、后训练方法、调度系统和硬件执行不再各自独立。
这类协作可能成为视频模型竞争的新模式。过去行业主要比较清晰度、时长、指令遵循和人物一致性,接下来还会比较首帧延迟、每秒生成帧数、并发吞吐量、单位视频成本以及长时间运行稳定性。
**H3 Max 当前仍不是电影制作的全能模型。**它最高只有 768p,主体参考能力不如标准版 H3,短片段之间还可能发生角色外观、服装和空间关系漂移;连续直播更需要跨片段状态管理,而不是把大量独立的 5 秒视频简单拼接起来。
**下一阶段的关键问题是模型能否记住上一段发生了什么。**真正的互动剧集需要维护角色身份、道具位置、叙事目标和观众选择,并在几十分钟后保持一致;如果每 5 秒都重新抽取一次世界状态,直播很快就会退化为画面连贯但剧情随机的视觉万花筒。
OpenAI Hub判断:这是分水岭,但还不是终局
**H3 Max 是 AI 视频从“生成工具”迈向“交互媒介”的一次明确分水岭。**过去的视频模型首先解决能不能生成,再解决生成得像不像,现在开始解决内容能不能按用户节奏持续供应。
3 秒这个数字真正改变的不是剪辑师要等多久,而是产品经理可以设计什么。等待 3 分钟时,AI 视频只能是一个任务;等待 3 秒时,它可以成为一次对话、一条反馈,甚至成为实时界面的一部分。
**H3 Max 证明了实时 AI 视频已经具备技术可行性,但商业成立仍取决于端到端延迟、连续一致性、单位成本和安全审核。**如果 MiniMax 与 fal 能把 3 秒模型推理进一步变成稳定低于 5 秒的端到端交付,并解决跨片段记忆问题,AI 视频就不只是更便宜的内容生产工具,而会成为一种此前不存在的、由用户实时驱动的视频形态。
参考来源
- MiniMax 官方 GitHub 组织主页:用于核对 MiniMax 开放模型与相关项目动态。
- MiniMaxAI 在 Hugging Face 的组织主页:用于查看 MiniMax 开放模型、模型卡及版本信息。
- AI 视频行业技术与商业化进程梳理:补充视频生成模型演进、DiT 技术路线及行业应用背景。



