AI 快讯FLUX 3开放早测,直出20秒音视频
模型上新

FLUX 3开放早测,直出20秒音视频

2026-07-24T09:02:57.576Z
FLUX 3开放早测,直出20秒音视频

Black Forest Labs 推出 FLUX 3 早期体验版,以统一架构生成图像、视频和原生音频,单次最长20秒。首轮评测显示,它已进入一线视频模型竞争区间。

FLUX 终于不只做图片了

Black Forest Labs(以下简称 BFL)在 7 月 23 日开放 FLUX 3 Early Access,把 FLUX 系列从图像模型扩展成了同时处理图像、视频与音频的多模态基础模型。

**FLUX 3 是一个统一生成图像、视频和音频的多模态基础模型。**它不只是给原有图片模型外挂一个视频模块,而是在同一套架构中联合学习三种模态,支持单次生成最长 20 秒、带原生音频的视频。

截至 2026 年 7 月 24 日,FLUX 3 仍处于 Early Access 阶段。**Early Access 是正式全面开放前的受限体验阶段,意味着模型能力已经可以对外验证,但价格、吞吐、稳定性和产品接口仍可能调整。**BFL 目前没有在已公开信息中披露完整定价、详细参数规模、推理成本以及普遍可用时间表。

这次发布的真正看点不是“FLUX 也能做视频”,而是 BFL 试图让一个模型完成从画面构思、镜头运动到对白和环境声的整段生成。过去创作者往往需要先用图片模型确定角色,再交给视频模型做运动,最后调用语音、配乐和音效工具补齐声音;FLUX 3 的目标,是把这条流水线压缩为一次生成。

FLUX 3 同时生成图像、视频与原生音频的统一多模态架构示意图

一次生成20秒,声音不是后期拼上去的

**原生音频生成是指模型在生成视频画面的同时生成与场景对应的对白、环境声和其他声音,而不是在视频完成后独立配音。**这一点直接决定了人物口型、动作节奏、镜头切换和声音事件能否保持一致。

FLUX 3 当前公开的主要能力包括:

  • 文生视频:从文字描述直接创建视频和声音;
  • 图生视频:把静态图片扩展为带运动和音频的片段;
  • 视频生视频:根据已有视频改变视觉表现或内容;
  • 视频与音频续写:沿着输入素材继续生成后续内容;
  • 关键帧转视频:根据一个或多个关键画面补全中间运动;
  • 多语言对话:在视频中生成不同语言的角色对白;
  • 多镜头串联:在一次结果中组织多个镜头,而非只生成单一连续机位;
  • 图像生成与编辑:覆盖不同风格、宽高比和分辨率。

**单次最长 20 秒是 FLUX 3 相比短片段模型最醒目的产品指标。**20 秒仍不足以直接生成完整广告或剧情短片,却已经能容纳一个相对完整的叙事单元,例如人物进入房间、拿起物品、说出一句台词,再由镜头切换到产品特写。

20 秒也会明显放大视频模型的弱点。5 秒片段只要保证一个动作不崩即可,20 秒则要求角色身份、服装、空间关系、光线、物体状态和声音连续保持稳定;只要其中一个环节漂移,整段素材就可能失去商用价值。

**FLUX 3 的多镜头能力比单纯延长时长更值得关注。**一条 20 秒固定机位视频通常只是“会动的图片”,而多个镜头意味着模型需要理解景别变化、叙事顺序和跨镜头主体一致性。对于广告分镜、音乐视频和社交媒体短片,这种能力比单项画质跑分更接近真实生产需求。

不过,BFL 尚未公布多镜头条件下的角色一致性成功率,也没有披露 20 秒结果与官方用于评测的 10 秒结果之间存在多大质量差异。最长可生成时长是能力上限,不等于模型在该时长下始终维持最佳质量。

统一架构不是把三个模型塞进同一个网页

**统一多模态架构是指图像、视频和音频在共享模型体系中共同学习与生成,而不是由三个彼此独立的模型按顺序传递结果。**这种设计的价值,在于模型可以把“玻璃杯落地”同时理解为画面中的下落和破碎、时间轴上的碰撞节点,以及声音中的碎裂声。

BFL 表示,FLUX 3 基于 Self-Flow 框架扩展,并在 FLUX.1、FLUX.2 的基础上同步训练视频、图像和音频。Self-Flow 是一种自监督流匹配学习框架,用于让模型从数据本身构造学习信号,并学习从噪声状态向目标数据分布演化的生成过程。

流匹配可以粗略理解为给噪声中的数据规划一条连续变化路线。模型学习的不是逐个像素“猜下一步”,而是学习如何沿着一条速度场,把随机状态逐渐推向合理的图片、视频或音频结果。

**联合训练的优势是跨模态事件更容易共用同一条时间轴。**当提示词要求“角色关门后回头说话”,模型需要同时处理关门动作、撞击声、人物转身、口型和对白;如果视频与音频由两个完全独立的系统生成,任何一步时长变化都可能造成错位。

联合训练也不是没有代价。视频和音频的数据规模、质量标准与表示方式差异很大,同一模型既要保持 FLUX 系列原有的图像细节,又要学习连续运动和声音同步,训练复杂度会迅速上升。BFL 没有公布参数规模、训练数据构成和计算量,因此目前还无法判断 FLUX 3 的统一架构在成本上是否优于多个专用模型组合。

对 Grok 胜得明显,对另外两家只领先一点

**FLUX 3 在官方披露的人工偏好评测中已进入头部视频模型区间,但还没有形成压倒性优势。**测试对象是带声音的 10 秒、720p 视频,比较指标为人工评测胜率。

| 对比模型 | 测试规格 | FLUX 3胜率 | 结果解读 | |---|---:|---:|---| | Grok Imagine Video | 10秒、720p、带声音 | 69% | 优势较明显,每100组比较约有69组更受评审偏好 | | Seedance 2.0 | 10秒、720p、带声音 | 52% | 接近五五开,仅领先4个百分点的对称胜率中线 | | Gemini Omni Flash | 10秒、720p、带声音 | 52% | 同样处于统计意义需要更多信息才能判断的微弱领先 |

**69% 对 31% 是足以引起注意的偏好差距,而 52% 对 48% 更接近同一梯队内的拉锯。**如果没有样本量、评审人数、提示词集合和置信区间,不能把 52% 解读为确定性的模型领先。

官方评测还有两个必须注意的限制。第一,评测采用 10 秒视频,并未直接验证 FLUX 3 最具宣传价值的 20 秒模式;第二,输出分辨率是 720p,尚不足以证明模型在更高分辨率下依然保持同样的动作稳定性和声音同步质量。

**人工偏好胜率衡量的是评审更喜欢哪一个结果,而不是对所有能力的完整测量。**它可能同时受到画面美感、运动自然度、提示词遵循、对白质量和音画同步影响,却无法告诉开发者模型究竟在哪一项上获胜。

因此,FLUX 3 的首轮成绩应该被理解为“具备正面竞争能力”,而不是“全面超越竞品”。尤其是 Seedance 2.0 与 Gemini Omni Flash 的 52% 对比结果,说明头部模型之间的差异正在缩小,最终选择很可能取决于可控性、生成速度、价格和工作流集成,而不只是样片观感。

FLUX 3与现有产品路线有何不同

**FLUX 3 的差异化路线是用一个基础模型横跨图片创作、视频生成和声音合成。**目前不少视频产品也能输出声音,但是否统一训练、能否理解输入音频并续写,以及是否同时保留成熟的图像编辑能力,决定了它们是不是同一类产品。

| 维度 | FLUX 3 | Grok Imagine Video | Seedance 2.0 | Gemini Omni Flash | |---|---|---|---|---| | 当前发布状态 | Early Access | 已纳入官方对比 | 已纳入官方对比 | 已纳入官方对比 | | 官方对比规格 | 10秒、720p、带声音 | 同规格 | 同规格 | 同规格 | | 相对FLUX 3人工评测结果 | 基准模型 | FLUX 3胜率69% | FLUX 3胜率52% | FLUX 3胜率52% | | FLUX 3已公布的最长单次输出 | 20秒 | 本次资料未披露 | 本次资料未披露 | 本次资料未披露 | | 图像生成与编辑 | 支持 | 本次资料未披露 | 本次资料未披露 | 本次资料未披露 | | 视频和音频续写 | 支持 | 本次资料未披露 | 本次资料未披露 | 本次资料未披露 | | 公开价格 | 尚未披露 | 本次资料未披露 | 本次资料未披露 | 本次资料未披露 |

这张表不能用来判断谁的绝对能力最强,因为 BFL 只公布了有限的成对偏好数据。它更能说明 FLUX 3 的产品定位:BFL 不想只在文生视频榜单上追赶,而是要把自己在图像生成上的基础扩展成完整媒体模型。

**FLUX 3 对创作者最直接的价值是减少工作流断点。**以一条 15 秒产品广告为例,传统流程可能需要图片模型出主视觉、视频模型做镜头、语音模型生成台词,再通过剪辑软件对齐音效;统一模型如果能一次处理角色、镜头和声音,试错轮次和素材搬运次数都会减少。

但统一不等于可控。商业制作更在意局部修改能力,例如只替换一句台词、保留人物表演,或者只调整背景音乐而不重生成画面。BFL 已确认模型支持图像编辑和多种视频条件输入,但尚未完整说明是否提供音轨级编辑、镜头级重生成和精确时间控制。

从内容生成走向机器人预测

**机器人行为预测模型是根据视觉、声音和历史动作,预测机器人或环境下一步状态的模型。**BFL 正与 Mimic Robotics 合作,研究将 FLUX 3 用于机器人行为预测,这让它具备了从内容工具向世界模型方向延伸的可能性。

视频生成与机器人预测在技术上存在相通之处。视频模型要预测“下一帧会发生什么”,机器人模型则要预测“执行这个动作后,环境会如何变化”;两者都需要理解物体运动、接触关系、时间连续性和因果结果。

**音频加入后,模型还能利用画面之外的反馈信号。**例如机械臂抓取物体时,碰撞声、摩擦声或电机声音都可能帮助模型判断动作是否成功。对于被遮挡的场景,声音有时比单帧视觉更早暴露异常。

机器人方向目前仍属于研究合作,而非可交付产品。BFL 没有公布机器人任务成功率、仿真测试结果或真实硬件部署数据,因此不能因为模型会生成视频,就直接推断它已经具备可靠的物理理解能力。生成一个看起来合理的动作,与在真实世界中安全执行动作,是两套不同的验收标准。

FLUX 3现在值得用吗

**FLUX 3 值得视频模型开发者和专业创作者尽早测试,但还不适合仅凭官方数据替换现有生产管线。**它最有吸引力的部分,是 20 秒原生音视频、多镜头组织、输入视频与音频续写,以及 FLUX 系列已有的图像生成和编辑基础。

首批测试应该重点观察以下问题:

  1. **20秒一致性:**人物面部、服装、手部和道具能否从头保持到尾;
  2. **音画同步:**对白口型、撞击声和镜头事件是否准确对齐;
  3. **多镜头连续性:**切换景别后,角色身份和空间关系是否漂移;
  4. **提示词遵循:**复杂动作顺序和多语言对白是否按要求执行;
  5. **可编辑性:**局部错误能否修正,而不是整段重新抽卡;
  6. **生成成本:**20秒带声音视频的价格、等待时间与失败重试成本;
  7. **商业可用性:**训练数据、生成内容授权和安全策略是否足够清晰。

**FLUX 3 目前最大的未知数不是画质,而是成本与可控性。**视频生成进入 20 秒后,单次失败的代价明显高于图片生成;如果每次修改台词或镜头都要完整重算,统一模型节省下来的工具切换成本,可能又会被重生成成本抵消。

BFL 也需要证明 FLUX 3 不会因追求“全都能做”而牺牲单项能力。FLUX 系列此前的品牌认知主要来自图像质量,如果 FLUX 3 的视频和音频能力只是追平竞品,却让图片编辑变慢或变贵,它就更像产品线扩张,而不是基础架构升级。

结论:一场从图片模型到媒体模型的跃迁

**FLUX 3 是 BFL 从图像模型公司转向统一媒体模型公司的关键一步。**单次最长 20 秒、原生音频、多镜头、视频与音频续写,让它覆盖了从静态视觉到连续叙事的主要生成任务。

现阶段最可靠的判断是:FLUX 3 对 Grok Imagine Video 的官方偏好优势较明显,但与 Seedance 2.0、Gemini Omni Flash 基本处于同一竞争区间。它的架构方向值得关注,实际领先幅度仍需等待独立评测、20 秒样本、生成速度和价格数据验证。

如果 BFL 能把 FLUX 在图像领域积累的质量与编辑能力迁移到视频,并让声音真正参与场景推理,而不是只负责填充背景音,FLUX 3 会成为少数能覆盖完整内容生产链的基础模型。反过来,如果 20 秒模式的一致性不稳、局部编辑能力不足或成本过高,那么“统一生成”仍会停留在展示效果,而不是生产效率。

参考来源

相关推荐

查看全部