AI 快讯Wan3.0上线,一次生成30秒
模型上新

Wan3.0上线,一次生成30秒

2026-08-24T05:03:12.551Z
Wan3.0上线,一次生成30秒

阿里视频生成模型 Wan3.0 今日结束公测并正式上线,单次生成时长提升至 30 秒,新增 doc、xls、ppt、pdf、md 文档输入,1080P 标准价格为每秒 1.2 元。

Wan3.0 正式上线,一次生成 30 秒视频

阿里云今天正式上线视频生成模型 Wan3.0,核心变化是单次视频生成时长提高至 30 秒,并把输入范围从文本、图片、音频和视频扩展到了 doc、xls、ppt、pdf、md 等文档格式。距离 8 月 6 日开启公测仅过去十余天,这次上线也意味着 Wan3.0 从限量验证走向阿里云百炼、万相、千问等产品的规模化供应。

**Wan3.0 是阿里推出的新一代多模态视频生成模型,能够根据文本、图像、音频、视频或文档素材生成最长 30 秒的视频。**按照阿里云披露的信息,模型在这十余天公测期内继续调整了指令遵循、跨镜头一致性、音频质感和视频编辑能力,但官方暂未给出可复现的公开基准、盲测胜率或与上一代模型的量化对比。

这不是一次单纯的“时长加倍”式更新。30 秒单次生成和文档直接输入放在一起看,阿里瞄准的已经不只是 AI 短片,而是教学课件、商品介绍、业务汇报和营销物料等更接近生产环节的内容。

Wan3.0 正式上线海报,突出单次生成 30 秒、文档输入和多模态参考能力

30 秒的价值,是少拼接而不是数字更大

**单次生成 30 秒视频意味着模型可以在一次推理中处理更长的动作、运镜和叙事关系。**对视频模型而言,时长并不是简单地多生成一些帧,因为人物身份、服装、道具位置、光照方向、镜头运动和音画节奏都要在时间轴上持续成立;视频越长,累计错误通常越明显。

过去的短片生产往往要把一条 20 至 30 秒的视频拆成多个片段,再通过首尾帧、参考图和后期剪辑拼起来。这个流程的问题不是“麻烦一点”,而是每多生成一个片段,就多一次人物变脸、服装变化、空间跳跃或运动断裂的机会。

Wan3.0 把单次时长拉到 30 秒后,一段商品演示、知识讲解或剧情对话有机会在一次生成中完成。比如一个人物走进房间、拿起桌上的产品、对镜头讲解并完成特写,原本可能需要四五个独立镜头,现在可以交给同一条生成任务处理,模型因而能看到更完整的上下文。

**跨镜头一致性是指人物、物体、场景和视觉风格在镜头切换后仍保持连续的能力。**阿里称正式版进一步改善了这项能力,但“支持 30 秒”不等于“任意 30 秒都稳定”,尤其是多人互动、复杂手部动作、大幅遮挡和高速运动,仍然是视频生成模型最容易暴露问题的场景。

这次升级更值得关注的地方,是模型开始尝试决定视频该有多长。Wan3.0 提供智能时长能力,可根据提示词推荐合适时长;它也支持视频延长,用已有片段继续拓展故事。前者减少用户反复试探 5 秒、10 秒还是 20 秒的成本,后者则给超过 30 秒的内容留下了继续生成的入口。

文档输入比 30 秒更接近生产力工具

**文档输入是指模型能够读取办公文件中的文字、图片、表格或页面结构,并据此规划和生成视频。**Wan3.0 首次支持 doc、xls、ppt、pdf、md 五类文档格式,这使它不再要求用户先把材料手工改写成一段提示词。

文档直接转视频的实际价值,是把“理解资料”和“制作画面”放进同一条工作流。一个 20 页的产品方案可以变成演示短片,一份教学课件可以转成课程预告,一张表格可以用于生成动态图表,一份业务报告也可以被整理成适合会议播放的视频摘要。

传统的文档转视频流程通常包含四步:

  1. 人工阅读并提炼文档;
  2. 把内容改写成分镜脚本和旁白;
  3. 为每个镜头寻找素材或生成画面;
  4. 添加配音、字幕、转场并完成剪辑。

Wan3.0 想做的是压缩这四步之间的人工交接,但它并不会自动解决所有问题。文档里的数字是否被准确读取、表格关系是否被正确解释、重点是否符合作者意图,以及生成画面有没有擅自补充事实,仍然需要用户逐项检查。

**文档输入目前更适合作为视频初稿生成器,而不是无需审核的自动发布系统。**特别是在财务报表、医疗资料、法律文件和技术参数等高准确性场景中,一个错误的小数点或单位就可能改变整条视频的含义;模型生成得越顺滑,人工反而越容易忽略其中的事实错误。

阿里尚未详细披露 Wan3.0 对不同文档的页数上限、文件大小限制、表格解析边界、演讲者备注处理方式,以及扫描版 PDF 的 OCR 能力。对企业开发者而言,这些限制将直接决定文档输入到底能覆盖完整生产流程,还是只适合结构简单的演示材料。

“全能参考”解决的是可控性

**全能参考是指模型同时利用角色、道具、场景、风格、动作、音频或已有视频作为生成约束。**Wan3.0 支持文本、图片、音频、视频和文档输入,目标不是只让画面更精致,而是让用户能更明确地规定“谁出现、在哪里、以什么风格、说什么、怎么运动”。

视频模型真正进入商业制作的门槛一直是可控性,而不只是单条样片的视觉冲击力。广告主需要商品外观不变,短剧团队需要同一角色在不同镜头中保持身份,教育内容需要图表和讲解对应,品牌方则要求颜色、字体和视觉风格不能随机漂移。

Wan3.0 宣称可以复刻角色、道具、场景和风格等关键维度,并在人像生成中呈现不同人物的五官、皮肤细节与复杂情绪。这类能力如果能稳定落地,会比偶尔生成一条“电影感大片”更有商业价值,因为生产团队关心的是连续交付,而不是抽卡式的最佳案例。

**真实世界还原是指生成视频在人物差异、物理运动、光影和空间关系上接近真实拍摄。**阿里强调 Wan3.0 要做到人物“千人千面”,这实际上是在处理视频模型常见的平均脸和群像同质化问题;但目前没有公开人像相似度、物理一致性或人工偏好测试数据,因此这部分仍主要来自官方描述。

正式版补的是连续性、声音和编辑

**正式版与 8 月 6 日公测版的主要差别,是指令遵循、跨镜头一致性、音频质感和视频编辑能力继续迭代。**阿里称 Wan3.0 在十余天公测期间以天为单位更新,不过没有公布具体版本号、单项性能增幅或失败率变化。

指令遵循决定模型有没有按要求完成镜头,而不是只生成一条视觉上不错但内容跑偏的视频。对于包含多个动作和时间顺序的提示,例如“人物先看向窗外,随后转身拿起桌上的红色杯子,最后镜头推近杯身标识”,长视频模型需要同时理解动作顺序、对象属性和运镜要求。

音频质感则决定生成内容能否直接进入社交媒体和营销场景。画面、台词、环境声和节奏如果需要分别生成再对齐,30 秒带来的效率提升会被后期工作抵消;但官方目前没有说明支持的语言范围、说话人数量、口型同步指标或音频采样规格,因此还不能只凭“音频质感提升”判断成片可用率。

视频编辑能力是 Wan3.0 从生成模型走向创作系统的另一个信号。模型支持修改画面、剧情与台词,这意味着用户不必因为一句台词或一个局部元素不满意,就把整条 30 秒视频完全重做;不过局部修改后能否保持其他内容不变,仍是需要实际测试的关键指标。

1080P 生成 30 秒,标准价格为 36 元

**Wan3.0 按输出分辨率和视频秒数计费,480P、720P、1080P 的标准价格分别为 0.3 元、0.6 元和 1.2 元每秒。**从 2026 年 8 月 24 日至 9 月 23 日,阿里云百炼和千问 AI 平台提供限时 7 折优惠,即按标准价格的 70% 计费。

| 输出规格 | 标准价格 | 7 折价格 | 生成 10 秒标准成本 | 生成 30 秒标准成本 | 生成 30 秒优惠成本 | |---|---:|---:|---:|---:|---:| | 480P | 0.3 元/秒 | 0.21 元/秒 | 3 元 | 9 元 | 6.3 元 | | 720P | 0.6 元/秒 | 0.42 元/秒 | 6 元 | 18 元 | 12.6 元 | | 1080P | 1.2 元/秒 | 0.84 元/秒 | 12 元 | 36 元 | 25.2 元 |

这个价格不能只看单次成片成本,还要乘以重试次数。假设一条 30 秒的 1080P 视频平均需要生成 4 次才能选出可用版本,标准生成成本就是 144 元,优惠期为 100.8 元;这还没有计入人工审核、脚本调整和后期剪辑。

**30 秒能力有可能降低拼接成本,却也会放大失败生成的损失。**一条 5 秒片段出现错误,浪费的是几秒算力;一条 30 秒视频在最后几秒出现人物变形或台词错误,用户可能需要重新生成整段。因此,局部编辑和续写是否可靠,最终会比标称最长时长更影响实际成本。

Wan3.0 已覆盖阿里内部多个入口

**Wan3.0 今天已经在阿里云百炼、万相官网、万镜一刻、千问 AI 平台、千问创作 PC 端、千问 App、堆友和 IF STUDIO 提供体验。**这套分发方式同时覆盖了开发者、普通用户、设计师和视频创作者,也说明阿里并不打算把 Wan3.0 只做成云端模型接口。

| 使用入口 | 更适合的用户 | 主要使用方式 | |---|---|---| | 阿里云百炼 | 开发者、企业团队 | 集成到业务系统或批量内容流程 | | 万相官网 | 普通创作者 | 直接生成和尝试视频能力 | | 万镜一刻 | 视频制作团队 | 面向镜头与成片创作流程 | | 千问 AI 平台、千问创作 PC 端、千问 App | 办公与内容用户 | 从对话、写作和资料出发生成视频 | | 堆友、IF STUDIO | 设计师与视觉创作者 | 结合素材和设计工作流创作 |

外部生态也已经开始接入 Wan3.0。官方披露的合作方包括麦芽旗下跳跃视界、Deevid、剧火、京东灵境平台、美图和井萌,这能帮助模型进入电商、营销、影像处理与短剧生产等垂直场景。

广泛接入并不等同于真实生产规模已经形成。后续更值得观察的数据包括日均生成量、平均重试次数、30 秒任务占比、文档转视频的使用率,以及企业客户最终保留并发布生成内容的比例。

阿里把视频模型从“镜头工具”推向“内容流水线”

**Wan3.0 最重要的方向变化,是把视频生成的输入端向办公文档延伸,把输出端从单镜头延伸到 30 秒叙事。**这两项能力组合后,一份资料可以直接进入脚本规划、画面生成、声音合成和视频编辑链路,模型开始承担过去由多个软件和多个岗位共同完成的中间工作。

这条路线对阿里尤其合理,因为它同时拥有云平台、办公与对话入口、电商场景以及视觉创作社区。模型可以在百炼中服务企业流程,也可以在千问中接住普通用户的文档,再通过万相、万镜一刻和堆友覆盖创作环节。

Wan3.0 当前的短板是公开评测信息不足。官方给出了最长时长、输入格式和价格,却没有给出视频生成速度、并发限制、最大文件大小、不同任务成功率、与上一代模型的盲测数据,以及文档事实准确率等开发者真正关心的指标。

**对个人用户而言,Wan3.0 已经值得用来制作产品介绍、课程预告、汇报摘要和 30 秒以内的社交视频。**对企业用户而言,更稳妥的方式仍是把它放在有人审核的生产流程中,让模型完成初稿和素材生成,而不是直接把包含业务数据的文档自动变成对外发布内容。

判断:30 秒是门槛,文档输入才是差异点

**Wan3.0 的 30 秒生成能力解决了“能不能讲完一件事”,文档输入则决定它能否进入真实工作。**前者让视频模型摆脱只生成单个漂亮镜头的局限,后者把大量已经存在于企业和个人电脑里的资料变成了可直接消费的输入。

这次正式上线仍不意味着 AI 视频已经可以替代完整制作团队。长视频的一致性、复杂动作、多人对话、事实准确性和局部修改稳定性,都会决定最终可用率;在官方发布更透明的基准之前,用户需要把“支持”与“稳定完成”区分开来。

但从产品方向看,Wan3.0 的升级是有效的。视频模型下一阶段的竞争不会只围绕画面是否足够惊艳,而会转向谁能读懂已有资料、保持角色与商品一致、用更少重试产出可编辑成片,并以可预测的成本接入内容流水线。

参考来源

相关推荐

查看全部