AI 快讯Wan3.0公测,文档也能生视频
模型上新

Wan3.0公测,文档也能生视频

2026-08-06T15:04:17.361Z
Wan3.0公测,文档也能生视频

阿里新一代视频生成模型 Wan3.0 于 8 月 6 日开启公测,单次可生成 30 秒视频,并首次支持 PDF、PPT、表格等文档输入。它瞄准的不只是镜头生成,而是从办公素材到完整视频的多模态生产流程。

阿里在今天(2026 年 8 月 6 日)晚间宣布,新一代视频生成模型 Wan3.0 正式开启公测。此次升级最值得关注的并不是单项画质参数,而是两个直接改变工作流的能力:单次视频生成时长提高到 30 秒,以及把 doc、xls、ppt、pdf、md 等文档纳入输入范围。

**Wan3.0 是阿里万相体系面向长时叙事与多模态内容生产的新一代视频生成模型。**截至 8 月 6 日晚,该模型已经在阿里云百炼、万镜一刻、万相官网和千问创作 PC 端开放公测,并在千问 App 灰度开放;相关 API 尚未全量开放,阿里给出的时间表是“近期”。

Wan3.0 公测界面,展示文本、图片、音频、视频及 PDF、PPT、表格等输入入口

从 15 秒到 30 秒,变化不只是数字翻倍

**30 秒单段生成意味着视频模型开始从“做镜头”转向“做段落”。**此前万相 2.6 的典型生成案例集中在 15 秒左右,已经可以通过分镜提示词安排多个镜头;Wan3.0 把单次时长推到 30 秒后,创作者能够在同一生成任务中容纳铺垫、动作发展、情绪变化和收束,而不必把每个动作拆成独立片段再剪辑。

**长时生成真正困难的部分是连续一致性,而不是多算 15 秒。**视频长度翻倍后,角色五官、服装、道具位置、镜头轴线、光照方向和动作因果都要保持稳定,任何一个维度在中途漂移,都会让成片出现明显断裂。例如,一个人物从室内拿起产品、走到窗边并转身介绍功能,模型不仅要记住人物是谁,还要记住产品握在哪只手、窗户位于哪个方向,以及前后镜头是否遵守同一空间关系。

**Wan3.0 对 30 秒的产品定位是支持连续运镜、一镜到底和完整情节表达。**这比简单拼接两个 15 秒片段更有价值,因为多个独立片段即使分别可用,也常常会在角色长相、构图、色温和运动节奏上产生跳变。单段生成至少让模型有机会在统一的时空表示中处理整个叙事,不过最终稳定性仍需更多公开样片和用户压力测试验证。

**智能时长是 Wan3.0 用来降低试错成本的新功能。**用户不必固定选择 5 秒、10 秒或 30 秒,系统可以根据提示词推荐合适时长;如果剧情没有说完,还可以使用视频延长功能继续扩展。这种设计比一律生成最长视频更实际,因为视频生成的时间与费用通常随输出时长增长,产品口播未必需要 30 秒,一个转场镜头也可能只需要 4 至 6 秒。

文档输入,才是这次升级的分水岭

**文档生视频是指模型读取文档中的文本、结构、表格或页面信息,并据此组织视频内容。**Wan3.0 在文本、图片、音频和视频四类基础模态之外,首次支持 doc、xls、ppt、pdf、txt、key、pages、numbers 和 md 等文件格式,同时允许输入文件或链接。

**Wan3.0 当前每次最多接收一个文件或一个链接。**文件大小上限为 100MB,页数上限为 50 页,这说明它面向的是单份方案、报告、课件或产品资料,而不是一次吞入整个企业知识库。对开发者和企业用户来说,这一限制很关键:如果源材料分散在多份文件中,仍需先进行合并、摘要或内容编排。

| 输入能力 | Wan3.0 可处理的内容 | 典型用途 | 当前约束 | |---|---|---|---| | 文本 | 提示词、脚本、分镜描述 | 广告短片、剧情视频、概念片 | 效果依赖描述完整度 | | 图片 | 人物、商品、场景和风格参考 | 商品展示、角色短片 | 需重点验证多角度一致性 | | 音频 | 音色、语速及声音参考 | 口播、表演、音乐视觉化 | 音画同步效果需实测 | | 视频 | 动作、运镜、表演和时序参考 | 动作迁移、风格复刻 | 长视频参考的处理规则尚待公开 | | 文档 | PDF、PPT、Word、表格、Markdown 等 | 课件、汇报、动态图表、产品演示 | 单个文件或链接,100MB、50 页以内 |

**文档输入把视频生成模型拉进了办公内容生产链。**过去把一份产品白皮书变成视频,通常要经过提炼要点、撰写脚本、设计分镜、制作图表、生成旁白和剪辑合成等步骤;Wan3.0 试图把前几步压缩到一次任务中,让用户上传 PDF 或 PPT,再通过提示词指定受众、时长、风格和讲述重点。

**最现实的落地场景不是电影,而是高频、标准化的信息视频。**一份销售方案可以被改造成客户演示,一份培训文档可以生成带讲解的课程片段,一张季度数据表可以转成动态图表,一份新品资料可以变成电商介绍视频。这些任务对“每一帧都惊艳”的要求不如影视制作高,却高度看重信息完整、数字准确、品牌元素稳定和批量生产效率。

**文档生视频也比文生视频更容易暴露事实错误。**如果模型把表格中的 23.6% 读成 26.3%,或者遗漏 PPT 中的限制条件,成片即使视觉效果出色也不可交付。因此,Wan3.0 是否能成为真正的生产力工具,取决于三个可验证指标:文档要点覆盖率、数字与专有名词准确率,以及画面、字幕和旁白之间的一致率。

**阿里目前没有公开文档理解准确率或相关基准测试成绩。**在缺少公开评测的情况下,“万物皆可生视频”更适合被理解为产品覆盖面的宣传,而不是已经被证明的能力上限。涉及财务数据、医疗说明、合同条款或对外业务汇报时,人工审核仍然不可省略。

全能参考要解决的,是生成视频最贵的返工问题

**全能参考是 Wan3.0 根据图片、音频、视频等素材保持角色、道具、声音、空间关系和视觉风格一致的能力。**阿里称模型能够稳定保留人物的五官、发型发色、形体、服装和配饰,也能够复刻商品 Logo、材质、硬件结构及多角度外观。

**一致性直接决定 AI 视频能否从演示样片进入商业项目。**一条 30 秒广告如果在第 18 秒改变了商品按钮数量,或者让品牌 Logo 发生变形,前面生成得再好也必须返工。对短剧来说,角色换脸、服装漂移和场景布局变化同样会破坏叙事连续性,而且时长越长,错误累积的概率越高。

**Wan3.0 还把人物“去模板化”列为重点升级方向。**官方对文生视频人像的描述是“千人千面”,强调五官与皮肤细节、克制的情绪表达,以及微表情和肢体动作的联动;在群像场景中,模型也需要让不同人物呈现不同情绪,而不是所有人共享同一套微笑或惊讶表情。

**人像自然度仍然不能只靠精选案例判断。**万相 2.6 的公开体验已经能够完成多人表白等连续情节,并让动作、嘴型和声音基本对应,但多人表演仍会出现较明显的 AI 感。Wan3.0 是否真正改善了这一点,需要观察侧脸、遮挡、快速转身、多人交互、手部接触和长对白等高难度场景,而不是只看正面慢动作特写。

Wan3.0 相比前代,路线越来越清晰

**万相视频模型的迭代主线已经从基础生成走向可控创作。**Wan2.6 强化了多镜头和角色表现,Wan2.7 将能力扩展到文生视频、图生视频、参考生视频和视频编辑,Wan3.0 则进一步增加 30 秒单段生成和文档输入,开始覆盖从信息理解到视频表达的上游环节。

| 模型代际 | 公开能力重点 | 典型时长或形态 | 产品角色 | |---|---|---|---| | Wan2.6 | 多镜头控制、角色替换、音画一致性 | 公开案例多为 15 秒叙事视频 | 从单镜头生成走向表演与分镜 | | Wan2.7 | 文生、图生、参考生视频与视频编辑 | 覆盖视频创作和编辑链路 | 从“演”进一步走向“导” | | Wan3.0 | 30 秒生成、智能时长、视频延长、文档输入、全能参考 | 单段最长 30 秒 | 从视频素材生成走向多模态内容生产 |

**Wan3.0 的差异化不在于单纯追求更长,而在于把输入端做得更宽。**多模态输入已经是视频生成产品的共同方向,文本和图片只能提供“想拍什么”,音频与视频参考能够补充“怎么演、怎么动”,文档则提供“具体讲什么”。当这几类输入被放进同一条工作流,视频模型就不再只是视觉渲染器,而开始承担内容策划、信息组织和表达转换的职责。

**这种路线也让 Wan3.0 更接近企业内容工具,而非纯粹的创作者玩具。**企业已经积累了大量 PPT、产品手册、培训材料、销售表格和 Markdown 文档,这些现成资产不需要重新编写,只需要转换成适合传播的视频。阿里的云服务、办公协作与电商业务具备天然素材入口,文档生视频因此也具有明显的生态协同价值。

30 秒视频最低 9 元,1080P 一次 36 元

**Wan3.0 公布了按输出秒数计算的 API 价格。**480P、720P 和 1080P 的价格分别为 0.3 元/秒、0.6 元/秒和 1.2 元/秒,因此一段完整 30 秒视频的理论生成费用分别为 9 元、18 元和 36 元。

| 输出规格 | 单价 | 10 秒成本 | 15 秒成本 | 30 秒成本 | |---|---:|---:|---:|---:| | 480P | 0.3 元/秒 | 3 元 | 4.5 元 | 9 元 | | 720P | 0.6 元/秒 | 6 元 | 9 元 | 18 元 | | 1080P | 1.2 元/秒 | 12 元 | 18 元 | 36 元 |

**实际项目成本通常会显著高于单次生成价格。**如果一条 30 秒的 1080P 视频需要生成 5 次才能选出可用版本,基础生成成本就是 180 元;如果还要重做局部镜头、延长剧情或生成不同画幅,费用会继续增加。因此,智能时长和参考一致性并非锦上添花,它们直接影响每条可交付视频的综合成本。

**分辨率也不等于最终画质。**1080P 只代表输出尺寸,不保证人物细节、文字渲染、运动稳定性和物理规律一定优于低分辨率版本。团队在批量生产时更合理的流程,是先使用较低规格验证脚本、构图和节奏,再把确定的方案生成高分辨率版本,而不是从第一轮就为所有候选片段支付最高价格。

Wan3.0 现在适合谁用

**Wan3.0 当前最适合拥有现成内容资产、但缺乏视频制作产能的团队。**教育培训团队可以把课件变成微课,产品团队可以把功能文档变成演示视频,电商团队可以结合商品图和卖点表制作介绍片,企业市场部门则可以把报告、活动方案和品牌素材转换成不同版本的传播内容。

**专业影视团队更适合把 Wan3.0 当作预演和素材工具,而不是直接替代完整制作流程。**30 秒单段生成可以用于概念预览、分镜验证、氛围测试和提案样片,但角色连续性、复杂物理交互、精准台词和可重复编辑仍是专业交付的硬门槛。模型能否让同一镜头稳定复现,也是决定其是否适合工业流程的重要指标。

**开发者目前仍需注意公测与全面可用之间的差距。**截至 8 月 6 日,Wan3.0 已在多个阿里产品入口开放体验,但 API 仅宣布将于近期全量开放,具体模型标识、并发限制、生成参数、失败重试规则和服务保障仍应以正式文档为准。对准备接入生产系统的团队来说,现在更适合先评估效果和成本,不宜根据公测界面直接推断正式服务能力。

判断:这不是一次常规的画质升级

**Wan3.0 最重要的信号是视频模型正在吞并内容生产的上游环节。**过去模型接收一句提示词,负责生成几秒视觉素材;现在它开始读取一份 50 页以内的文档,理解其中的结构和重点,再决定视频要讲什么、讲多久、如何分镜以及采用什么风格。

**文档输入比 30 秒时长更可能成为 Wan3.0 的长期竞争力。**生成时长会被同行持续追平,分辨率也会随着算力和模型进步不断提高,但能否把企业已有的文档、表格、图片、视频和声音组织成稳定可控的成片,决定了模型能否进入真实业务流程。

**Wan3.0 目前仍缺少足够公开数据证明其稳定性。**阿里尚未公布长视频一致性、文档数字准确率、指令遵循率、生成速度和失败率等量化指标,因此现阶段可以确认的是能力边界明显扩展,而不是质量问题已经被彻底解决。

**这次公测值得开发者关注,但更值得用真实材料进行压力测试。**最有效的测试方式不是输入一段漂亮的电影描述,而是上传一份包含表格、品牌名、多个产品参数和明确叙事要求的真实文档,检查模型是否漏掉关键事实、是否篡改数字、是否保持角色与商品一致,以及一条可交付视频究竟需要生成多少次。

参考来源

相关推荐

查看全部