AI 快讯Seedance 2.5发布,直出30秒
模型上新

Seedance 2.5发布,直出30秒

2026-07-31T06:05:13.172Z
Seedance 2.5发布,直出30秒

字节跳动正式发布Seedance 2.5,单次视频生成时长由15秒提升至30秒,并支持多轮延长及最多50份多模态参考素材。它解决的不只是时长问题,更是AI视频长期缺失的连续叙事与制作可控性。

字节跳动正式把AI视频拉到30秒

字节跳动在7月31日正式发布新一代视频创作模型Seedance 2.5,并开始陆续将其上线即梦AI、豆包专业版等平台。按照官方公布的计划,Seedance 2.5的API服务也将在近期接入火山方舟,但截至目前,具体开放时间、调用价格、生成分辨率档位及并发限制尚未公布。

Seedance 2.5是一款采用多模态音视频联合生成架构的视频创作模型,能够在同一生成过程中统筹画面、人物动作、镜头变化、对白、环境声与音效。与只负责生成连续画面的传统视频模型相比,音视频联合生成的关键价值是让声音参与叙事,而不是在视频完成后再机械地补上一条音轨。

这次更新最直接的变化,是单次视频生成时长从Seedance 2.0的15秒提升至30秒,时长增加100%。30秒看起来仍然不像“长视频”,但对于当前的生成式视频而言,它已经足以容纳一次完整的场景建立、人物行动、冲突变化和结果交代。

Seedance 2.5生成的30秒多镜头叙事视频示意图,展示后台、通道、舞台与体育馆全景的连续转换

30秒的意义不只是数字翻倍

长叙事能力是模型在较长时间轴内维持角色、场景、动作因果和镜头逻辑,并让内容形成完整叙事结构的能力。AI视频过去擅长制造几秒钟的“惊艳瞬间”,却很难解释人物为什么来到这里、接下来做了什么,以及一个动作如何产生后续结果。

Seedance 2.5试图把视频生成从“做一个镜头”推进到“完成一段创作”。官方称,模型可以在30秒内组织多个具有逻辑关联的镜头,让内容按照铺垫、推进、转折和收尾展开,而不只是生成一段持续运动但没有情节发展的动态画面。

官方展示的歌手登台案例很好地说明了这种变化。镜头先从红色幕布的缝隙进入后台化妆间,随后拍到歌手整理耳机、工作人员提醒登台、歌手穿过通道并与舞伴互动,最后接过麦克风走上舞台,画面再拉远到体育馆全景。

这个案例的难点并不是生成一名歌手,而是维持连续的空间关系。幕布后方应该连接后台,后台通道应该通往舞台,歌手手中的道具、服装和身份需要在不同景别中保持稳定,工作人员的提醒还要与后续登台动作构成因果关系。

30秒原生生成也能减少分段制作产生的接缝。此前要制作同等长度的内容,创作者通常需要分别生成多个短片段,再依靠剪辑、抽帧续写或首尾帧控制进行拼接;人物脸型、服装细节、光线方向和运动速度都可能在片段交界处突然变化。

原生30秒并不等于模型已经能稳定制作30秒短片。生成时间越长,误差累积通常越明显,一个角色在第5秒出现的轻微形变,可能在第20秒演变成身份漂移;一次不合理的镜头调度,也可能让后续空间关系全部失效。因此,真正值得观察的不是官方精选案例能否讲完故事,而是普通用户在不同题材下的成功率和重生成成本。

多轮延长开始挑战更长时间轴

多轮延长是模型基于已有视频继续生成后续内容,并尽量继承人物、场景、风格、动作状态和声音线索的功能。Seedance 2.5支持用户在既有视频基础上继续生成30秒,这意味着创作者不必每次从静态参考图重新建立角色与场景。

官方示例展示了一段连续追逐情节。小男孩抱着足球沿车厢奔跑,地铁停稳后冲出车门,男主继续追赶并最终抓住小男孩;模型需要理解上一段结束时人物的位置、速度和行动目标,再让下一段自然接续。

多轮延长真正解决的是“状态继承”而不是简单加时。假设前一段最后一帧中,人物正向右奔跑、左手抱球、列车已经停站,那么后续视频就不能让人物突然改变方向、足球换到另一只手,或者把站台重新变成行驶中的车厢。

目前不能据此断言Seedance 2.5已经能够稳定生成数分钟成片。部分非官方资料提到最长可延展至180秒,但字节跳动7月31日的正式发布信息只确认了“支持多轮延长”,没有公布累计时长上限、推荐延长轮数或长时间生成的一致性指标,因此更稳妥的判断是:模型已经提供长时间轴工具,但实际可用边界仍需测试。

50份参考素材比30秒更重要

多模态参考是模型同时读取图片、视频和音频素材,并从中提取人物身份、场景构图、视觉风格、动作规律及声音特征的能力。Seedance 2.5单次最多可以接收30张图片、10段视频和10段音频,总计50份参考素材。

50份参考素材让视频生成从“提示词猜测”更接近“根据制作资料执行”。创作者可以分别提供角色正面与侧面照片、服装和道具图、场景概念图、镜头运动参考、表演片段、对白录音及环境声音,而不必把所有要求压缩成一段容易产生歧义的文字。

多人同框是这套参考系统最有现实价值的场景之一。官方展示的30秒音乐会片段同时涉及钢琴家、大提琴手、小提琴手、主唱、管弦乐队、合唱团和观众席,模型需要把不同素材中的人物放进统一空间,同时避免身份互换、声音错配和乐器结构变形。

参考素材数量增加也会带来新的控制难题。50份素材可能包含互相冲突的信息,例如不同图片中的服装不一致、视频参考与音频节奏不匹配,或者多个角色拥有相似外观;模型能否正确判断素材优先级,将直接影响复杂项目的可控性。

Seedance 2.0与2.5差在哪里

Seedance 2.5的升级重点可以概括为更长的单次生成、更丰富的参考输入和更完整的连续创作流程。由于字节跳动尚未公布统一基准测试、盲测胜率和正式价格,现阶段最可靠的对比仍是官方确认的产品能力,而不是缺少测试条件的主观画质排名。

| 对比项目 | Seedance 2.0 | Seedance 2.5 | 实际影响 | |---|---:|---:|---| | 单次生成时长 | 最长15秒 | 最长30秒 | 时长增加100%,可容纳更完整的叙事结构 | | 后续延长 | 已有续写能力有限 | 支持多轮延长,每次可继续生成30秒 | 减少重新建立人物和场景的次数 | | 多模态参考 | 支持图片、视频和音频参考 | 最多30张图片、10段视频、10段音频 | 复杂角色、品牌素材和群像场景更容易统一 | | 音视频架构 | 原生音视频联合生成 | 延续统一架构并加强长叙事 | 声音、动作与镜头可以共同参与叙事 | | 编辑能力 | 支持基础视频创作与控制 | 官方称编辑能力进一步提升 | 更接近反复修改的制作流程,而非一次性抽卡 | | 上线渠道 | 已在字节系产品提供 | 陆续上线即梦AI、豆包专业版 | 普通用户将分批获得使用权限 | | 企业服务 | 已有相关云端能力 | 近期接入火山方舟 | 具体时间、端点及价格尚未披露 | | 官方基准成绩 | 未统一公布 | 未统一公布 | 暂时无法用同一数字量化画质和成功率差异 |

这张表也说明,Seedance 2.5当前最清晰的领先指标是工作流容量,而不是已经得到第三方验证的绝对画质。单次30秒和50份参考素材都有明确数字,但角色一致性、指令遵循率、口型同步误差以及多轮延长后的质量衰减,仍缺少公开测试结果。

它首先改变广告和短叙事制作

30秒是商业内容中非常实用的时间单位。信息流广告、品牌短片、产品演示、音乐预告和知识讲解经常落在15秒至30秒区间,Seedance 2.5理论上可以在一次生成中覆盖完整成片,而不是只提供若干素材镜头。

影视预演可能比最终成片更早受益。导演或分镜师可以用角色图、场景概念图、动作参考和临时配音快速验证镜头节奏,确认一段追逐、转场或群像调度是否成立,再决定是否进入实拍或更昂贵的后期制作。

教育、工业制造和具身智能场景更看重连续动作的正确性。一个设备操作视频必须维持零件位置和操作顺序,一个机器人示范视频必须让动作满足物理约束,一个自动驾驶模拟片段则必须保持道路参与者的轨迹合理;这些任务对一致性的要求远高于视觉风格展示。

Seedance 2.5暂时还不能直接取代成熟的视频制作管线。专业项目需要精确修改某一镜头、锁定人物表演、管理素材版权、输出不同画幅版本,并保证多次生成结果可复现,而公开信息尚不足以证明模型已经解决这些制作环节。

真正的考题是30秒里有多少秒可用

Seedance 2.5值得肯定的地方,是字节跳动没有继续把升级重点放在单帧质感上。当前AI视频已经不缺少适合社交媒体传播的几秒钟画面,真正稀缺的是镜头之间的关系、人物行动的原因,以及创作者能够持续修改作品的控制权。

30秒也会让模型错误变得更容易被发现。短片段可以依靠快速剪辑掩盖手部变形、道具消失和空间跳跃,但在一镜到底或连续追逐中,观众会自然追踪人物和物体,任何状态不一致都会破坏可信度。

Seedance 2.5的产品价值最终应由“有效成片率”衡量。假如生成一次30秒视频,却只有其中8秒可以使用,那么它并没有真正优于连续生成三个10秒片段;如果多数生成结果都能保留完整人物、合理动作和可用声音,它才算完成从演示模型到生产工具的跨越。

字节跳动此次发布给出的方向是明确的:AI视频竞争正在从画面惊艳程度转向叙事长度、参考控制和编辑闭环。Seedance 2.5已经把单次生成的时间窗口扩大了一倍,但长叙事创作是否真正成立,还要等待即梦AI和豆包专业版全面开放后,由大规模真实项目而不是官方样片给出答案。

参考来源

相关推荐

查看全部