AI 快讯LTX-2.5把视频生成跑进实时
模型上新

LTX-2.5把视频生成跑进实时

2026-08-12T08:05:14.159Z
LTX-2.5把视频生成跑进实时

LTX-2.5 已原生接入 ComfyUI,在两张 NVIDIA GB200 上生成 10 秒 720p 视频仅需 6.8 秒。它真正的竞争力不只是快,而是开放权重、同步音频、工作流集成和每 10 秒 0.90 美元的综合成本。

LTX-2.5 把视频生成跑进实时

LTX 于 8 月 11 日发布 LTX-2.5,并在 8 月 12 日全面开放获取:这款视频生成模型已经原生接入 ComfyUI,在两张 NVIDIA GB200 上生成一段 10 秒、720p 的图生视频只需 6.8 秒,生成速度首次明确快于视频播放速度。

这组数字很抢眼,但更值得关注的是它背后的产品取向。LTX-2.5 没有只追求样片质量,而是同时押注开放权重、本地部署、同步音频、低延迟和节点式工作流,试图把视频模型从“等待数分钟出一条成片”的生成器,变成可以连续调参数、快速看结果的生产工具。

LTX-2.5 在 ComfyUI 中生成带音频视频的工作流界面,以及 6.8 秒生成 10 秒 720p 视频的性能数据

6.8 秒生成 10 秒视频,但别忽略两张 GB200

LTX-2.5 是一款面向文本生成视频和图像生成视频场景的开放权重视听模型,可以在同一生成流程中输出画面与匹配的音频。

LTX 公布的核心成绩是:在两张 NVIDIA GB200 上,以稳定运行状态生成一段 10 秒、720p 的图生视频,耗时为 6.8 秒。换算下来,其生成速度约为内容时长的 1.47 倍,也就是模型生成完整视频时,这段视频本身还没有播放完。

这一成绩意味着 LTX-2.5 已经跨过“快于实时”的门槛。对视频模型而言,快于实时不是单纯的跑分标签,而是交互方式的变化:创作者可以像调色、剪辑一样连续修改镜头运动、主体动作和声音描述,而不是每次调整提示词后等待几分钟。

不过,6.8 秒不能被理解为普通消费级显卡的普遍体验。GB200 是 NVIDIA 面向数据中心的高端 Grace Blackwell 超级芯片,两张 GB200 的算力、显存带宽和部署成本远超 RTX 5090 等桌面显卡,因此这项数据更接近“架构上限展示”,而不是本地用户开箱即得的速度。

LTX 托管环境中的另一组数据更接近日常在线使用体验。相关测试显示,托管服务生成一段 10 秒、1080p 视频用时约 23.7 秒;由于分辨率、服务调度和硬件环境均与 6.8 秒测试不同,两组数据不能直接做倍数比较,但都说明 LTX-2.5 的优化重点确实是低延迟。

| 测试场景 | 输出规格 | 生成耗时 | 相对视频时长 | 需要注意的条件 | |---|---:|---:|---:|---| | 自行部署性能测试 | 10 秒、720p、图生视频 | 6.8 秒 | 约 0.68 倍 | 两张 NVIDIA GB200、稳定运行状态 | | LTX 托管服务测试 | 10 秒、1080p | 约 23.7 秒 | 约 2.37 倍 | 在线服务环境,分辨率更高 | | 消费级显卡本地运行 | 取决于量化、分辨率和帧数 | 官方未给统一数字 | 无法直接判断 | 显存容量和工作流设置影响明显 |

原生接入 ComfyUI,比单独发布权重更有价值

ComfyUI 是一种基于节点图的视频与图像生成工作流工具,用户可以把模型加载、条件控制、采样、放大和导出等步骤组合成可复用流程。

LTX-2.5 的“原生集成 ComfyUI”意味着用户不必等待第三方开发者临时适配模型节点,而是可以通过官方支持的模板和组件,将模型直接接入已有创作管线。模型目前可通过 Hugging Face 的 Lightricks 页面获取,也可以在 ComfyUI 中使用对应工作流,或者选择官方托管服务。

原生工作流支持解决的是视频模型长期存在的“最后一公里”问题。一个视频模型即使单次效果不错,如果不能方便地连接参考图、姿态、深度、边缘约束、画质放大和后期节点,它仍然更像演示产品,而不是稳定的生产组件。

LTX 系列此前的 ComfyUI 工作流已经覆盖文本生成视频、图像生成视频、深度控制、姿态控制和 Canny 边缘控制等路径。LTX-2.5 接入后,创作者可以继续沿用节点式流程,把主体、运镜、动作、对白、环境声和音乐写入条件,再通过参考图或结构控制减少画面漂移。

图生视频仍然是更适合实际项目的起点。纯文本生成视频的自由度最高,但主体外观、服装细节和空间关系更容易在连续帧中变化;参考图相当于先为模型钉住视觉起点,通常能提高角色稳定性和首轮命中率。

同步音频不是附赠功能,而是效率放大器

原生视听生成是指模型在一次推理中共同生成视频画面及与之对应的对白、音效、环境声或音乐,而不是先生成静音视频,再调用另一套模型配音。

LTX-2.5 Fast 的公开价格为每生成 1 秒带音频的 720p 视频收费 0.09 美元,因此一段 10 秒视频成本为 0.90 美元,按当前汇率约合人民币 6.1 元。它并不是价格最低的视频模型,但考虑到同步音频、开放权重和最长 20 秒生成能力,综合成本仍有竞争力。

同步音频真正节省的是多轮工具切换成本。传统流程通常要经历视频生成、对白合成、口型匹配、音效添加和混音等环节,而联合生成可以先输出一版视听一致的草稿,再决定哪些声音需要后期替换。

同步音频目前也不能完全取代专业后期。角色声线跨镜头统一、精确台词控制、多语言口型和复杂音乐结构仍可能需要单独处理,因此更合理的定位是“带完整声音关系的第一版成片”,而不是最终混音母版。

价格不最低,但开放权重改变了账本

开放权重模型是指开发者可以下载模型参数并在自有硬件上运行或微调,但其使用范围仍受具体许可证约束。

LTX-2.5 的授权并非无条件开源。年度经常性收入 ARR 低于 1000 万美元的组织可以免费使用;ARR 是企业一年内可重复获得的订阅或合同收入,常用于衡量软件公司的收入规模。超过这一门槛的企业需要与 LTX 协商商业授权。

这一区别对企业采购非常重要。LTX-2.5 可以被称为开放权重模型,但不能简单写成“任何公司都可无限制免费商用”;模型能否使用、能否微调和是否需要付费,应以正式许可证及企业收入规模为准。

从公开价格看,LTX-2.5 Fast 不是最低价方案。Google Veo 3.1 Lite 每秒 0.05 美元,生成 10 秒只需 0.50 美元,比 LTX-2.5 Fast 的 0.90 美元低 44.4%;但 Veo 3.1 Lite 不提供开放权重,也不支持 4K 和剪辑扩展。

| 模型 | 每秒成本 | 10 秒成本 | 最高规格或时长 | 权重开放 | 主要特点 | |---|---:|---:|---|---|---| | Veo 3.1 Lite | 0.05 美元 | 0.50 美元 | 不支持 4K与剪辑扩展 | 否 | 公开方案中价格最低 | | LTX-2.5 Fast | 0.09 美元 | 0.90 美元 | 最长 20 秒,24/25 fps;可扩展至 4K | 是,受收入门槛限制 | 同步音频、可部署、可微调 | | Veo 3.1 Fast | 0.10 美元 | 1.00 美元 | 4K 路径为 0.30 美元/秒 | 否 | Google Veo 系列经济型方案 | | Gemini Omni Flash | 0.10 美元 | 1.00 美元 | 720p、最长 10 秒 | 否 | 强调成片质量与迭代体验 | | LTX-2.5 Pro | 0.12 美元 | 1.20 美元 | 最高 1080p、10 秒 | 是,受许可证限制 | 更偏质量、文字和排版优化 |

LTX-2.5 Fast 的 4K 生成价格为每秒 0.30 美元,一段 10 秒视频成本为 3 美元。它与 Veo 3.1 Fast 的公开 4K 单价处在同一水平,因此 LTX 的优势并不在 4K 价格,而在于企业能否自行控制推理环境、微调模型并嵌入内部流程。

自有部署的成本结构也不能只看“每秒价格”。企业需要承担 GPU、存储、运维、模型加载和并发调度成本,但在调用量足够大、GPU 利用率稳定或数据不能离开内网时,自行部署可能比按次使用更合算。

Fast 与 Pro 针对的是两种工作节奏

LTX-2.5 Fast 是优先降低生成延迟和单次成本的版本,适合预览、批量试错、广告分镜和短视频草稿。

LTX-2.5 Pro 是更偏向质量优化的版本,每秒成本为 0.12 美元,生成 10 秒视频需要 1.20 美元,比 Fast 贵 33.3%。Pro 最高支持 1080p、10 秒,官方强调其在字体、排版和提示词贴合方面的表现。

Fast 和 Pro 的合理用法不是二选一,而是分层生成。团队可以先用 Fast 连续测试构图、动作和镜头,再将命中的方案交给 Pro 生成质量更高的版本,从而避免把昂贵算力浪费在明显不可用的提示词上。

这种“低成本预览、高质量定稿”的机制与三维渲染中的代理预览相似。创作者不需要在每次移动镜头后都完成最终级渲染,只要先确认运动、节奏和主体关系,再提高分辨率与质量即可。

消费级显卡能跑,不代表可以复刻发布会成绩

本地可运行是 LTX-2.5 相比纯闭源视频服务的重要优势,但消费级硬件仍需在画质、时长和速度之间做取舍。

LTX 早期版本的社区经验显示,高质量工作流通常需要至少 32GB 显存,RTX 5090 32GB 可以尝试 FP8 量化版本,并运行 1080p 乃至经过工作流放大的 4K 输出。LTX-2.5 的实际显存占用仍会受到模型版本、帧数、分辨率、量化精度和控制节点数量影响,不能直接照搬单一配置结论。

720p 是多数本地用户更现实的起点。视频张量会随宽度、高度和帧数迅速增长,因此从 720p 提升到 1080p 不只是多出一点像素:1920×1080 的像素总量约为 1280×720 的 2.25 倍,显存和计算压力也会明显增加。

先低分辨率生成再放大通常比原生高分辨率反复抽卡更划算。创作者可以先在 720p 或更低规格下确定镜头与动作,随后使用视频超分工具完成增强,这种流程尤其适合短视频素材、动态概念图和广告分镜。

LTX-2.5 的强项是迭代速度,而非宣告质量封王

LTX-2.5 目前最明确的竞争优势是速度、开放性和工作流完整度,而不是已经证明其绝对画质超过所有闭源模型。

视频模型的成片质量不能只看一组精选样片。角色一致性、复杂物理运动、手部细节、镜头切换、字幕准确度、对白可控性和长时间叙事稳定性,都需要更广泛的第三方测试才能判断。

6.8 秒成绩也不应被包装成所有用户都能获得的速度。它是在两张 GB200 上测得的最优条件数据,但这项成绩仍然有技术意义,因为它证明开放权重视频模型可以在高端硬件上达到快于实时生成,而不是只能依赖高度封闭的云端系统。

LTX-2.5 对开发者最有价值的地方,是它提供了一条不同于 Veo 等闭源产品的路线。开发者可以下载权重、查看工作流、进行微调并把模型接入现有视觉生产管线,这种可控制性往往比单次样片多一点细节更重要。

谁最适合现在就用 LTX-2.5

LTX-2.5 最适合需要大量迭代,而不是一次性追求电影级最终画面的团队。

  • 广告与电商团队可以用 Fast 版批量测试构图、运镜、商品动态和背景音乐,再挑选版本精修。
  • 短视频创作者可以快速生成带环境声或对白的 10 至 20 秒素材,减少在多个音视频工具之间切换。
  • 游戏与动画团队可以把它用于动作预演、氛围草图和镜头分镜,而不是直接替代正式资产制作。
  • 企业研发团队可以利用开放权重和微调能力,将特定人物、产品或视觉风格纳入内部工作流。
  • 独立开发者可以通过 ComfyUI 先验证交互产品,再决定是否投入高规格硬件或使用托管服务。

LTX-2.5 不太适合显存有限、只追求一键最终成片的用户。开放权重带来自由,也意味着模型管理、节点配置、显存优化和后期处理仍需要一定技术能力;如果完全不想接触工作流,闭源产品的使用门槛通常更低。

结论:视频模型的下一场竞争是“反馈速度”

LTX-2.5 的发布把开放权重视频模型推进到了一个更实用的阶段:10 秒 720p 视频在顶级硬件上只需 6.8 秒,Fast 版带音频生成成本为每秒 0.09 美元,并且已经原生进入 ComfyUI。

这款模型最重要的意义不是刷新了一次速度数字,而是缩短了创作者从想法到反馈的距离。视频生成一旦从分钟级等待变成秒级预览,提示词调整、动作设计和声音测试就能进入连续循环,模型也会从“偶尔使用的生成按钮”变成真正嵌入生产流程的节点。

现阶段仍需保持一个清醒判断:两张 GB200 的 6.8 秒不是大众本地体验,开放权重也不等于无限制免费商用,原生音频更不能完全替代专业后期。但在速度、成本、部署自由度和 ComfyUI 生态之间,LTX-2.5 已经给出了一套比单纯追求榜单画质更务实的答案。

参考来源

相关推荐

查看全部