生成 10 秒视频只需 6.8 秒。比实时还快。还开源。
这不是广告语,这是 Lightricks 旗下 LTX 正式发布 LTX-2.5 时的数据。这一次,开源阵营真的打到了闭源大模型的腹地。
一、这家公司是谁?
很多人不知道,Lightricks 是以色列的一家老牌消费级图像/视频编辑应用公司,旗下有 Facetune、Videoleap 等产品,在 AI 浪潮之前就是一家盈利的软件公司。
2022 年,他们开始转型做基础模型,2024 年推出了第一个开源视频模型 LTX Video(仅 2B 参数)。此后一路狂奔:2025 年 5 月升级到 13B,同年 10 月推出 LTX-2,2026 年 3 月推出 LTX-2.3,再到今天的 LTX-2.5。
LTX 的整个模型家族已超过 3300 万次下载,是目前市场上下载量最高的开放世界模型系列。
二、LTX-2.5 是什么?核心参数先看清楚
LTX-2.5 是建立在 22B 参数非对称双流扩散 Transformer 上的音视频基础模型,通过双向音视频交叉注意力机制与模态感知无分类器引导,联合生成视频与音频。
三、最重磅的新特性:逐一拆解
1. Diffusion Fidelity Rendering(扩散保真渲染)
这是 LTX-2.5 最核心的技术创新,也是官方命名的全新渲染体系。
核心思路是:按场景复杂度动态分配渲染算力。复杂场景多用算力,简单场景不浪费资源,最终实现「每一帧都对得上大银幕」的画面精度。
LTX-2.5 采用的 Diffusion Fidelity Rendering 流程,根据场景复杂度分配渲染算力。
与此同时,旧版的 VAE 解码器被全新的扩散视频解码器取代——这意味着面部细节更清晰、纹理更稳定、运动更自然、伪影更少。
2. 原生多镜头(Native Multishot)
这是目前开源模型里最稀缺的能力之一:在单次生成中产出多个衔接镜头,角色形象、环境、光线、声音全程一致。
多镜头生成在整个剪辑场景中保持角色形象、光线和视觉风格的一致性,非常适合需要多个镜头衔接的企业视频、产品演示和营销内容。
以往做多镜头视频,要么用户手动缝合,要么祈祷每段单独生成的视频里角色脸不变形。LTX-2.5 一次生成全搞定,这对视频创作者来说意义极大。
3. 更强的提示词理解(Gemma 4 12B 文本编码器)
LTX-2.5 把文本编码器换成了定制版 Gemma 4 12B,并配合专属提示词增强器(Prompt Enhancer)。
效果是什么?该模型能在整段复杂提示词中保留多个主体、动作、光线和摄像机方向,而提示词增强器则能将简短描述扩展成更详细的电影级指令。
简单说:你写一个人走过街道,模型会自动理解并扩展为具有光影、镜头运动、环境氛围的完整创作指令。
4. 自动时长预测(Auto Duration)
以往生成视频需要手动指定帧数,LTX-2.5 加入了时长预测头:模型根据你描述的动作内容,在扩散开始之前自动判断应该生成多长的片段。
不再需要反复调参猜帧数,「跑步穿过森林」和「慢慢回头看一眼」自然生成不同时长。
5. 同步音频生成
音频不是后期配的,而是和视频联合生成的。对话、环境音、音效,自动匹配视频内容的情绪和节奏。
统一的音视频生成意味着声音、背景音和拟音自动匹配视觉内容的情绪和节奏,无需单独的音频后期工作流程。
6. 原生 4K HDR + RAW 工作流
最高支持原生 4K HDR 输出,同时支持 EXR 格式的 RAW 工作流——这意味着可以直接接入专业调色和后期流水线,不破坏母版。
四、速度对比:快到什么程度?
官方数据:LTX-2.5 在自建环境(2×GB200)以稳定状态运行,生成一个 10 秒 720p 图生视频片段仅需 6.8 秒。
这意味着比视频实时播放还要快。把这个数字放到同类模型的对比里:
当然,这里需要说明:6.8 秒是 LTX 自建环境的测试数据,普通开发者用 API 是 23.7 秒,仍是对比列表中最快的。但即使是 23.7 秒,也比 Seedance 2.5 的 317 秒快了 13 倍以上。
五、画质对比:伪影更少
官方公布了一项文生视频的伪影数量评测(98 个相同提示词、10 个模型、自动评分):
LTX-2.5 Pro 在伪影评分上排名第一,伪影计算包括污点、破碎纹理、融化或涂抹区域。结果为初步数据,评测范围扩大后预计会持续更新。
六、与主要对手全面对比
LTX-2.5 vs Seedance 2.5
这是被问最多的问题。两者代表了当下最高水准的开源与闭源方向。
LTX 的开放权重允许更高分辨率,而 Seedance 2.5 即使在托管平台上也只能达到 720p。
一句话总结: Seedance 2.5 的闭源方案在角色一致性和提示词精准度上仍有优势,但 LTX-2.5 在速度、分辨率、开放性、成本上全面领先,且伪影更少。
LTX-2.5 vs MiniMax H3
MiniMax H3 是「有条件开放」,在美国、欧盟、英国、韩国不可用,生成同一片段需 180 秒,且有强制品牌显示要求。LTX-2.5 无地区限制,无强制品牌,可完全自建部署。
LTX-2.5 vs Kling 3.0 Pro / Veo 3.1
都是闭源 API,无法本地部署,无法微调,生成速度(Kling 398 秒、Veo 70 秒)对比 LTX 均不占优。
七、开源的真实价值:你能拿它做什么?
Lightricks CEO Zeev Farbman 和 ComfyUI 联合创始人 Yoland Yan 都押注开放权重的路线,而非闭源。
对开发者和创业者来说,开源意味着:
可自建,零边际成本:一旦跑在自己的 GPU 上,生成不额外收费,规模越大越省钱。
可微调:用自己的数据和 IP 训练,打造专属风格。官方同时提供 LTX Trainer 工具,社区已有大量 LoRA 开放共享,包括:
- 唇形同步 LoRA
- 360° 全景视频 LoRA
- 任意运动轨迹控制 LoRA
- 视频超分 LoRA
- 无缝扩展(Outpainting)LoRA
无数据泄露风险:敏感内容、品牌 IP、客户素材都在本地处理,不出局域网。
无平台绑定:不依赖任何云厂商,可部署在本地、私有云、边缘设备。
八、快速上手:三种接入方式
方式一:在线体验(0 成本)
直接打开 https://app.ltx.io 或 HuggingFace Space,无需安装。
方式二:ComfyUI 本地部署
LTX-2.5 首日就原生支持 ComfyUI,官方提供了完整的工作流模板。
# 第一步:下载模型权重(需先在 HuggingFace 申请访问权限) hf auth login hf download Lightricks/LTX-2.5 \ diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors \ text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors \ vae/ltx-2.5-video-vae-bf16.safetensors \ vae/ltx-2.5-audio-vae-bf16.safetensors \ model_patches/ltx-2.5-duration-head-bf16.safetensors \ --local-dir models/ltx-2.5
加载到 ComfyUI 后,导入官方提供的 JSON 工作流即可开跑。
方式三:Python 代码调用
from ltx_pipelines.distilled import DistilledPipeline from ltx_pipelines.utils.model_paths import ModelPaths model_paths = ModelPaths.from_split( transformer_path="models/ltx-2.5/diffusion_models/ltx-2.5-22b-distilled-transformer-bf16.safetensors", text_encoder_path="models/ltx-2.5/text_encoders/gemma4-12b-with-proj-ltx-2.5-bf16.safetensors", video_vae_path="models/ltx-2.5/vae/ltx-2.5-video-vae-bf16.safetensors", audio_vae_path="models/ltx-2.5/vae/ltx-2.5-audio-vae-bf16.safetensors", ) pipeline = DistilledPipeline(model_paths) output = pipeline.generate( prompt="夕阳下,一只金毛猎犬在草原上奔跑,电影级光线", num_frames=121, # 帧数必须满足 frames % 8 == 1 seed=42 )九、它也有局限
在客观性上,有几点值得如实说:
显存要求不低:全量 22B 模型对显存要求较高,推荐使用蒸馏版 + fp8 量化 + CPU Offload 组合降低门槛,但高分辨率长视频仍需现代 GPU。
帧数有限制:帧数必须满足 frames % 8 == 1(如 121、129、137),不够灵活。
多镜头功能尚新:对于极端光线变化或复杂摄像机运动,跨镜头一致性仍可能出现问题。
$1000万以上商用需谈判:年收入超过 1000 万美元的企业需要单独签商业协议。
小结:开源已经够用了
LTX-2.5 这次的发布,某种程度上打破了「开源效果差、部署麻烦」的旧印象:
- 速度:API 最快,自建超越实时
- 伪影:10 个对比模型中最少
- 开放性:真正的开放权重,可微调,可自建,可商用
- 分辨率:原生 4K,对手闭源产品多数卡在 720p
- 生态:ComfyUI 首日支持,社区 LoRA 持续涌现
LTX-2.5 发布的 6.8 秒生成时间,让它在开源视频生成工具中进入了极少数模型才能到达的速度区间。
Seedance 2.5 在角色一致性上仍是值得尊敬的对手,但当一个开源模型在速度快 13 倍、分辨率高一倍、伪影更少的情况下,还能免费商用和本地部署——它已经不是「凑合能用」,而是真正可以进生产环境的选择。
热门跟贴