描述
LTX-2.5 是由 Lightricks 开发的前沿开放世界模型,旨在从文本、图像和视频输入生成同步的高保真视频和音频。该模型专为本地执行和微调而构建,为用户提供完全的控制和定制选项。它特别适合于机器人和物理人工智能等新兴领域,在这些领域中,高质量多媒体生成的需求至关重要。
LTX-2.5 的一个突出特点是其原生多镜头生成能力,允许用户在一次传递中创建连接的场景。这意味着多个镜头可以在切换中保持角色身份、环境、光照、声音和视觉风格,从而增强叙事体验。此外,该模型采用扩散保真度渲染,根据场景复杂性动态分配计算资源,确保在最重要的地方渲染细节,同时在其他地方保持高效。
新引入的扩散视频解码器取代了 VAE 重建阶段,导致在要求苛刻的场景中面部更加清晰、纹理改善、运动更流畅且伪影更少。定制的 Gemma 4 12B 文本编码器是另一个重要进展,能够在较长序列中保持复杂提示的完整性而不丢失细节。此外,提示增强器将短提示扩展为更丰富的电影指令,从而提升整体输出质量。
对于希望预测剪辑长度的用户,LTX-2.5 包含一个可选的持续时间预测器,根据提示设置帧数,从而简化工作流程。该模型还具有显著改进的蒸馏版本,保留了完整模型的大部分视觉质量和运动一致性,同时体积更小、速度更快。
LTX-2.5 在 LTX-2.x 社区许可证下提供,允许免费进行商业和生产使用,尽管微调的转移可能需要付费许可证。用户可以通过多种集成选项访问该模型,包括 Python 和 ComfyUI,使其在不同的技术环境中具有灵活性。凭借其强大的能力和开源特性,LTX-2.5 有望推动和普及多媒体生成中的人工智能。
LTX-2.5亮点
开放世界模型
高保真视频生成
高保真音频生成
原生多镜头生成
扩散保真度渲染
定制 Gemma 4 12B 文本编码器
提示增强器
持续时间预测器
可用蒸馏模型
商业使用许可证
LTX-2.5入门
访问页面:访问 Hugging Face 上的 LTX-2.5 模型页面。
加载模型:下载 LTX-2.5 所需的权重和组件。
配置环境:确保您的设置满足要求(Python >= 3.12,CUDA >= 12.7,PyTorch ~= 2.7)。
集成:使用提供的 CLI 标志在您的应用程序中加载模型组件。
微调:根据需要使用 LTX-2 Trainer 对模型进行微调。
LTX-2.5的使用案例
- 视频制作
- 音频创作
- 机器人仿真
- 游戏开发
- 教育内容





