

























今天在 GitHub Trending 上看到一个有意思的项目:LTX-2,这是 Lightricks 推出的首个基于 DiT 的音视频基础模型,将现代视频生成的所有核心功能集成在一个模型中。
LTX-2 是首个基于 DiT(Diffusion Transformer)的音视频基础模型,包含了现代视频生成的所有核心功能:同步音频和视频、高保真度、多种性能模式、生产就绪的输出、API 访问以及开源访问。这个模型突破了传统视频生成的限制,实现了音频与视频的完美同步,同时保持了极高的视觉质量。
项目由 Lightricks 公司开发,这家公司以其专业的图像和视频处理工具而闻名。LTX-2 不仅是一个研究项目,更是一个可以直接用于生产环境的解决方案,提供了完整的 API 访问和多种优化选项。
LTX-2 基于 DiT 架构,这是目前最先进的扩散模型架构之一。与传统扩散模型不同,DiT 使用 Transformer 结构来处理图像和视频数据,能够更好地捕捉时空相关性。
# DiT 架构的核心特点
class DiTModel(nn.Module):
def __init__(self, input_channels, hidden_size, num_layers):
super().__init__()
self.input_proj = nn.Conv2d(input_channels, hidden_size, 3, padding=1)
self.transformer = Transformer(hidden_size, num_layers)
self.output_proj = nn.Conv2d(hidden_size, input_channels, 3, padding=1)
def forward(self, x, t):
x = self.input_proj(x)
x = self.transformer(x, t)
return self.output_proj(x)
# 克隆仓库
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2
# 设置环境
uv sync --frozen
source .venv/bin/activate
项目需要下载多个模型文件:
ltx-2.3-22b-dev.safetensors(22B 参数)或蒸馏版本 ltx-2.3-22b-distilled-1.1.safetensorsltx-2.3-spatial-upscaler-x2-1.1.safetensorsltx-2.3-temporal-upscaler-x2-1.0.safetensors所有模型均可从 HuggingFace 仓库 下载。
项目提供了多种管道,满足不同需求:
| 管道名称 | 用途 | 特点 |
|---|---|---|
| TI2VidTwoStagesPipeline | 文本/图像到视频 | 生产质量,2x 上采样(推荐) |
| TI2VidTwoStagesHQPipeline | 文本/图像到视频 | 使用二阶采样器,更高质量 |
| TI2VidOneStagePipeline | 文本/图像到视频 | 单阶段,快速原型 |
| DistilledPipeline | 文本/图像到视频 | 最快推理,8 步 |
| ICLoraPipeline | 视频/图像到视频 | 视频转换 |
| A2VidPipelineTwoStage | 音频到视频 | 音频驱动生成 |
| RetakePipeline | 视频编辑 | 重新生成特定时间区域 |
| HDRICLoraPipeline | HDR 视频输出 | 线性浮点帧 |
| LipDubPipeline | 口型同步 | 重新配音 |
LTX-2 使用特殊的提示工程方法,需要注意以下几点:
# 启用提示增强
video = pipeline(prompt, enhance_prompt=True)
DistilledPipeline 只需 8 个步骤--quantization fp8-castUV 同步失败: 清理缓存并重试 uv cache clean && uv sync --frozen
模型下载失败: 使用 Hugging Face CLI huggingface-cli download Lightricks/LTX-2.3 --local-dir ltx-2.3
CUDA 内存不足: 减少批次大小,使用 FP8 量化,或启用 --quantization fp8-cast
推理速度慢: 使用 DistilledPipeline,只需 8 步即可完成推理
视频质量不佳: 使用 TI2VidTwoStagesHQPipeline 获得更高质量
音频不同步: 使用 A2VidPipelineTwoStage 确保音频与视频同步
项目提供了 ComfyUI 集成,可通过 ComfyUI-LTXVideo 使用。
LTX-2 代表了视频生成技术的重要进步,它将现代视频生成的所有核心功能集成在一个模型中。通过基于 DiT 的架构,它实现了音频与视频的完美同步,同时保持了极高的视觉质量。
项目的开源特性使得研究人员和开发者可以深入探索和改进这个技术。多种管道和优化选项使得 LTX-2 可以适应不同的应用场景,从快速原型制作到生产环境部署。对于任何从事视频生成相关工作的开发者来说,LTX-2 都是一个值得关注和学习的优秀项目。
项目地址:Lightricks/LTX-2
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。