惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Troy Hunt's Blog
Blog — PlanetScale
Blog — PlanetScale
Engineering at Meta
Engineering at Meta
F
Full Disclosure
Recorded Future
Recorded Future
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
GbyAI
GbyAI
博客园_首页
博客园 - 叶小钗
MongoDB | Blog
MongoDB | Blog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
Recent Commits to openclaw:main
Recent Commits to openclaw:main
H
Hacker News: Front Page
人人都是产品经理
人人都是产品经理
The Cloudflare Blog
博客园 - 司徒正美
Webroot Blog
Webroot Blog
Google DeepMind News
Google DeepMind News
Help Net Security
Help Net Security
Cloudbric
Cloudbric
PCI Perspectives
PCI Perspectives
有赞技术团队
有赞技术团队
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
TaoSecurity Blog
TaoSecurity Blog
L
Lohrmann on Cybersecurity
量子位
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
Tailwind CSS Blog
Hacker News - Newest:
Hacker News - Newest: "LLM"
B
Blog RSS Feed
Apple Machine Learning Research
Apple Machine Learning Research
大猫的无限游戏
大猫的无限游戏
P
Proofpoint News Feed
N
News and Events Feed by Topic
罗磊的独立博客
T
Threat Research - Cisco Blogs
Schneier on Security
Schneier on Security
T
Tor Project blog
IT之家
IT之家
M
MIT News - Artificial intelligence
S
Security @ Cisco Blogs
O
OpenAI News
AI
AI
S
Securelist
Simon Willison's Weblog
Simon Willison's Weblog
The Last Watchdog
The Last Watchdog
月光博客
月光博客
Security Archives - TechRepublic
Security Archives - TechRepublic
L
LINUX DO - 热门话题

BlogFinder

日常漫步 Vol.24 之漫步前山河 - 雅余 周报 #1-聊聊本周的收获 - Edwin's Blog 我的OpenCode必装插件与Skill Write Something 掌中之物未必在掌握之中 · CRIVU PiliNara,一个更顺手的 PiliPlus 分支 「NekoEcho」:做一个必有回响的猫娘主题博客 2026-05 书影音总结 简化博客主题 - 安迪 我第一次发布 npm 包 拾花小记#45:中考前的二三事 – 小改学习志 黛西花园5月游 #18 枇杷又熟了的五月月报 一些奇奇怪怪的需求?word仿方正书版的几个小操作 - Xiobb's Blog 0419 御温泉之旅 修复了一些bug,网站基本上趋于稳定了 - 新锐博客 又回到四十年前 如何定义成功 迷鹿屋2026已重新上线 科技冰火两重天+一周回顾 ${title} 热度退了,我反而用得更深了-咕咚同学 我到底该不该换个域名? 随身WIFI折腾记 - 安迪 博客撰写体验提升——hexo pro插件 为什么不用相机把屏幕上的接关密码拍下来? 国清寺与天台山 – Ouroboros ★★★★☆《挽救计划》——久违的经济上行感 - Davidの3号基地 删除右键“打开方式”里多余选项 第三周刊_No.53|一切都会被支付两次 安卓APP通话记录与录音上传踩坑记录 - 子舒的博客 天量下跌 inBox 笔记 2.3.8,把工具栏交给了你-咕咚同学 我把小龙虾搬到了微信-咕咚同学 安好 - 响石潭 Compound Engineering Plugin:让每个工程单元都比上一个更容易 MOSS-TTS Family:开源高质量语音与声音生成模型家族深度解析 Crawl4AI:专为 LLM 设计的开源 Web 爬虫与数据抓取工具 Build Your Own X:从零实现你最喜欢的技术——程序员进阶的终极资源清单 Anthropic Skills:用文件夹教 Claude 专业技能的开源框架 1年的去月球(下) - 梅之夏 欢迎回来。 简单讲讲 ASN.1 与 OID DTV - 直播聚合客户端 5.22-5.27 – 不兴江 还没去过鸭川 – 不兴江 张晶晶同学三刷林志颖 关于我 – 不兴江 爱与嫉妒 – 不兴江 港股被持续做空 备案码花了四百块-咕咚同学 一句话生成封面:我给公众号做了4种风格的AI封面生成技能 「官」方認證 再谈费曼学习法 2026-05-28T00:34:11+08:00 2026-05-28T00:28:45+08:00 离谱的英语学习指南:基于AI的英语进阶系统方法论 iii:零集成架构的后端统一运行时 Claude Code Harness:让 Claude Code 工作有迹可循的工程化框架 Heretic:全自动移除大语言模型审查机制的开源工具 MarkItDown:微软开源的万能文档转 Markdown 利器 Harness:让 Claude Code 秒变多智能体协作工厂 这段时间尽折腾AI Agent了,确实极大地提高了效率 近期动态:两个新站点正式上线啦 误判解除!zhouayuan.com 腾讯安全申诉成功 - 周阿源|玩具设计・插画日常・生活随笔 Ralph:让 AI 编码工具自主循环跑完所有 PRD 任务的量产神器 全都违法 – 个人工作记录 关于zhouayuan.com被误判 “含违规信息” 的说明与申诉记录 - 周阿源|玩具设计・插画日常・生活随笔 小米 MiMo v2.5 Pro 白嫖 最大的人间清醒,兜里有钱,但是不花。 夜晚靓歌(12):于文文现场solo - 王志勇的Blog 今日插画:风扬起的倔强 - 周阿源|玩具设计・插画日常・生活随笔 回门习俗 独立网卡 - 忘记了回忆 500亿入股人工智能企业 从命令行到桌面智能体-咕咚同学 第一性原理读书笔记 行者微评论223-加班の守株待兔-博客|政治与时事-风雨行者 ZOZO开源物理接触求解器:GPU加速的可扩展仿真引擎 OpenStock:开源股票市场交易平台技术深度解析 MoneyPrinterTurbo:基于AI的全自动短视频生成工具深度解析 Claude-Mem:为 Claude Code 构建的持久化记忆压缩系统 Twenty:可代码化定制的企业级开源 CRM 平台技术深度解析 2026-05-26T22:59:17+08:00 企业级开源大模型部署平台 GPUStack 实战教程 1年的去月球(上) - 梅之夏 Sevalla - 静态网站托管服务 不用翻墙、不用注册、不用月费,普通人也能用上 Claude Code 装修灯具要注意⚠️ 黄梅天先锋 - 游子微博 公安备案顺利办结,站点备案全部完成 - 周阿源|玩具设计・插画日常・生活随笔 第三次兑换天猫超市卡了宗宗酱-三维狐少儿编程 Don't think, feel. - Rolen's Blog 人这一辈子,到底图个什么 博客迁移 - Edwin's Blog 情感赛道写作模板 再现本轮行情的典型特征 裁员与平常心-咕咚同学 别让“偷懒”,成为隐私泄露的破绽 片刻 - Jdeal | Life is like a Design.
LTX-2:首个基于 DiT 的音视频基础模型
Cheman · 2026-06-20 · via BlogFinder

今天在 GitHub Trending 上看到一个有意思的项目:LTX-2,这是 Lightricks 推出的首个基于 DiT 的音视频基础模型,将现代视频生成的所有核心功能集成在一个模型中。

一、项目概述

LTX-2 是首个基于 DiT(Diffusion Transformer)的音视频基础模型,包含了现代视频生成的所有核心功能:同步音频和视频、高保真度、多种性能模式、生产就绪的输出、API 访问以及开源访问。这个模型突破了传统视频生成的限制,实现了音频与视频的完美同步,同时保持了极高的视觉质量。

项目由 Lightricks 公司开发,这家公司以其专业的图像和视频处理工具而闻名。LTX-2 不仅是一个研究项目,更是一个可以直接用于生产环境的解决方案,提供了完整的 API 访问和多种优化选项。

二、技术原理

架构设计

LTX-2 基于 DiT 架构,这是目前最先进的扩散模型架构之一。与传统扩散模型不同,DiT 使用 Transformer 结构来处理图像和视频数据,能够更好地捕捉时空相关性。

# DiT 架构的核心特点
class DiTModel(nn.Module):
    def __init__(self, input_channels, hidden_size, num_layers):
        super().__init__()
        self.input_proj = nn.Conv2d(input_channels, hidden_size, 3, padding=1)
        self.transformer = Transformer(hidden_size, num_layers)
        self.output_proj = nn.Conv2d(hidden_size, input_channels, 3, padding=1)
    
    def forward(self, x, t):
        x = self.input_proj(x)
        x = self.transformer(x, t)
        return self.output_proj(x)

核心技术栈

  • PyTorch: 深度学习框架
  • Hugging Face: 模型发布和部署平台
  • FlashAttention: 优化的注意力机制实现
  • TensorRT-LLM: NVIDIA 的推理优化库
  • Gemma Text Encoder: Google 的文本编码器

关键算法特性

  1. 两阶段生成流程: 第一阶段生成基础视频,第二阶段进行空间上采样
  2. 多 LoRA 支持: 支持多种控制 LoRA,包括相机控制、HDR、LipDub 等
  3. 梯度估计优化: 减少推理步骤从 40 到 20-30,同时保持质量
  4. 量化支持: 支持 FP8 量化,降低内存占用

三、安装与快速开始

环境要求

  • Python 3.11+
  • CUDA 支持的 GPU
  • 至少 24GB VRAM(推荐 48GB+)
  • UV 包管理器

安装步骤

# 克隆仓库
git clone https://github.com/Lightricks/LTX-2.git
cd LTX-2

# 设置环境
uv sync --frozen
source .venv/bin/activate

下载模型

项目需要下载多个模型文件:

  1. LTX-2.3 模型检查点 - ltx-2.3-22b-dev.safetensors(22B 参数)或蒸馏版本 ltx-2.3-22b-distilled-1.1.safetensors
  2. 空间上采样器 - ltx-2.3-spatial-upscaler-x2-1.1.safetensors
  3. 时间上采样器 - ltx-2.3-temporal-upscaler-x2-1.0.safetensors
  4. LoRA 模型 - 多种控制 LoRA,包括相机控制、HDR、LipDub 等

所有模型均可从 HuggingFace 仓库 下载。

四、使用方法与实战

可用管道

项目提供了多种管道,满足不同需求:

管道名称用途特点
TI2VidTwoStagesPipeline文本/图像到视频生产质量,2x 上采样(推荐)
TI2VidTwoStagesHQPipeline文本/图像到视频使用二阶采样器,更高质量
TI2VidOneStagePipeline文本/图像到视频单阶段,快速原型
DistilledPipeline文本/图像到视频最快推理,8 步
ICLoraPipeline视频/图像到视频视频转换
A2VidPipelineTwoStage音频到视频音频驱动生成
RetakePipeline视频编辑重新生成特定时间区域
HDRICLoraPipelineHDR 视频输出线性浮点帧
LipDubPipeline口型同步重新配音

提示工程

LTX-2 使用特殊的提示工程方法,需要注意以下几点:

  • 详细的、按时间顺序的动作和场景描述
  • 包含具体动作、外观、镜头角度和环境细节
  • 控制在 200 词以内
  • 像摄影师描述镜头清单一样思考
# 启用提示增强
video = pipeline(prompt, enhance_prompt=True)

性能优化

  1. 使用蒸馏管道 - DistilledPipeline 只需 8 个步骤
  2. 启用 FP8 量化 - --quantization fp8-cast
  3. 安装注意力优化 - FlashAttention 4 或 xFormers
  4. 使用梯度估计 - 减少推理步骤
  5. 选择单阶段管道 - 当不需要高分辨率时

五、常见问题与解决方案

安装失败

UV 同步失败: 清理缓存并重试 uv cache clean && uv sync --frozen

模型下载失败: 使用 Hugging Face CLI huggingface-cli download Lightricks/LTX-2.3 --local-dir ltx-2.3

运行时错误

CUDA 内存不足: 减少批次大小,使用 FP8 量化,或启用 --quantization fp8-cast

推理速度慢: 使用 DistilledPipeline,只需 8 步即可完成推理

性能问题

视频质量不佳: 使用 TI2VidTwoStagesHQPipeline 获得更高质量

音频不同步: 使用 A2VidPipelineTwoStage 确保音频与视频同步

兼容性

项目提供了 ComfyUI 集成,可通过 ComfyUI-LTXVideo 使用。

六、总结

LTX-2 代表了视频生成技术的重要进步,它将现代视频生成的所有核心功能集成在一个模型中。通过基于 DiT 的架构,它实现了音频与视频的完美同步,同时保持了极高的视觉质量。

项目的开源特性使得研究人员和开发者可以深入探索和改进这个技术。多种管道和优化选项使得 LTX-2 可以适应不同的应用场景,从快速原型制作到生产环境部署。对于任何从事视频生成相关工作的开发者来说,LTX-2 都是一个值得关注和学习的优秀项目。

项目地址:Lightricks/LTX-2