惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
G
Google Developers Blog
博客园 - 司徒正美
J
Java Code Geeks
aimingoo的专栏
aimingoo的专栏
A
About on SuperTechFans
博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
D
Docker
大猫的无限游戏
大猫的无限游戏
D
DataBreaches.Net
腾讯CDC
V
Visual Studio Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
C
Check Point Blog
M
MIT News - Artificial intelligence
Jina AI
Jina AI
I
InfoQ
雷峰网
雷峰网
The Cloudflare Blog
美团技术团队
Engineering at Meta
Engineering at Meta

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
突破分钟级长视频生成瓶颈:Meta&普林斯顿推出LinGen,线性复...
站外新闻 · 2026-06-28 · via Prompt 语宙

💡 站外导读:当前AI视频生成领域面临核心痛点:高分辨率、长时长的视频创作需要巨大的算力支撑,传统基于Diffusion Transformer的模型因二次复杂度的自注意力机制,导致计算成本高昂,难以在单GPU上实现分钟级视频的高效生成。这限制了AI视频在内容创作、实时交互等大规模场景中的落地应用。Meta联合普林斯顿大学推出的LinGen框架,通过革命性的线性复杂度设计,直接瞄准了这一行业瓶颈,有望推动AI视频生成进入更高效、更普惠的新阶段。

LinGen是普林斯顿大学和Meta共同推出的新型文本到视频生成框架。框架基于线性复杂度的MATE模块(包含MA-branch和TE-branch),替换传统Diffusion Transformers中的二次复杂度的自注意力模块,实现在单个GPU上高效生成高分辨率、分钟级时长的视频。LinGen显著降低计算成本,保持高质量的视频输出,在视频质量和生成效率上均优于现有的先进模型,为长视频生成和实时交互式视频应用开辟新的道路。

  • LinGen是什么
  • LinGen的主要功能
  • LinGen的技术原理
  • LinGen的项目地址
  • LinGen的应用场景
      • 📝 站长洞察 (Editor’s Insight)

LinGen

LinGen的主要功能

  • 高分辨率视频生成:支持生成高分辨率(如512p、1024p)的视频,满足高质量内容创作的需求。
  • 长时长视频生成:支持生成分钟级时长的视频,突破传统模型只能生成短视频(10-20秒)的限制。
  • 线性计算复杂度:基于采用线性复杂度的MATE模块,显著降低计算成本,让视频生成更加高效,适合在单个GPU上运行。
  • 高质量视频输出:生成的视频在视觉质量和文本对齐方面与现有的先进模型相当,同时保持帧间的一致性。
  • 实时交互式视频生成:LinGen为实时交互式视频生成和编辑提供可能,适用各种动态内容创作场景。

LinGen的技术原理

  • MA-branch(多尺度注意力分支)
    • 双向Mamba2模块:Mamba2是高效的线性复杂度的序列模型,基于双向设计,捕捉序列中的双向依赖关系。
    • Rotary Major Scan(RMS):基于不同的扫描方式(如空间行优先、空间列优先、时间行优先、时间列优先)重新排列3D视频token张量,增强短距离相关性,同时减少计算延迟。
    • Review Tokens:在序列处理前添加平均池化的token序列,提供对整个序列的全局概览,增强长距离相关性。
  • TE-branch(时间注意力分支):将3D视频token张量划分为小窗口,在窗口内计算自注意力,TESA能捕捉空间上相邻和时间上中等距离的token之间的相关性。窗口在不同层之间交替移动,扩大感受野并增强视频的一致性。
  • 线性复杂度:基于MATE模块的设计,LinGen的计算复杂度与生成视频中的像素数量呈线性关系,而不是传统的二次关系。这使得LinGen能够在保持高质量输出的同时,显著降低计算成本,提高生成效率。
  • 训练策略:LinGen用渐进式训练策略,先在低分辨率的文本到图像任务上进行预训练,再逐步增加视频分辨率和长度进行预训练。在文本到视频预训练阶段,结合文本-图像对进行混合训练,提高生成视频的一致性。基于在高质量视频数据集上进行微调,进一步提升生成视频的质量。

LinGen的项目地址

  • 项目官网:https://lineargen.github.io/
  • GitHub仓库:https://github.com/jha-lab/LinGen
  • arXiv技术论文:https://arxiv.org/pdf/2412.09856

LinGen的应用场景

  • 内容创作:快速生成高质量的视频内容,如广告、电影、电视剧等,显著缩短创作周期和成本。
  • 娱乐行业:生成游戏中的过场动画和背景视频,增强游戏的视觉效果和沉浸感。
  • 教育与培训:生成教育视频,如课程讲解和实验演示,提高教学的趣味性和互动性;生成培训视频,帮助员工快速理解和掌握知识,提升培训效果。
  • 广告视频:快速生成广告视频,满足不同广告场景的需求,提高广告制作的效率和效果。
  • 艺术创作:生成艺术视频,为艺术家提供新的创作工具,激发创意。

📝 站长洞察 (Editor’s Insight)

LinGen的发布标志着AI视频生成技术从‘追求效果’向‘效率与效果并重’的关键转折。其核心创新MATE模块通过线性复杂度设计,解决了长期困扰行业的长视频生成算力难题,这不仅是技术路径的突破,更是对应用场景的深层解锁。在AIGC竞争白热化的当下,这种能大幅降低部署门槛、实现‘单GPU生成分钟级视频’的框架,将直接推动视频生成从实验室走向大规模商业化,尤其是在企业级内容创作、教育、广告等领域。它预示着,未来的AIGC竞争将更聚焦于底层架构的创新和实际部署的效能,而非单纯地堆叠模型参数。