惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
有赞技术团队
有赞技术团队
博客园 - 【当耐特】
云风的 BLOG
云风的 BLOG
Martin Fowler
Martin Fowler
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
量子位
Engineering at Meta
Engineering at Meta
博客园 - 叶小钗
T
The Blog of Author Tim Ferriss
Recent Announcements
Recent Announcements
罗磊的独立博客
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
U
Unit 42
Microsoft Azure Blog
Microsoft Azure Blog
D
Docker
N
Netflix TechBlog - Medium
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
B
Blog RSS Feed
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
V
V2EX

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
英伟达LONGLIVE框架发布:单GPU实时生成240秒交互式长视频,A...
站外新闻 · 2026-06-19 · via Prompt 语宙

💡 站外导读:AI视频生成正经历从“玩具”到“生产力工具”的关键跃迁,但长视频的生成效率、质量连贯性与实时交互能力一直是行业核心痛点。英伟达等顶尖机构联合推出的LONGLIVE框架,直击这些挑战。它不仅能在单GPU上以20.7 FPS的速度生成长达4分钟的视频,更通过创新的KV-recache机制和流式微调技术,实现了视频生成过程中的实时提示词切换与平滑过渡,为大规模、高质量、可交互的AI视频创作铺平了道路。

LONGLIVE 是英伟达等顶尖机构联合推出的实时交互式长视频生成框架。框架通过帧级自回归(AR)模型,结合 KV-recache 机制、流式长视频微调和短窗口注意力 + 帧汇入技术,解决长视频生成中效率和质量的双重瓶颈。LONGLIVE 能在单个 H100 GPU 上以 20.7 FPS 的速度生成长达 240 秒的高质量视频,支持实时提示词切换和动态调整,为创意、教育和影视等领域开辟了新的创作可能性,是推动 AI 视频生成从“玩具”走向“生产力工具”的关键一步。

  • LONGLIVE是什么
  • LONGLIVE的主要功能
  • LONGLIVE的技术原理
  • LONGLIVE的项目地址
  • LONGLIVE的应用场景
      • 📝 站长洞察 (Editor’s Insight)

LONGLIVE

LONGLIVE的主要功能

  • 实时交互:支持用户在视频生成过程中实时输入流式提示词(prompt),动态调整视频内容,引导叙事或改变风格。

  • 长视频生成:模型能生成长达数分钟的高质量视频,支持复杂的叙事和场景发展。

  • 高效推理:在单个 NVIDIA H100 GPU 上达到 20.7 FPS 的实时速度,支持长达 240 秒的视频生成,同时保持高保真度和时间连续性。

  • 高质量生成:通过创新技术确保生成视频的视觉连贯性和语义一致性,在频繁切换提示词时能保持平滑过渡。

  • 低部署成本:支持 INT8 量化推理,进一步降低模型大小和部署成本,几乎不损失性能。

LONGLIVE的技术原理

  • KV-recache 机制:在切换提示词时,通过重新计算键值(KV)缓存“刷新”状态,清除旧提示词的残留信息,同时保留视觉和运动线索,确保画面平滑过渡并精准执行新指令。将 recache 操作整合到训练中,使模型在训练时就学会如何在提示词切换后平滑过渡。
  • 流式长视频微调(Streaming Long Tuning):解决自回归(AR)模型在长视频生成中的质量衰减问题,通过“滚动扩展”的方式模拟推理过程,减少训练与推理的不一致性。用局部监督和梯度分离,避免长序列反向传播导致的内存溢出(OOM)问题,确保教师模型的可靠监督。
  • 短窗口注意力 + 帧汇入(Frame Sink):基于短窗口注意力,将注意力范围限制在局部窗口内,显著降低计算复杂度和内存需求。引入帧汇入机制,通过保留全局锚点(如视频的第一帧块),恢复长程一致性,同时保持短窗口的高效性。

LONGLIVE的项目地址

  • GitHub仓库:https://github.com/NVlabs/LongLive
  • HuggingFace模型库:https://huggingface.co/Efficient-Large-Model/LongLive-1.3B
  • arXiv技术论文:https://arxiv.org/pdf/2509.22622

LONGLIVE的应用场景

  • 创意视频制作:创作者能实时调整视频内容和风格,快速生成符合创意需求的长视频,提升创作效率和灵活性。

  • 教育内容生成:教师根据教学进度实时生成教学视频,动态插入知识点或案例,增强教学互动性和趣味性。

  • 影视制作:导演和编剧能在拍摄前实时预览不同场景和叙事路径,快速调整剧本和拍摄计划,降低制作成本。

  • 广告创作:广告团队能根据客户需求实时生成广告视频,快速调整创意方向,提高广告的针对性和吸引力。

  • 游戏开发:开发者能实时生成游戏过场动画或动态背景,根据游戏剧情实时调整内容,提升玩家沉浸感。

📝 站长洞察 (Editor’s Insight)

LONGLIVE的发布,绝非又一个模型的简单迭代,它精准地击中了AIGC视频赛道从“炫技”走向“实用”的命门——长时序、高保真、强交互的工程化落地。其核心价值在于通过架构创新,将昂贵的计算负担转化为可控的实时生产力。单GPU实现240秒20.7FPS,背后是KV-recache和短窗口注意力等工程智慧的胜利,这大幅降低了高质量视频生成的硬件门槛和延迟。更重要的是,它支持的“流式提示词交互”,将创作过程从静态的“输入-输出”变成了动态的、可引导的“对话”,这完全契合了专业创作领域对控制感和迭代效率的核心需求。这预示着,AI视频工具将加速渗透到影视预演、教育内容制作、个性化广告等需要复杂叙事和即时反馈的产业场景中,其影响将远超短视频娱乐范畴,真正开启一个‘引导式生成’的新创作范式。