

























本文一次性深扒Yan的仿真-生成-编辑三大内核、400M帧训练数据黑科技,以及对游戏、XR、智能体训练即将带来的冲击。想提前拿到“人人都是造梦师”的门票,从这5000字开始。

最近,腾讯推出了一款互动视频生成系统——Yan,面向游戏、虚拟世界、AIGC等场景,支持高保真、实时、可编辑的互动视频生成(论文地址:https://arxiv.org/abs/2508.08601v3)。)
本文系统梳理Yan的技术方案,重点解析其在数据采集、AAA级仿真、多模态生成、交互式编辑等方面的核心突破,并展望未来发展方向。
互动视频生成(Interactive Generative Video, IGV [1])是指AI系统能够不断根据用户输入,生成可交互的视频内容。这一范式突破了传统视频生成的静态、单向特性,使内容能够动态响应用户操作,带来个性化、沉浸式的体验。其潜在价值包括:
目前主流的互动视频生成方案主要包括:
我们的尝试👇
基于上述背景,我们团队在互动视频生成领域进行了一次系统性尝试,提出了Yan框架。“Yan”(衍)寓意“演化、流变”,象征着内容与现实的不断生成与展开。我们以“高画质、强交互、可编辑”为目标,探索了端到端的互动视频生成新范式,力求推动AIGC迈向下一代开放式、可控的数字内容引擎。

整体框架示意图
Yan整体采用端到端的互动视频生成范式,核心由三大模块组成:Yan-Sim(AAA级仿真)、Yan-Gen(多模态生成)、Yan-Edit(多粒度编辑)。三者均基于从游戏环境(基于元梦之星)中采样而来,大规模高质量互动视频数据集进行训练和协同优化,形成完整的“仿真-生成-编辑”一体化流程。其设计目标是实现高分辨率、低延迟、强交互、可编辑的开放式内容生成。
三大模块均依赖于统一的高质量互动视频数据采集与预处理流程,数据集为整个系统提供了坚实的基础。

数据采集管线示意图
Yan构建了大规模的高质量互动视频数据集,覆盖90+场景、400M帧(3700小时),具备高分辨率(1080P)、高帧率(30FPS)、高精度动作-图像对齐和丰富动作空间。
数据集对比表:


Yan-Sim模型结构示意图
Yan-Sim模块基于高压缩、低延迟3D-VAE与KV-cache shift-window去噪推理,实现1080P/60FPS的高保真实时仿真,支持复杂物理机制与多风格场景。
模型架构:
推理优化:
特性对比表:

多场景仿真与生成效果:

Yan-Gen模型结构示意图
Yan-Gen模块实现了基于文本、图像、动作等多模态输入的实时互动视频生成,具备强泛化与可控性。 能够实现交互场景生成、跨域融合等多样化内容创作。
层次化caption体系:
多模态条件注入:
自回归与蒸馏优化:
多模态内容生成与扩展效果:

Yan-Edit模型结构示意图
Yan-Edit模块实现了结构与风格的多粒度、实时交互式视频编辑,支持任意时刻通过文本prompt修改内容。 用户可通过文本prompt动态添加/替换场景元素、切换渲染风格,极大提升了内容创作的灵活性与交互性。
架构设计:
训练与推理:
结构与风格实时编辑效果:
局限性:
未来方向:
[1] Jiwen Yu, Yiran Qin, Haoxuan Che, Quande Liu, Xintao Wang, Pengfei Wan, Di Zhang, Kun Gai, Hao Chen, and Xihui Liu. A survey of interactive generative video. arXiv preprint arXiv:2504.21853, 2025a.
[2] Genie 3: A new frontier for world models
[3] Ruili Feng, Han Zhang, Zhantao Yang, Jie Xiao, Zhilei Shu, Zhiheng Liu, Andy Zheng, Yukun Huang, Yu Liu, and Hongyang Zhang. The matrix: Infinite-horizon world generation with real-time moving control. arXiv preprint arXiv:2412.03568, 2024.
[4] Yifan Zhang, Chunli Peng, Boyang Wang, Puyi Wang, Qingcheng Zhu, Zedong Gao, Eric Li, Yang Liu, and Yahui Zhou. Matrix-game: Interactive world foundation model. arXiv, 2025.
[5] Mingyu Yang, Junyou Li, Zhongbin Fang, Sheng Chen, Yangbin Yu, Qiang Fu, Wei Yang, and Deheng Ye. Playable game generation. arXiv preprint arXiv:2412.00887, 2024.
[6] Jiwen Yu, Yiran Qin, Xintao Wang, Pengfei Wan, Di Zhang, and Xihui Liu. Gamefactory: Creating new games with generative interactive videos. arXiv preprint arXiv:2501.08325, 2025b.
[8] Genie 2: A large-scale foundation world model
[9] Zeyinzi Jiang, Zhen Han, Chaojie Mao, Jingfeng Zhang, Yulin Pan, and Yu Liu. Vace: All-in-one video creation and editing. arXiv preprint arXiv:2503.07598, 2025.
本文由人人都是产品经理作者【鹅厂技术派】,微信公众号:【鹅厂技术派】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自Unsplash,基于 CC0 协议。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。