惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
月光博客
月光博客
B
Blog RSS Feed
C
Check Point Blog
WordPress大学
WordPress大学
T
Tailwind CSS Blog
GbyAI
GbyAI
H
Help Net Security
Y
Y Combinator Blog
I
InfoQ
雷峰网
雷峰网
阮一峰的网络日志
阮一峰的网络日志
小众软件
小众软件
美团技术团队
博客园 - 三生石上(FineUI控件)
MongoDB | Blog
MongoDB | Blog
Jina AI
Jina AI
A
About on SuperTechFans
G
Google Developers Blog
爱范儿
爱范儿
F
Fortinet All Blogs
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
U
Unit 42
人人都是产品经理
人人都是产品经理

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
Wan-Move 开源:阿里清华联手,无需改动模型即可实现点级精准...
站外新闻 · 2026-06-15 · via Prompt 语宙

💡 站外导读:在AIGC视频生成领域,如何实现精准、细粒度的运动控制一直是核心挑战。传统方法往往需要复杂模型改造或额外模块,门槛高且效果受限。阿里通义实验室与清华大学等机构最新开源的Wan-Move框架,直击这一痛点。它无需对现有图像到视频模型进行任何架构更改,即可通过潜在轨迹引导技术,实现对场景中每个元素的精确点级运动控制,并生成与商业系统质量相当的视频,为行业提供了全新的高效、易用的解决方案。

Wan-Move 是阿里巴巴通义实验室等机构开源的运动可控视频生成框架,通过潜在轨迹引导实现高质量的视频运动控制。核心亮点在于无需对现有图像到视频模型进行架构更改,可实现细粒度的点级运动控制,能生成 5 秒、480p 的视频,运动控制质量与商业系统相当。Wan-Move 提供了 MoveBench 基准测试,包含大规模样本和高质量轨迹注释,可用于评估和对比不同方法的运动控制能力。

  • Wan-Move是什么
  • Wan-Move的主要功能
  • Wan-Move的技术原理
  • Wan-Move的项目地址
  • Wan-Move的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Wan-Move

Wan-Move的主要功能

  • 高质量运动控制:能生成5秒、480p的视频,其运动控制质量与商业系统相当,满足高质量视频创作需求。

  • 潜在轨迹引导:通过传播第一帧的特征沿轨迹生成时空特征图,无需额外运动模块,可无缝集成到现有图像到视频模型中。

  • 细粒度点级控制:支持对场景中每个元素进行精确的区域级运动控制,实现高度定制化的视频效果。

  • 基准测试MoveBench:提供大规模、多样化、长时长的视频样本和高质量轨迹注释,用于评估和对比不同方法的运动控制能力。

  • 开源与易用性:代码、模型权重和MoveBench均已开源,用户可快速上手进行视频生成和运动控制实验,降低使用门槛。

Wan-Move的技术原理

  • 潜在轨迹引导:Wan-Move 使用潜在轨迹引导技术,将物体的运动表示为密集的点轨迹,并将这些轨迹映射到潜在空间中。通过沿着轨迹传播第一帧的特征,生成对齐的时空特征图,从而实现对视频生成中运动的精细控制。

  • 无需额外模块:框架无需对现有的图像到视频模型(如 Wan-I2V-14B)进行架构更改,也无需添加额外的运动编码器,即可实现运动控制,具有很好的兼容性和扩展性。

  • 大规模训练:通过大规模的训练数据和优化,Wan-Move 能生成高质量的 5 秒、480p 视频,其运动控制能力与商业系统相当,确保了视频的视觉效果和运动的准确性。

  • 细粒度点级控制:物体的运动通过密集点轨迹表示,使用户可以对场景中的每个元素进行精确的区域级运动控制,实现高度定制化的视频效果。

  • 基准测试 MoveBench:为了验证和评估运动控制效果,Wan-Move 提供了 MoveBench 基准测试,包含大规模样本、多样化内容类别、长时长视频和高质量轨迹注释,为研究和开发提供了标准化的测试平台。

Wan-Move的项目地址

  • 项目官网:https://wan-move.github.io/
  • Github仓库:https://github.com/ali-vilab/Wan-Move
  • HuggingFace模型库:https://huggingface.co/Ruihang/Wan-Move-14B-480P
  • arXiv技术论文:https://arxiv.org/pdf/2512.08765

Wan-Move的应用场景

  • 视频创作:用户可以通过定义物体的运动轨迹来生成具有特定运动效果的视频,适用于动画制作、特效设计、创意短视频等领域,帮助创作者快速实现复杂的运动场景。

  • 广告与营销:在广告视频中,Wan-Move 可以用于生成动态的产品展示、品牌故事等,通过精细的运动控制吸引观众注意力,提升广告的吸引力和影响力。

  • 视频编辑:支持对视频的第一帧进行编辑,将这些更改应用到整个视频中,还可以进行运动复制和相机运动控制,帮助视频编辑人员快速调整和优化视频内容。

  • 教育与培训:在教育领域,Wan-Move 可以生成具有动态演示效果的教学视频,例如物理实验、生物动画等,通过生动的运动展示帮助学生更好地理解和学习知识。

  • 游戏开发:在游戏开发中,Wan-Move 可以用于生成游戏中的动画效果,如角色动作、场景变化等,提升游戏的视觉效果和用户体验。

  • 虚拟现实(VR)和增强现实(AR):Wan-Move 可以生成与虚拟环境或增强现实场景相匹配的动态视频内容,为用户提供更加沉浸式的体验。

📝 站长洞察 (Editor’s Insight)

Wan-Move的发布,标志着可控视频生成技术正从“能动”向“精准动”迈进关键一步。其核心价值在于“无侵入式”的架构设计:无需改动现有模型,即可实现细粒度运动控制,这极大降低了技术集成与迭代的门槛,预示着模块化、可插拔将成为AIGC工具链的主流趋势。同时,伴随发布的MoveBench基准测试,为行业建立了统一的评估标尺,这比单个模型本身更具长远意义,它将加速该领域的研究收敛与创新。从商业角度看,这种精准控制能力将直接赋能广告、影视、教育等需要高度定制化动态内容的场景,是AIGC从炫技走向实用、从生成走向创作的关键基础设施。