惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
J
Java Code Geeks
小众软件
小众软件
D
Docker
腾讯CDC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
V2EX
博客园 - 叶小钗
GbyAI
GbyAI
Microsoft Azure Blog
Microsoft Azure Blog
Stack Overflow Blog
Stack Overflow Blog
B
Blog RSS Feed
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 【当耐特】
IT之家
IT之家
博客园 - 司徒正美
M
MIT News - Artificial intelligence
T
The Blog of Author Tim Ferriss
The GitHub Blog
The GitHub Blog
罗磊的独立博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
L
LangChain Blog
阮一峰的网络日志
阮一峰的网络日志
C
Check Point Blog

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
RAM——复杂场景下多人3D人体运动重建新框架 | CVPR 2026 | 雷峰网
2026-04-24 · via 雷峰网

  一、研究背景  

从视频中准确理解并重建人体3D运动是计算机视觉的重要研究方向,在体育赛事分析、VR/AR、人机交互以及医疗康复等领域具有广泛应用价值。然而,在真实复杂场景中,该任务仍面临三大严峻挑战:

首先是身份关联不稳定——多人交互时,频繁的遮挡和快速运动容易导致ID Switch,影响后续重建的一致性;其次是运动轨迹中断——视角变化和极端遮挡会造成目标跟踪丢失;第三是重建结果不连续——传统逐帧处理方式难以维持时间维度上的三维结构稳定性。

传统方法通常将目标跟踪和三维重建作为两个独立的流水线模块处理,无法从整体视角利用跨帧的时序信息。RAM(Recover Any 3D Human Motion)从根本上打破了这一范式,提出统一框架将运动感知跟踪、时序建模与动作预测有机融合,实现从逐帧处理向时序建模的范式转变。

 二、核心方法  

RAM 框架由四个关键模块构成,各司其职、协同工作:

SegFollow 模块(稳定跟踪):引入基于卡尔曼滤波的运动建模机制,将运动一致性信息融入目标关联过程。不再过度依赖外观特征,即使在严重遮挡或外观发生剧变的情况下,依然能维持稳定的身份跟踪,从根本上降低 ID Switch 发生率。

T-HMR 模块(时序三维重建):基于时间记忆机制,从邻近帧中筛选关键特征,利用 Transformer 结构进行跨时间信息融合。当当前帧信息不完整或存在噪声时,借助历史上下文生成平滑且一致的3D人体结构,解决重建不连续问题。

动作预测模块:基于历史运动序列对人体动态进行建模,预测未来的姿态。专门针对目标被完全遮挡的极端情况,在当前没有任何观测信息时,靠预测结果维持运动序列的连续性。

自适应融合模块:对当前帧重建结果与预测结果进行自适应加权——遮挡严重时更依赖预测,观测清晰时更依赖重建,根据当前信息可靠性动态调整权重,实现最优融合。

RAM——复杂场景下多人3D人体运动重建新框架 | CVPR 2026

 三、亮点总结  

亮点一:统一框架打破流水线壁垒RAM 首次将目标跟踪、时序三维重建与动作预测整合到统一框架内,从整体视角充分利用跨帧时序信息,彻底改变了传统串行流水线的局限,代表了多人3D运动理解的范式转变。

亮点二:强大的零样本泛化能力在 PoseTrack 等国际主流复杂场景数据集上,RAM 在无需针对特定目标数据集进行额外训练(Zero-shot)的条件下,依然在身份一致性、跟踪稳定性以及三维重建精度上显著超越现有方法,展现了极高的实际应用潜力。

亮点三:时序建模接近人类认知通过引入时间记忆与动作预测机制,使模型更接近人类真实世界中的动态认知过程——人们即使暂时看不到一个运动中的人,也能凭借记忆预判其位置与姿态。这一仿人认知设计不仅提升了技术性能,也为视频理解领域提供了重要的方法论启示。

──────────────────────────────────────────

上述内容包含AI辅助生成,更详细信息参见两个链接

链接:https://arxiv.org/abs/2603.19929

解读来源:https://cloud.tencent.com/developer/article/2658222

【封面图片来源:网站名开发者社区,所有者:NLPIR Lab】

雷峰网版权文章,未经授权禁止转载。详情见转载须知

RAM——复杂场景下多人3D人体运动重建新框架 | CVPR 2026