惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
罗磊的独立博客
雷峰网
雷峰网
量子位
V
Visual Studio Blog
Vercel News
Vercel News
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Cloudflare Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
宝玉的分享
宝玉的分享
月光博客
月光博客
Martin Fowler
Martin Fowler
aimingoo的专栏
aimingoo的专栏
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Microsoft Security Blog
Microsoft Security Blog
博客园 - 叶小钗
腾讯CDC
Engineering at Meta
Engineering at Meta
博客园 - Franky
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Y
Y Combinator Blog
Recent Announcements
Recent Announcements
Jina AI
Jina AI
A
About on SuperTechFans

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
DAM-VLA——手臂与夹爪解耦,三星研究院的动态动作VLA刷新机器...
2026-04-27 · via 雷峰网

一、背景 

视觉-语言-动作(VLA)模型正成为机器人智能化的核心架构,但现有主流方法(如OpenVLA、π0、CogACT)存在一个根本性缺陷:用同一个动作模型统一处理所有类型的动作。这种「一刀切」的设计在面对机器人操控任务时暴露出两大内在矛盾。

从任务特性来看,机器人操控存在两种本质不同的动作类型:手臂大幅度运动(粗动作)需要全局场景理解、路径约束宽松;夹爪精细操作(精细动作)需要局部精细聚焦、精确抓取姿态、容错率极低。这两种动作在路径约束、视觉注意力和数据分布上有本质差异,用同一个模型兼顾「粗定位」与「精细操作」必然产生冲突。

此外,传统方法缺乏对动作类型的主动感知与路由机制,无法根据当前操控阶段动态分配合适的推理资源,导致在长时程复杂任务中错误率随步骤增加而快速累积。DAM-VLA(Dynamic Action Model-Based Vision-Language-Action)首次将手臂运动与夹爪操作解耦建模,配合双尺度加权机制实现了精准高效的机器人操控。

 DAM-VLA——手臂与夹爪解耦,三星研究院的动态动作VLA刷新机器人操控SOTA  |  ICRA 2026

 二、核心方法 

DAM-VLA 的核心架构包含三大组件,各司其职,协同实现手臂-夹爪的精准解耦。

模块一:双通道视觉编码与VLM骨架

同时采用DINOv2和SigLIP两种视觉编码器,输出三类特征:普通视觉token用于多模态融合;DINOv2的class token(全局视觉表征)专门服务手臂运动模型;DINOv2的register token(局部视觉表征)专门服务夹爪操作模型。LLaMA-2的浅层输出用于动作路由决策,深层输出用于动作预测。这一设计使「全局感知」与「局部精细」的视觉信息分别流向对应的动作模型。

模块二:VLM驱动的动作路由机制

利用VLM的推理能力判断当前处于哪种操控阶段,通过可学习路由权重w动态选择激活手臂运动模型(w<0.5)或夹爪操作模型(w≥0.5)。两个专用DiT扩散模型并行训练:手臂运动模型接收全局视觉特征,预测大范围粗动作;夹爪操作模型接收局部视觉特征,精细预测夹爪动作。动作路由实现了「该全局时全局,该精细时精细」的智能切换。

模块三:双尺度动作加权机制

轨迹级权重采用非对称高斯分布(前沿σ=6宽、后沿σ=2窄),在夹爪状态转换点前后施加差异化权重,反映「操控前需要更充分准备」的人类直觉;Action-chunk级权重采用指数衰减(γ=0.8),确保近期动作预测权重更大。两层加权机制联合作用,显著提升了操控的时序一致性。

 三、亮点总结 

创新点一:真实机器人操控平均成功率86.8%

在Franka机器人的pick-and-place任务(80次试验)中,DAM-VLA平均成功率达86.8%,远超CogACT的62.9%(提升23.9个百分点)。分布内任务成功率91.4%(vs CogACT 65.7%),分布外泛化成功率82.2%(vs CogACT 60.0%),在仿真和真实环境中全面刷新SOTA。

创新点二:长时程任务最终成功率56%,超越所有基线

在FurnitureBench One-Leg组装任务(连续5步操控)中,DAM-VLA最终成功率56%,远超CogACT的42%和OpenVLA的29%。消融实验显示,双尺度加权机制是核心贡献,去掉后性能大幅下降,证明其对长时程动作连贯性的不可替代性。

创新点三:DINOv2 class/register token分工的关键发现

研究首次系统验证了DINOv2的class token与register token具有天然的全局-局部信息分工——前者包含场景级全局语义,后者包含精细局部几何信息。将两类token分别路由给粗动作和精细动作模型,无需额外的特征对齐训练,即可让模型的「视觉感知」与「操控阶段」高度匹配,为未来VLA模型的视觉编码设计提供了重要的实证依据。

──────────────────────────────────────────

上述内容包含AI辅助生成,更详细信息参见两个链接

论文链接:https://arxiv.org/abs/2603.00926

解读来源:https://research.samsung.com/blog/DAM-VLA-A-Dynamic-Action-Model-Based-Vision-Language-Action-Framework-for-Robot-Manipulation

雷峰网版权文章,未经授权禁止转载。详情见转载须知