惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
N
Netflix TechBlog - Medium
宝玉的分享
宝玉的分享
Google DeepMind News
Google DeepMind News
腾讯CDC
G
Google Developers Blog
Martin Fowler
Martin Fowler
Microsoft Security Blog
Microsoft Security Blog
Recent Announcements
Recent Announcements
爱范儿
爱范儿
Engineering at Meta
Engineering at Meta
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans
aimingoo的专栏
aimingoo的专栏
有赞技术团队
有赞技术团队
Jina AI
Jina AI
人人都是产品经理
人人都是产品经理
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
M
MIT News - Artificial intelligence
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
美团技术团队
WordPress大学
WordPress大学
阮一峰的网络日志
阮一峰的网络日志

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了!
DeepSeek阮翀加盟元戎首秀,详解基座VLA,研发提效10倍
一凡 · 2026-04-26 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-04-26 12:16:23 来源:量子位

V4作者之一

一凡 发自 副驾寺

智能车参考 | 公众号 AI4Auto

前DeepSeek核心成员阮翀,加盟元戎后首次亮相了。

阮翀(chōng),本硕均毕业于北京大学,早年从事NLP研发,2023年加入DeepSeek,参与了DeepSeek VL、V3和R1等工作,是VL2的通讯作者,也是最新发布的V4的作者之一

△图源:DeepSeek V4论文

如今他以新身份元戎首席科学家,现身北京车展,分享了元戎如何利用40B基座模型,评估模型表现,用模型迭代模型的过程。

这意味着AI不再是被训练出的结果,而是训练系统本身的组成部分。这也是AI领域当前的趋势。

比如,同样是在自动驾驶行业,小马智行最近发布世界模型2.0,就具备自我诊断能力,可以实现自我强化。

再比如,OpenAI今年在发布 GPT-5.3 Codex时透露,该模型的早期版本,加速了其自身的开发进度。

在数字世界和物理世界,AI都初步呈现出自我进化的趋势。而能同时深刻理解这两个领域的人才,非常稀缺,阮翀正是这样一位罕见的人才,从LLM转身自动驾驶,横跨两大领域。

阮翀详解基座模型,元戎研发提效10倍

据阮翀介绍,过去自动驾驶研发,会选择用很多小模型,专门解决不同的问题,这给开发和管理,带来了很多挑战。

所以,行业正在向统一基座模型收敛,用一个大模型,分化出多个不同版本,解决几乎所有问题。

其中元戎的基座模型,是一个40B参数规模的VLA(Vision-Language-Action Model),可以拆分成三个部分来看:

  • 驾驶模型:AI司机,专门负责开车
  • 分析模型:AI分析员,分析和解释AI司机为什么这么开
  • 评估模型:AI教练,评估AI司机开车的表现

基座模型如何落地,加速元戎开发呢?阮翀举了三个例子。

第一个例子是数据表征任务。自动驾驶研发的关键,是实现数据闭环,但阮翀认为过去数据驱动的方式,其实带有滞后性

你必须先训练出模型,才能发现模型的问题,进而知道哪些数据不够。

数据表征则改变了这个顺序,它可以提前分析数据,并进行归类,这样研发团队在训练前就知道,自己手头什么场景的数据多,又缺什么场景数据,在训练时就可以有所侧重,调整数据配比。

第二个例子是数据质量评估。过去分析数据质量,需要通过间接方式,根据这批数据,训出的模型表现,反推数据质量,迭代周期比较长。

现在基于一个庞大的基座模型,只需要进行简单的微调,就能评估数据质量

最后,基座模型不仅在数据维度实现了提效,同时也加快了模型评估。过去评估模型能力,主要依赖路测,要先更新模型上车,再找人跟车,实测后回传数据,这种方式费时又费力。

现在利用云端虚拟环境,就能评估模型,判断AI司机开得好不好,并进行修正。

据阮翀估计,以前迭代一版模型可能需要100多个小时,现在加速了10倍,迭代时间缩短到了十几个小时。

在详解技术成果后,阮翀还参与了圆桌讨论,回应了外界最关心的问题:

为什么他会加盟元戎,转向物理AI?

以下是圆桌实录,经编辑

阮翀回应入局物理AI

Q:什么才是物理AI?

阮翀:从狭义的角度讲,物理AI一定要有一个现实载体,比如人能操纵它,然后现实世界会给出反馈,像机械手或者车。

但我认为物理AI最重要的事其实是闭环。

所以从广义的角度讲,比如说AI Coding,写了代码然后编译器会给出反馈,告诉你这个地方写了对不对,然后你再去调试。

只有这样的一个闭环,才是AI真正进入物理世界的最重要手段,能够让它不断提升。

Q:什么情况让你意识到了大模型的能力边界?

阮翀:我认为视觉模型现在最难的问题是空间方位感知,经常前后左右不分,然后导致一些奇奇怪怪的行为,比如分不清车门在左边还是右边,东西在车内和车外。

Q:哪些领域的突破性进展,值得大模型借鉴?

阮翀:我想强调的一个概念还是闭环我觉得这个问题可以反过来看,就是如何把LLM推广到其他领域,比如用AI去预测化学分子性质,比如它的熔点或溶解度,然后用这项技术,加速药物研发。

Q:我们如何保证AI发展,是对人类有利的?

阮翀:我个人现在非常赞同Harness(约束AI边界的系统工程)的概念。人需要法律和规章制度,保证他成为一个好人。

对AI也是一样的,如果你坚信AI能超越人,那么你也需要一些工具来控制它,而不是期待它性本善。

Q:为什么近期不少LLM公司的多模态负责人,入局物理AI?

阮翀:对我来说,我觉得有两方面的原因:

第一,我自己不太喜欢做边际收益递减的事情。我觉得做LLM很多年了,当然它的能力在不断提升,但和ChatGPT刚出来时,感觉已经完全不一样了,有一种疲倦的感觉。

LLM发展非常好,比其他领域领先,一个模型几乎可以解决你想要的所有事。

但在别的领域,比如多模态或者具身智能,还没有发展到这样的阶段,我自己更愿意参与这样的阶段,而不是进入一个相对成熟的阶段

第二,我自己性格的原因。我不喜欢跟别人抢着做事,比如LLM很好,那大家都一窝蜂去做,但我更在意某种使命感或者责任感

一件事情,如果我去做和我不去做,对世界来说都没有差别,那我为什么要做?

所以,我选择换一个领域。

版权所有,未经授权不得以任何形式转载及使用,违者必究。