惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

GbyAI
GbyAI
阮一峰的网络日志
阮一峰的网络日志
G
Google Developers Blog
J
Java Code Geeks
Blog — PlanetScale
Blog — PlanetScale
大猫的无限游戏
大猫的无限游戏
云风的 BLOG
云风的 BLOG
Vercel News
Vercel News
L
LangChain Blog
Hugging Face - Blog
Hugging Face - Blog
T
The Blog of Author Tim Ferriss
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Stack Overflow Blog
Stack Overflow Blog
P
Proofpoint News Feed
腾讯CDC
博客园_首页
博客园 - 聂微东
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
M
MIT News - Artificial intelligence
WordPress大学
WordPress大学
D
DataBreaches.Net
Microsoft Security Blog
Microsoft Security Blog
有赞技术团队
有赞技术团队
博客园 - 叶小钗

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
自动驾驶2.0时代已至:VLA与VLM如何重塑出行?
OpenAIer · 2026-01-12 · via 人人都是产品经理

自动驾驶正在经历从感知到决策的质变飞跃。最新涌现的VLA和VLM技术不仅让车辆'看见'世界,更赋予其人类般的思考与行动能力。本文将深度解析这两种模型的差异与演进,揭秘它们如何攻克长尾场景、实现人车共驾,并推动汽车与机器人产业的跨界融合。

2026年,自动驾驶领域正迎来一场深度的技术变革。如果说早期的技术是让车辆“看见”世界,那么现在的VLA(视觉-语言-动作模型)和VLM(视觉-语言模型)则是在教车辆如何像人类一样“思考”并“行动”。

我们先认识一下什么是VLM和VLA

1. VLM(Vision-Language Model),称为视觉语言模型

是一种多模态人工智能模型,设计用来理解和处理视觉信息(图像、视频)和语言信息(文本)之间的联系。它们融合了计算机视觉和自然语言处理的技术。

核心能力是擅长将视觉内容与语言描述关联起来,例如:

  • 图像描述生成(看图说话)
  • 视觉问答(根据图片内容回答问题)
  • 图文检索(根据文本找图或根据图找相关文本)
  • 多模态对话(结合图像和文本进行交流)

输入: 可以接受图像/视频 + 文本的组合作为输入。

输出: 通常生成文本输出(描述、答案等)。

2. VLA(Vision-Language-Action Model),意思是视觉语言动作模型

是一种扩展了 VLM 能力的多模态模型。它不仅理解视觉和语言信息,还能基于这些理解来规划或执行具体的动作或任务。它是迈向具身智能(Embodied AI)的关键一步。

核心能力: 在 VLM 能力的基础上,增加了决策和行动的能力:

  • 理解环境(通过视觉)
  • 理解指令(通过语言)
  • 规划并执行动作来实现目标(如机器人操作、游戏控制)。

输入:图像/视频 + 文本(指令或任务描述)。

输出:文本 + 动作序列/决策(例如,控制机器人的指令、在虚拟环境中的下一步操作)。

它们之间的主要差异:

简单来说:

  • VLM是理解图像和语言之间关系的高手。
  • VLA是在 VLM 的基础上,增加了根据视觉和语言信息来采取实际行动的能力。

作为端到端自动驾驶的“2.0版本”,VLA正从幕后走向台前,成为重塑行业格局的核心力量。

一、从“辅助分析”到“直接控车”:VLA的定位升级

过去,VLM主要扮演“场景分析师”的角色,负责提供文本描述和环境理解。而VLA的出现实现了质的飞跃:

  • 感知-决策-执行闭环:VLA深度融合了视觉输入、语言理解和动作输出,能够直接生成驾驶控制指令。
  • 核心演进方向:业内普遍认为,VLA是通往L4级别自动驾驶的关键跳板,也是“端到端+VLM”架构的终局形态。

二、暴力美学:算力与规模的全面进化

为了支撑复杂的实时决策,VLA和VLM在硬件与模型参数上正在疯狂“堆料”:

  • 巅峰算力:小鹏第二代VLA搭载了具备2250 TOPS有效算力的图灵AI芯片,为环境处理提供了强大的底座。
  • 性能飞跃:模型推理效率提升了12倍,参数规模从10B扩展至72B,验证了性能随数据增长的“规模法则”。
  • 毫秒级响应:这种进化带来的直接结果就是更高精度的场景理解和近乎零延迟的实时反馈。

三、攻克“长尾场景”:它比你更懂复杂路况

自动驾驶最难的不是跑高速,而是处理那些奇葩的“长尾场景”。

  • 高难度场景覆盖:在车道线模糊、路口盲区、积水路面等复杂环境下,VLA表现优异。例如,小鹏VLA已能实现“小路之王”般的顺畅通行。
  • 越开越聪明的AI:通过强化学习,模型能够记录并学习用户的操作,逐步实现个性化驾驶风格的适配,真正实现人机共驾的进化。

四、行业大整合:一套模型,驱动万物

VLA的影响力正在溢出汽车领域,向更广阔的机器人生态延伸:

  • 一体化架构:通过深度整合视觉/语言编码器与动作解码器,实现多模态输入的高效处理。
  • 跨界落地:小鹏提出的“一套模型、多维落地”战略,让同一套VLA模型能同时驱动AI汽车、Robotaxi及机器人。
  • 巨头博弈:理想、英伟达等企业正密集布局。理想计划在2026年落地基于英伟达Thor芯片的封闭式VLA模型,其目前的VLM应用已将复杂场景接管里程提升了2.5倍。

最后

从文字理解到控制指令,从实验室走向全场景覆盖,VLA与VLM的深度融合标志着自动驾驶已经进入了高阶智能的决胜期。

当算力不再是瓶颈,当模型学会了自主进化,我们距离“真正解放双手”的那一天,或许比想象中更近。

本文由 @OpenAIer 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议