惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
博客园 - 司徒正美
Microsoft Azure Blog
Microsoft Azure Blog
J
Java Code Geeks
The Cloudflare Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
The GitHub Blog
The GitHub Blog
Recent Announcements
Recent Announcements
Blog — PlanetScale
Blog — PlanetScale
G
Google Developers Blog
WordPress大学
WordPress大学
A
About on SuperTechFans
Hugging Face - Blog
Hugging Face - Blog
T
Tor Project blog
阮一峰的网络日志
阮一峰的网络日志
Recent Commits to openclaw:main
Recent Commits to openclaw:main
The Hacker News
The Hacker News
F
Full Disclosure
有赞技术团队
有赞技术团队
H
Help Net Security
Security Latest
Security Latest
P
Palo Alto Networks Blog
MyScale Blog
MyScale Blog
Simon Willison's Weblog
Simon Willison's Weblog
G
GRAHAM CLULEY
P
Privacy International News Feed
P
Proofpoint News Feed
Scott Helme
Scott Helme
V
Vulnerabilities – Threatpost
罗磊的独立博客
Y
Y Combinator Blog
云风的 BLOG
云风的 BLOG
aimingoo的专栏
aimingoo的专栏
Latest news
Latest news
Jina AI
Jina AI
Stack Overflow Blog
Stack Overflow Blog
C
Cyber Attacks, Cyber Crime and Cyber Security
Hacker News: Ask HN
Hacker News: Ask HN
爱范儿
爱范儿
T
Threat Research - Cisco Blogs
Last Week in AI
Last Week in AI
The Last Watchdog
The Last Watchdog
N
Netflix TechBlog - Medium
D
DataBreaches.Net
L
LINUX DO - 热门话题
Application and Cybersecurity Blog
Application and Cybersecurity Blog
L
Lohrmann on Cybersecurity
O
OpenAI News
S
SegmentFault 最新的问题
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC

36氪

滨化股份港股上市获中国证监会备案-36氪 飞南资源:一季度净利润4.05亿元,同比增长7919.37%-36氪 A股三大指数集体收跌,全市场超3300股飘绿-36氪 阳光电源股份有限公司向港交所提交上市申请书-36氪 沪深两市成交额连续第222个交易日突破1万亿元-36氪 证监会部署打击和防范上市公司财务造假专项行动 天辰生物港股IPO获中国证监会备案-36氪 阿里云:4月30日10:00起,Qoder Teams版新购价格调整为300RMB/席位月-36氪 超捷股份:第一季度净利润1422.89万元,同比下降1%-36氪 外汇局:1-3月,中国外汇市场累计成交75.78万亿元人民币-36氪 当升科技:第一季度净利润2.77亿元,同比增长150%-36氪 最前线|AI收入破亿后的路径选择:微盟推行AI First战略与B端交付的挑战-36氪 洛阳钼业:第一季度净利润77.6亿元,同比增长96.65%-36氪 高德地图发布“AI 伴行”-36氪 赤峰黄金:第一季度净利润9.88亿元,同比增长104%-36氪 恒指收涨0.24%,恒生科技指数涨0.75%-36氪 中材科技:第一季度净利润5.07亿元,同比增长40.15%-36氪 东阿阿胶:第一季度净利润4.55亿元,同比增长7.14%-36氪 杭钢股份:第一季度净利润960.76万元,同比扭亏为盈-36氪 法国国民健康数据将从微软迁移至本土平台-36氪 歌尔股份:公司MEMS传感器产品在消费电子和汽车电子领域内均有较多应用场景-36氪 财政部:截至上周,消费品以旧换新带动销售额超5400亿元,惠及近7500万人次-36氪 财政部:一季度国债发行规模超3.62万亿元,投资者认购积极踊跃-36氪 DeepSeek V4发布,海光DCU完成Day0适配-36氪 财政部:一季度全国税收收入4.85万亿元,同比增长2.2%-36氪 财政部:股票市场交易活跃,一季度证券交易印花税增长78.1%-36氪 财政部:一季度全国一般公共预算收入6.16万亿元,同比增长2.4%-36氪 日本将从5月1日起释放第二批石油储备-36氪 天猫与长安汽车达成合作,正式入局整车销售-36氪 理想L9 Livis计划于5月15日正式上市,并开启交付-36氪 百度联盟正式发布海外App业务-36氪 挪威将禁止16岁以下儿童使用社交媒体-36氪 小马智行联合宁德时代首发L4级无人驾驶轻卡-36氪 日本将成立特别工作组应对金融体系网络安全风险-36氪 美股新高之际 高盛警告:美股近期可能下跌,切莫贸然加仓-36氪 有道龙虾已率先集成DeepSeek-V4和Kimi K2.6-36氪 PPIO首批上线DeepSeek-V4-36氪 特斯拉:赛博无人驾驶电动车Cybercab在北美投产-36氪 航油价格飙升令多家美国航空运营商业绩承压-36氪 国家能源局:3月核发绿证3.03亿个-36氪 每日互动DeepSeek-V4私部方案已就绪-36氪 沪深两市成交额连续第13个交易日突破2万亿-36氪 博硕科技:蓝海芯新材料已投入运营,当前营收规模较小-36氪 DeepSeek V4终于发布,但它留下的5道主观题还没有答案-36氪 起亚公司第一季度销售额29.5万亿韩元,高于市场预期-36氪 小鹏第二代VLA智驾报告首发,全系Ultra车型订单环比提升118%-36氪 北京君正:目前公司在研发LPDDR5-36氪 融了2000万美金,这家2000万美金ARR的AI公司,推出“视频版Photoshop”「Buzzy」 阶跃发布新一代自动语音识别模型StepAudio 2.5 ASR-36氪 NEC宣布与Anthropic达成网络安全合作-36氪 Keep发布9.0版本-36氪 李斌:汽车行业决赛期还有五年结束-36氪 电投贵安数据中心公司注册资本增至2.98亿元-36氪 半日主力资金加仓基础化工板块,抛售通信板块-36氪 海光C86全栈产品与解决方案亮相第87届教育装备展-36氪 茅台向经销商「要利润」-36氪 香港机场3月客运量同比增长19.6%-36氪 恒指午间休盘跌0.2%,恒生科技指数涨0.34%-36氪 英特尔CEO:半导体行业整体潜在市场规模已逼近1万亿美元-36氪 江苏省环保集团注册资本增至约63.6亿元 A股三大指数午间休盘集体下跌,贵金属板块领跌-36氪 英特尔CEO:所有业务板块需求仍高于供给,预计至强服务器CPU今明两年保持强劲增长势头-36氪 中国首款原生开发Robotaxi亮相北京车展,曹操出行定制版计划2027年量产-36氪 摩根士丹利:新兴市场股票远未进入新的长期牛市-36氪 Gartner:2025年阿里云中国市场份额32.8%,同比提升2.7个百分点-36氪 DeepSeek官网公布DeepSeek-v4接口文档-36氪 2026年大众汽车将在中国推出13款新能源车型-36氪 华尔街多家公司承诺提供60亿美元支持QXO收购TopBuild-36氪 现货白银向下跌破75美元/盎司-36氪 软银拟改造工厂为数据中心生产电池-36氪 蔚来在武汉成立新能源科技公司-36氪 万兴科技旗下万兴脑图上线“万兴脑图AI”-36氪 国家能源局:1-3月全国电力市场交易电量同比增长25.6%-36氪 菲律宾央行暗示将小幅加息以抑制通胀-36氪 可灵AI 3.0模型新增原生4K能力-36氪 用“活人感”做科技社区,小红书能成吗?-36氪 创业板指跌逾2%,AI硬件、软件领跌-36氪 天鹜科技发布对话式蛋白质研发智能体MatwingsVenus™-36氪 人工智能初创公司Cognition AI进行融资谈判,估值达250亿美元-36氪 恒生指数跌幅扩大至1%-36氪 OMV新西兰公司预计毛伊气田将于2026年停产-36氪 维塔流动近日完成数千万元Pre-Seed轮融资-36氪 亚马逊支持的X-Energy通过IPO募资10.2亿美元-36氪 千问加速上车,10多家车企同日宣布接入-36氪 天问三号任务计划于2031年前后携带火星样品返回地球-36氪 统筹推进商业航天标准化建设,商业航天标准体系(1.0版)发布-36氪 博裕、经纬、顺为等投资前新石器COO超亿元,押注AI超便携电子纸|硬氪独家-36氪 A股三大指数集体低开,新易盛跌超9%-36氪 央行今日开展50亿元7天逆回购操作-36氪 恒指开盘跌0.7%,恒生科技指数跌0.8%-36氪 人民币兑美元中间价报6.8674-36氪 小米汽车:新一代SU7已交付26000台-36氪 8点1氪丨华谊兄弟被申请破产重整;普华永道因恒大审计赔偿10亿港元;伊朗将恢复往返中国的航班-36氪 打造生物智能基础设施,AI4S企业「奥明星程」获超亿元A轮融资|36氪首发-36氪 美国百年太妃糖易手,Roca乐家被全资收购-36氪 破局“智驾双雄”,千里科技如何以AI之力重塑行业格局-36氪 氪星晚报|ThinkPad发布AI主机,可一键部署“龙虾”、较云主机三年总成本可节省48%;量化投资先驱马丁·卢克警告勿将交易决策全盘交予人工智能;国家知识产权局:2025年我国共授权发明专利97.2万件-36氪 创·问|炜璨医疗李强:从理解规则,到建立规则——重塑植入式给药路径-36氪 固态激光雷达“像素竞赛”加速,速腾聚创VGA大面阵SPAD-SoC产品发布|最前线-36氪 36氪官方AI专属社群,正式开放招募!-36氪
从混沌到秩序:具身智能的数据供给革命与技能结构化实践| 2026AI Partner·北京亦庄AI+产业大会-36氪
2026-05-22 · via 36氪

大语言模型可以靠堆数据跑通Scaling Law,但机器人面对的是动态、多模态、强时序关联的物理世界,杂乱的数据堆在一起,训不出可靠的模型。从混沌到秩序的工业化路径,质量比数量更重要。

机器人进工厂、进场景,真正的挑战不在模型本身,而在数据。徐良威指出,具身智能的数据不是时间、空间、任务意图紧密耦合的多模态资产。智域基石提出了五层数据编译管线模型,每一层都有明确的质量指标,唯有构建数据底座生态,让本体方、模型方、产业方各司其职,高质量物理世界的数据才能真正流通起来,支撑具身智能的规模化落地。

以下为演讲内容,经36氪整理编辑:

徐良威丨智域基石CTO

大家好,我是智域基石的联合创始人兼CTO,今天我跟大家分享的是从具身智能的数据供给革命与技能结构化实践,标题是从混沌到秩序。为什么是从混沌到秩序?具身智能的到来让大家发现原先在大语言模型、自动驾驶或者在所有过去AI的数据实践在具身智能里不够用了,今天主要讲一下智域基石在上面做了什么样的工作,主要讨论两个话题,第一个事情我们在具身智能的数据上怎么去做标准化的工业化实践。第二个如何把数据和模型本体、产业、场景结合起来,变成一个生态,而不是单纯数据的事情。

我们直接到机器人的落地,2026年我们可以看到一部分的机器人已经从小样逐渐往产业里跑了,原先我们考虑到的是怎么把实验室里的算法用视频或者现场展示的方式展现出来,这个事情已经远远不一样了,我们把机器人从实验室里搬到真实的场景里,原先只要考虑让机器人动起来、完成指定任务就可以了。现在我们要考虑的事情是如何让机器人面对不确定的、动态的、多模态整个场景数据输入,还能够进行持续稳定和物理世界的交互,这时候我们就要考虑我们怎么产生稳定化供给。

原先有一句话说的很对,模型决定机器人的能力上限,模型决定了机器人能干什么,很难决定机器人在最差的环境下能做到什么程度,因为很多事情即使是人在新的场景里都不一定能够处理的好,这个时候就需要我们考虑怎么把真实场景里的数据,这个数据可能分为本体数据,机器人感知到的环境数据,甚至是机器人的任务,机器人的日志,这些信息都要能够送到机器人训练的整个闭环里,这时候才能够把原先在小样级别变成真正在产业里能够落地的事情。

原先大家做语言模型时,大家说Scaling Law,希望有越来越多的数据才能让模型变的越来越好,本身这个事情是没有问题的,具身智能不像原先是结构化的数据,我们在多模态跟持续强相关的数据领域里发现,我们如果单纯堆数据,把大量原先混杂在互联网的数据跟机器人操作相关的数据,不管什么样的仿真数据,把这些数据全部堆在一起,能不能让模型训练出来?有这个可能性,目前的结论,我们还很难说把一些杂乱的、毫无规则的数据堆在一起就能够训练出更好的模型,我们不仅考虑数量,还要考虑质量。这个质量一方面体现在采集,另一方面体现在数据的采集、质检、预标注、人态环路的闭环再到数据后处理,再到导出,最后进到模型训练,完成模型到数据的闭环体现在整个环节里,每个环节都需要质量,如果某一环节出了差错,不是说这个模型训练不出来,而是真正的模型落到本体再进入场景,如果这个场景出问题,怎么回溯到我这个数据或者在原先的闭环里哪一部分出了问题,这是我们对于数据的要求,数量很重要,但我们要考虑质量,还要考虑质量在每一个环节里的重要性。

路线有很多,大家经常讲的VLA,以模仿学习为主,以视觉输入、语言指令再加上机器人的动作,一个机器人看到什么样的场景,我得到了指令,下一步输出什么样的动作,是一个轨迹层面的数据,以轨迹为主。另外一条路线,大家经常提起的世界模型,在world model中加一个action,最终要作用在物理世界里的,这里考虑的是我看到一个场景,我施加了一个动作,物理世界变成什么样,这时候考虑的是因果关系,这里面虽然VLA和world model有模型上的差异,需要的都是同一种底层资产,在真实世界里的结构化高质量数据,我定义了合理的或者适用于最终模型任务,通过一定手段把物理里的信息数字化,再经过结构化的过程,把它变成可以输入到模型里的东西,这时候原始数据是一样的,中间流程稍微有一些不一样,基于同一套数据底座。

数据底座是一整套把真实的场景、真实的任务、真实的成功/失败、真实的和整个环境交互全部都记录下来,从而能够输入到模型里,让模型能够在真实的世界里获得闭环。这一套数据输入有可能是机器人本体,大家看到很多数据采集工厂、数据实训厂,通过让人操控机器人获得和机器人有关的数据,直接作用于机器人不管是预训练、后训练,现在还有一些比较前沿的,让人带着第一人称视角记录人的数字化劳动,让人本身的劳动数字化到虚拟世界里,再去训练不管是VLA还是世界模型,让机器人学会人类技能,本质上都是把人类或者是机器人这样的一个本体和环境的交互,把物理的概念变成一套数字化的概念,智域基石就做了一套数据底座,不管前端是什么样的数据流入,我们都可以通过数据编译管线处理成模型可以使用的数据,最终完成数据本体,再回到场景再回到数据的闭环。

一个任务怎么把原始数据记录变成模型可以使用的数据,第一个流程,先定义好任务,先要采一个什么样的数据,先要知道机器人看到了什么,它做出什么样的动作甚至它听到了什么,还要关注前因后果,我之前的场景是什么样的,我在看到这个场景以后我做出什么样的决策,我又做出什么样的动作,如果我发生这个动作,我接下来的思考是什么,这个世界真实又会怎么变,一方面记录在真实世界里发生的所有传感器的记录,另外从任务记录,不是单纯从传感器得到的,是事前规划或者是事后推演,我通过把现场记录、任务整理搞起来,后面我们把它变成机器人、具身智能需要的一套数据资产,中间涉及到怎么采集、提取其中的关键因素,最后怎么把它沉淀到资产,也会涉及到成功/失败的处理,涉及到失败以后机器人怎么重试,重试策略是什么,重试之后导致的结果是什么,这都是从原始数据变成训练样本重要的步骤之一。

这是智域基石提出的五层数据编译管线模型,我们考虑到原始数据不是把数据采完了,把它存到硬盘里可以直接被输入到模型里训练,我们考虑到的是中间有非常多道流程,每一道流程都是有关键指标的。只有把每一步做好,才不是简单的数据存档,而是真正能够成为数据资产的东西,这一套数据资产下面可以进入到场景、模型,可以和本体结合,被真正的用起来。

第一个流程数据质检,首先是数据采集,采集后才能把真实物理环境里的模型信号变成数字信号,以数字化的形式存下来,raw data,是杂乱的、没有规则的、非结构化的数据,我并不知道好不好,也不知道能不能进入后面的处理流程里,第一步做数据质检,先看一看数据是否满足基本的数据处理要求。

数据满足后,进入数据处理管线里,下一步是数据对齐,机器人或者具身智能数据不是单纯的画面或者是简单的视频,其实是多模态和时序紧密结合的数据,完成空间、时间的对齐,完成时间、空间的结构化,不是单纯杂乱的数据,至少是被数据处理的算法和机器能够理解的数据,每处理一帧数据都可以完成横向、纵向的索引。完成以后,到了数据变成模型可用数据层次,从结构化数据里再提取出真正的语义或者因果关系部分,我们要知道数据在整个空间里怎么和环境交互的,跟意图对齐是什么样的,因果,比如之前发生了什么,场景是什么,之后又是什么,这是第三个步骤,到这个地方为止,这个数据已经能被模型用起来了,距离真正的模型泛化还很远。这时候我们要考虑我们要做好大规模数据处理,大规模数据在以前很多行业都有,现在所有行业都在讲大数据概念,但是在具身智能里不一样,因为是时间、空间、整个任务意图都紧密相连的一类数据。我们要考虑在上亿小时甚至是上千亿小时大规模数据下,我们怎么快速检索出来被某类模型需要找到的数据,这也是非常难的工作。

在前面四个步骤过去后就变的相对简单了,把数据处理好、对齐好,提取的所有内容,再找初模型需要的数据,最后给客户使用,这是最后一个环节交付。

在技术层面上完成了数据到训练之前的闭环,数据最终闭环远没有结束,必须要被模型公司用起来,而且模型公司后面的模型还要搭载在本体上,不仅完成小样,还要在产业落地,需要让数据出发经过模型部署到本体再落实到产业,最终再从产业获得反馈,回到数据这一方,这时候才是真正让数据流通起来,让智能不仅是单点而是让整个体系里把它部署起来,作为数据方是非常核心的作用,它要对接本体、对接模型,也可以对接产业。

在现在很多数据行业里,大家还是以项目制的形式做这个事情,模型没有收敛,本体百花齐放,产业也是在逐步进入到整个具身智能行业中来,智域基石做的数据,我们不仅是做一个数据项目,把体系都搭建起来,通过和本体、模型、产业对接,我们把一个项目制交付的能力变成可以被整个具身智能领域作用起来的一套数据基础措施,这时候不仅是能够交付一套数据,而是我能够支撑整个具身智能的发展,以后所有的产业、本体、模型都可以从数据方获得他想要获得的东西。

我们希望能够划分新的数据分工,让本体公司做数据,让模型公司做数据,或者让产业方做数据,都不能够支撑整个产业发展的,只有把这么一套生态构建起来,才能够让高质量物理世界的数据进入整个生态里,让具身智能行业发展起来。

我的分享就到这里,谢谢。