惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

有赞技术团队
有赞技术团队
Martin Fowler
Martin Fowler
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
罗磊的独立博客
H
Help Net Security
MongoDB | Blog
MongoDB | Blog
A
About on SuperTechFans
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Docker
云风的 BLOG
云风的 BLOG
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
I
InfoQ
J
Java Code Geeks
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
Engineering at Meta
Engineering at Meta
美团技术团队
小众软件
小众软件
Stack Overflow Blog
Stack Overflow Blog
C
Check Point Blog

博客园 - 张善友

RedNb.Nacos 2.0.0 正式发布:.NET 接入 Nacos 3.2.4,AI Registry 全能力落地 Rust 成为微软一线语言之后:谈谈 C# 与 Rust 的互补性 .NET 异常处理的"暗门":代码里写满 catch,你依然能抓住它——从一个 AI Agent 运行时的源码说起 写给 C++ 工程师的 OpenClaw.NET 上手指南:用你熟悉的 C++ 思维,跑起一个生产级 AI Agent .NET 11 RC1 发布:拿到"准生证",生产环境可以上了! 写给 PHP 工程师的 OpenClaw.NET 上手指南:用你熟悉的 PHP 思维,跑起一个生产级 AI Agent 写给 Rust 工程师的 OpenClaw.NET 上手指南:用你熟悉的 Rust 思维,跑起一个生产级 AI Agent 从对标 Java 到对标 Go:Native AOT 的"无痛化"之路,走到哪一站了? NuGet 半年度总结:周下载量从 54 亿到 67 亿,.NET 生态的"新一轮增长期"实锤了 写给 Java 工程师的 OpenClaw.NET 上手指南:用你熟悉的 Spring 思维,跑起一个生产级 AI Agent 写给 TypeScript 工程师的 OpenClaw.NET 上手指南:用你熟悉的 TS 思维,跑起一个生产级 AI Agent 写给 Python 工程师的 OpenClaw.NET 上手指南:用你熟悉的 Python 思维,跑起一个生产级 AI Agent 写给 Golang 工程师的 OpenClaw.NET 上手指南:用你熟悉的 Go 思维,跑起一个生产级 AI Agent MetaSkill 落地 .NET:当 Agent 从「调用工具」进化到「组织工具」 都是 AI 写代码,为什么 C# 比 Java 快半拍 MHS 三部曲(下):谁允许 AI 行动?——权力、合规与中国厂商的答卷 弱模型不能裸奔:Agent Harness 凭什么真实有效 TensorSharp 3.3.0.0 发布,视频生成、DFlash2 投机解码、安全加固一起来了 MHS 三部曲(上):别急着叫它「物理 MCP」——Anthropic 到底发布了什么 编程语言的「第三条道路」上,走得最远的其实是 C# 纯 .NET 手写 CUDA kernel,GLM-5.3-Flash decode 跑出 llama.cpp 的 2 倍 3 张卡到底能不能跑大模型推理?从 vLLM、llama.cpp 到 TensorSharp 的多卡真相 AI 编程时代,.NET 的机会在哪里? Vibe Coding 月提交量 29 亿次之后:GitHub 的危机、Azure 迁移,以及 .NET 的机会 从 PostgreSQL 到 Kubernetes:开源的护城河,从来不写在代码里 人工智能最先替代的,是人工智能学院自己 企业架构的六种场景:从"四大流派"到数字原生与 AI 原生 TensorSharp 最新进展研究报告:从 DeepSeek V4 Flash 到 GLM-5.2,以及等待中的 GLM-5.3 Google 官方下场安利:Go 是 AI 时代的"理想语言"?其实 C# 更有资格坐这个位置 当"入门第一课"的作者开始 Vibe Coding:廖雪峰 2026 上半年 AI 编程实践深度探索
MHS 三部曲(中):8 小时集成、六种被拦截的故障,和一次教...
张善友 · 2026-09-01 · via 博客园 - 张善友

导读

上篇讲了 MHS 的概念与设计。这一篇全部交给实战:卡内基梅隆大学的 8 小时到底替代了什么、六种人为注入的故障如何被拦在设备动作之前、Genentech 的 AI 如何自我校准又如何在泡沫面前翻车、以及一个会自己找离心机解决问题的系统。

案例的价值不在宣传数字,而在它们同时画出了能力的上限和下限。
1

一、CMU:8 小时替代数周,替代的到底是什么

卡内基梅隆大学的设备环境堪称地狱难度:机械臂由调度软件控制、靠往目录里扔作业文件驱动;液体处理器只有老式 Windows 脚本接口;酶标仪根本没有编程接口、只有屏幕——MHS 直接像人一样点界面。从零写驱动加编排层用了约 8 小时,而厂商交付同类方案通常要数周[1][2]

注意:8 小时替代的是设备接入与流程编排时间,不是把数周的科学实验压缩成 8 小时。 这是最容易被误读的数字。

接通之后才是重点。Agent 运行连续稀释剂量响应实验,第一轮最高浓度设 200 μg/mL,高浓度区饱和、拟合 R² 仅 0.884,系统自己判定不合格——把最高浓度降到 100 μg/mL、换新孔板重跑,第二轮 R² 提升到 0.981,全程无人介入[1:1]

这证明的是:在给定目标、接口和评价指标下,Agent 能完成「观察—判断—调整—重跑」的闭环。它没有证明系统能理解任意实验。

更硬核的是安全测试:团队人为注入六种故障——板子缺失、板子放反、读板器忙、相机断连、设备不可达、急停生效——六种情况下,系统全部在设备动作之前拦截[3][4]

二、Genentech:自优化很漂亮,翻车也很诚实

基因泰克的 BCA 蛋白定量实验里,Claude 的表现其实很亮眼:它自主编排液体处理仪、机械臂和酶标仪,还通过对照专家操作自我校准,把移液速度优化到水约 140 μL/s、黏稠蛋白液约 10 μL/s[3:1]

但翻车了:蛋白溶液摇晃产生泡沫,Claude 把它当作普通运行错误,在原孔位换参数重试,泡沫越搅越多。研究人员必须明确告诉它:这是物理故障,要换干净孔位、减少混合[1:2]。之后团队把这条经验写成可复用的 skill,同类错误率明显下降[2:1]

模型能读懂错误码,不等于理解错误背后的物理过程。 代码世界里合理的「重试」,到了液体世界可能让情况更糟。放到工厂里同理:相机看到工件位置不对,Agent 不断让机械臂重抓,却可能没发现是夹具松了——多试几次不是排障,反而可能把小问题变成碰撞。

三、更多一线信号

华盛顿大学:一位博士生一周内接入六台仪器(含自己写驱动),做了远程仪表盘、能盯着 qPCR 扩增曲线在平台期前自动叫停的监督流程,以及机械臂与液体处理仪之间的无碰撞交接。他也说了句实在话:让 Agent 长时间盯仪器,算力成本要跟省下的人力算一笔账[3:2][2:2]

HHMI Janelia:需要按序启动 7 个厂商软件的双光子显微镜平台整合为一键操作,后来新增一台相机只花几分钟[1:3][3:3]

Tetsuwan Scientific:在 9,143 次分液、1,508 个测量条件上跑通自动化移液优化,留出数据上的精度预测比厂商标称还准约 12%[3:4]。还有一个更能说明「能力发现」的细节:qPCR 试验中相机发现移液产生了气泡,机械臂本身解决不了,系统在已连接的设备中自己找到了离心机,提出把试管送进去低速转一下,再通过 MHS 下达指令[5][6]——相机负责发现问题,机械臂负责搬运,离心机负责处理,没有人为它们两两写连接程序。

四、安全原则:约束必须长在模型之外

这些案例背后是同一条安全原则。MHS 在硬件接口层强制设备自声明的边界、联锁和急停,与模型完全独立[7]——Janelia 的激光功率上限在设备层强制,而不是依赖 Claude「记住不要开太大」。

为什么必须这样?因为操作员换成了 Agent,而 Agent 不可信。把限幅、联锁写在上位机界面逻辑里的时代过去了,唯一可信的地方只剩驱动层。提示词可以告诉模型"速度不要超过多少",但不能代替控制器的硬限制;设备还要在模型失联、读数异常、权限被盗或指令冲突时,自己停在安全状态。

五、它不是 VLA——恰恰因为不是,才值得重视

具身智能行业最熟悉的词是 VLA:把视觉和语言指令映射成机器人动作。VLA 解决「这台机器人此刻该怎么动」;MHS 处理的是另一层:「整个现场有哪些设备、各自能干什么、现在什么状态、哪些动作绝对不能做」。

层级 解决什么 典型输出
MHS(接口编排层) 发现、理解、读取并编排异构设备 设备清单、状态、流程、约束
VLA / Policy(技能层) 把视觉与指令转成动作策略 轨迹、动作序列、高层技能
PLC / 控制器(执行层) 以确定时序执行运动与安全联锁 伺服指令、IO、毫秒级急停

两条路线不冲突。更准确的说法不是「Claude 终于拥有了身体」,而是:它第一次有了一套标准方法去调用身体——而且这个身体不一定是人形机器人,也可以是一间实验室、一套量子设备、一整条制造单元。

本篇小结

四个案例合起来说明三件事:接入与编排成本可以数量级下降(CMU/Janelia),闭环试错和跨设备补救是真的(CMU/Tetsuwan),但物理直觉仍是硬伤(Genentech),安全必须长在模型之外。

下篇预告:技术边界看清了,产业和人的问题才刚开始——谁允许 AI 行动?出了事谁负责?国内厂商用不了 Claude 怎么办?欧盟新规又卡在哪里?下篇聊权力、合规与落地清单。


参考资料:


  1. Anthropic's Model Hardware Standard Lets Claude Control Lab Robots Overnight — AlphaSignal ↩︎ ↩︎ ↩︎ ↩︎

  2. MHS:Anthropic 给硬件定了个"MCP",写上位机的人该怎么读 — 实验室仪器上位机 ↩︎ ↩︎ ↩︎

  3. Anthropic Model Hardware Standard (MHS) Explained — Kingy AI ↩︎ ↩︎ ↩︎ ↩︎ ↩︎

  4. Anthropic previews Model Hardware Standard for AI-controlled lab and factory equipment — MLQ.ai ↩︎

  5. Previewing the Model Hardware Standard — Anthropic ↩︎

  6. 从 MCP 到 MHS,AI 从调用软件走到了操作机器 — Daily Buffer ↩︎

  7. Holding the Light: Teaching an AI to Lock and Tune our Quantum Computer's Lasers — QuEra ↩︎