惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

I
InfoQ
C
CERT Recently Published Vulnerability Notes
The Last Watchdog
The Last Watchdog
P
Proofpoint News Feed
D
Darknet – Hacking Tools, Hacker News & Cyber Security
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
GbyAI
GbyAI
T
Tenable Blog
博客园 - 三生石上(FineUI控件)
P
Privacy & Cybersecurity Law Blog
Simon Willison's Weblog
Simon Willison's Weblog
Jina AI
Jina AI
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
T
Tor Project blog
博客园_首页
F
Fortinet All Blogs
博客园 - Franky
Latest news
Latest news
Last Week in AI
Last Week in AI
T
Threat Research - Cisco Blogs
Scott Helme
Scott Helme
L
LINUX DO - 热门话题
U
Unit 42
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Hugging Face - Blog
Hugging Face - Blog
D
Docker
Project Zero
Project Zero
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
MongoDB | Blog
MongoDB | Blog
F
Full Disclosure
D
DataBreaches.Net
Google DeepMind News
Google DeepMind News
Cisco Talos Blog
Cisco Talos Blog
Y
Y Combinator Blog
WordPress大学
WordPress大学
C
Cyber Attacks, Cyber Crime and Cyber Security
H
Help Net Security
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
月光博客
月光博客
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Blog — PlanetScale
Blog — PlanetScale
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
Schneier on Security
C
Cybersecurity and Infrastructure Security Agency CISA
P
Proofpoint News Feed
PCI Perspectives
PCI Perspectives
Cloudbric
Cloudbric
V
Visual Studio Blog
Recorded Future
Recorded Future
人人都是产品经理
人人都是产品经理

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
Claude 通过率不到4%,SaaS-Bench撕碎了Computer-Use的「全自动办公」幻想
量子位的朋友们 · 2026-05-25 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-25 11:29:41 来源:量子位

UniPat AI 发布 SaaS-Bench 评测,Claude 等主流大模型在真实办公任务中完全通过率最高仅 3.8%,AI 全自动办公远未落地。

想象一个真实的工作日:项目经理要更新项目状态,财务人员要整理客户账单,医疗管理员要核对预约和保险信息。

这些并不是高级专家任务,很多时候,一个认真一点的实习生照着流程也能完成。

但对今天的 AI Agent 来说,这些“日常工作”却远没有看起来那么简单。

它需要理解业务目标、跨应用查找信息、保持状态一致,还要在几十甚至上百步操作后,把所有细节正确落到系统里。

这也是 SaaS-Bench 想揭示的现实:Agent 不只是要会点按钮、填表格,更要能完成真实办公室里的长流程工作。
如果连实习生日常能做的任务都无法稳定完成,那我们就需要重新审视:距离真正可用的 Agent,还有多远。

Computer-Use Agent的「奇点」没有来,现实的冷水先泼下来了

过去一年,各家GUI Agent争先恐后地宣称能替人类干活。Benchmark成绩一路飙升,投资人兴奋,媒体狂欢,「全自动办公」似乎就在眼前。

但UniPat AI刚刚用一组数据证明:这一切,都建立在沙子上!

Leaderboard

23个真系统,106个任务,一场残酷的实战考试

现有的Agent评测,说白了就是:仿真环境、简单任务、最多几十步搞定。

跟真实工作完全是两回事。

真实办公长什么样?一个医疗管理员写完SOAP病历→填病例上报→生成正式文档。一个财务收到报销申请→审批→打款→记账。跨好几个系统,步骤动辄几百步。

SaaS-Bench的思路很暴力:直接把真系统搬进Docker,让Agent在真实的前后端逻辑、数据库状态和业务约束中干活。

SaaS-Bench 任务 —— 真实工作场景任务

SaaS-Bench 精心挑选了 23 个开源 SaaS (Software-as-a-Service) 系统,全部通过 Docker 本地部署,保留了完整的前后端逻辑、数据库状态和业务约束。覆盖六个专业领域:

软件研发:OpenProject、Baserow、Code-Server、Metabase

业务财务:Twenty CRM、BigCapital、HRMS、Pretix

医疗管理:OpenEMR、OpnForm、OnlyOffice

团队协作:SiYuan、Roundcube、Mattermost、ownCloud

农业供应链:FarmOS、Grocy、Recipya、E-Label

独立媒体:PhotoPrism、MediaCMS、BookLore、Watcharr

更重要的是,这些系统不是“空壳网页”:每个软件里都填充了真实业务的数据,包括用户、项目、订单、文件等实体记录。Agent 进入的不是一个空白的测试页面,而是一个有历史数据、有干扰项、有跨系统关联的真实工作环境。

任务模态、领域、app 三层分布

106 个任务中,93.4% 跨越至少两个应用,三应用任务占了一半(53 个)。纯文本任务 74 个,涉及多模态理解的 32 个。以 Claude Opus 4.6 的执行轨迹估算,97.3% 的文本任务操作步数超过 100 步,最长轨迹达 300+ 步。

任务难度分析 ——大多数任务是 Cross-App + Long-Horizon 的

这些任务是怎么来的?如何评估 Agent 的操作能力?

SaaS-Bench 采用“LLM 生成 + 专家把关”的方式完成任务构建:

先由 LLM 围绕六大专业领域和具体职业角色生成任务,明确任务目标、跨应用依赖和验证要求,并通过多轮修改减少歧义和漏洞。

随后,专家会对任务进行人工筛选和真实执行检查,重点判断任务是否专业、自然、可完成、可验证。对于堆砌步骤、逻辑混乱或验证不准的任务,会被修改或剔除,最终确保每个任务都能真实运行,并能被验证器准确评估。

任务构建流程图 —— 四个阶段保证任务质量

SaaS-Bench 允许 Agent 使用 Browser-Use 在 SaaS 环境中操作计算机,并给出了两个指标:

Resolved Score(完全通过分数,严苛):全部检查点通过才算 1,否则为 0

Checkpoint Score(检查点分数,宽松):按权重计算部分检查点完成比例

Agent → Browser-Use → 执行 → 验证 → 打分总览图

后面的结果会表明——这两个数字之间的巨大落差,恰好暴露了 Agent 最核心的问题。

榜单出炉:全军覆没

来看这组数字 ——

主要结果 (DeepSeek V4 、M2.7 和 GLM5.1 为单模态模型,仅测评 Text-Only Domain)

最强的Claude Opus 4.7,检查点分数43.9%,端到端完全通过分数只有3.8%——106个任务,只完整通过了4个。Kimi K2.5和Gemini 3.1 Pro?完全通过分数为零。一个任务都没走完。

这组数字的含义极其残酷:Agent可以推进工作的部分中间环节,但几乎没有能力将一个完整的长程工作流走完

多跑几次能救吗?

四个模型的 Pass@k 结果

把每个模型在同一任务上独立跑3次,对一次就算通过。pass@3相比pass@1整体提升约8个百分点。

Sonnet 4.6在多模态任务上从33.9%跳到52.1%(+18.2pp)——它并非完全不行,而是执行极不稳定

这不是环境随机性。每次运行的初始状态完全相同。这是路径依赖——模型在某个决策点的微小差异,导致后续轨迹完全分叉。

多跑几次有帮助,但远不是解决方案。

越复杂,分越低

三个结构维度全部单调递减:

分数 vs 应用数 / 分数 vs 步长 / 分数 vs 检查点个数

跨应用数 1→4:平均分从53%降至20%

操作步长增加:任务轨迹越长,得分显著越低

检查点个数 ≤6 vs ≥18:平均分从65%降至27%

「跨应用+轨迹长+细粒度验证」的任务得分最低——这恰恰是真实工作流最常见的形态。

四种结构性失败:Agent到底在哪翻车

SaaS-Bench真正的价值不在于分数本身,而在于暴露了Agent在真实环境中的四种致命缺陷。

失败1:任务越长,越做不对

即使每个检查点通过率高达95%,12个检查点的全部通过概率也只有54%。而SaaS-Bench的平均检查点数远超12。

所有模型都呈现同一个模式:通过率随任务推进呈下降趋势,没有一个模型能在后半段维持住前期表现。

模型随着任务执行,做对的越来越少

这是一条不可逆的下降曲线。越往后走,越不可能走完。

失败2:一步错,步步错

一个典型案例:任务要求创建一个公司客户「Arcturus Digital」。Agent同时填了联系人姓名和公司名,触发了个人客户逻辑,实际创建的是个人客户Elena Vasquez。

此后的10张发票、付款记录、账户对账,全部挂在错误实体下。核心检查点权重仅3%,但导致了下游30%的权重损失。

上游任务导致下游失败链示意图

一个3%的错误节点,造成30%的分数损失。

失败3:做完不检查,自以为对了

Claude Opus 4.6在Step 124识别出日期错误(2026-03-19 vs. 2026-03-20),执行了修改,但没有回到页面复查,直接推进后续子任务。Step 210提交时,汇报写的是「账单日期2026-03-20,已修复」——页面上实际日期仍是03-19。

Agent 在意图层面认为成功,Verifier 在状态层面发现失败

Agent在意图层面认为成功,验证器在状态层面发现失败。两者之间的断层是系统性的。 当前CUA框架缺少「严谨的反思闭环」 —— Agent是个不会检查自己作业的学生。

失败4:同一张考卷,成绩忽高忽低

Claude Sonnet 4.6 在同一任务的三次独立运行中,分数范围从 0.00 到 0.68。这不是环境随机性造成的 —— 每次运行的初始状态完全相同 —— 而是路径依赖:模型在某个决策点的微小差异,会导致后续执行轨迹完全分叉,这让 Agent 在长程任务中的执行变成了赌博。

Claude Sonnet 4.6在同一任务的三次运行

这意味着什么

SaaS-Bench撕碎了一个幻觉:Agent的Benchmark成绩和真实工作能力之间,存在巨大的鸿沟。

四种结构性失败模式——越往后越做不对、一步错步步错、做完不检查、次次分数不一样——指向同一个底层事实:当前Agent缺少对持久状态的有效推理能力,缺少操作后的闭环验证机制,缺少从错误中恢复的能力。

这些不是靠模型变大、或者加几个工程模块就能解决的问题。 它们指向的是当前 Agent范式更深层的局限:在长程任务中,模型缺少对全局状态的持续感知,无法像人一样”心里有数”。这不只是技术债,而是当前范式的天花板。

Computer-Use Agent想要真正替人干活?路还很远。SaaS-Bench把地图摊开了——接下来就看各家怎么走了。

但这也引向了一个正在逐渐形成的共识:今天的 SaaS 是给人设计的——菜单、按钮、表单,都在服务人类的眼睛和手指。但当 Agent 成为主要用户,这些界面就变成了累赘。未来不是让 Agent学会操作人类的软件,而是软件本身要为 Agent 重新设计。SaaS-Bench 揭示的不只是 Agent 的短板,也是当前软件形态的保质期——面向人类的 SaaS,可能都要为Agent 重做一遍。

Blog:https://unipat.ai/blog/SaaS-Bench

GitHub:https://github.com/UniPat-AI/SaaS-Bench

论文:https://arxiv.org/abs/2605.15777

UniPat AI

UniPat AI 致力于构建面向真实场景的 AI 训练、评测与应用新范式,推动 Agent 能力在千行百业中规模化落地,创造切实的经济与社会价值。

官网链接:https://unipat.ai

转载来源:UniPat AI
本文为量子位获授权转载,观点仅为原作者所有。

版权所有,未经授权不得以任何形式转载及使用,违者必究。