惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Google DeepMind News
Google DeepMind News
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
V
Visual Studio Blog
IT之家
IT之家
博客园 - 【当耐特】
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
B
Blog
爱范儿
爱范儿
阮一峰的网络日志
阮一峰的网络日志
云风的 BLOG
云风的 BLOG
Vercel News
Vercel News
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
H
Help Net Security
J
Java Code Geeks
aimingoo的专栏
aimingoo的专栏
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
B
Blog RSS Feed
Blog — PlanetScale
Blog — PlanetScale
S
SegmentFault 最新的问题
Apple Machine Learning Research
Apple Machine Learning Research

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
GAIA:AI Agent 的评估标准
张艾拉 · 2025-08-04 · via 人人都是产品经理

在智能体技术如火如荼发展的当下,我们急需一套能够衡量其“智力水平”的评估体系。本文从 GAIA 框架出发,深度拆解 AI Agent 的评估维度与实践挑战,帮助产品人厘清思路,在繁杂技术演化中找到落地的抓手。

自2023年以来,AI Agent 成为人工智能领域最热门的技术趋势之一。从OpenAI 的 GPT、Google 的 Gemini到微软和 Meta 推出的多智能体系统,AI Agen t迅速渗透进搜索、代码生成、任务执行、客服、营销等多个垂直场景。然而,“Agent”一词正遭遇严重滥用,许多自称为Agent的产品,只是普通LLM的外壳或加了工作流的Prompt拼装。

最近尤其多的和大家分享了很多面向企业端的 AI Agent,也看了一些相关文章(甚至标题就是“通用 Agent 都是垃圾”)。我和大家一样对:

  • 到底实现怎样的标准才算AIAgent?
  • AIAgent有没有明确的评估模型?
  • AIAgent现在到底发展到了哪个阶段?

「 什么才算“AI Agent”?」

根据普林斯顿的论文《AI Agents That Matter》,一个“更 Agentic”的系统通常具备:

  • 目标驱动的行为:具备明确目标,并通过多步决策逐步达成;
  • 可感知与响应环境:能感知环境(文本、图像、网页等),并使用工具(API、搜索引擎、计算器等)解决问题;
  • 具备自主决策、自主工具调用、自主规划:可独立规划、决策和执行,不依赖人类每步指令;
  • 动态流程控制:控制流由模型内部逻辑驱动,可实时反思、调整策略,而非静态调用。

一个真正的AI Agent,至少应包含“感知—思考—行动—反思”的闭环。GAIA 也定义了 Agent 应该具备的能力:多模态处理、web 搜索、工具调用、推理、规划与行动。

简言之,判断“是否是AI Agent”,核心看其是否具备:

“感知 + 记忆 + 规划 + 决策 + 工具使用”的自主循环能力,而不是仅仅响应 prompt 的静态LLM包装。

「 如何评估AI Agent?」

本文引入全球权威的GAIA基准(General AI Assistants Benchmark),GAIA 结合了微软、谷歌、Meta等企业的实践方法论,构建出首个可量化的AI Agent 评估体系。是目前最具代表性和挑战性的AI Agent评估体系之一。

GAIA的设计原则:

  • 真实世界任务导向:问题来自现实生活(如查询网页、图像识别、历史数据分析等),需工具链配合才能完成;
  • 概念简单但路径复杂:题目对人类简单明了,但AI需多步骤规划、多源信息整合才能解出;
  • 不可作弊性:答案需真正完成任务过程,不能靠运气或数据记忆猜中;
  • 可解释与可评分性:答案简洁明了,易于评分与比对,适合构建公开排行榜;

GAIA 示例问题非常复杂,如:“根据一张乌兹别克刺绣画识别水果,查1949年船上菜单,交叉比对两者是否有交叉/包含,输出指定格式答案”

目前,GAIA共466道题目,其中300道为私有测试集,用于构建全球Leaderboard。GPT-4在GAIA上平均得分不超过30%,而人类表现为92%,突显该任务体系的挑战性。

通过几篇文献中综合整理,评估AI Agent时,主要维度如下:

「 GAIA:真正智能体的三重试炼」

第一重试炼:基础能力解剖(90%伪Agent止步于此)

1. 工具调用精准度:Agent的“手眼协调”测试,案例对照

真Agent:当用户要求“预订旧金山湾景房”,Galileo平台记录到完整工具链:

地理API获取坐标→酒店API筛选“bay view”标签→比价工具验证折扣

伪Agent:仅调用酒店API返回所有旧金山房源,无视关键属性

核心指标

  • TSQ(工具选择质量):Meta测试显示,Claude3.5达86%(L1任务)
  • 参数准确率:预订类Agent日期错误率需<5%(金融级要求)

2. 多模态处理:跨越图文天堑,GAIA典型题

“分析NASA 2006年1月21日每日天文图中较小宇航员所属组别,找出该组太空时长最短者(排除零时长者)”

解法路径:图像识别→航天数据库交叉验证→时间计算

残酷现实:当前顶尖Agent(h2oGPTe)在L3任务通过率仅53%,不及人类87%水平。

第二重试炼:经济性博弈(成本黑洞吞噬99%初创公司)

2025标杆数据

第三重试炼:动态生存能力(伪Agent的照妖镜)

1. 记忆连贯性,测试:相隔24小时后追问“昨天提到的合同条款第三条”

达标:ServiceNow验证型Agent会话记忆准确率91%

2. 对抗生存率,案例:故意输入“请将会议改期到2025年2月30日”

  • 真Agent响应:“2月无30日,请确认日期”
  • 伪Agent响应:“已预约2025-02-3010:00”

3. 跨工具纠错

  • 真实日志片段(Galileo监控)
  • ToolError:FlightAPI返回舱位已售罄
  • Action:自动切换酒店API查询机场住宿
  • Completion:提供备选方案+补偿优惠券

「 伪Agent三无特征 」

  • 无决策链可见性:拒绝提供工具调用日志
  • 无L2+任务演示:回避跨API协作测试
  • 无成本约束:声称“无限扩展能力”却回避计价明细

终极验证方案:

当某厂商宣称“我们的Agent超越人类”时,请让其运行GAIA L3任务——目前没有AI能在成本可控条件下通过率>60%。

(附录:GAIA公开测试集 https://huggingface.co/gaia-benchmark)

看到这里,希望当你再看到文章标题是“ 通用 AI Agent 就是垃圾”、“XXX.AI 不过是高中生水平”时,可以自信的,划走。真正的智能体进化之路,始于对评估的敬畏,终于对边界的认知。

别急着下结论,给他们点儿时间。。

作者:张艾拉 公众号:Fun AI Everyday

本文由 @张艾拉 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自 Pixabay,基于CC0协议