惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
T
Tenable Blog
T
The Exploit Database - CXSecurity.com
A
Arctic Wolf
C
CERT Recently Published Vulnerability Notes
Blog — PlanetScale
Blog — PlanetScale
V
Vulnerabilities – Threatpost
Vercel News
Vercel News
P
Palo Alto Networks Blog
N
News and Events Feed by Topic
Simon Willison's Weblog
Simon Willison's Weblog
L
LINUX DO - 最新话题
阮一峰的网络日志
阮一峰的网络日志
C
CXSECURITY Database RSS Feed - CXSecurity.com
Google DeepMind News
Google DeepMind News
Project Zero
Project Zero
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
WordPress大学
WordPress大学
The Last Watchdog
The Last Watchdog
博客园_首页
D
Docker
MyScale Blog
MyScale Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
The Hacker News
The Hacker News
云风的 BLOG
云风的 BLOG
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
T
The Blog of Author Tim Ferriss
T
Threat Research - Cisco Blogs
M
MIT News - Artificial intelligence
S
Schneier on Security
C
Check Point Blog
I
Intezer
S
Securelist
雷峰网
雷峰网
小众软件
小众软件
C
Cyber Attacks, Cyber Crime and Cyber Security
PCI Perspectives
PCI Perspectives
S
Security @ Cisco Blogs
酷 壳 – CoolShell
酷 壳 – CoolShell
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
S
Security Affairs
量子位
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
A
About on SuperTechFans
T
Troy Hunt's Blog
Google Online Security Blog
Google Online Security Blog
F
Fortinet All Blogs
C
Cybersecurity and Infrastructure Security Agency CISA
Security Archives - TechRepublic
Security Archives - TechRepublic
Latest news
Latest news

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
国产Agent 评测:智普沉思Auto GLM、扣子空间、纳米AI
贝琳_belin · 2025-05-30 · via 人人都是产品经理

随着人工智能技术的不断发展,Agent(智能体)作为能够自主决策和执行任务的系统,正在成为AI领域的热门研究方向。本文将深入探讨Agent与大模型的区别,分析Agent的工作原理及其评测标准,并对国内三款具有代表性的Agent产品——智普沉思Auto GLM、扣子空间和纳米AI进行深度评测。

一、什么是Agent

大家有没有过这样的疑惑:

“都已经有大模型了,为什么还要做Agent?大模型不是也能得到agent中得到的结果吗?

“Agent与大模型之间具体有什么区别呢?”

首先让我们先从定义上看看这两者有什么区别:

大模型是基于深度学习、拥有数十亿至数千亿参数的人工智能模型,能通过海量数据学习复杂模式,具备文本生成、逻辑推理等多任务处理能力,是当前 AI 领域的核心突破方向。

而AI Agent呢,他拥有llm这个大脑,且具备自主决策和行动能力的系统,它可以根据目标,自主地使用工具、调用 API、规划步骤、执行任务。他是让AI真正实现自主完成任务,代表人类去完成具体任务的AI

所以从上述来看,大模型只提供任务方法,具体行动还是需要人去做执行;而agent则可以独立做出决策、主动执行,帮助人类执行任务,从而直接得到想要结果,这样的一个人工智能系统。

Lilian Weng也提到说“ Agent是由大语言模型驱动的自主代理”具备三大核心能力— 规划、行动和记忆。

二、Agent工作原理及评测原理

1、Agent内部工作原理:

Agent 在 LLM 支持下,通过调用外部工具完成具体任务。它是构建智能 Agent 的基础机制之一。

在 LangChain 官方文档《How to migrate from legacy LangChain agents to LangGraph》一节中,通过 magic_function(3) 的示例,展示了语言模型(LLM)如何调用外部工具的完整流程,包括工具的定义、与模型的绑定、工具调用的生成与执行,以及最终结果的返回。

在 LangChain 框架中,通过结构化的方式将外部函数集成到 LLM 的推理过程中,从而增强模型的功能和灵活性。它是理解 LangChain Agent 与工具交互机制的关键示意图之一。

这张图展示了AI Agent 调用机制以及他的原理,语言模型(LLM)如何通过绑定的外部工具,实现对用户指令的理解与执行。当用户以自然语言提出问题时,LLM 将其解析为结构化的工具调用请求,并根据工具定义发起调用,获取结果后再生成最终回答。这一过程体现了 Agent 具备“理解 → 决策 → 行动 → 回答”的能力,是其完成复杂任务的基础机制。

2、Agent评测原理

在评测 Agent 时,对他的工具调用决策与行为的评估逻辑是:当 Agent 接收到用户问题后,语言模型需要判断是否使用工具,并做出相应的调用。如果调用工具,则进入工具执行阶段,并基于结果继续推理;否则直接回答。评测过程不仅关注最终的回答是否接近参考答案(蓝色箭头),还关注模型是否按预期正确地调用了工具(红色箭头)以及调用顺序是否合理(橙色箭头)。这体现了对 Agent 的行为路径最终输出的双重评估标准。

图中通过一个工具调用agent(tool-calling agent)的示例,展示了语言模型(LLM)如何判断是否调用工具、如何执行工具调用,以及如何返回最终结果的完整流程。

3、Agent 的核心构成

通常,一个 Agent 包含以下几个部分:

  • 感知(Perception):从环境中获取信息,比如读取传感器、接收用户输入、获取API数据等。示例:一个客服Agent从用户输入里提取问题意图。
  • 决策(Reasoning / Planning):基于感知到的信息,判断当前情况,并决定下一步要做什么。可能用到规则系统、机器学习、强化学习、逻辑推理等技术。
  • 执行(Action):执行决策的动作,比如调用API、发送消息、控制机器人动作等。
  • 目标(Goal)或任务系统(Task):Agent通常有一个明确的目标,比如完成订单、回答问题、规划路径等。

反馈与学习(可选):一些高级Agent具有自我反馈机制,比如通过强化学习不断优化行为策略。

三、评测维度

测评 Agent(智能体)的过程,本质上是评估它是否 高效、准确、稳定地完成任务目标,通常包括以下几个维度:

以及主要看任务完成度与流程正确性:

✅ 是否按预定流程走完?

✅ 是否能处理异常输入?

✅ 是否成功调用对应API?

例如你训练了一个能够帮用户“查询天气并写日报”的 Agent,可以如下测评:

输入任务: “今天北京天气如何?请写一段日报总结。”

评估点:

-是否正确使用了天气 API 工具?

-是否写出了结构完整、内容合理的日报?

-是否在遇到API失效时能优雅降级?

-总共调用了几步?是否冗余?

也可以设计一组标准任务 + 一组边界/干扰任务,自动对输出结果进行判分或人工审阅。

以及评测Agent的最终结果、单个步骤、轨迹

  • 评测其在任务上的整体表现。将Agent视为黑盒,并简单地评测其是否完成了工作。
  • 评测Agent的单个步骤–即LLM是否正确调用某个工具,以及传入正确参数。
  • 评测Agent的单个步骤–即LLM是否正确调用某个工具,以及传入正确参数。

四、国内三款Agent产品

1. 字节跳动 Coze(扣子空间)

链接地址:https://www.coze.cn/space-preview?

定位:字节跳动 2025 年 4 月推出的 AI 协同办公平台,主打低代码开发与企业级场景。

核心能力:

  • 三个模式任务执行:探索模式(快速任务)、规划模式(复杂任务)自由模式,支持动态子任务拆解与工具调用(如浏览器、代码编辑器)。
  • 专家 Agent 生态:引入华泰 A 股观察助手、用户研究专家等领域专家,提供行业深度服务。
  • 多模态集成:支持飞书多维表格、高德地图等 MCP 扩展,输出 PPT、飞书文档等结构化报告。优势:操作界面最友好,插件商店、工作流商店生态完善,适合非技术人员快速上手。

2. 智普沉思Auto GLM

链接地址:https://autoglm-research.zhipuai.cn/

定位:依托智谱 GLM 大模型的垂直领域 Agent 平台,聚焦科研、法律等场景。

核心能力:

  • 学术知识库:内置 2000 万篇论文、专利数据,支持学术文献自动综述与分析。
  • 多模态交互:支持 PDF 解析、公式识别,输出 LaTeX 格式文档。

优势:学术领域精度高,适合高校、科研机构。

3、纳米AI Agent

链接地址:https://bot.n.cn/tools/aiagent

定位:纳米 AI Agent是 360 集团推出的 AI Agent 平台,其核心产品为MCP 万能工具箱,主打 “零代码构建智能体” 与 “开放工具生态” 两大特性,在技术架构、应用场景和行业适配性上展现出显著差异化优势。以下从技术特性、应用场景、行业影响三个维度展开分析

核心能力:

  • 5 分钟快速搭建:通过可视化操作界面,用户可自由组合 360 自研工具(如 360 搜索、浏览器自动化)和第三方工具(如 ArXiv 学术搜索、小红书数据抓取),系统自动生成任务流。
  • 行业模板库:内置 200 + 行业模板(如金融风控、HR 招聘、电商运营),支持一键复用。例如,选择 “股票分析助手” 模板,智能体自动调用同花顺 API 抓取数据→生成 K 线图→输出风险预警。
  • 110 + 即用工具:覆盖办公协作、学术研究、金融分析、生活服务等场景,工具接入无需代码。例如,用户输入 “分析 2025 年上海车展趋势”,智能体可自动调用高德地图生成展馆路线图→调用爬虫工具抓取媒体报道→调用数据可视化工具生成新能源车对比图表。
  • 开发者生态:支持用户自定义工具接入,开发者可通过简单配置将本地工具(如 Obsidian 笔记检索)转化为 MCP 工具,形成 “千人千面” 的智能体生态。

五、深度测评Agent

1、目的:生成网页能力

prompt:你是一个经验丰富的旅行规划师和前端开发者,请为我生成一个5天4晚的大理旅游计划,并以简洁美观的HTML网页形式输出。

生成结果:

1)扣子空间

说明:1)逻辑问题严重,比如酒店离古城走路需要7个小时,但攻略建议,“稍作休息后,漫步古城”,这太不符合常识,而且配图是喜洲古镇,并不是大理古城,还有三塔倒影公园也离酒店距离很远,并不是一天就能逛完的,所以逻辑问题严重;2)任务完成较快,但并未全部完成要求,生成网页排版,而且内容过于简单,并不能作为旅游攻略使用。

2)智普沉思Auto GLM:

说明:

1)只是给了一个可以下载的pdf文档,并未遵循最后的指令生成html网页链接;

2)确实能看到他自动打开了新的网页在浏览小红书等攻略的内容;

3)海东海西游玩顺序有逻辑错误

3)纳米AI:

说明:

1)完成了html的输出,耗费时间较长20分钟左右;

2)整个ui做的相比比较美观,但只是网页展示,并没有交互,地图也没有展示出来。

3)生成内容上,给的攻略过于笼统,大理最美的洱海周围景点并没有突出展示,景区介绍过多,对于游玩,用处较小。

整体说明:三个产品其实都没有很好的回答,智普没有完成指令,扣子空间逻辑错误较多,纳米AI界面稍微好看一点,但内容质量较低,并没有给出太多有用信息。

2、目的:生成游戏能力

Prompt:你是一个高级 WebGL 游戏开发者,请使用 Three.js 帮我开发一个“跑酷小游戏”类型的 3D 网页小游戏,并返回完整可运行的 HTML+JavaScript 代码。

生成结果:

1)扣子空间:

完成了游戏的开发,可以使用,基本满足预期

2)智普沉思Auto GLM:

说明:只给出规则文档,和运行代码,并未给出能够运行的文件,感觉跟普通大模型没区别,不太像个agent

3)纳米AI:

说明:完成了游戏的开发,可以使用,基本满足预期

整体说明:三个产品中只有智普沉思Auto GLM没有生成网页形式的小游戏,只是给了代码,其余两个agnet都基本满足预期了

3、目的:查询资料能力

prompt:你是一个专业的健康与健身内容编辑,请为我搜集并整合一份完整的“30天减肥计划”图文资料,适合普通人居家参考。请结合权威健康信息和流行趋势,返回为结构化的图文形式并用pdf形式输出。

1)扣子空间:

说明:基本符合要求,但没有图片,只有文字,最后生成了pdf格式的文档

2)智普沉思Auto GLM:

说明:也是基本符合要求,没有生成图片,最后给出了pdf格式的文档

3)纳米AI:

说明,基本符合要求,有目标、饮食、运动、计划,有示意图也生成了pdf格式

整体说明:三个产品中只有纳米AI有图文表达,其余两个产品都是文字形式的pdf

六、总结

在本次评测中,我们从网页生成能力、生成游戏能力、查询总结资料能力等维度,深入对比了智普沉思 Auto GLM、扣子空间与纳米AI三款代表性的智能体产品。由此看出,他们也是各自有不同的优势,但也不难看出,还有一些问题需要改进,随着大模型与 Agent 技术不断演进,我们有理由相信,不同类型的智能体将根据用户需求各自生长,并最终走向融合。选择哪一类平台,并不在于谁更强,而在于你的任务场景真正需要什么。

本文由 @贝琳_belin 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务