惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

美团技术团队
Microsoft Azure Blog
Microsoft Azure Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
B
Blog
Y
Y Combinator Blog
博客园_首页
有赞技术团队
有赞技术团队
博客园 - Franky
腾讯CDC
G
Google Developers Blog
Recent Announcements
Recent Announcements
博客园 - 【当耐特】
D
Docker
The GitHub Blog
The GitHub Blog
MyScale Blog
MyScale Blog
H
Help Net Security
Apple Machine Learning Research
Apple Machine Learning Research
A
About on SuperTechFans
D
DataBreaches.Net
T
The Blog of Author Tim Ferriss
V
V2EX
U
Unit 42
aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
AI Agent 是人类生产关系的一次巨变
世界模型工场 · 2025-01-10 · via 人人都是产品经理

AI Agent不仅仅是对现有技术的升级;它们代表了一种组织运作、竞争和创新方式的转变。

谷歌发布的一份名为《Agent》的白皮书,展望了人工智能在商业中扮演更加积极和独立的角色的未来。这份42页的文件在9月发布时并未引起太大轰动,但如今在X.com(前身为推特)和LinkedIn上引起了广泛关注。

这份报告提出了“AI Agent”的概念,一种超越现有AI模型的软件系统,能够进行推理、规划并采取行动,以实现特定目标。与传统的AI系统不同,后者仅根据预先存在的训练数据生成响应,AI Agent可以与外部系统互动,做出决策,并独立完成复杂任务。

白皮书解释道:“Agent是自主的,可以在没有人类干预的情况下独立行动。”它们被描述为结合了推理、逻辑和实时数据访问的系统。AI Agent的背后理念十分雄心勃勃:它们可以帮助企业自动化任务、解决问题,并做出曾经完全由人类处理的决策。

白皮书的作者——朱莉亚·维辛格(Julia Wiesinger)、帕特里克·马洛(Patrick Marlow)和弗拉基米尔·武斯科维奇(Vladimir Vuskovic),详细阐述了AI Agent如何运作以及它们所需的功能。

然而,更广泛的影响同样重要。AI Agent不仅仅是对现有技术的升级;它们代表了一种组织运作、竞争和创新方式的转变。那些采纳这些系统的企业可能会在效率和生产力上获得巨大的提升,而那些犹豫不决的企业则可能发现自己在竞争中逐渐落后。

以下是谷歌白皮书中的五大关键见解,以及它们对未来商业中AI应用的潜在影响。

一、AI Agent不仅仅是更聪明的模型

谷歌认为,AI Agent代表了对传统语言模型的根本性突破。像GPT-4和谷歌的Gemini这样的模型,在生成单轮响应方面表现优异,但它们仅限于从训练数据中学习到的内容。相比之下,AI Agent设计的初衷是与外部系统互动,基于实时数据进行学习,并执行多步骤任务。

白皮书指出:“传统模型中的知识仅限于它们训练数据中已有的内容。AI Agent通过与外部系统的连接扩展了这些知识。”

这种差异不仅仅是理论上的。设想一个传统的语言模型被要求推荐旅游行程。它可能会基于一般知识提出一些建议,但缺乏预订机票、检查酒店可用性或根据用户反馈调整建议的能力。然而,AI Agent则能做到这一切,它可以结合实时信息并做出自主决策。

这一转变使AI Agent成为一种新的数字工作者,能够处理复杂的工作流。对于企业来说,这意味着能够自动化那些曾经需要多个人力角色来完成的任务。通过整合推理与执行,AI Agent可能成为从物流到客户服务等多个行业中不可或缺的工具。

人工智能Agent如何使用扩展访问外部API以执行任务的细分。(图片来源:谷歌)

二、认知架构驱动它们的决策过程

AI Agent能力的核心是其认知架构,谷歌将其描述为一个用于推理、规划和决策的框架。这一架构被称为协调层,使Agent能够以循环的方式处理信息,结合新数据来优化其行动和决策。

谷歌将这一过程比作一位大厨在繁忙厨房中的工作。大厨会收集食材,考虑顾客的口味需求,并根据反馈或食材的可用性调整食谱。类似地,AI Agent会收集数据,推理下一步行动,并根据目标调整自己的行为。

协调层依赖于先进的推理技术来引导决策过程。诸如推理与行动(ReAct)、思维链(CoT)和思维树(ToT)等框架,为拆解复杂任务提供了结构化的方法。例如,ReAct允许Agent在实时中结合推理和行动,而ToT则使Agent能够同时探索多个可能的解决方案。

这些技术赋予Agent不仅仅是反应性的决策能力,还能做出积极主动的决策。白皮书指出,这使得AI Agent具有高度的适应性,能够以传统模型无法做到的方式应对不确定性和复杂性。对于企业来说,这意味着AI Agent可以承担一些任务,例如故障排除供应链问题或分析财务数据,且在较少人工监督的情况下实现高度的自主性。

AI Agent决策过程的流程,从用户输入到工具执行和最终响应。(图片来源:谷歌)

三、工具拓展了Agent的能力,超越了训练数据的限制

传统的AI模型常被描述为“静态知识库”,仅限于其训练数据所涵盖的内容。而AI Agent则不同,它们能够通过工具访问实时信息,并与外部系统进行互动。这一能力使得它们在现实应用中具有实际价值。

白皮书解释道:“工具弥合了Agent内部能力与外部世界之间的差距。”这些工具包括API、扩展程序和数据存储,它们使Agent能够获取信息、执行操作,并检索随着时间变化的知识。

例如,一位负责规划商务旅行的Agent可以通过API扩展程序检查航班时刻表,通过数据存储检索旅行政策,或者使用地图工具查找附近的酒店。AI Agent能够动态与外部系统互动,这使得它们不再是静态的响应者,而是商业流程中的活跃参与者。

谷歌还强调了这些工具的灵活性。例如,函数允许开发者将某些任务卸载到客户端系统,企业因此能更好地控制Agent如何访问敏感数据或执行特定操作。这种灵活性对于金融、医疗等行业至关重要,因为这些行业对合规性和安全性有严格的要求。

代理端和客户端控制的比较,说明人工智能Agent如何与Google Flights API等外部工具交互。(图片来源:谷歌)

四、检索增强生成(RAG),让Agent变得更智能

AI Agent设计中的一项最具前景的进展是检索增强生成(RAG)的整合。这项技术使Agent能够在其训练数据不足时,查询外部数据源——如向量数据库或结构化文档。

白皮书解释道:“数据存储通过提供访问更动态和最新信息的途径,解决了[静态模型]的限制。”Agent可以实时检索相关数据,从而将其响应基于事实信息。

基于RAG的Agent在信息变化迅速的领域尤其有价值。例如,在金融行业,Agent可以在做出投资建议之前拉取实时市场数据。在医疗领域,Agent则可以检索最新的研究成果,来为诊断建议提供支持。

这一方法还解决了AI中一个长期存在的问题:幻觉(hallucinations),即生成不正确或虚假的信息。通过将响应建立在现实世界数据的基础上,Agent能够提高准确性和可靠性,从而更适用于那些高风险的应用场景。

检索增强生成(RAG)如何使Agent能够查询向量数据库并提供精确的上下文感知响应。(图片来源:谷歌)

五、谷歌提供工具加速Agent部署

尽管这份白皮书充满了技术细节,但它同样为希望实施AI Agent的企业提供了实用的指导。谷歌重点介绍了两个关键平台:LangChain,一个开源的Agent开发框架,以及Vertex AI,一个用于大规模部署Agent的托管平台。

LangChain通过允许开发者将推理步骤和工具调用串联在一起,简化了构建Agent的过程。而Vertex AI则提供了测试、调试和性能评估等功能,使得部署生产级Agent变得更加容易。

白皮书指出:“Vertex AI使得开发者能够专注于构建和完善他们的Agent,而平台本身则管理了基础设施、部署和维护的复杂性。”

这些工具降低了那些想尝试AI Agent但缺乏深入技术专长的企业的门槛。然而,它们也引发了关于广泛采用Agent的长期后果的思考。随着这些系统变得越来越强大,企业将需要考虑如何平衡效率提升与潜在风险,如对自动化的过度依赖或决策透明度方面的伦理问题。

推理循环、工具和API的集成,使AI Agent能够处理旅行计划或天气检查等复杂任务。(图片来源:谷歌)

六、这意味着什么

谷歌关于AI Agent的白皮书呈现了一个详细且雄心勃勃的AI发展蓝图。对于企业而言,信息非常明确:AI Agent不仅仅是一个理论概念,它们是能够重塑企业运营方式的实际工具。

然而,这一转型不会一蹴而就。部署AI Agent需要精心的规划、实验和重新思考传统工作流程的勇气。正如白皮书所指出的:“由于基础模型的生成特性,没有两个Agent是完全相同的。”

目前,AI Agent既是一个机遇,也是一项挑战。那些投资于理解和实施这一技术的企业将能够获得显著的竞争优势。而那些选择观望的企业,可能会在智能化、自动化系统日益主导一切的世界中,陷入追赶的困境。(Venture Beat)

本文由人人都是产品经理作者【AI新智能】,微信公众号:【AI新智能】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。