惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

宝玉的分享
宝玉的分享
H
Hackread – Cybersecurity News, Data Breaches, AI and More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
小众软件
小众软件
月光博客
月光博客
D
DataBreaches.Net
L
LangChain Blog
美团技术团队
S
SegmentFault 最新的问题
MyScale Blog
MyScale Blog
大猫的无限游戏
大猫的无限游戏
博客园 - 司徒正美
aimingoo的专栏
aimingoo的专栏
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
H
Help Net Security
阮一峰的网络日志
阮一峰的网络日志
Y
Y Combinator Blog
I
InfoQ
U
Unit 42
Microsoft Azure Blog
Microsoft Azure Blog
J
Java Code Geeks
博客园 - 三生石上(FineUI控件)
腾讯CDC
Martin Fowler
Martin Fowler

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
Sarang Kulkarni 谈在生产环境中构建深度研究智能体的经验教训
作者:Srini Penchikala平川 · 2026-06-03 · via InfoQ - 促进软件开发领域知识与创新的传播

深度研究智能体系统(如 OpenAIGemini Deep Research Agent)是一类 AI 智能体,旨在利用动态推理和多步骤信息检索技术,在互联网上针对复杂任务进行多步骤研究,并生成达到研究分析师水平的全面的结构化分析报告。

2026 年 Arc of AI 大会上,来自 Thoughtworks 团队的 Sarang Kulkarni 发表了演讲,探讨如何设计和部署用于深度推理与合成的多智能体研究系统,以及在实际的医疗保健和制药研发项目中开发深度研究智能体时汲取的经验教训。他还探讨了团队如何利用智能体循环和任务工程等技术,充分发挥该解决方案的潜力。

在医疗保健和临床试验等关键行业中,研究人员需要的不仅仅是能够执行简单问答任务的传统 AI 模型。他们需要的是能够在处理内部数据和互联网数据时进行发现、关联和推理,同时确保可靠性、透明度和合规性的系统。

在演讲开时时,Kulkarni 指出,将一种新药推向市场通常需要花费 26 亿美元。此外,大约一半的研究是在缺乏前期证据的情况下进行的,因为虽然存在相关的知识,但获取这些知识和信息却存在障碍。在整个药物发现与开发流程中,如何在恰当的时机获取正确的数据是一项很大的挑战。为了利用 AI 技术研发新药,两年前,他们团队构建了一个基于检索增强生成(RAG)技术的聊天机器人,用于检索非结构化数据。对于研究中的简单查询,RAG 解决方案运行良好,但面对复杂问题时,他们不得不对其进行升级,使其成为一个智能体 RAG [] 应用程序。而针对深度研究用例,该团队开发了一个名为 Agentic RAG++ 的解决方案。

Kulkarni 详细介绍了该深度研究系统的架构,包括:澄清循环、研究循环(用于执行思考与规划、执行、反思和规划调整等任务)以及写作循环(专注于写作和反思任务)。研究智能体的初始版本基于两个工具:RAG 工具和 text2sql 工具。RAG 工具的设计基于加权混合搜索、20 个上下文块、一个重新排序器以及 7 个精炼后的上下文块。text2sql 工具负责将 SQL 查询错误反馈给大型语言模型(LLM),以便优化模型,提高查询执行的准确性。他提到,诸如令牌成本过高、性能不佳和延迟过长等因素,都可能导致 AI 智能体的检索效果不佳。上下文焦虑是团队需要警惕的另一个问题。此外,数据不完整也会导致自我评估失准,但反思循环等技术有助于解决数据完整性问题。

演讲者探讨了在开发定制化深度研究智能体解决方案时需要应对的各种故障模式。长期任务需要明确的“思考-行动”循环。这可以通过整合多个步骤来解决,例如思考、规划(在搜索之前进行)、检查(在搜索完成后进行,并验证输出结果),以及最后的更新步骤,这一步实际上会生成最终报告。Anthropic 的 “think” 工具及其他类似的解决方案有助于规范化推理暂停。

此外,长期任务往往会在整体流程的各个步骤之间产生决策断层。在他们的解决方案中,反思步骤不仅包括数据反思,还包含流程反思,即评估流程是否已经完成。该阶段还包含第三个反思步骤“草稿撰写循环”,用于弥补合成方面的不足。例如,那些在研究过程中存在但在写作任务中未能涵盖的信息,会由“重写草稿”步骤来处理。

在演讲的最后,Kulkarni 探讨了新兴的治理框架工程技术,其中工具设计、记忆系统、验证检查、约束条件以及反馈循环的构建,使得自主式 AI 智能体可以更加可靠且可追溯。治理框架工程的目标是帮助 AI 解决方案从单纯的提示工程转向专注于 AI 智能体的自动化任务执行。本质上, AI 智能体是模型与治理框架的结合,因此,模型质量越高,所需的框架就越精简。

原文链接:https://www.infoq.com/news/2026/05/kulkarni-deep-research-agents/