惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Stack Overflow Blog
Stack Overflow Blog
云风的 BLOG
云风的 BLOG
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Recent Announcements
Recent Announcements
Microsoft Security Blog
Microsoft Security Blog
Microsoft Azure Blog
Microsoft Azure Blog
J
Java Code Geeks
D
DataBreaches.Net
U
Unit 42
P
Proofpoint News Feed
I
InfoQ
Apple Machine Learning Research
Apple Machine Learning Research
Google DeepMind News
Google DeepMind News
博客园 - Franky
博客园_首页
IT之家
IT之家
博客园 - 叶小钗
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 【当耐特】
Hugging Face - Blog
Hugging Face - Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
阮一峰的网络日志
阮一峰的网络日志

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
基准测试表明:AI智能体可修复独立漏洞,却难以理解系统范围影响
作者:Claudio M · 2026-05-20 · via InfoQ - 促进软件开发领域知识与创新的传播

Brandon Foley 在 CNCF 博客上发布了一项基准测试研究,证实 AI 编码智能体能够发现并修复孤立的漏洞,但它们通常难以理解系统范围内的影响。这对“改进代码检索是提升自动化漏洞修复能力的主要途径”这一观点提出了挑战。

作者将 AI 编码智能体集成到他的日常工作流中,开展实验来探究这类工具处理真实漏洞时的实际表现。他以 Kubernetes 仓库中的拉取请求作为基准,这些都是真实存在、由实际开发者主动修复的漏洞。每一个智能体仅能获取问题描述,无法借助拉取请求说明与代码差异内容获取解题提示。

三种智能体配置针对九份 Kubernetes 漏洞报告进行了测试,涵盖 kubelet、调度器、网络、存储及应用子系统。第一种使用通过 KAITO RAG 引擎(由 Qdrant 支持)实现的纯 RAG 检索,结合了 BM25 关键词匹配和嵌入向量语义搜索。第二种采用了混合方法,先通过 RAG 完成信息检索,再读取本地文件系统。第三种则完全依靠本地仓库克隆文件,没有检索索引。所有测试流程均使用同款模型 Claude Opus 4.6,统一设置五分钟超时限制与相同的输出格式,唯一变量是每个智能体查阅代码的方式。

本次基准测试的 AI 智能体配置

在速度和成本方面,结果很明确。纯 RAG 始终是最快的,平均耗时 76 秒,因为它完全跳过了文件系统导航,直接根据检索到的代码片段生成内容。混合方法最慢,平均耗时约两分半钟,因为强制的 RAG 检索在本地查阅代码前额外增加了开销。从词元使用效率来看,混合方法被证明是最昂贵的,不是因为它读取了更多代码,而是因为它进行了最多的模型调用,而且由于 API 是无状态的,每次调用都需要完整的对话历史。在所有测试中,调用次数是影响成本和延迟的最主要因素。

然而,在正确性方面,情况更为微妙。主要的失败情形不是修复不正确,而是修复不完整。智能体解决了“主要”漏洞,但忽略了相关联的变更;修复了一种实现方式,却忽略了第二种;修补了核心问题,但遗漏了依赖集成逻辑中必要的调整,或者在遇到代码库中已存在的部分修复时停止。常见的模式是:智能体不会主动思考还有哪些内容需要同步修改,只要当下问题看似解决,便直接停止。

第二个模式出现在架构选择方面。面临多种选择时,智能体倾向于引入新的抽象,而不是复用现有的抽象。在一个测试案例里,正确的修复使用了已有的 RestartCount 字段,而所有智能体却引入了一个新的 Attempt 字段,功能上虽正确,但让架构变得更为臃肿。

研究表明,检索策略会影响代码信息的查找效率,但不影响推理质量。强制使用 RAG 在某些情况下改善了结果,因为它会迫使智能体在执行修复之前识别出相关的策略评估层,从而产生了更优的架构决策。然而,在识别出相关代码后,智能体会继续进行局部推理;检索有助于导航,但无法帮助其理解系统范围内的影响。

也许最具可操作性的发现是关于问题报告质量的。标注了具体文件、函数和预期行为、描述清晰的漏洞报告让三种方案都达到优异效果,完全抹平了检索策略之间的性能差异。这意味着,人工撰写的问题描述的质量,其影响远大于检索架构的选择。

该研究发现,作用域发现是 AI 智能体面临的一个关键挑战,也就是识别出所有需要更改的部分,而不仅仅是看起来出问题的地方。这个问题仍然是 AI 大规模运营的主要障碍。结构化的智能体技能或精心策划的执行流程可能会改善系统级推理,但在大型代码库中,这些技能需要持续维护,才能保持与仓库的对齐,这就形成了需要额外运维管理的体系,无法实现一次性完成修复。

查看英文原文https://www.infoq.com/news/2026/05/ai-agents-kubernetes-rag/