惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
Martin Fowler
Martin Fowler
Google DeepMind News
Google DeepMind News
大猫的无限游戏
大猫的无限游戏
雷峰网
雷峰网
MyScale Blog
MyScale Blog
G
GRAHAM CLULEY
云风的 BLOG
云风的 BLOG
MongoDB | Blog
MongoDB | Blog
WordPress大学
WordPress大学
Y
Y Combinator Blog
The Register - Security
The Register - Security
宝玉的分享
宝玉的分享
S
Schneier on Security
N
News and Events Feed by Topic
T
Threat Research - Cisco Blogs
C
Cyber Attacks, Cyber Crime and Cyber Security
G
Google Developers Blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园_首页
S
Security @ Cisco Blogs
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
Visual Studio Blog
M
MIT News - Artificial intelligence
U
Unit 42
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
人人都是产品经理
人人都是产品经理
W
WeLiveSecurity
Latest news
Latest news
博客园 - 【当耐特】
P
Palo Alto Networks Blog
博客园 - 叶小钗
Simon Willison's Weblog
Simon Willison's Weblog
Jina AI
Jina AI
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
T
Troy Hunt's Blog
L
LangChain Blog
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - Franky
C
Check Point Blog
O
OpenAI News
C
Cisco Blogs
T
Tor Project blog
A
About on SuperTechFans
F
Full Disclosure
D
Darknet – Hacking Tools, Hacker News & Cyber Security
L
Lohrmann on Cybersecurity
Attack and Defense Labs
Attack and Defense Labs

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
如何通过 Trace 数据监控 Cortex Agent 性能 | 技术实践
Michael Segner王玮张琰梓 · 2026-05-27 · via InfoQ - 促进软件开发领域知识与创新的传播

2026 年,智能体将在企业级应用中取得哪些实质性突破?点击下载《2026 年 AI 与数据发展预测》白皮书,获悉专家一手前瞻,抢先拥抱新的工作方式!

观察你的 Cortex Agent 集群

使用 Snowflake Intelligence 的团队往往行动很快。Cortex Agents 可以快速且无缝地构建,不知不觉间,你就已经有一个集群在不同领域和业务职能中投入生产运行。

Snowflake Intelligence 架构

部署 agents 是一种赋能体验。然而,理解和评估它们的性能可能是另一回事。监控错误率、延迟、token 消耗等健康功能指标,以及新鲜度和数量等质量指标,是任何生产系统的基本要求;agents 也不例外。

Snowflake Intelligence 为团队回答这些重要问题提供了所需的基础。它会原生记录丰富的 trace 数据——对话历史、工具执行、LLM 规划、响应生成。

挑战在于如何以具有运营实用性的方式呈现这些数据,而不是每次都要针对可观测性表编写 SQL。

可以把它看作一条成熟曲线。

一开始,你可能只是通过查询 agent 错误率或其他性能指标来获取某个时点的快照。随着不断推进,你会开始构建和维护仪表板,然后使用异常检测模型监控这些仪表板趋势,以识别离群值和 SLA 违约。最终,你可以主动识别导致“边缘案例”的系统性问题,并实施事件管理流程,以维持生产级 SLA。

要沿着这条成熟曲线不断升级,需要深入理解 agent telemetry,以及它如何被观察、分析,并最终用于排查 Agentic 故障。

我们将在本文中探讨这些主题,逐步介绍 Snowflake 如何记录 Cortex Agent telemetry,以及 agent 可观测性解决方案如何帮助监控并修复常见的性能故障模式。agent 可靠性的其他关键方面,包括上下文(数据质量)、轨迹(工具调用)和输出,将留待以后讨论。

Snowflake 为 Cortex Agents 记录了什么:深入底层一探究竟

在设置任何监控之前,值得先理解 Snowflake Intelligence 生成的 trace 结构。

每一次 Cortex Agent 交互都由一个 spans 层级结构组成,每个 span 代表 agent 操作的不同阶段。Snowflake 将这些 trace 数据存储在原生可观测性表中,可以通过一个名为 SNOWFLAKE.LOCAL.GET_AI_OBSERVABILITY_EVENTS 的表函数访问,该函数可以直接在 Snowflake SQL worksheet 中调用。

例如,Monte Carlo 在底层运行、用于支持我们 agent 性能监控的查询如下。这个查询值得仔细看一看,因为它准确揭示了 Snowflake 在 span 级别记录了什么:

SELECT * FROM TABLE(    SNOWFLAKE.LOCAL.GET_AI_OBSERVABILITY_EVENTS(        'YOUR_DATABASE',        'YOUR_SCHEMA',        'YOUR_AGENT_NAME',        'CORTEX AGENT'    ))WHERE RECORD_TYPE = 'SPAN'  AND RECORD:name::STRING NOT LIKE 'SqlExecution_%'

复制代码

在 Snowflake 中对 “MSegner_Demo_Agent” 运行 Get_AI_Observability_Events 查询

这里有意过滤掉了 SqlExecution_* spans,因为它们代表 Cortex Analyst 触发的实际 SQL 运行,如果包含在 agent 级指标中,往往会产生噪声。将它们移除后,剩下的就是 agent 行为 trace。

将 records 映射到 span 类型

每个 span 都有一个 record_name,用于标识其 span 类型。

这些元数据对于理解每个 record_name 在 agent 行为中实际代表什么至关重要,也正是它让 trace 数据变得可操作。如果没有这种映射,你看到的只是一串晦涩字符串组成的扁平列表,无法清楚判断 agent 操作中的哪个环节出了问题。

它们与 agent 操作的映射关系如下:

CASE    WHEN record_name = 'AgentV2RequestResponseInfo'               THEN 'chat'    WHEN record_name LIKE 'ReasoningAgentStepPlanning-%'          THEN 'planning'    WHEN record_name LIKE 'ReasoningAgentStepResponseGeneration-%' THEN 'response_generation'    WHEN record_name LIKE 'CortexSearchService_%'                 THEN 'tool_call'    WHEN record_name LIKE 'CortexAnalystTool_%'                   THEN 'tool_call'    ELSE 'unknown'END AS request_type

复制代码

Snowflake 中的 Agent telemetry,record_name

每种 span 类型代表什么:

- chat完整对话轮次的顶层 span。AgentV2RequestResponseInfo 是最外层封装:它捕获单次用户交互的完整输入和输出,以及将多轮对话关联在一起的 thread_id

- planningReasoningAgentStepPlanning spans 捕获 agent 的决策过程:下一步调用哪个工具、制定什么查询、传递什么上下文。每个 planning step 都会在 RECORD_ATTRIBUTES 中记录自己的 token 数量、模型名称和工具选择;

- response_generation:ReasoningAgentStepResponseGeneration spans 捕获最终答案合成过程。此时 agent 已经完成工具调用,正在生成响应。这里的 token 数量反映最终 LLM 调用的成本;

- tool_call:两类工具会使用不同的属性 schema 记录,包括:

  • CortexSearchService_* spans 记录搜索查询、请求的列、应用的筛选器、结果限制、返回结果和状态;

    CortexAnalystTool_* spans 记录传入的 messages、使用的 semantic model、生成的 SQL 查询、文本响应,以及——尤其值得注意的是——一个 question_category 字段,用于分类 Cortex Analyst 收到的问题类型。

关于 question_category 字段,Cortex Analyst 会自动对问题进行分类,并且该分类可在 trace 数据中观察到。类别可能包括简单查找、聚合、时间序列查询和比较分析等。

如果你发现某个特定 agent 出现 token 峰值或延迟增加,按 question_category 筛选 traces 可以快速显示该模式是否集中在某类特定问题上。

更复杂的分析类问题往往会生成明显更复杂的 SQL 和更长的响应,因此,即便 agent 配置没有变化,命中某个 agent 的问题类型组合发生变化,也可能推动汇总指标变化。

需要监控的关键性能指标

现在我们已经很好地理解了 span 类型,接下来深入讨论团队应该监控的关键性能指标:token 数量、状态码和持续时间。异常行为几乎总是会先在这些指标中显现出来,然后才会出现在其他地方。

Total tokens

Token 消耗(成本)反映了 agent 在其 spans 中处理和生成了多少上下文;你做的工作越多,消耗的 token 就越多。进一步分析,通常平均 token 的持续增加意味着以下几种情况之一:

  • 输入长度变化:用户发送的查询更长,或者调用应用在每个请求中传递了更多上下文;

  • 上下文窗口累积:在多轮对话中,Cortex Agents 通过 thread_id 维护 thread 历史。每一轮后续对话都会携带完整的先前上下文,因此一个从 5k tokens 开始的会话,到第 10 轮时可能超过 40k。如果平均 token 逐渐上升,多轮上下文增长通常就是原因;

  • 检索行为变化:如果 agent 使用 Cortex Search,检索配置发生变化(返回更多结果、更大的 chunks、不同的 reranking)会表现为 token 增加,而用户行为并没有任何变化;

  • 工具调用深度增加:每次对话中的工具调用越多,就意味着更多 planning spans,而每个 planning span 都有自己的 token 成本。工具路由逻辑的变化会在这里变得很明显;

  • 输出冗长度漂移:这种情况较少见,但底层 Cortex model 的变化可能会影响响应的详细程度。planning spans 上的 model_name 字段使我们能够将 token 变化与模型版本关联起来。

在 Snowflake 中,token 计量发生在 span 级别,而不是对话级别。Snowflake 会在每个 span 的 RECORD_ATTRIBUTES 中分别记录 prompt tokens 和 completion tokens,这意味着单次对话会在其 planning、tool call 和 response generation spans 中合计生成多个 token 计数。

Snowflake 中显示的 ReasonAgentStepPlanning-O span 的 Token_count

无论你使用的是 agent 可观测性工具,还是更手动的流程,一项最佳实践都是将这些数据解析为每个 span 的统一 total_tokens 指标,并查看当天所有 spans 的平均值,而不是按对话查看。这在解释 token 峰值时非常重要。

Duration

Duration 往往与 token 消耗相关;token 越多,通常处理时间越长。

然而,当 agent 进行了比预期更多的工具调用、命中了较慢的底层数据,或者正在重试失败操作时,duration 也可能独立飙升。同时观察两者,比单独观察任一指标都能提供更多诊断信号。

P50 和 P90 这类延迟分布也比单纯的平均值更能真实反映情况:稳定的平均值可能掩盖越来越长的慢响应尾部,而这种尾部正在悄悄侵蚀用户信任。

虽然 token 消耗和 duration 都无法告诉你具体哪里出了问题(这需要人工或 Agentic 排查),但两者都能告诉你发生了某种变化。这非常有价值,因为对于那些优雅失败而不是直接崩溃的 Agentic 系统来说,检测问题通常非常困难。

Status Codes

Status codes 也会在 Snowflake 的 trace 数据中直接按 span 跟踪,每个 span 都会解析为 STATUS_CODE_OKSTATUS_CODE_ERROR

因此,错误可以在 span 级别被观察到,这意味着你可以区分 planning step 失败、tool call 失败和 response generation 失败。这三者是完全不同的根因,对应不同的修复路径,因此具备这种清晰区分对于排查 Agentic 故障至关重要。

完成率这类派生指标,即解析为 STATUS_CODE_OK 与 STATUS_CODE_ERROR 的 spans 比例,可以捕捉到 duration 和 token 数量完全遗漏的静默失败。

组合信号

一旦你建立了基线指标,并对正常 agent 性能有了感觉,监控范围就会显著扩展,而这正是 agent 可观测性开始与传统数据管道监控产生实质差异的地方。

例如,evaluation monitors 会监控最终 agent 输出适配性的显著退化。它有帮助吗?完成任务了吗?使用了正确的语言或语气吗?

真正的力量来自利用 agent 可观测性解决方案,将这些信号跨 span 类型组合起来。planning spans 上的高 token 数量与 tool call spans 上的低完成率同时出现,指向的问题,与性能指标稳定但 evaluation scores 下降所指向的问题完全不同。

一个按天分组、设置为在 duration 或 token 异常时告警的 agent monitor,显示在 Monte Carlo 中

同时跨多个信号类型获得 span 级可见性,是“知道出了问题”和“知道该去哪里查”之间的关键差别。

常见 agent 性能问题

Token 峰值:它们是什么样子,又是什么导致的

在 Cortex Agent 部署早期几周中,一个常见模式是平均 token 消耗出现阶跃式增长,平均 token 在几天内大约翻倍,然后部分回落。

Monte Carlo 中显示的一个 Cortex agent 生命周期早期的初始 token 峰值

  • 这种模式有几种明确的潜在原因,值得系统性排查:突然飙升然后部分回落:这表明发生了一个临时变化,并已部分解决,常见原因包括某个高 token 用户会话抬高了每日平均值,system prompt 或工具配置发生了临时变化后又被回滚,或者一批多轮对话在用户放弃前累积了上下文;

  • 阶跃式上升且没有回落:这表明发生了持续性变化。可能原因包括 system prompt 变化、调用应用的新版本传递了更多上下文,或检索配置变化永久增加了结果集大小;

  • 逐渐上升漂移:这是多轮 agents 最值得担心的模式。如果 thread 历史在没有截断的情况下不断累积,随着用户进行更长对话,平均 token 会持续上升。这是可以管理的,但需要在 agent 配置中明确进行上下文窗口管理。

对于你的 Cortex Agent 中出现的任何这些模式,你可以手动排查,也可以使用 agent 可观测性解决方案进行排查。下一步是查看 traces,筛选受影响的日期范围,并检查单个 spans,对比峰值前后的输入长度、planning step 数量和工具调用行为。一些 agent 可观测性工具提供 Agentic 根因分析,以加速这一步。

来自 Cortex Analyst spans 的 question_category 字段在这里尤其有用:如果峰值与问题类型变化同时出现(例如更多复杂分析查询),这与问题类型保持不变时所代表的问题并不相同。

使用量波动

在早期 Cortex Agent 部署中持续出现的第二种模式,是每日使用量的高方差。

Monte Carlo 中显示的高 token 方差

对于企业内部工具和 B2B 工作流——许多早期 Cortex Agents 通常部署在这些场景中——使用量往往是尖峰式的,而不是均匀的。流量集中在工作时间、特定工作流和特定用户群体周围,因此低流量日可能会在 agent 可观测性表中产生接近零的行数。

这对监控有两个实际影响:

  • 基线质量不均衡。基于高方差数据训练的异常检测模型会产生更宽的置信区间,这意味着需要更大的偏差才会触发告警。接近零流量的日期几乎不会为基线贡献任何信号,而基于小样本量计算出的平均值并不可靠。对于流量模式高度可变的团队,可能需要自行调整 monitor 敏感度,或考虑筛选到工作时间窗口,以获得更干净的基线;

  • 低流量日可能掩盖故障。如果某个 agent 正在经历更高的错误率,但每日量很低,汇总指标可能看起来正常,原因只是没有足够的 spans 来推动平均值变化。这就是为什么要添加错误率监控作为单独信号:将 status_code = 2(STATUS_CODE_ERROR)作为总 spans 的比例进行跟踪,而不是仅依赖性能指标来暴露问题。

底层原则

Snowflake Intelligence 生成的可观测性数据比大多数团队意识到的更多。其中有大量 trace 数据,包括对话历史、span 级 token 数量、工具调用输入和输出、状态码、模型名称以及问题类别。

真正的挑战并不在于有哪些数据可用,而在于能否持续观察这些数据、学习什么是正常状态,并在用户发现问题之前呈现偏差。此外,所有这些都需要以规模化方式完成,因为你和世界上其他人一样,都在竞相部署 agents 集群,而不仅仅是单个 agent 工作流。

原文地址:https://medium.com/snowflake/monitoring-cortex-agent-performance-using-trace-data-8f40dd3e012c

点击链接立即报名注册:Ascent - Snowflake Platform Training - China更多 Snowflake 精彩活动请关注专区