惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

aimingoo的专栏
aimingoo的专栏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Blog — PlanetScale
Blog — PlanetScale
博客园 - Franky
The GitHub Blog
The GitHub Blog
F
Fortinet All Blogs
Microsoft Azure Blog
Microsoft Azure Blog
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tailwind CSS Blog
博客园 - 三生石上(FineUI控件)
Apple Machine Learning Research
Apple Machine Learning Research
D
Docker
Google DeepMind News
Google DeepMind News
GbyAI
GbyAI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Proofpoint News Feed
N
Netflix TechBlog - Medium
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Engineering at Meta
Engineering at Meta
H
Help Net Security
B
Blog
宝玉的分享
宝玉的分享

暗无天日

读:AI Agent 生产化——一份从原型到上线的速查清单 - 暗无天日 AI写作的语言指纹——如何让文字不那么像机器 - 暗无天日 读:50 条 Claude Code 技巧——一个工程经理的六个月使用心得 读:AI 辅助开发为什么让 E2E 测试更有价值 - 暗无天日 读:在Emacs中使用Claude Code(Spacemacs适配版) - 暗无天日 Claude Code 背后的工程哲学——读 Agent Harness Engineering 读:Agent Harness Engineering——AI 智能体不只是模型,还有套件 - 暗无天日 browser-harness:让 AI 直接接管你的浏览器 - 暗无天日 读:Security-First CI/CD —— DevSecOps 自动化实践指南 TIL: 数字小键盘的小数点陷阱与行内算术求值 - 暗无天日 读:Immutability 不是万能药,它是一种权衡 - 暗无天日 Conducty:给 Claude Code 加上项目记忆和并行执行能力 - 暗无天日 读 — GitHub Trending 里的 Claude Code 技能包 读 — Prompt Caching 省钱指南 TIL: Emacs 中那些跟鼠标配合的冷门快捷键 - 暗无天日 读:Anvil——把 Emacs 变成 AI 的工具服务器 读:Emacs 代码折叠终极指南 - 暗无天日 读:Clojure 搭车客指南 - 暗无天日 git推送失败后恢复仓库损坏的完整记录 - 暗无天日 多智能体系统的两个有效模式——以及对 Claude Code 用户的启示 - 暗无天日 用 Org Babel 写 Literate 博文:扩展执行 + 定制导出 proced:Emacs 内置的进程查看器 - 暗无天日 从 proced 定制中学到的 Elisp 模式 读:让 Emacs proced 在 macOS 上显示 CPU 和内存 异步编程的函数着色税 - 暗无天日 链式调用的代价:JavaScript 和 Clojure 的共同教训 - 暗无天日 hyperfine:命令行基准测试工具 - 暗无天日 管道中的变量去哪了?——子 shell 作用域陷阱 - 暗无天日 开源包装器的信任陷阱:四个危险信号 - 暗无天日 程序员愿意为 AI 写文档,却不愿为同事写 - 暗无天日
读:AI Agent 安全日志——从可见性与隐私的两难说起 - 暗无天日
2026-05-01 · via 暗无天日

原文把 agent 可见性拆成四个维度。这四个 pillar 覆盖了安全、运维、产品三个角色的需求,不需要在每个事件里塞原始内容。

**1. 工具交互(Tool Interactions)

记录 agent 调了哪个工具、为什么调、结果如何。关键字段包括工具名称、参数类型、调用延迟、重试次数、响应状态、错误分类。

长期看,这些数据能揭示工具选择模式的漂移。如果一个 agent 突然开始频繁调用高风险连接器、或者反复调用导出接口,那往往是 prompt 滥用或策略漏洞的最早信号。这比等出了事再查更有价值。

**2. 推理过程(Reasoning Processes)

推理过程日志记录的是决策上下文,不是原始思维链。原文的观点很明确:你知道哪个策略门被评估了、哪些约束激活了、哪个分支被选中就够了,不需要记录推理过程中产生的每一个 token。目的是可解释性,不是全量采集。

**3. 质量指标(Quality Indicators)

质量指标衡量系统是否在安全地做有用的事。典型指标包括任务完成率、回退频率、幻觉代理指标(hallucination proxy metrics,用模型自我矛盾频率等间接信号推测是否产生了幻觉)、人工修正率、评估流水线的响应相关性分数(用自动化评测系统判断输出是否准确回答了问题)。

安全和质量在这里是关联的。质量信号下降往往先于不安全行为,因为困惑的 agent 更容易过度调用工具、误处理指令、或在响应中暴露无关上下文。

**4. 用户交互(User Interactions)

用户交互日志记录请求和响应的元数据,但内容本身要严格控制。有用的字段:用户角色、会话标识、意图标签、响应类别、策略执行结果。原始提示和响应应该抽样采集,采集到的必须做脱敏处理,保留期要短。

大多数场景下,元数据已经足够回答运维问题,同时大幅降低隐私泄露风险。

原文还给出了一个 OTel trace 事件示例,展示了实践中的样子:

{
  "trace_id": "4bf92f3577b34da6",
  "service.name": "support-agent",
  "gen_ai.tool.name": "document_retriever",
  "gen_ai.tool.call.status": "success",
  "gen_ai.policy.decision": "allowed",
  "gen_ai.safety.filter": "pii_detected",
  "gen_ai.safety.action": "masked",
  "document.classification": "internal",
  "latency_ms": 340,
  "user.role": "support_tier_1"
}

注意文档内容、用户提示、检索文本都没有出现在事件中。 gen_ai.safety.filter: pii_detected 记录发现了什么, gen_ai.safety.action: masked 记录做了什么处理。这些信息已经足够重建事件经过和证明合规。