惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
MyScale Blog
MyScale Blog
U
Unit 42
M
MIT News - Artificial intelligence
小众软件
小众软件
P
Proofpoint News Feed
雷峰网
雷峰网
L
LangChain Blog
S
SegmentFault 最新的问题
腾讯CDC
F
Fortinet All Blogs
A
About on SuperTechFans
WordPress大学
WordPress大学
Vercel News
Vercel News
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
G
Google Developers Blog
大猫的无限游戏
大猫的无限游戏
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
D
Docker
N
Netflix TechBlog - Medium
Apple Machine Learning Research
Apple Machine Learning Research
Recent Announcements
Recent Announcements
D
DataBreaches.Net
Stack Overflow Blog
Stack Overflow Blog

博客园 - iTech

7万星的AI交易框架:让大模型模拟投行多空辩论,自动做交易决策 71000颗星的AI交易团队:让大模型模拟投行分工,自动做交易决策 13400颗星的开源项目:输入一句话,AI全自动帮你做短视频 102颗星的沙盒:当AI学会自己写代码、跑测试、做部署 AI 技术日报 - 2026-05-08 29k 星的 PageIndex:不用向量数据库,靠推理就能做 RAG 每天花两小时刷信息?这个开源项目帮你全自动搞定 读源码像读小说?试了 DeepWiki 和 Zread,我再也不想裸读 GitHub 了 Matt Pocock 开源的这套 .claude 技能,为什么让工程师集体上头? Cursor Team Kit:Cursor 官方团队在用的 17 个 AI 工作流 AI 技术日报 - 2026-05-07 AI 技术日报 - 2026-05-06 AI 技术日报 - 2026-05-05 Anthropic CEO 说 12 个月内程序员要失业,我扒完他的底牌,发现事情没那么简单 把工程师的肌肉记忆装进 Claude Code,这个 4300 Star 的项目我后悔没早用 AI 技术日报 - 2026-05-04 AI 技术日报 - 2026-05-03 AI 技术日报 - 2026-05-02 六大 Agent 框架横评:谁支持 Skills?谁能自动创建 Agent?MCP 呢? Wechatsync:一个 Chrome 插件,一键把文章同步到 31 个平台 LangChain 开源了 Open SWE:Stripe、Ramp、Coinbase 内部都在造的编程 Agent Cockpit:把 Claude Code 从终端里搬出来,装进浏览器 Cursor 把自家的 AI Agent 开放了:写几行 TypeScript 就能调 Cursor 干活 AI 技术日报 - 2026-05-01 AI 写代码每次结果都不一样?Archon 用 YAML 工作流把 AI 编程变成流水线 AI 写代码比你快了,但你还是得学编程——只不过学法得换 腾讯的龙虾特工队:4 个 AI Agent 同日更新,全家桶正式成型 Agno 不做更聪明的 Agent,它要把所有 Agent 框架包进同一个操作系统 Hermes Agent 终于有了像样的 Web 界面,而且还支持远程访问 Datawhale 出了一套 29 学科知识地图,把 AI 的底牌全掀了
橙色手册:LLM Agent 循环工程的完整实践指南
iTech · 2026-06-19 · via 博客园 - iTech

橙色手册:LLM Agent 循环工程的完整实践指南

当我们谈论 Agent 时,大多数人关注的是模型能力、工具调用、RAG 检索——但很少有人深入讨论那个最核心的东西:思考循环(Thinking Loop)

Loop Engineering Orange Book(循环工程橙色手册)正是为了填补这个空白而生。这不是一本理论书,而是无数 Agent 开发者踩坑踩出来的实战手册。

什么是 Loop Engineering?

简单来说,Loop Engineering 就是设计、调试和优化 Agent 思考循环的工程学科

一个典型的 Agent 循环是这样的:
1. 观察(Observe):收集当前状态和环境信息
2. 思考(Think):分析情况,制定计划
3. 行动(Act):执行工具调用或代码
4. 反思(Reflect):评估结果,调整策略
5. → 回到第 1 步

这个循环听起来简单,但真正跑起来时,你会遇到各种各样的问题:死循环、无限递归、工具滥用、方向跑偏、状态爆炸...

Loop Engineering 就是解决这些问题的方法论。

循环设计的核心原则

1. 每个循环必须有明确的进展度量

反模式:循环跑了 10 次,你完全不知道它在干嘛,也不知道有没有接近目标。

最佳实践:每个循环都应该产出可量化的进展指标。

# ❌ 坏的循环设计
loop:
  while: true
  steps: [think, act]

# ✅ 好的循环设计
loop:
  max_iterations: 15
  progress_metric: "任务完成百分比"
  exit_conditions:
    - "任务完成度 >= 100%"
    - "连续3次无实质进展"
    - "达到最大迭代次数"

2. 状态必须是可序列化和可检查的

反模式:Agent 的"思考"只存在于模型的上下文窗口中,出了问题你根本不知道为什么。

最佳实践:每个循环的完整状态(思考过程、工具调用、结果、错误)都应该被持久化。

{
  "loop_id": "loop_20260617_001",
  "iteration": 3,
  "thought": "需要验证数据库连接配置",
  "action": "run_command",
  "result": "连接成功,响应时间 120ms",
  "reflection": "配置正确,可以继续下一步",
  "progress": 45,
  "timestamp": "2026-06-17T10:30:00Z"
}

3. 必须有防死循环机制

反模式:Agent 陷入"检查错误 → 没解决 → 再检查 → 还是没解决"的无限循环。

最佳实践:多层防护机制。

防护层级 机制 触发条件
L1 最大迭代次数 硬上限,超过即终止
L2 进展停滞检测 连续 N 次无实质进展
L3 模式重复检测 相同或高度相似的思考/行动重复出现
L4 资源超限检测 耗时、Token、内存超过阈值

常见的循环反模式

橙色手册总结了 Agent 开发中最常见的 8 种循环反模式:

反模式 1:乒乓循环(Ping-Pong Loop)

症状:Agent 在两个状态之间来回切换,永远停不下来。

迭代1: "我需要检查配置文件"
迭代2: "配置文件看起来没问题"
迭代3: "等等,还是再检查一下配置文件吧"
迭代4: "配置文件确实没问题"
迭代5: "让我再确认一遍配置..."

解决方案:添加状态访问计数,同一类操作超过阈值强制转向。

反模式 2:分析瘫痪(Analysis Paralysis)

症状:Agent 一直在"思考"和"规划",但从来没有真正执行过任何有实质意义的行动。

迭代1: "让我先制定一个完整的计划"
迭代2: "计划还需要更详细一些"
迭代3: "我应该再考虑几个备选方案"
迭代4: "让我评估一下风险..."

解决方案:强制"行动阈值"——思考次数超过 N 次后必须执行至少一个工具调用。

反模式 3:工具滥用(Tool Addiction)

症状:Agent 痴迷于调用工具,明明可以直接回答的问题也要查半天。

用户:"2+2等于几?"
Agent:"让我搜索一下计算器工具..." → "让我用 Python 计算一下..." → ...

解决方案:添加"工具必要性检查",每次调用工具前必须证明为什么不能直接回答。

反模式 4:上下文膨胀(Context Bloat)

症状:每个循环都把完整历史塞回去,Token 爆炸,性能指数级下降。

解决方案:滚动摘要 + 关键信息保留,而不是完整拼接。

反模式 5:目标漂移(Goal Drift)

症状:跑着跑着,Agent 已经忘了最初的任务是什么。

用户:"帮我写个 Python 爬虫"
迭代5: "等等,我应该先优化一下日志系统..."
迭代10: "说到日志,ELK 栈好像也该升级了..."

解决方案:每个循环开始时重新宣读原始任务,并要求 Agent 明确说明当前步骤与目标的关联。

反模式 6:错误循环(Error Loop)

症状:同一个错误反复出现,Agent 每次都用同样的方式尝试修复,每次都失败。

解决方案:错误记忆库 + 尝试计数器,同一错误超过 N 次必须换策略或请求人工干预。

反模式 7:递归地狱(Recursion Hell)

症状:Agent 启动子 Agent,子 Agent 启动孙子 Agent... 无限递归下去。

解决方案:最大递归深度限制 + 任务复杂度评估,简单任务禁止启动子 Agent。

反模式 8:收尾困难(Completion Anxiety)

症状:任务明明已经完成了,Agent 还在不断地"检查"、"优化"、"验证",就是不肯结束。

解决方案:明确的完成标准检查清单,达到所有条件后强制终止循环。

循环工程的成熟度模型

橙色手册定义了 Agent 循环系统的 5 个成熟度等级:

等级 名称 特征
L0 无控循环 while true 一把梭,全靠模型自觉
L1 基础防护 最大迭代次数 + 超时机制
L2 可观测 完整状态持久化 + 进度可视化
L3 自调节 自动检测反模式 + 自动纠正
L4 自优化 从历史循环中学习,动态调整策略

大多数开源 Agent 框架停留在 L0-L1 级别。能够做到 L2(完整可观测) 的已经算优秀。真正达到 L3/L4 的系统凤毛麟角。

为什么这很重要?

我们正在进入一个 Agent 普及的时代。每个人都在谈论构建自己的 AI Agent,每个人都在喊"Agent is the new App"。

但残酷的现实是:
- 90% 的 Agent Demo 只能跑一次
- 80% 的 Agent 在真实场景下会陷入某种死循环
- 70% 的 Agent 开发者不知道如何调试自己的 Agent
- 60% 的 Agent 项目最终因为可靠性问题而放弃

Loop Engineering 就是解决这些问题的钥匙。它不是什么高大上的理论,而是每个 Agent 开发者都应该掌握的基本工程素养。

就像当年 Web 开发从"能跑就行"进化到软件工程化,今天的 Agent 开发也正在经历同样的过程。循环工程就是这个过程的重要里程碑。

橙色手册的价值不在于它提出了多少革命性的新概念,而在于它把无数人踩过的坑系统地整理出来,给后来者一张清晰的避坑地图。

如果你正在做 Agent 相关的开发,或者计划做,这本手册值得你认真读一遍。


作者: itech001
来源: 公众号:AI人工智能时代
网站: https://www.theaiera.cn/
每日分享最前沿的AI新闻资讯和技术研究。

本文首发于 AI人工智能时代,转载请注明出处。