惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

U
Unit 42
T
The Blog of Author Tim Ferriss
H
Help Net Security
博客园 - 叶小钗
云风的 BLOG
云风的 BLOG
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
D
DataBreaches.Net
博客园 - 聂微东
A
About on SuperTechFans
大猫的无限游戏
大猫的无限游戏
P
Proofpoint News Feed
Martin Fowler
Martin Fowler
博客园 - 【当耐特】
S
SegmentFault 最新的问题
Blog — PlanetScale
Blog — PlanetScale
酷 壳 – CoolShell
酷 壳 – CoolShell
G
Google Developers Blog
I
InfoQ
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
GbyAI
GbyAI
B
Blog
Engineering at Meta
Engineering at Meta
V
V2EX
Hugging Face - Blog
Hugging Face - Blog

博客园_首页

Plist 二进制格式 Milvus 和 PGVector,哪个更好? OpenClaw 已过时?在 VS Code 中运行 Hermes Agent! 第30篇文章:一个大三计科生的自白 Manim如何在数学公式中完美显示中文? Docker 部署 RocketMQ 5 并发编程核心概念辨析 C#事务处理最佳实践:别再让“主表存了、明细丢了”的破事发生 CLI 是什么?为什么大厂突然集体卷命令行? 【从0到1构建一个ClaudeAgent】协作-自主Agent UIImageView 设置图片不生效的原因排查 最小二乘问题详解20:无先验约束下的增量式SFM自由网平差 痞子衡嵌入式:大话双核i.MXRT1180之XIP应用里借助MU实现可靠Flash IAP的方法 AI Chat 封装, SemanticKerne.AiProvider.Unified 已发布 Windows下右键编辑js文件无法打开记事本——在注册表中使用环境变量 在后台服务中使用 Scoped 服务,为什么总是报错? H200 安装驱动并使用sglang启动模型 wireshark 抓包Trap上报告警内容 我用 AI 辅助开发了一系列小工具(2):图片压缩工具 [A Primer On MC and CC] 2.1 Memory Consistency 1 - 指令重排序和 SC 模型 Oracle数据库SCN推进技术详解与实践指南 玩转控件:封装个带图片的Label控件 Claude Code 4.7 真正该升级的不是模型,而是你的工作流 前端小白一句话,AI 帮我做了个颜值拉满的桌面媒体播放器。当代码不再是门槛,一句话编程就是现实。 5. WorkBuddy: 小龙虾的灵魂三件套,让你的小龙虾不只是工具 SQLite 分片方案实战:三种分片策略的深度对比 告别简陋 UI!一款基于 Fluent Design 和基于 WinUI 的开源免费、现代化的 Avalonia UI 控件库 关于二进制排列组合枚举的总结 AI开发-python-LangGraph框架(3-27-LangGraph从零实现大模型智能决策工作流) ElasticSearch主分片和副本分片概念详解
Agent新技术分享-Forge论文已被ACM接受
一蓑烟雨tw · 2026-05-23 · via 博客园_首页

Forge 五层准确率优化方案

模型基础准确率数据

  • 小模型:单步准确率90%,连续10步准确率30%左右

  • 大模型:单步准确率99%,连续10步准确率90%左右

Forge通过5层策略提高准确率

1. 救援解析层

问题:工具调用时,模型意图对了,但输出格式不对,模型输出了自由文本而不是结构化json

方法:三种抢救策略

  • 正则提取代码块包裹的JSON

  • 识别推理模型的「排练语法」

  • 识别Qwen的XML格式工具调用

2. 重试提示

问题:救援无效

方法

  • 注入纠正消息:「请用工具调用格式重试」

  • 工具不存在时列出可用工具

  • 预算限制:最多3次,超过就终止

  • 成功调用重置计数器

3. 步骤强制执行

问题:小模型爱跳步

  • 跳过中间步骤直接调终端工具

  • 前置依赖没完成就想出结论

方法:升级式纠正(分三次注入不同语气的纠正消息,三次后仍违规则报错终止)

  • 第1次跳步:礼貌提醒

  • 第2次跳步:直接要求

  • 第3次跳步:强硬命令

  • 之后跳步:报错终止

同时限制工具调用的前置条件。(如获取详情任务必须在搜索列表任务之后)

4. 错误恢复层

区分工具执行错误类型

  • 硬错误:代码 bug、权限不足等错误记入连续错误计数器,超两次则终止;

  • 解析错误:参数猜错等解析错误不记入计数器,仅引导模型换参数重试

区分原因:解析错误这种即使工具本身正常猜错三次也会终止,进行区分后这样可以防止系统过早放弃。

5. 上下文压缩

问题:多步的工作流会产生大量的上下文,包括每一步的工具调用,工具返回结果,推理过程,纠错信息。在消费级的GPU上,过长上下文会把模型从GPU挤到CPU,速度降低10~100倍。

方法:三阶段确定性压缩策略

  • 第一阶段:删除所有纠正消息,把旧的工具返回结果截断到前两百个字符。

  • 第二阶段:如果第一阶段不够,直接删除旧的工具返回结果。但保留模型的推理过程,

  • 第三阶段:如果还不够,删除推理和失败的文本回复,只保留工具调用的骨架。

Forge项目github链接:https://github.com/antoinezambelli/forge
视频讲解参考:https://v.douyin.com/j6Ty3rZnh_A/