惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Hugging Face - Blog
Hugging Face - Blog
GbyAI
GbyAI
Engineering at Meta
Engineering at Meta
有赞技术团队
有赞技术团队
博客园 - 【当耐特】
H
Hackread – Cybersecurity News, Data Breaches, AI and More
WordPress大学
WordPress大学
博客园_首页
美团技术团队
H
Help Net Security
MongoDB | Blog
MongoDB | Blog
宝玉的分享
宝玉的分享
大猫的无限游戏
大猫的无限游戏
小众软件
小众软件
J
Java Code Geeks
A
About on SuperTechFans
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
IT之家
IT之家
T
The Blog of Author Tim Ferriss
Microsoft Azure Blog
Microsoft Azure Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
B
Blog
雷峰网
雷峰网
爱范儿
爱范儿

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12)
Agent新技术分享-Forge论文已被ACM接受
一蓑烟雨tw · 2026-05-23 · via 博客园_首页

Forge 五层准确率优化方案

模型基础准确率数据

  • 小模型:单步准确率90%,连续10步准确率30%左右

  • 大模型:单步准确率99%,连续10步准确率90%左右

Forge通过5层策略提高准确率

1. 救援解析层

问题:工具调用时,模型意图对了,但输出格式不对,模型输出了自由文本而不是结构化json

方法:三种抢救策略

  • 正则提取代码块包裹的JSON

  • 识别推理模型的「排练语法」

  • 识别Qwen的XML格式工具调用

2. 重试提示

问题:救援无效

方法

  • 注入纠正消息:「请用工具调用格式重试」

  • 工具不存在时列出可用工具

  • 预算限制:最多3次,超过就终止

  • 成功调用重置计数器

3. 步骤强制执行

问题:小模型爱跳步

  • 跳过中间步骤直接调终端工具

  • 前置依赖没完成就想出结论

方法:升级式纠正(分三次注入不同语气的纠正消息,三次后仍违规则报错终止)

  • 第1次跳步:礼貌提醒

  • 第2次跳步:直接要求

  • 第3次跳步:强硬命令

  • 之后跳步:报错终止

同时限制工具调用的前置条件。(如获取详情任务必须在搜索列表任务之后)

4. 错误恢复层

区分工具执行错误类型

  • 硬错误:代码 bug、权限不足等错误记入连续错误计数器,超两次则终止;

  • 解析错误:参数猜错等解析错误不记入计数器,仅引导模型换参数重试

区分原因:解析错误这种即使工具本身正常猜错三次也会终止,进行区分后这样可以防止系统过早放弃。

5. 上下文压缩

问题:多步的工作流会产生大量的上下文,包括每一步的工具调用,工具返回结果,推理过程,纠错信息。在消费级的GPU上,过长上下文会把模型从GPU挤到CPU,速度降低10~100倍。

方法:三阶段确定性压缩策略

  • 第一阶段:删除所有纠正消息,把旧的工具返回结果截断到前两百个字符。

  • 第二阶段:如果第一阶段不够,直接删除旧的工具返回结果。但保留模型的推理过程,

  • 第三阶段:如果还不够,删除推理和失败的文本回复,只保留工具调用的骨架。

Forge项目github链接:https://github.com/antoinezambelli/forge
视频讲解参考:https://v.douyin.com/j6Ty3rZnh_A/