惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
博客园 - 司徒正美
C
Check Point Blog
G
Google Developers Blog
The GitHub Blog
The GitHub Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
有赞技术团队
有赞技术团队
P
Proofpoint News Feed
IT之家
IT之家
B
Blog
博客园_首页
量子位
MongoDB | Blog
MongoDB | Blog
博客园 - Franky
J
Java Code Geeks
H
Help Net Security
A
About on SuperTechFans
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
D
DataBreaches.Net
Y
Y Combinator Blog
大猫的无限游戏
大猫的无限游戏
云风的 BLOG
云风的 BLOG
Google DeepMind News
Google DeepMind News

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
Harness工程的二次理解——弥补大模型的缺陷
coldingcode · 2026-04-29 · via LINUX DO - 最新话题
回顾前文 Harness 工程的基本理解与Multi-Agent系统的区别 本人目前使用最频繁的模型,本篇博客接替上门继续讨论编程大模型: deepseek-v4-pro[max] sonnet 4.6[web] qwen3.6-plus glm-5 后两个模型为gc模型,不在本次讨论范围内,不过会作为背景板提到一点。 大模型的缺陷 什么是大模型的缺陷,我认为这个是因人而异的,因为有需求才会有缺陷,没有需求等于没有缺陷。那我的需求是什么,四个字—— 写好代码 。可这四个字背后藏着的可不止四个字,我自己尝试去理解,大概能翻译出来以下几种意思。 代码能编译成功不报错 代码能真正实现功能 代码能模块化、完整度高 代码能实现业务功能 前端代码不仅页面设计好看、而且要交互体验好、还能跟后端接口顺利对接保持数据正确传递 后端代码不仅性能优秀、还要能良好处理数据存储、线程并发、顺利通过接口与前端交互 然后即使上面这6项要求,很遗憾地告诉大家,前面提到的4个模型,没有一个是能全面达到的,困难点几乎都在是后面三点。 不过deepseek-v4不知道是不是灰度加强了,第一天、第二天是达不到的,从4.28后开始,也就是第三次deepseek发福利延长到5月底的时候,以上6项已经全部满足。 那好,我们发现了的大模型的第一个缺陷——编程能力不足。上一篇博客也提到,Harness 是编程大模型的IDE,专门为编程大模型打辅助,即使我们发现了第一项,我们就需要去干活了,不过在干活之前,我们还要知道怎么干,所以我们需要分析分析(猜测猜测)大模型是因为什么导致的这些问题。 由于前三个问题,4个大模型基础都能满足,就不多占用文字了。后面三个为什么达不到,我猜测为以下原因: 人员自身问题 (问题4):需求不明确、需求冲突但模型没提问,将计就计 模型不够聪明或自以为是 (问题4):模型理解能力不够或突破上限,导致实现与需求对不齐 模型代码库有限 (问题5、问题6):模型代码模板就那些,或预训练代码为低质量代码 逻辑创新不够 (问题1-6):不关于结合上下文编写代码,或者说写代码死板 那好,我们已经 尝试 找到原因了,那我们就来 尝试 使用Harness的手段进行修复吧。首先我们来复习下,Harness 最简化工程分为三个阶段:规划(planner)——生成(generator)——验证(evaluator),两相对比下来,经常写智能体的专家,立马就知道如何下手了,那我就在这说一种最简单的方式: 规划(planner) 我们需要在planner的提示针对以上4个问题去强调: ### 角色定义 你作为一个规划师,你最重要的是严格遵守用户确认过的需求,不能再有其它发散balabala 如果你依旧觉得无法形成闭环,需求不明确,可再次向用户提问balabala ### 操作规范 你要深知,大模型的逻辑能力不够,你需要给到明确的规划,比如设计定义、接口文档、业务核心流程定义,不要尝试给模型发挥的空间,模型是个捣蛋鬼balabala 生成(generator) ### 角色定义 你作为整个工程最核心的环节,你一定不能出错,认真读取Planner的定义,严格执行,模型给你的代码,你需要深度思考,是否匹配,如果不匹配,需要打回直到契合业务balabala ### 操作规范 大模型最不擅长的就是前后端对接部分,而且大模型给你的代码质量并不一定就是可行的,你一定要看清楚每一行代码,你一定要看清楚接口文档去实现,否则这块代码将会影响整个工程的不可用,后果极其严重balabala 验证(evaluator) ### 角色定义 你是整个工程的质量检验员,过了你这一关,就直面用户了,一定要把好关,不能让不良工程,出自你的手。你要永久的辨证去看待每一个功能,不能留有一丝余地balabala ### 操作规范 大模型会有逃逸和偷懒的形为,你要始终提高警惕balabala 可以发现,我是 尝试 在harness的所有维度都去做了相关工作,由于大模型的不可控性,我们也只能尽可能的去弥补大模型的弱点。而这时我们就知道,什么大模型对我们来说,才是好模型,问题点越少,需要我们做得越少,那就是好模型。 到这里,我们就完成了一次harness 工程的迭代,发现大模型的缺陷——思考与规划——优化harness流程——得到一个新版本的harness。 1 个帖子 - 1 位参与者 阅读完整话题