



























最近这段时间,我一直在做 Agent Runtime 。
然后越做越发现一个问题。
现在很多 Agent Demo ,看起来真的很猛。
会规划。 会调用 Tool 。 会 MCP 。 会 Multi-Agent 。 还能自己拆任务。
但问题是。
这些东西很多时候只适合 Demo 。
一旦真的开始接企业里的系统,问题马上就开始出现。
比如:
一个长任务执行 20 分钟之后,上下文乱了怎么办?
多个 Agent 同时修改状态,memory 冲突怎么办?
AI 调错 Tool 了怎么办?
任务执行到一半挂了,怎么恢复?
企业里的权限怎么隔离?
出了问题之后,怎么审计?
这些问题其实都不是 Prompt 能解决的。
甚至很多都已经不是“大模型问题”。
而是 Runtime 问题。
我现在越来越觉得,现在很多人其实高估了 Agent 的“智能”,但低估了 Agent 真正进入生产环境的难度。
因为 AI 一旦开始真正“做事”,而不是聊天,它碰到的问题会越来越像:
而不是 Prompt Engineering 。
所以我最近在做的东西,核心已经不是“怎么让 Agent 更聪明”。
反而是:
怎么让 Agent 不失控。
现在我的思路有点像:
Runtime 负责管理。
Agent 负责干活。
用户请求进来之后,Runtime 先做路由,再把任务交给不同领域的“数字员工”。
每个员工只负责自己领域内的事情。
然后 Runtime 去解决:
这些问题。
我现在甚至有一种感觉。
未来企业真正需要的,可能根本不是一个“超级 Agent”。
而是一套稳定的数字员工系统。
而真正难的部分,也不是模型。
而是 Runtime 。
1 leoliu168 5 月 28 日有道理,魔鬼都在细节,需要用确定性的 runtime 来控制大模型的不确定性 |
2 cadl 5 月 28 日写的好好。 感觉现在人在充当着这个 runtime 的角色。我有一个类似问题的想法,还在实现中…… |
3 thedog 5 月 28 日有多少人工才有多少智能。agent 需要由 agent 工程师让他变得好用。 |
4 409164 5 月 28 日两个顶级模型来回修正,效果比人工好 |
6 shakaraka 5 月 28 日多数企业要的是一个“稳定可靠的系统”+“AI 叙事”+“轻量化 AI 应用”,这样才能赶上互联网潮流,坑钱骗投资骗预算,见多了 |
7 JYii 5 月 28 日问题已经从使用大模型,上升到软件工程问题了 |
10 wadewade 5 月 28 日@409164 是的,这个评估机制确实可以有。这样可以减少模型幻觉带来的盲目自信,不过还是在关键节点,通过 runtime 限制死,核心的动作必须要人工参与授权。企业落地哪怕只有 1%的概率会出现不可控都是很难接受的,不可控带来的就是损失,那产品的信用也就毁了 |
11 newaccount 5 月 28 日不是有人么? |
15 wadewade 5 月 28 日@newaccount 对的呀,肯定需要在关键的节点卡 HITL ,目前的模型能力还无法完全替代人。所以需要构建一套确定性的 Runtime 体系去控制住模型的幻觉 |
17 wadewade 5 月 28 日@thedog 这个需要反驳一下,哈哈哈,模型底层就注定了它没办法永远稳定,即使你把温度压到最低,它天然就是进行向量计算预测,如果完全通过模型去预测,可能真的得等到世界模型了,否则现在的模型想要稳定进入企业不太可能。还是需要软件工程去限制它的能力 |
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。