惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Cisco Talos Blog
Cisco Talos Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Google Online Security Blog
Google Online Security Blog
博客园 - Franky
Hugging Face - Blog
Hugging Face - Blog
Security Archives - TechRepublic
Security Archives - TechRepublic
博客园 - 司徒正美
N
News and Events Feed by Topic
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
WordPress大学
WordPress大学
博客园 - 三生石上(FineUI控件)
Help Net Security
Help Net Security
N
News and Events Feed by Topic
O
OpenAI News
L
LangChain Blog
F
Full Disclosure
A
About on SuperTechFans
The GitHub Blog
The GitHub Blog
GbyAI
GbyAI
Cloudbric
Cloudbric
W
WeLiveSecurity
Application and Cybersecurity Blog
Application and Cybersecurity Blog
罗磊的独立博客
Attack and Defense Labs
Attack and Defense Labs
PCI Perspectives
PCI Perspectives
TaoSecurity Blog
TaoSecurity Blog
AI
AI
有赞技术团队
有赞技术团队
酷 壳 – CoolShell
酷 壳 – CoolShell
C
CXSECURITY Database RSS Feed - CXSecurity.com
C
Cisco Blogs
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Apple Machine Learning Research
Apple Machine Learning Research
C
CERT Recently Published Vulnerability Notes
T
The Exploit Database - CXSecurity.com
T
Threatpost
P
Palo Alto Networks Blog
G
GRAHAM CLULEY
Last Week in AI
Last Week in AI
雷峰网
雷峰网
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
C
Cyber Attacks, Cyber Crime and Cyber Security
博客园 - 聂微东
P
Proofpoint News Feed
Latest news
Latest news
S
SegmentFault 最新的问题
J
Java Code Geeks
T
Threat Research - Cisco Blogs
H
Help Net Security
P
Privacy International News Feed

AI Agent 智能体

MiMo Token 激励计划:你们拿它做出了什么? 分享一个 Claude Code 脚手架: abc-scaffold 被喷了一天后,我觉得技术不值钱这句话应该改一下 中转站的安全性如何保障, Agent 一个提示就是几百个工具调用,几十个 exec 没人会一个一个审核吧。 以后技术鄙视链可能就一句话:你会不会使唤 Agent 最近又造了个轮子,基于 AI 的软件交付工作流引擎 自从有了 AI 之后, Commit 数量是不是已经不适合衡量开发效率了 我发现有了 AI 之后,很多人都在重复造轮子 AI 时代 产品需求文档(PRD) 软件需求文档(SRS) 应该怎么写呢?有推荐的模板吗?有推荐的 SKILL 吗? 征求可行方案:远程操控 + codex 桌面端 computer use 功能 + API 中转 - V2EX 做了个常驻的 AI 金融分析 Agent —— 不给买卖信号,只把事实端给你看 我跑了一晚 RAG,发现问题不在检索层 你们用的桌面 Agent 都是啥, 能操作浏览器么? Ucloud 也下场做中转站了 是不是第一个大厂做 gpt/anthropic 中转站的 怎么做的合规 如果为了本地大模型,卖掉 MacBook Pro M3 Pro 36G,买Μ5 Max 128G,合适吗? 照 AI 这个发展速度,感觉 AI 失控导致世界末日不远了 有用 openclaw 排杂志或者月刊的没?能达到 HTML 的效果吧? - V2EX 做了一个本地查看 Coding Agent API trace 的工具: claude-tap docker sandbox + Codex CLI 这个方案可做开发自动化吗? 把 LLM 当成“人”,才是 Agent 工程进阶的起点 目前无人值守的 AI 开发流程是否有研究前途 - V2EX 你还能回到没有 AI 的过去吗? 最近两周在用向量数据库来给 Hermes 扩充脑容量,直接让我力竭了。 火山新出了 Agent Plan,涨价 2~7.5 倍 - V2EX GLM 崩了? - V2EX 做了个小工具:让本地 AI Agent 操作堡垒机后的远程 Linux 环境 - V2EX “这个确实有点复杂。要不先把这个功能延后到 TODO,今晚先收工?已经凌晨快 2 点了。” - V2EX AI 大趋势,有人转全栈了吗?有没有成功案例可以分享一波的 - V2EX 做了一个给 AI agent 用的"万能钥匙",一个 key 调所有社交平台和数据源 - V2EX memory 真的会让 Agent 变得更好用吗? - V2EX Macbook 上装的 OpenAI Codex App 如何才能使用国内的大模型? 刚接了 hermes agent,这是微信 ClawBot 的 bug 吗? 你们给 agent 配的谁家的模型?求推荐 openclaw 和 hermes agent 支持多个聊天机器人吗 没啥事研究了一下 Hermes agent 原理 OpenClaw, Hermes, Mercury 或其他,哪个个人 Agent 能真正投入使用? 向佬们征集一些实务上遇到的法律实务问题或疑惑 Claude Code 和 Codex 神级联动! Claude code 不想订阅了, API token 选哪家? 你们 CC 都用在新项目?老项目呢? 求一个 iOS 应用,接自定义 API 看看各位的 Vibe Coding 配置 [调研] 主流编程 agent Qoder 要恢复原价了. 价格直接翻倍, 消费不起了.... 简单使用了一周在本地 Mac 的 qwen3.6-35b-a3b 模型 一线城市回县城两年,有回乡或想回乡的可以交流下 有什么龙虾、养虾 OpenClaw 论坛推荐吗 ? codex 有什么好的中转站吗 大家有没有发现下午 2~3 点开始, coding vibe 就开始变慢 VsCode 切换到 TRAE 国际版还是 Cursor? - V2EX 麻烦推荐下比较稳定的梯子,我现在两个梯子美国节点都不能用了 当我让 gemini3.1-pro 评价一下 minimax-m2.7 MiniMax 29 元的套餐访问 BASE_URL 报 404 大模型选择求助 mini-cc:打造你的专属轻量级 AI 编程智能体 别再写 Selenium 了!这个 AI Agent 一条命令搞定浏览器自动化 给用户配置专门的智能聊天机器人,只能人工调教吗 做了个 TS 多 Agent 框架拿了 5700+ stars,但发现国内几乎没人用,想了解下大家的情况 朋友闲聊: AI 的三个核心问题—工具、认知与产业的再思考 kimi 2.6 有没有用过的?和智普 5.1 比如何? - V2EX 我该订阅哪家 AI? Coding Plan 推荐 - V2EX MacOS 上搭建了本地的 Gemma4,如何与它协作最高效? - V2EX [开源] 做了个桌面虚拟陪伴助手 CodeWalkers 各位大佬,有没有遇到过 antigravity 在移动网络不能使用的问题? claude 最近泄露的源码和官方开源的 github.com/anthropics/claude-code 是啥关系? 不考虑中转,有哪些靠谱的个人方案? antigravity 的 Claude 用量是一个谜 🚀 开源发布!全栈 AI Agent 实战项目 & 保姆级教程 Coding Plan 实测额度,给有需要的人 分享一个自用的 全自动开发 多 Agent 编排脚本 求一个 agent 开发交流群 superpowers skills 使用中的问题 我写了款 iOS 输入法,帮 LLM 窥探你的隐私 CrabTalk: 8MB agent daemon 今天在 PH launch, 老板们求助力! - V2EX OpenSpec 还是 Cursor Plan 分享一个 AI 漫剧 Agent 项目: Anime AI Studio,已开源 AI 发展的终极形态是贾维斯吗?如果是的话,在国内真的可能吗? [opencode] 我只能说 bug 太多了 - V2EX 一个不会设计的人,用 ChatGPT+ UIPro-CLI + OpenClaw 做了在线一个拼图工具的反思 求助,如果 ai 钻入了一个错误方向,怎么能重新纠正它的注意力 给 ccem 补了个微信机器人入口,现在能直接用微信远程叫 Claude 干活了 写了个 Rust 版本的 Wechat Bot API 微信支持连接小龙虾了 我是怎么看待 AI 的? 现在千问 Qwen3.5-Plus 都开始饥饿营销了吗? - V2EX 开源智能体系统越来越多,还有必要自己开发吗 Antigravity 修改前端代码会自动打开浏览器检查 - V2EX 准备离职长休搞自己的小项目--求个抗造的大杯 AI 订阅建议 预测下一个词的大语言模型为什么会涌现出智能 [问大家] 同时用多个 AI 服务(ChatGPT/Claude/Kimi),你们怎么追踪费用的? 🦞小龙虾应用第二项:让它加入自己的社区进行学习和探索 抽象一下:无能的丈夫 skill 火山 codeplan 也太慢了 - V2EX 🦞小龙虾应用第一项:自动搜集并更新博客 rust 写了个非常轻量的 meta search tool 告别 brave API 关于最近火热的中转站推广,入门成本有多高 听说有 V 友的龙虾在抓 V 站热帖? 看好腾讯和小米能做出超级 AI 入口 openclaw 纯纯的割韭菜
越来越怀疑,很多 Agent 现在根本进不了企业
wadewade · 2026-05-28 · via AI Agent 智能体

最近这段时间,我一直在做 Agent Runtime 。

然后越做越发现一个问题。

现在很多 Agent Demo ,看起来真的很猛。

会规划。 会调用 Tool 。 会 MCP 。 会 Multi-Agent 。 还能自己拆任务。

但问题是。

这些东西很多时候只适合 Demo 。

一旦真的开始接企业里的系统,问题马上就开始出现。

比如:

一个长任务执行 20 分钟之后,上下文乱了怎么办?

多个 Agent 同时修改状态,memory 冲突怎么办?

AI 调错 Tool 了怎么办?

任务执行到一半挂了,怎么恢复?

企业里的权限怎么隔离?

出了问题之后,怎么审计?

这些问题其实都不是 Prompt 能解决的。

甚至很多都已经不是“大模型问题”。

而是 Runtime 问题。

我现在越来越觉得,现在很多人其实高估了 Agent 的“智能”,但低估了 Agent 真正进入生产环境的难度。

因为 AI 一旦开始真正“做事”,而不是聊天,它碰到的问题会越来越像:

  • 分布式系统
  • 状态机
  • 调度系统
  • 工作流引擎
  • 权限系统

而不是 Prompt Engineering 。

所以我最近在做的东西,核心已经不是“怎么让 Agent 更聪明”。

反而是:

怎么让 Agent 不失控。

现在我的思路有点像:

Runtime 负责管理。

Agent 负责干活。

用户请求进来之后,Runtime 先做路由,再把任务交给不同领域的“数字员工”。

每个员工只负责自己领域内的事情。

然后 Runtime 去解决:

  • 权限
  • memory
  • 调度
  • sandbox
  • 状态恢复
  • 多 Agent 协同
  • Human-in-the-loop

这些问题。

我现在甚至有一种感觉。

未来企业真正需要的,可能根本不是一个“超级 Agent”。

而是一套稳定的数字员工系统。

而真正难的部分,也不是模型。

而是 Runtime 。

leoliu168

1

leoliu168      5 月 28 日

有道理,魔鬼都在细节,需要用确定性的 runtime 来控制大模型的不确定性

cadl

2

cadl      5 月 28 日

写的好好。 感觉现在人在充当着这个 runtime 的角色。我有一个类似问题的想法,还在实现中……

thedog

3

thedog      5 月 28 日

有多少人工才有多少智能。agent 需要由 agent 工程师让他变得好用。

409164

4

409164      5 月 28 日

两个顶级模型来回修正,效果比人工好

shakaraka

6

shakaraka      5 月 28 日

多数企业要的是一个“稳定可靠的系统”+“AI 叙事”+“轻量化 AI 应用”,这样才能赶上互联网潮流,坑钱骗投资骗预算,见多了

JYii

7

JYii      5 月 28 日

问题已经从使用大模型,上升到软件工程问题了

wadewade

10

wadewade      5 月 28 日

@409164 是的,这个评估机制确实可以有。这样可以减少模型幻觉带来的盲目自信,不过还是在关键节点,通过 runtime 限制死,核心的动作必须要人工参与授权。企业落地哪怕只有 1%的概率会出现不可控都是很难接受的,不可控带来的就是损失,那产品的信用也就毁了

newaccount

11

newaccount      5 月 28 日

不是有人么?
企业上这东西的意义是让一个人可以干原来五个人的活,而不是上了之后不要人了

wadewade

12

wadewade      5 月 28 日

@thedog 对呀,就目前阶段来说,模型确实很强,但是幻觉也很严重,还是要靠人去构建系统架构才能真正的进入企业级场景

wadewade

15

wadewade      5 月 28 日

@newaccount 对的呀,肯定需要在关键的节点卡 HITL ,目前的模型能力还无法完全替代人。所以需要构建一套确定性的 Runtime 体系去控制住模型的幻觉

thedog

16

thedog      5 月 28 日

@wadewade 也没有那么复杂。少数的人就可能调教出很强的 agent 了。主要还是模型要强。

wadewade

17

wadewade      5 月 28 日

@thedog 这个需要反驳一下,哈哈哈,模型底层就注定了它没办法永远稳定,即使你把温度压到最低,它天然就是进行向量计算预测,如果完全通过模型去预测,可能真的得等到世界模型了,否则现在的模型想要稳定进入企业不太可能。还是需要软件工程去限制它的能力

thedog

20

thedog      5 月 29 日

@wadewade 不用反驳,这个我们有实践经验的,也有落地使用。模型基座强,就是可以解决很多看起来存在的问题。你自己实测就知道了。

wadewade

21

wadewade      5 月 29 日

@thedog 模型的能力提升确实会解决很多原来需要工程解决的问题,不过,要解决企业怎么敢让它去执行任务的问题,这个时候就从模型能不能做变成出了问题怎么办。所以我更关注的是 runtime 或者是 harness 这一层,而不是单纯的模型能力。

thedog

22

thedog      5 月 29 日

@wadewade 我知道你说的是什么。runtime 确实很重要。当模型能力增强的时候,能极大的减轻 agent 工程师的负担。也确实如我所说,一个好的模型 + 少数的工程师,就能够调教出很稳定的 agent 。