惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
博客园 - 聂微东
人人都是产品经理
人人都是产品经理
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园_首页
量子位
阮一峰的网络日志
阮一峰的网络日志
酷 壳 – CoolShell
酷 壳 – CoolShell
H
Hackread – Cybersecurity News, Data Breaches, AI and More
云风的 BLOG
云风的 BLOG
D
DataBreaches.Net
B
Blog
L
LangChain Blog
Apple Machine Learning Research
Apple Machine Learning Research
Vercel News
Vercel News
博客园 - 三生石上(FineUI控件)
爱范儿
爱范儿
Microsoft Azure Blog
Microsoft Azure Blog
IT之家
IT之家
aimingoo的专栏
aimingoo的专栏
B
Blog RSS Feed
H
Help Net Security
The Cloudflare Blog
U
Unit 42

博客园 - 天戈朱

EO03|Palantir 的企业操作系统 EO02| 从 Palantir 带火 Ontology,到 GB/T 48000.3-2026:看懂企业 AI 的关键底座 05|充电运营商如何参与电力市场 04| 看懂容量电价与基本电费 03| 看懂电力市场:一度电的价格是怎样形成的 02| 看懂电力系统:物理世界如何保持平衡 01| 从“源网荷储”到“零碳园区”:看懂双碳时代的能源转型逻辑 EO01|企业 AI 应用:从数据平台、本体建模到世界运行 开源 Agent 实测:OpenClaw、Hermes Agent 与 OpenWorker 同一份 PRD,国内 Work Agent 为什么交出了不同的 MVP? Agent产品与运行框架地图 FDE崛起:AI正在重写软件研发岗位 AI PPT 收官篇:我做了一个能直接生成可编辑 PPTX 的 Skill 从文件堆积到版本可控:用 Git、GitHub 与 Gitee 管理 AI 资产 Codex 额度不足后的模型替代 AI 生成 PPT 的最后一公里:图片转可编辑 PPTX 从网页采集到 SQL Server 入库:WorkBuddy 自动化流程设计实战复盘 从“会干活”到“会成长”:从OpenClaw 到 Hermes,看懂 Agent 的进化路线 WorkBuddy 运行逻辑解读:桌面 AI Agent 如何把事真正做完 详解|从 Prompt 到 Meta-Loop:AI 工程化实践的演进历程 GB/T 27930.2 -2024 通 信 协 议解读 OCV与SOH dQ/dV曲线 锂离子电池脉冲频率优化的低温预热 EIS在线辨识方法 EIS基础知识 大厂订单架构参考 新能源汽车大数据与运行安全 新能源车新风口:9大潜力赛道 ES各版本对比及升级路径
同一份 PRD,国外 Work Agent 表现如何?
天戈朱 · 2026-08-14 · via 博客园 - 天戈朱

在上一篇《同一份 PRD,国内 Work Agent 为什么交出了不同的 MVP?》 验证基础上,本次继续围绕《城市分时电价观察站 MVP 需求文档》,对国外 Work Agent 进行同样的实践验证。

本轮选择:

  • • Claude Work;

  • • ChatGPT Work(Codex);

  • • Gemini。

其中,Claude Work 和 ChatGPT Work(Codex)均通过统一模型环境进行验证,Gemini 因模型切换配置未完成,未形成有效测试结果。

通过同一份 PRD、相同验证方式和真实 MVP 开发过程,进一步了解国外 Work Agent 在实际任务中的表现。

完整验证结果和交付页面已同步发布到 GitHub。图片
国外 Work Agent 验证总览图


01 实验环境

本轮实验保持与上一篇一致,采用相同 PRD 和验证方式。

模型:DeepSeek-v4-flash。

接入方式:

  • • 使用 CC-Switch 进行模型路由与协议转换;

  • • 通过 API 接入 DeepSeek;

  • • Token 消耗通过 DeepSeek 后台统计。后台展示为累计用量,各 Agent Token 消耗根据对应验证阶段前后累计值计算


02 Claude Work 实测结果

Claude Work 本轮基本完成了一次完整 MVP 交付,首次生成耗时约 50 分钟,人工检查发现部分业务逻辑偏差,本轮未继续要求 Agent 进行二次修改。

从 PRD 到最终页面,完成:

  • • Web 页面;

  • • CSV 数据加载;

  • • SQLite 数据结构;

  • • 数据说明文档。

图片
Claude Work 概览页面

从实际验收结果看,大部分功能符合预期,但仍存在部分业务理解偏差:

  • • 顶部菜单主要用于页面定位,并非完整查询入口;

  • • 省份过滤能力不完整;

  • • 当前主要展示夏季工业用电数据。

资源消耗:

通过 DeepSeek 后台用量统计:

  • • API 请求次数:约 81 次;

  • • Token 消耗:约 1005 万。


03 ChatGPT Work(Codex)实测结果

ChatGPT Work(Codex)首次版本约 15 分钟完成。初始交付包括:

  • • Web 页面;

  • • CSV 数据;

  • • SQLite 建库脚本;

  • • 数据导入程序;

  • • 配置文件;

  • • README 和限制说明。

但首次版本数据加载不出来,后续进行了多轮交互修复。

主要问题包括:

  • • CSV 数据加载异常;

  • • 页面脚本运行错误;

  • • 外部资源加载问题;

  • • 页面结构与脚本逻辑不一致。

经过 5 轮交互后,最终完成可运行版本。

图片
ChatGPT Work 最终页面

交付周期

首次版本:约 15 分钟。初版数据加载不出来,经过多轮问题定位和修复:

最终耗时:约 90 分钟。

资源消耗

通过 DeepSeek 后台用量统计:

  • • API 请求次数:约 145 次;

  • • Token 消耗:约 1922 万;


04 小结

图片
DeepSeek后台流量统计

通过本轮真实 MVP 开发验证,可以看到:

当前 Work Agent 已经具备完成从需求理解到应用交付的大部分能力。

但在实际任务中,最终交付效率并不只取决于首次生成速度。

本轮两个 Agent 均使用相同模型环境,但交付过程存在明显差异:

  • • Claude Work 首次交付耗时约 50 分钟,人工验收后未进入多轮交互修改流程;

  • • ChatGPT Work(Codex)首次版本约 15 分钟完成,但由于数据加载、页面运行等工程问题,经过 5 轮交互后,最终耗时约 90 分钟。

从本次验证结果看,模型提供基础能力,而 Agent 自身的任务规划、工具调用、上下文管理和验证机制,会直接影响最终交付质量。

更佳阅读效果,请移步关注我的公众号

tgzhu_公众号