惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Forbes - Security
Forbes - Security
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
L
LangChain Blog
量子位
GbyAI
GbyAI
B
Blog RSS Feed
月光博客
月光博客
人人都是产品经理
人人都是产品经理
腾讯CDC
Recent Announcements
Recent Announcements
Microsoft Azure Blog
Microsoft Azure Blog
I
InfoQ
The Cloudflare Blog
D
Docker
Cyberwarzone
Cyberwarzone
U
Unit 42
NISL@THU
NISL@THU
C
Check Point Blog
B
Blog
大猫的无限游戏
大猫的无限游戏
Cisco Talos Blog
Cisco Talos Blog
Recorded Future
Recorded Future
H
Hackread – Cybersecurity News, Data Breaches, AI and More
J
Java Code Geeks
G
GRAHAM CLULEY
Engineering at Meta
Engineering at Meta
酷 壳 – CoolShell
酷 壳 – CoolShell
博客园 - 叶小钗
P
Proofpoint News Feed
F
Fortinet All Blogs
V
V2EX
T
Threat Research - Cisco Blogs
T
Threatpost
S
SegmentFault 最新的问题
Know Your Adversary
Know Your Adversary
雷峰网
雷峰网
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
博客园 - 司徒正美
P
Privacy & Cybersecurity Law Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
TaoSecurity Blog
TaoSecurity Blog
Latest news
Latest news
Apple Machine Learning Research
Apple Machine Learning Research
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Y
Y Combinator Blog
P
Privacy International News Feed
L
Lohrmann on Cybersecurity
AWS News Blog
AWS News Blog
G
Google Developers Blog
美团技术团队

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
模型之外,皆属Harness!DeepSeek终于出手:招人、组队、从零造一个中国版Claude Code
Tina · 2026-05-25 · via InfoQ - 促进软件开发领域知识与创新的传播

Claude Code 定义了当前 AI 编程工具的上限,但它不对中国开发者开放。这个缺口,就是 DeepSeek 的机会。最新组建的团队,正在补上这一层最关键的基础设施——它叫 Harness。

DeepSeek 公开招兵买马:从零开始,对标 Claude Code

5 月中下旬,DeepSeek 开始了一场横跨多个平台的招聘动作:官网、小红书、X 同步放出信息,目标是组建一支全新的 Harness 团队,从零开始构建对标 Claude Code 的代码智能体产品。

DeepSeek 官网上发布的“Agent Harness 产品经理”和“Agent Harness 研发工程师”职位,开头就写着一句很醒目的公式:Model + Harness = AgentDeepSeek 对这个团队的定义很清楚:他们正在把 DeepSeek 的前沿模型能力转化为领先的 Agent 产品,而除模型本身以外的所有工作,都属于 Harness 的范畴。

在小红书上,“陈小礼”发布的帖子也非常直白:“简单来说就是对标 Claude Code,做 DeepSeek Code Harness”。

在 X(推特)上,DeepSeek 高级研究员陈德里(Deli Chen)发布了一条更带个人色彩的招聘推文:

陈德里毕业于北京大学,于 2023 年加入 DeepSeek 担任研究员,此后他的名字多次出现在公司发布的重要研究报告中。由于创始人梁文锋很少公开露面,陈德里已成为公司对外沟通的重要代表,曾在 2024 年 NVIDIA GTC 开发者大会和 2025 年世界互联网大会乌镇峰会上发表过公开演讲。

在这条推文的评论区,陈德里还补充了一句:“简历直达部门老大”,鼓励大家私信内推。这条推文获得了超过 30 万次浏览,以及 1600 多个点赞。网友反应普遍积极,可以说是万众期待。连 Redis 之父也在头排推荐人选 Armin Ronacher(Rust 核心贡献者、常用命令行工具的知名开发者)和 Mario Zechner(游戏开发领域的技术专家)。

再回到官网 JD,会发现 DeepSeek 对这个产品的要求很高。这个团队要连接研究员、工程师、开源社区和大厂用户,把真实任务里的问题、反馈和使用数据,反过来喂给产品和模型训练。

职位要求覆盖了当前 Agent 工程涉及的多个关键技术方向。DeepSeek 还明确写到,候选人要深度使用过 Claude Code、Cowork、Codex、Cursor、OpenCode、GitHub Copilot、Manus、OpenClaw、Hermes 等类似产品,并熟悉其中的使用方法、设计思想和产品实现。这已经不是传统产品经理的画像,而是一个真正理解 coding agent、开发者工具和 Agent 工作流的人。

还有一个细节也很 DeepSeek:官网职位的加分项最后写着,“其它超乎常人的与工作相关的才能”。这句带点极客气质的表达,甚至可以理解为这个产品不仅要对标 Claude Code,更是希望它能做到“标新立异”一些。

陈德里还特地指出,DeepSeek 已经招揽了曾在 Jane Street 工作多年、“有才华且富有”的工程师 Cui Tianyi,加入这个 Harness 团队。Cui Tianyi 毕业于浙江大学,在 Jane Street 工作了近九年,从事股票和固定收益领域的软件开发与研究,后联合创办了香港量化基金 TSY Capital。

Anthropic 一边定义未来,一边把中国开发者挡在门外

最近,Anthropic 在企业 AI 采用率上,把 OpenAI 从王座上拽了下来。

过去一年,Anthropic 的客户增长接近四倍,OpenAI 却几乎原地踏步。在首次采购 AI 服务的企业里,Anthropic 面对 OpenAI 的正面竞争,已经能赢下约 70% 的订单。Ramp 的报告说,这是“一个惊人的逆转”——他们从未见过一个软件行业的新来者能在短短几个月内颠覆市场领导者地位。这也足够说明 Anthropic 已经从“模型公司”变成了企业软件工作流里的重要供应商。

去年 2 月,Claude Code 推出预览版,不到一年就跑出数十亿美元的年化收入。但更重要的是,Claude Code 不只是一个编程工具,而是 AI Agent 发展中的一个转折点。按 Claude Code 创建者 Boris Cherny 的说法,代码只是第一个跑通的场景。根据 SemiAnalysis 在 2026 年 2 月的报告,Claude Code 已经占到 GitHub 公开提交量的 4%,而且仅在一个月内日活用户就翻了一倍。

Boris Cherny 说,对他日常做的编程工作,Claude 基本已经能搞定,2026 年底就会“跨 domain 变成所有人的通用能力”。也就是说,Anthropic 先拿代码开刀,是因为代码反馈明确、工具链成熟、易验证。coding 则是第一个被打穿的工作流,下一步是把这种 agentic 工作方式扩展到更多职业和日常办公场景。

然而 Anthropic 一路高歌猛进的同时,又一直把中国开发者挡在门外。Anthropic 官方明确禁止中国大陆访问 Claude。2025 年 9 月,它又出了更狠的政策:任何由中国资本控制超过 50%的公司,不管注册地在哪,都不准用。而 CEO 达里奥·阿莫迪本人也公开主张对中国实施技术制裁。

结果是:全球最好的 AI 编程产品之一,正在重新定义下一代软件开发的工作方式,而中国开发者连正式使用的资格都没有。今年 4 月还有报道指出,尽管封禁存在,Claude 在中国仍然需求旺盛,灰色渠道正在扩大:Claude Code 越强,这个缺口就越大。

这就是 DeepSeek 做 Harness 最直接的背景:不是“我们要做一个更好的工具”,而是“我们没有别的选择”。

Harness 为什么突然成了必争之地?

同一个模型,换一套 Harness,结果可能完全不同。

以 Claude Opus 4.5 为例:放进 Claude Code 的 Harness,在 CORE-Bench Hard 上能达到 95%;换成一个朴素的 Hugging Face Smolagents 配置,成绩只剩 42%。同样的权重、同样的智能水平,单是 Harness 就拉开了 53 个百分点。

https://x.com/sayashk/status/1996334941832089732

Terminal Bench 上也能看到类似现象:头部清一色用 Claude Opus 4.6,大家拼的已经不是模型,而是谁的 Harness 更好。更极端一点,一个更小、更便宜的模型,只要配上设计良好的 Harness,也可能打败一个大模型加粗糙 Harness。

这就是 2026 年 Harness 突然站到台前的原因。AI 编程已经过了“模型会不会写代码”的阶段,现在几乎所有前沿模型都会写代码,真正拉开差距的地方,变成了模型能不能在真实代码库里稳定干活。

AI 行业的关注点一直在往模型外层移动。2022 年,大家盯着权重、微调和 RLHF;2023 年,焦点转向上下文、RAG 和长上下文;2024 年,工具调用、MCP 成了关键词;到了 2026 年,真正站到台前的,是最外层的 Harness。

截图来源:https://arxiv.org/pdf/2604.08224

几年前,语言模型处理的还是很轻的任务:给它一段评论,让它判断情绪,几十个 token,几乎瞬间返回。现在的 coding agent 面对的是另一类任务:看完整个代码库,找到 bug,写补丁,跑测试,再验证结果。一次任务可能消耗上千万 token、持续几十分钟,背后还有数百次工具调用。到了这个阶段,单个模型已经撑不起全部体验,真正决定成败的是模型外面那套系统。

Harness 负责组织代码库、项目规则、上下文摘要;控制迭代次数、重试策略和任务边界;把模型的决策转成 shell 命令、文件编辑和测试执行,再把测试失败、日志输出、浏览器截图重新喂回模型。现代 coding agent 跑的已经不是一次性问答,而是一个“思考—行动—反馈—修正”的长循环。这个循环能不能跑稳,靠的就是 Harness。

截图来源:https://arxiv.org/pdf/2604.14228

Claude Code 的内部机制,也正好说明了这一点。它的核心并不神秘,本质上就是一个 loop:调用模型,运行工具,拿到反馈,再继续调用模型。

真正的护城河在外围:权限控制、上下文压缩、MCP 工具、插件、Skills、Hooks、Subagent 调度、会话存储和安全策略。它把一个简单循环包成了可控、可扩展、可长时间运行的工程系统。

不同的产品会长出不同的 Harness。Claude Code 重安全与稳定性,OpenClaw 重开放与可实验性——没有标准答案,所以各家公司必须自己掌握这套能力。

Claude Code 的爆发,正是 Harness 的力量。它用的模型并不比对手强一大截,但 Harness 做得细——终端集成、文件读写、权限控制、代码检索、并行子 Agent,组合成一个开发者愿意天天用的环境。你扔给它一句“修这个 bug”,它不会只生成代码让你复制粘贴,而是会沿着代码库往下走:定位、修改、运行、读报错、再修正。对开发者来说,这才是 AI 编程从“玩具”变成“生产力工具”的分界线。

截图来源:https://arxiv.org/pdf/2604.14228

而且 Claude Code 改变的不只是效率,而是任务边界。Anthropic 内部调查显示,约 27% 的任务是开发者没有这个工具时原本不会尝试的。它把“太麻烦、不值得、不敢碰”的工作变成可尝试的任务,让 AI 编程的价值从“省时间”转向“扩大人能做什么”。

更关键的是,Anthropic 把这套 Harness 放出去,每一次真实使用都在收集问题、失败轨迹和用户修正,反哺模型训练,形成了飞轮效应。模型越强,Harness 越顺手;Harness 越顺手,使用越多,模型进步越快。

只做模型,远远不够:模型和 Harness 一起进化

DeepSeek 现在最需要补的,正是这一点。它已经有足够强的模型,也有很强的开发者认同,但模型本身不会自动变成 Claude Code。一个强模型如果只是接在 API 后面,它依然只是一个模型;只有进入一套成熟的 Harness,它才能开始接触真实代码库、真实终端、真实测试、真实失败路径,并在这些反馈里不断变得更能干。

Claude Code 的演进史说明,模型和 Harness 从来不是两条分开的线。

Boris Cherny 曾在 Claude Code 一周年时回顾说,一年前,Claude 连写 bash 命令、处理字符串转义都还很吃力,一次只能运行几秒钟或几分钟;一年后,几乎整个 Claude Code 都是由 Claude Code 自己写出来的,而且 Claude 已经可以稳定地连续运行几分钟、几小时,甚至几天。

仅仅一年时间,变化幅度非常大。

长运行时直接区分了“会写代码”和“能完成任务”。 短任务里,模型一次生成就够了;而真实工程任务是持续的“修改、测试、出错、再修改”循环,可能持续几十分钟甚至数小时。一个只能稳定跑几分钟的 Agent,本质上仍是代码助手;而一个能跑几小时甚至几天的 Agent,才开始像真正的工程代理。

而长时间运行的难点在于:上下文窗口有限且越跑越乱,模型规划能力弱容易半途而废,它还总高估自己的完成度——明明只做了半成品,却会说“好了”。

解决这些问题有两条路。第一条是模型本身,把能力直接烘焙进权重。根据 Anthropic 展示的图表,在最小脚手架下,一个代理能稳定完成 50%任务的运行时长,从 Opus 3.7 的大约 1 小时,提升到 Opus 4.6 的 12 小时,并且已经很难再提升了。第二条路是改 Harness,也就是模型外面的脚手架。

回顾过去一年的发布节奏,每次发布新模型,几乎都会同步更新 Harness。两者不是先后关系,而是一起共同演化。

一年前,Sonnet 3.5 第一次在 Claude.ai 的 artifacts 里展现出编码潜力——它能自己验证构建出的东西,然后继续迭代。那是 Claude Code 出现前的第一个“aha 时刻”。

2025 年 2 月,Sonnet 3.7 发布,同时 Claude Code 以研究预览版发布。Anthropic 在公告中明确写道:“我们推出 Claude Code 的目标,是更好地理解开发者如何使用 Claude 进行编码,从而为未来的模型改进提供依据。”也就是说,Claude Code 从一开始就不只是一个开发者工具,更是一个实验性入口——用来观察开发者如何使用 Claude 编码,并把这些观察反哺给模型训练。它承担的任务,远不止产品本身,而是“让模型暴露真实问题”。

同年 5 月,Opus 4 和 Sonnet 4 发布,模型在管理上下文、推进任务方面变得更好。Claude Code 正式 GA,SDK 开放(也就是驱动 Claude Code 的那套 Harness 被公开)。到了 Sonnet 4.5,模型开始具备上下文感知能力,但还不够稳定,于是 Harness 加入了 checkpoints(回退机制)来补这个缺口,运行时长被推到约 30 小时。

这时,Claude Code SDK 改名为 Agent SDK,因为 Anthropic 意识到它的用途比编码广泛得多:这些长时间运行的 harness 可以应用到其他领域了。

Haiku 4.5 和 Opus 4.5 补齐后,用 Opus 做规划、Sonnet 做执行的分工成为可能——这又是 Harness 在模型分化出不同特长后重新编排的结果。同时发布的 skills 采用渐进式披露,本质上也是为了补“上下文窗口”不够用的缺。

随后是 Opus 4.6 和 Sonnet 4.6。Sonnet 4.6 以更低价格提供 Opus 级别的智能,成为主力编码模型;Opus 4.6 则在规划上极强,被称作“非常 agentic 的模型”——在极简 Harness 下,稳定运行时长从约 4 小时跳到了 12 小时。伴随这次发布,Anthropic 推出了 agent teams(子代理之间可以直接沟通,减少主代理负担)、server-side compaction(服务端压缩,解决上下文爆满问题)以及 100 万上下文窗口。这些都是 Harness 在模型变强后重新设计的“脚手架”。

每一次模型的升级,都伴随着 Harness 的同步进化。模型变强,Harness 就利用新能力去补新缺口,或者把旧逻辑简化。Anthropic 方面的总结是:“找到模型里的缺口,用 Harness 补上,再用 Harness 的数据去训练模型——到某个时间点,那部分 Harness 可能就不再需要了,然后循环继续。”

这也是 DeepSeek 面临的真正挑战。做一个代码助手的外观并不难,把模型接进终端、给它文件读写和命令执行,也只是第一步。真正难的是建立自己的长时运行闭环:让 DeepSeek 模型在真实代码库里工作,让 Harness 记录它在哪里失败、为什么失败、用户怎么修正,再把这些失败变成下一轮产品设计、工具设计和模型训练的输入。如果 DeepSeek 只做模型,它永远会被包在别人的工具里;如果它能跑通模型和 Harness 共同演化的循环,它才有机会长出自己的 Claude Code。

结语:模型之外,皆属 Harness

DeepSeek 官网那句 Model + Harness = Agent,正在成为行业共识。控制层不再只是模型的附属品,而是一个独立的产品维度。没有 Harness,模型只是能力;有了 Harness,模型才开始变成能运行、能交付、能持续迭代的产品。

更大的变化是,Harness 本身正在变成一个新市场。Anthropic 选择把托管运行时单独计费,按会话小时收费;谷歌和微软把会话、内存、代码执行、工具调用拆成平台里的消费项;OpenAI 则把 Agents SDK 开源,不额外收第一方运行时费用,只对模型和工具调用收费。各家都承认这层很重要,分歧只在于它到底应该是什么:一个付费托管服务,一组平台原语,还是一个用来带动模型消费的免费开源层。

DeepSeek 的机会也在这里。它本来就有模型价格优势,如果再补上一套自己的 Code Harness,就不只是“用更便宜的模型对标 Claude”,而是用更低成本的模型,加上自己的 Agent 工程系统,去挑战 Claude Code 这类产品的完整体验。AI 编程下一阶段拼的不是单点模型,也不是单点工具,而是模型能力、Harness 设计、运行成本和开发者入口的组合。

参考链接:

https://arxiv.org/pdf/2604.08224

https://arxiv.org/pdf/2604.14228

https://www.youtube.com/watch?v=mR-WAvEPRwE

https://www.infoq.cn/article/Z3MKvAKFC2Hjjk643oKQ

https://www.anthropic.com/engineering/harness-design-long-running-apps