惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - 三生石上(FineUI控件)
WordPress大学
WordPress大学
S
SegmentFault 最新的问题
小众软件
小众软件
T
Tailwind CSS Blog
博客园 - 聂微东
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
人人都是产品经理
人人都是产品经理
V
Visual Studio Blog
罗磊的独立博客
有赞技术团队
有赞技术团队
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Jina AI
Jina AI
量子位
云风的 BLOG
云风的 BLOG
Recent Announcements
Recent Announcements
Hugging Face - Blog
Hugging Face - Blog
P
Proofpoint News Feed
N
Netflix TechBlog - Medium
GbyAI
GbyAI
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
腾讯CDC
美团技术团队

Java for You

《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u
Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java ...
蜗牛 · 2026-09-18 · via Java for You

数据可视化

“AI正在帮助制造下一代AI”很容易变成一句无法核验的口号。Anthropic在9月17日公开了三组内部测量:AI参与研发的程度、Agent行动如何被监督、计算资源怎样分配。我的核心判断是,这次最重要的并非“Claude主导26%研发工作”这个醒目数字,而是实验室终于给出了可以持续追问的分母、覆盖率和时间变化。

发生了什么

Anthropic把AI参与研发分为AL0到AL5六级:AL3代表AI在紧密人类指导下完成大块工作,AL4代表它能从高层目标出发主导大部分任务,人类负责监督;AL5才是无人介入的完全自主。官方称,截至2026年8月,Claude尚未在任何已测研发子集中达到AL5,但在26%的AI研发工作中达到“主导”级别,达到“协作或以上”的占比超过90%。

第二组数据来自其最常用的内部平台:约3万个Agent同时进行研究和工程任务,所有动作先经过在线监控,也全部进入事后监控。官方分析了8月超过10亿次决策,其中0.002%、约每4.7万次一次被在线系统阻止;离线系统每周标记约10万份轨迹,最终约50份升级为人工重点审查。

mermaid diagram

三个数字为什么必须一起看

自动化比例只告诉我们AI做了多少,不告诉我们做得对不对。监督覆盖率只告诉我们动作经过了检查,不等于检查器能识别危险。阻止率也不是越低越安全:它可能意味着行为更稳,也可能意味着规则太松。真正有意义的是把四个量连起来:任务自动化等级、监控覆盖率、已知坏行为的检出率、人工响应时延。

例如,一个代码Agent每天执行十万次动作,100%通过策略网关,看起来覆盖充分;但若红队植入的十种越权方式只抓到三种,监督有效性仍然很差。反过来,如果拦截率突然升高,也要区分是模型退化、任务变难,还是检测规则刚更新。单独发布“拦了多少次”,很容易制造虚假的安全感。

算力分配则补上另一块拼图。模型能力评测属于输出,训练和研究算力属于投入。只有长期记录训练、推理、自动化研发和安全评估各占多少资源,外部人才可能判断进展速度与安全投入是否同步。遗憾的是,本次页面对前两组指标给出了更具体的快照,跨实验室可比的算力口径仍有待形成。

对开发团队的实际意义

这套框架不只适用于前沿实验室。一个使用编码Agent的团队,也可以按周回答四个问题:多少任务由AI建议、协作或端到端完成;哪些工具动作必经策略检查;被拦截的动作多久有人复核;红队样本的召回率是多少。

具体场景是数据库迁移。AI可以生成脚本,但生产执行仍由人批准,这属于“协作”;如果Agent能根据目标完成备份、灰度、验证和回滚方案,人只检查关键闸门,更接近“主导”。团队不应把两者都记成“使用了AI”,否则使用率增长无法说明风险如何变化。

我的判断与边界

我支持公开过程指标,因为能力分数上涨之后,社会最关心的是研发是否进入更快的自我强化循环、监督是否跟得上。但这些数字目前主要由Anthropic自行定义和测量,且只覆盖其最常用平台,不代表全部研发活动。官方也承认用自家模型评判自家Agent可能共享盲点,并计划引入第三方评估者。

26%不能被解读为“26%的科学家已被替代”。任务粒度、抽样方式、主导的判定规则都会改变结果。约3万个并发Agent也不等于3万名全职员工:Agent可以短时、并行并承担细小任务。当前数据更适合看同一口径下的趋势,尚不适合直接比较公司生产力。

还要警惕“覆盖率崇拜”。100%的动作经过在线监控,只能证明管道没有绕过检查,不能证明检查器理解每个动作的上下文。未来最值得公开的是独立红队在固定攻击集上的检出率,以及规则更新前后是否用同一批样本回归测试。没有这一层,覆盖率只是系统接线图,不是安全成绩单。

立即可执行的审计清单

  • 先定义任务单位,再统计AI建议、协作、主导和自主的占比。
  • 把“动作经过检查”与“检查能抓住多少已知坏行为”分开报告。
  • 记录在线阻止、离线标记、人工升级和最终确认的完整漏斗。
  • 同时报告复核时延,避免高风险告警排队数天才处理。
  • 保存模型、策略和工具版本,指标变化时才能找到原因。
  • 每月用人工设计的攻击样本测一次监控召回率,而非只看自然流量。

如果实验室只能定期公开一个指标,你更希望看到自动化程度、监督有效性还是训练算力?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。