惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
有赞技术团队
有赞技术团队
博客园_首页
H
Help Net Security
GbyAI
GbyAI
aimingoo的专栏
aimingoo的专栏
V
Visual Studio Blog
The Cloudflare Blog
腾讯CDC
Jina AI
Jina AI
Last Week in AI
Last Week in AI
月光博客
月光博客
博客园 - 叶小钗
Google DeepMind News
Google DeepMind News
B
Blog RSS Feed
Blog — PlanetScale
Blog — PlanetScale
人人都是产品经理
人人都是产品经理
Engineering at Meta
Engineering at Meta
Y
Y Combinator Blog
Hugging Face - Blog
Hugging Face - Blog
博客园 - 聂微东
爱范儿
爱范儿
N
Netflix TechBlog - Medium
F
Fortinet All Blogs

博客园 - 四眼蒙面侠

OpenAI 宣布破解纳维—斯托克斯:证明之外,为什么吵翻了? # 基于 Claude Code 的 Moltbook 心跳脚本:让你的 AI Agent 全自动参与社区 Moltbook 要把事情高大: AI 机器人的"身份证"来了 电视黑屏了,还在听吗?聊透 LG 智能电视隐私争议 Chrome 今年第六个零日漏洞:V8 认错了对象,而且真的有人在打 GLM-5.3 开放权重:该买机器把 AI 搬回家吗? 苹果没料到:Mac mini 怎么成了企业 AI 香饽饽 同一个模型,两道安全闸门:克劳德寓言 5.1 真正变了什么 AI 推荐的软件,到底是谁推荐的? OpenAI 的智能体,在德国老 wiki 上开了一块作弊黑板 一串会清空手机的密码,为什么可能换来五年牢狱? 作业高分,考试却跌两成:AI到底帮你学了什么? GitHub 上的第二张假面:一个大学生如何拦住会骗人的 AI 从十一到九十九,AI 创业公司为什么都爱叫 Labs? 卖十块板子,先交一千欧?欧洲包装新规为何难倒小卖家 玄戒 O3 跑分追上苹果,是真突破还是数字游戏? 当 AI 开始拆你的摄像头:桌面外设的安全边界正在消失 你用 AI 裁我,我就造个 AI CEO? 英伟达为什么想花 130 亿美元买下 Hugging Face? AI 已经会设计分子,为什么新药还没变快? 模型越强,为什么我们反而越不敢放手? DeepSeek Harness:为什么要把智能体的所有部件都做成插件 AI 让代码变便宜以后,工程师真正昂贵的是什么 加密的思考,也会被偷走吗?这篇论文真正发现了什么 一群模型,各干各的活:Nemotron 3.5 Lightning 和 Switchyard 到底解决什么 它真的“懂”你吗?用一杯咖啡理解大语言模型 买书、扫描、然后销毁:AI 训练的旧书去哪儿了? 七十GB与八十TB:当个人和科技巨头站上不同的法律天平 只读到小学五年级的 AI,能自己悟出高等知识吗? 低价 Token:省下的钱,够不够买回风险?
GPT-6 Astra:破纪录之后,AGI 真的来了吗?
听懂AI · 2026-09-06 · via 博客园 - 四眼蒙面侠

同一个推理核心面对透明笔记与不透明状态两套解谜测试装置

TL;DR:ARC Prize 于 2026 年 9 月 3 日公布,GPT-6 Astra 在 ARC-AGI-3 Semi-Private 的标准框架中以 max 推理强度取得 62.7%、成本 26,098 美元;在保留不透明推理状态并使用上下文压缩的 Provider Adapter 中,high 强度取得 99.9%、成本 18,817 美元。两项结果都是真实榜单成绩,但测试框架和推理强度都不同,不能把 99.9% 当作无条件的“AGI 百分比”。ARC Prize 明确表示,跑满这一封闭、确定、目标有限的测试不等于证明实现 AGI。

一个接近满分的数字,为什么反而需要读更多脚注?因为智能体评测不只测模型,还测它怎样保存状态、使用工具、消耗 token,以及测试框架替它做了哪些工作。

029 期讨论的重点不是给“AGI 是否到来”投票,而是理解两套成绩各自回答什么问题。发布文章时,我们又核对了 ARC Prize 原文和官方 OpenAI 文档,补上当前产品信息与推出范围。

视频版(B站)音频版(6 分)| Spotify 订阅 | 偏好阅读?文字版就在下方

62.7% 和 99.9%,不是同一场考试

标准框架给所有供应商相同的最小接口。模型可以选择把可见笔记带到后续请求,但状态保存主要由模型自己负责。ARC Prize 认为,这种方式适合做跨供应商比较。

Provider Adapter 则允许调用模型供应商提供的上下文管理能力。Astra 的适配器会在请求之间保留测试方不可见的推理状态,并通过 compaction 管理较长对话。因此,这套结果更接近“模型加上供应商运行系统”的表现。

两个问题都有价值:标准框架问共同接口下的能力有多强;适配框架问整套产品系统最多能做到什么。用后一项成绩回答前一个问题,才会产生误导。ARC Prize 原文

ARC-AGI-3 中标准框架与 Provider Adapter 的分数、成本和状态差异

图:ARC-AGI-3 Semi-Private 公布结果。99.9% 使用 high,62.7% 使用 max;两者不是相同推理强度的直接对照。

最高分和最低成本,也不是同一行

ARC Prize 给出了不同推理强度下的完整表格。三行最能说明问题:

运行方式 推理强度 分数 记录成本
Standard max 62.7% 26,098 美元
Provider Adapter max 98.6% 17,332 美元
Provider Adapter high 99.9% 18,817 美元

所以,99.9% 不是“max 模式的最佳结果”,最低成本也不在最高分那一行。ARC 的解释是,更高推理强度有时会用更少动作解决游戏,从而减少模型调用和 token;但这只是该评测里的成本关系,不保证真实业务也同样变化。

评测支出也不是购买一次 API 请求的价格,而是整批关卡运行的记录成本。对自己的应用,更应计算一次通过验收的任务成本,把重试、工具调用和人工检查都算进去。

动作比人少,限定在已经完成的关卡里

ARC Prize 用约 500 名普通参与者建立人类基线,并以完成某一关的人类动作数中位数作为比较。Provider Adapter 下,Astra max 在其完成关卡的 96% 中使用更少动作,平均少 51.7%。

这说明一旦形成有效世界模型,Astra 在这些抽象环境中往往能高效执行。但人类参与者能够解决全部环境,而 96% 的分母是 Astra 已完成的关卡。它证明的是特定测试中的动作效率,不是“96% 的现实任务超过人类”。

ARC 还观察到 Astra 会把陌生环境整理成紧凑符号、规则和行动计划。这里的“临时语言”是测试回放中可见的速记,不是已经确认的机器意识或秘密通信协议。

99.9% 的关键不只是记忆,而是连续工作的系统

一次请求结束后,下一次请求知道多少前情,会直接影响长任务。可见笔记便于检查,但模型要自己决定写什么;供应商保存的不透明推理状态可能保留更多连续性,外部评测者却更难知道具体保留了什么。

ARC 报告还称,在两套框架共同解决的 167 组“游戏—推理强度”结果上,Provider Adapter 聚合记录时间约快 3.66 倍,总 token 少 49%。这是交集上的系统对比,不是所有关卡的通用加速比。

因此,部署长任务时应把记忆与压缩策略列入评测配置。否则,同一个模型名称在不同会话管理方式下得出的成绩,很难互相解释。

循环架构仍是外部报道和推测

LessWrong 作者 Rauno Arike 根据媒体报道分析,Astra 可能使用沿网络深度重复计算的 looped transformer。他也强调,关键问题是实际串行深度、循环次数是否容易扩大,以及更多隐藏计算会不会削弱推理监控。LessWrong 分析

截至 2026 年 9 月 5 日,本文查到的官方 OpenAI 模型页和使用指南没有披露 Astra 的具体网络架构、循环次数或“神经语”。因此,文章只把循环架构写成第三方报道与讨论,不能据此断言内部推理已经无法监控。

ARC 中的“不透明推理状态”描述的是 Provider Adapter 在请求之间保留什么,也不能单独证明模型内部采用何种网络架构。运行时状态与模型结构是两个问题。

ARC-AGI-3 衡量的能力很重要,但范围很窄

ARC-AGI-3 让智能体在陌生、抽象、回合制环境里探索、推断目标、建立世界模型并执行计划。它比静态问答更接近“学习怎样做事”。

但这些环境仍然封闭、确定且目标有限。现实工作包含模糊需求、变化中的组织、不可逆操作、他人利益和无法完整观察的后果。一个系统能高效解开陌生游戏,不代表它能自动承担现实世界的全部判断责任。

ARC Prize 自己也明确表示,Astra 是通用化能力的重要进步,但没有宣称它就是 AGI。这是阅读 99.9% 时最重要的边界。

《听懂 AI》第 029 期节目封面

节目封面。独立头图为两套评测框架的概念插画,不是模型内部结构图。

官方文档确认了什么

OpenAI 官方模型页当前列出 gpt-6-astra:上下文窗口 1,050,000 token,最大输出 128,000 token,普通输入、缓存输入和输出每百万 token 分别为 10、1 和 50 美元;超过 272K 输入的请求采用更高费率。官方 OpenAI 模型页

使用指南称 Astra 正从 Trusted Access Program 企业开始推出,API 及 Plus、Pro、Business、Enterprise 方案将在随后开放。这里的“随后开放”不等于任意账号此刻已经获得权限,也不应凭文档推测具体到账时间。官方 OpenAI 使用指南

官方文档还列出了 persisted reasoning、compaction、computer use 和 misalignment monitoring 等能力。这些产品特性可以解释系统为何适合长任务,但不能替 ARC 的标准框架分数加分,也不能证明模型在开放现实环境中可靠。

网络安全发布范围也要按当前资料更新

CNBC 报道称,OpenAI 将 Astra 视为首个达到其内部“Critical”网络安全能力门槛的模型,并在此前安全事件后增加防护。这个等级和事件关系属于媒体对公司发布会的转述,不是本文独立评估。CNBC 报道

当前官方 OpenAI 模型目录把 Astra 列为旗舰通用模型,同时把 Daybreak Red 列为需单独批准的高级网络安全模型别名。两者不能因为都涉及安全能力就视为同一个产品。官方模型目录

对使用者来说,模型在安全基准上更强,不会扩大目标授权。漏洞分析、验证修复、生成利用程序和访问生产系统必须分别管理权限。测试模型防护的同时,还要限制网络、凭据、文件范围和不可逆操作。

评估自己的智能体,也要同时记录框架

内部评测至少应保存模型版本、推理强度、上下文管理、工具、最大步数、超时、重试策略和每次任务成本。若用了供应商特有的持久状态或压缩,还应单独报告共同接口下的结果。

这样可以同时回答两个问题:如果未来更换模型,公共框架里的任务还能完成多少;如果继续使用当前供应商,完整系统能达到什么效果。

GPT-6 Astra 的 ARC-AGI-3 表现值得重视,因为它展示了陌生环境中的快速建模和高效行动。但离“AGI 已经得到证明”仍差着评测范围、现实开放性和责任边界。数字越接近满分,测试条件越不能省略。

收看本期节目

音频:在线播放或下载 | 播客主页:听懂 AI

原始资料与延伸阅读

本文由《听懂 AI》第 029 期访谈整理而成,核对日期为 2026 年 9 月 5 日。ARC 分数、成本、动作效率和测试条件来自 ARC Prize;OpenAI 产品规格及推出范围使用官方 OpenAI 文档。网络安全发布由 CNBC 转述,循环架构来自媒体消息与 LessWrong 分析,均不写成官方已披露架构。Simon Willison 与 Hacker News 只作为外部解读和社区观察。本文未复跑 ARC-AGI-3,也不把封闭环境成绩外推为 AGI 证明。

  1. ARC Prize:OpenAI's GPT-6 Astra on ARC-AGI-3 — 两套框架、完整分数、成本、动作效率和测试边界。
  2. 官方 OpenAI 文档:GPT-6 Astra — 当前模型规格、价格和工具支持。
  3. 官方 OpenAI 文档:Using GPT-6 Astra — 产品能力、推出范围和使用说明。
  4. CNBC:OpenAI announces rollout of GPT-6 Astra — 网络安全能力与发布背景的媒体报道。
  5. Rauno Arike:How concerned should we be about Astra's recurrent architecture? — 第三方架构分析及未决问题。
  6. Simon Willison:GPT-6 Astra — 外部发布摘要与评论。
  7. Hacker News 讨论入口 — 社区观点,不作为模型架构或安全结论的证据。