惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
宝玉的分享
宝玉的分享
Jina AI
Jina AI
IT之家
IT之家
博客园 - Franky
MyScale Blog
MyScale Blog
Y
Y Combinator Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
I
InfoQ
雷峰网
雷峰网
WordPress大学
WordPress大学
Microsoft Security Blog
Microsoft Security Blog
Google DeepMind News
Google DeepMind News
美团技术团队
S
SegmentFault 最新的问题
罗磊的独立博客
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
H
Help Net Security
D
Docker
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
阮一峰的网络日志
阮一峰的网络日志
M
MIT News - Artificial intelligence

Java for You

GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 票据抽取不一定要上最大模型:先看版式是否真的变化 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u 智能体上线最难的不是提示词:Agents API开始托管运行时 - Java for You - java4u AI任务一多就堵车:问题可能不在模型速度 - Java for You - java4u AI能写无人机控制代码后,安全边界不能只守提示词 - Java for You - java4u AI代码扫描能批量开了,但它还不能替你挡住合并 - Java for You - java4u 机器人动作误差降近九成,真正该先看数据切分 - Java for You - java4u 图片一多首字就慢?用EPD拆开多模态推理三段路 - Java for You - java4u 蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转 - Java for You - java4u
GPT‑6 Astra真正的变化:AI开始直接操作工作软件 - Java for ...
蜗牛 · 2026-09-10 · via Java for You

AI 机械手

如果你只把GPT‑6 Astra看成“回答更聪明的聊天机器人”,很可能会低估这次变化。它真正触及开发者和企业的地方,是模型开始把浏览器、表格、文档与桌面软件当作同一个工作现场。可引用的核心判断是:模型能力的竞争正在从生成一段内容,转向在权限约束下完成一段可验收的流程。

发生了什么

OpenAI在9月9日发布面向工作的Astra说明,称该模型现已用于ChatGPT Work、Codex和API。与前一周的基础模型介绍相比,这次更新把重点放在企业场景:模型可以写代码,也可以操作没有API的现有应用,并通过新的管理控制限制可访问的网站、桌面应用、上传下载和浏览历史。

这不是一个“所有人立即全量可用”的简单开关。官方页面写明,企业访问默认关闭,需要管理员启用;API模型名为gpt-6-astra,标准价格为每百万输入Token 10美元、每百万输出Token 50美元。符合条件的API客户可申请零数据保留,但这不等于所有调用天然不留数据。

关键事实与证据

根据OpenAI的一手发布页,Astra在Terminal-Bench 4.0得分57.9%,高于GPT‑5.6 Sol的37.3%;官方还报告,在内部电脑操作安全基准上,非预期结果比Sol少89%。这些数字能说明方向,却不能直接等同于你公司的成功率:其中包含内部基准、特定工具链和供应商选择的配置。

页面列出的客户案例同样应当被视为合作方自报结果,而不是普遍结论。例如CodeRabbit称其基准中多发现约20%的缺陷,OpenAI内部则称一次内存分配器调整让测试环境中的轮次延迟降低25倍、代价是峰值内存约增加30%。真正可迁移的启示不是复制这些百分比,而是同时记录质量、时延、成本和资源占用。

技术原理:从回答问题到闭环执行

普通聊天模型的链路通常在“生成答案”结束。电脑操作智能体还要经历观察界面、理解当前状态、选择动作、执行、读取反馈、修正计划等循环。任务越长,单步99%的正确率也会因连乘效应快速下降,所以系统需要检查点、可逆操作和明确的终止条件。

mermaid diagram

这也解释了为什么权限比提示词更重要。好的提示词只能表达意图,权限系统决定模型“能做什么”;验收规则决定“做到什么程度算完成”;审计记录则让失败可以追溯。

普通人和开发者会受到什么影响

对普通用户,最先被压缩的不是一个完整岗位,而是跨软件搬运信息的时间:从邮件提取需求、在CRM更新记录、把数据填进模板,再生成汇报。对开发者,接口之外多了一种集成方式——让模型操作现有界面。这能覆盖老系统,却也比稳定API更脆弱,因为按钮位置、登录状态和弹窗都会改变执行路径。

想象一个销售运营场景:AI读取获授权的会议纪要,将客户需求写入CRM,生成报价草稿,再把待确认项放进邮件。合理设计应允许前两步自动执行,报价折扣和邮件发送必须人工确认;如果模型看不到某个字段,就应停在草稿状态,而不是猜一个值补上。

我的判断及依据

我的判断是,Astra最重要的产品信号不是“又一个榜单第一”,而是企业AI的购买单位正在从Token变成“完成一次合格任务的总成本”。依据有三点:官方反复强调减少重试和调用次数;电脑操作开始覆盖无API软件;管理端同时推出应用白名单与确认策略。这三件事合起来,说明落地焦点已从模型入口转到流程工程。

适用边界与风险

官方基准不等于真实生产环境,合作方评价也不等于独立测评。界面操作会受到版本、语言、网络和账号权限影响。模型达到更高的网络安全能力后,误操作和滥用的后果也更大;官方明确承认额外安全检查可能暂停合法任务。涉及付款、删除、对外发布、隐私数据和权限变更时,不能用“模型更强”替代人工责任。

今天就能做的检查表

  • 只选一个低风险、可回滚、每周重复的跨软件流程试点。
  • 把读取、编辑、上传、发送和付款拆成不同权限,默认最小授权。
  • 为每一步写可机器检查的验收条件,不接受“看起来差不多”。
  • 对高影响动作设置人工确认,并保留输入、动作和结果日志。
  • 用你自己的20个真实任务比较完成率、人工修正时间和单任务成本。

如果只能让AI接管一个跨软件流程,你会选哪个,又会在哪一步保留人工确认?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。