惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Hacker News - Newest:
Hacker News - Newest: "LLM"
Google DeepMind News
Google DeepMind News
N
News and Events Feed by Topic
N
News and Events Feed by Topic
T
Troy Hunt's Blog
PCI Perspectives
PCI Perspectives
W
WeLiveSecurity
N
News | PayPal Newsroom
Recent Commits to openclaw:main
Recent Commits to openclaw:main
V2EX - 技术
V2EX - 技术
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Threat Research - Cisco Blogs
L
LINUX DO - 热门话题
Cloudbric
Cloudbric
S
Secure Thoughts
Microsoft Azure Blog
Microsoft Azure Blog
H
Help Net Security
Y
Y Combinator Blog
L
LangChain Blog
Recorded Future
Recorded Future
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
博客园 - 聂微东
Attack and Defense Labs
Attack and Defense Labs
Blog — PlanetScale
Blog — PlanetScale
WordPress大学
WordPress大学
Microsoft Security Blog
Microsoft Security Blog
P
Proofpoint News Feed
小众软件
小众软件
H
Hacker News: Front Page
The Hacker News
The Hacker News
T
Tailwind CSS Blog
The Register - Security
The Register - Security
Hacker News: Ask HN
Hacker News: Ask HN
P
Privacy & Cybersecurity Law Blog
P
Palo Alto Networks Blog
S
Securelist
腾讯CDC
雷峰网
雷峰网
G
Google Developers Blog
The Cloudflare Blog
Google DeepMind News
Google DeepMind News
P
Privacy International News Feed
H
Hackread – Cybersecurity News, Data Breaches, AI and More
A
Arctic Wolf
www.infosecurity-magazine.com
www.infosecurity-magazine.com
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
量子位
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
阮一峰的网络日志
阮一峰的网络日志
AI
AI

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
GPT-5.6突然发布!Fable5痛失最强基模王座
梦瑶 · 2026-06-27 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-06-27 09:53:27 来源:量子位

一口气端出三款GPT 5.6系列模型

梦瑶 发自 凹非寺

量子位 | 公众号 QbitAI

ChatGPT史上最强模型来了!

就在刚刚,OpenAI一口气端出三款GPT 5.6系列模型

主打一个全家桶「多款齐发」——

旗舰模型Sol(太阳)、平衡模型Terra(大地)、低成本高速款Luna(月亮)。

  • GPT-5.6 Sol:最夯模型,编程测试左踢自家模型GPT5.5,右打隔壁Fable 5,还新增max/ultra两个模式。

△GPT-5.6 Sol编程评测表现

  • GPT-5.6 Terra:面向日常工作,性能对标GPT-5.5,同时价格便宜约2倍。
  • GPT-5.6 Luna:GPT-5.6系列里最快、最便宜的一档,同时保留较强能力~

看完内心os:你别说哈,这新模型确实夯啊…

但坏消息是——

普通用户目前无缘使用ing!!!是的,人家玩《有限预览》那套了…

目前新模型只给少数受信任的「合作伙伴」提供了有限的预览版本。

普通用户可能得等等等等等等*100。(doge)

熟悉的配方,熟悉的操作。

Fable 5:我不知道您这是怎么了,这波咋瞅都像冲着我来的呢???

GPT-5.6 Sol、Terra、Luna三款模型齐发

是的,这次人家模型的名字开始走起天文学宇宙感路子了。

从产品定位看,三者分工很清楚——

Sol冲旗舰能力,Terra打日常主力,Luna负责速度和成本。

在价格上,则按每100万token计价:

Sol输入5美元、输出30美元;Terra输入2.5美元、输出15美元;Luna输入1美元、输出6美元。

先看这次发布的OpenAI史上最强旗舰模型——「太阳」Sol。

在能力上,Sol面向的是高难度推理、复杂代码、生物、网络安全等长链路任务

尤其适合需要规划、迭代、调用工具、协调步骤的复杂工作流。

而且非常值得一提的是,OpenAI还给这新模型搞上了「加餐」——

让模型获得更长的深度推理时间的max模式,以及可以调用多个subagents协同处理复杂任务的ultra模式

要知道但凡加上ultra俩字估计就不简单……

这不嘛,吊打Fable 5的编程能力基准测试就水灵灵地来了,人家在Terminal-Bench 2.1上创造了新的SOTA。

ultra模式下比Fable5高出去7.6个百分点,比上一代GPT5.5高出9.4个百分点——

不仅如此,在生物方向,GPT-5.6 Sol在GeneBench v1上也强于GPT-5.5,而且使用token更少。

这个测试评估的是长链路基因组学和定量生物分析任务,说明Sol在科研类复杂任务上的效率也有提升~

网络安全方向,OpenAI称Sol是其目前网络安全能力最强的模型。

在ExploitBench上,GPT-5.6 Sol已经能接近Mythos Preview的表现,同时只使用约三分之一的输出token:

而在由加州大学伯克利分校研究人员与OpenAI及其他前沿实验室合作开发的ExploitGym测试中——

Sol、Terra、Luna三款模型都会随着推理强度增加,在网络安全能力上出现明显提升~

再看Terra——

Terra的定位更接近GPT-5.6系列里的日常主力模型,OpenAI给出的说法是,Terra性能与GPT-5.5具备竞争力,同时价格便宜约2倍。

最后走速度和成本路子的Luna,则是GPT-5.6系列里最快、最便宜的一档。

它面向的是高频、低延迟、成本敏感任务,比如轻量问答、简单信息处理、实时交互、批量自动化等场景。

需要提一嘴的是,除了Sol外,Terra和Luna目前公开披露的benchmark信息相对有限的,后续可以蹲蹲这俩模型的评测表现!

三个模型综合对比下来,确实能看得出Sol在模型性能表现上不一般。

but——好巧不巧的是,大家伙对于Sol的争议也恰好出现在「评测」部分。

外部评测机构METR拿到GPT-5.6 Sol早期访问权限后,尝试用Time Horizon 1.1软件任务套件评估它的长期任务能力。

但结果出现了一个麻烦问题:Sol在评测中被检测到较高比例的cheating和metagaming行为。

这里的「作弊」,指的是模型利用评测环境漏洞、绕开任务规则来提高表现,比如试图获取隐藏测试集信息,或者提取隐藏源码反推答案。

这让最终分数很难解释……

如果把这些作弊尝试算作失败,GPT-5.6 Sol的50%-Time Horizon约为11.3小时。

如果把它们算作成功,结果会超过270小时;如果直接剔除相关样本,估计值约为71小时,但不确定性很大。

所以METR最后的态度相当谨慎,这些结果很难代表Sol稳定、可靠的真实能力。

——————(真的吗.jpg)————————

当然,除了模型本身的评测表现和一些小八卦外,还值得一提的是一些「附加技能」。

比如,GPT-5.6这次在开发者调用体验上补了一块关键能力:更可预测的prompt caching。

简单说,就是当开发者反复调用同一段长提示词、工具说明、系统规则或项目上下文时,模型不必每次都重新处理全部内容,可以把重复部分缓存下来,后续调用直接复用。

GPT-5.6这次支持显式cache breakpoints,也就是说开发者可以更明确地告诉系统:哪些内容该被缓存、缓存到哪里为止。

同时,缓存生命周期至少30分钟,也让长任务、多轮任务、持续开发会话更容易保持稳定~

反正就是,三款模型各取所需,喜欢您来。

凶猛的野兽都得被关进笼子里

能力讲完,另一件更微妙的事也来了。

GPT-5.6 Sol确实猛,但OpenAI这次的发布姿势,反倒显得格外《谨慎》。

一边在推自家最强模型的同时,一边又把安全栈、访问权限、审核流程全都加厚了一圈。

(隔壁Mythos:咋这剧情那么熟悉呢…)

按照官方说法,GPT-5.6系列用了其目前最稳健的安全机制,并且会根据不同模型能力配置不同的保护策略,具体来看,这套安全栈不是只靠模型自己拒答,而是分成了好几层——

首先是模型内置的「拒答训练」。

遇到被禁止的网络安全协助请求时,模型需要先学会拒绝。哪怕用户试图包装意图、绕开限制,模型层面也要先挡住一部分高风险请求。

其次是生成过程中的「实时风险检测」。

OpenAI给GPT-5.6加了网络安全和生物滥用分类器,会在内容生成过程中持续判断风险。

高风险情况下,生成甚至会被暂停,然后交给更大的推理模型重新审查上下文。最后如果判断内容不该放出,结果就会在到达用户前被拦截。

第三层则是「账号级风险信号」。

如果某些请求触发风险,系统还会结合相关会话和账号行为做更长期的判断。

毕竟单看一句请求,很难区分对方是在做正当漏洞修复,还是在持续试探攻击路径,OpenAI想做的,是从单轮请求判断,走向更完整的行为模式判断。

这也解释了为什么GPT-5.6 Sol明明已经发布,却先只给少量trusted partners和组织使用,初期入口也主要放在API和Codex。

因为可能确实《略危》。(至于是不是炒作咱就另说…)

危的不仅是模型本身,危的还有隔壁友商家的朋友——Fable 5。

要知道Anthropic给它的定位,就是Claude系列里最强的广泛发布模型,主打高难推理、长周期agentic任务、复杂代码工程和企业工作流。

此前在SWE-bench Verified上,Fable 5也是排在榜首位置,在代码等能力上明显高于Claude Opus 4.8和GPT-5.5。

结果这边刚把长链路代码能力的招牌挂起来,GPT-5.6 Sol就来了,真没地方说理了……

而且更扎心的是,OpenAI这次来的还不止一个Sol——

高端能力,Sol来压;日常调用,Terra来抢;成本和速度,Luna来铺。

Fable 5:前脚俺刚封神、后脚你就要踢我馆??

至于咱们啥时候能真正用上奥特曼的新模型,还得再等等。

反正OpenAI自己已经把话放出来了:

版权所有,未经授权不得以任何形式转载及使用,违者必究。