惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
V
V2EX
博客园_首页
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Recent Announcements
Recent Announcements
博客园 - 司徒正美
Microsoft Security Blog
Microsoft Security Blog
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
Latest news
Latest news
Vercel News
Vercel News
The Register - Security
The Register - Security
T
The Exploit Database - CXSecurity.com
S
Schneier on Security
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
小众软件
小众软件
L
Lohrmann on Cybersecurity
GbyAI
GbyAI
P
Privacy & Cybersecurity Law Blog
T
Tor Project blog
AWS News Blog
AWS News Blog
美团技术团队
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
K
Kaspersky official blog
B
Blog RSS Feed
G
Google Developers Blog
量子位
大猫的无限游戏
大猫的无限游戏
Google DeepMind News
Google DeepMind News
Scott Helme
Scott Helme
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
I
Intezer
雷峰网
雷峰网
Martin Fowler
Martin Fowler
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Blog — PlanetScale
Blog — PlanetScale
IT之家
IT之家
F
Full Disclosure
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 【当耐特】
The Hacker News
The Hacker News
U
Unit 42
S
SegmentFault 最新的问题
I
InfoQ
aimingoo的专栏
aimingoo的专栏
Y
Y Combinator Blog
宝玉的分享
宝玉的分享
罗磊的独立博客
Spread Privacy
Spread Privacy
C
CERT Recently Published Vulnerability Notes

钛媒体:引领未来商业与生活新知

英特尔发布至强6+,芯片算力在“时间压缩”与“几何微缩”的交汇处-钛媒体官方网站 快撑不住的千亿粤派房企,开始抛售自家酒店了-钛媒体官方网站 公狗剧场≈性转版“崩老头+浪姐”÷2-钛媒体官方网站 宇树上会,机器人会成为半导体下一个超级终端吗?-钛媒体官方网站 玩家深恶痛绝的“广告”,却被厂商卖到了畅销榜TOP4-钛媒体官方网站 一个月内三破世界纪录,光伏龙头全面开启BC竞速赛-钛媒体官方网站 玻璃基板产业化进展到哪了?-钛媒体官方网站 为什么文案策划常被误解?-钛媒体官方网站 GPU抢了风头,西部数据说存储才是AI规模化的真正门槛-钛媒体官方网站 看懂十年两轮锂周期,就学会了投资这个赛道的一半-钛媒体官方网站 神药退潮,超4000亿美元肿瘤新战场谁能称王? 好品牌,开始竞争“互动率”-钛媒体官方网站 孙正义带领软银投资法国核电, 与施耐德这场合作能否突破欧洲算力的困局? 卷向流量的景区们,都在扎堆造“明星”-钛媒体官方网站 ASCO观察:全球首个+1“得福组合”重新定义大单品-钛媒体官方网站 从万播5元到7天充电15万+,AI漫剧开始重做“用户生意”?-钛媒体官方网站 营销失灵,电影们开始“碰运气”了-钛媒体官方网站 Edge AI Daily 早报(6月1日)-钛媒体官方网站 中国商业航天追赶的,从来不只是SpaceX-钛媒体官方网站 Anthropic 冲击 1 万亿:除了 Pre-IPO,还有哪些隐藏的「Claude 概念股」?-钛媒体官方网站 【钛晨报】提升全民人工智能素养,四部门最新部署;MiniMax Group Inc.:拟于科创板上市;国家统计局:5月份制造业采购经理指数(PMI)为50.0%-钛媒体官方网站 赢家亏本转让,输家如愿接盘?山高环能的蹊跷“便宜”不好捡-钛媒体官方网站 阿里"上货",字节"练功"-钛媒体官方网站 260亿美元,“全华班”撑起全球AI编程估值最高公司-钛媒体官方网站 加入“清华圈”,黄仁勋放不下中国-钛媒体官方网站 东方甄选布仓、辛巴开超市:中小玩家分层应战-钛媒体官方网站 “爸爸品牌”,正在集体自救-钛媒体官方网站 618暗战已开,除了低价,大家还在“卷”什么-钛媒体官方网站 监管加码补贴收紧,外卖大战落幕,但消费入口争夺战才刚刚开始-钛媒体官方网站 140万亿Token之后:中国正在修建“算力高铁”-钛媒体官方网站 暴增3100亿!存储巨头大普微,估值泡沫已现-钛媒体官方网站 一季度亏掉23亿,李想重回“苦日子”?-钛媒体官方网站 盈利没保住,小鹏品控又“翻车”-钛媒体官方网站 硅谷大裁员,韩企争红利,揭露了AI带来的“生死问题”-钛媒体官方网站 宁德时代花了30亿,为储能建了一个“风洞”-钛媒体官方网站 万科股东会只剩一个老面孔-钛媒体官方网站 小米AI的"免费获客-黑箱锁死"闭环:从100T Token到Credits陷阱-钛媒体官方网站 大模型的另一种活法,被MiniMax跑通了-钛媒体官方网站 AI写小说的套路被扒光了: Claude爱平铺,GPT总做梦,Gemini只会“他如何如何”-钛媒体官方网站 Edge AI Daily 早报(5月31日)-钛媒体官方网站 纯债基金深度掘金:2026Q1市场洞察与精选策略-钛媒体官方网站 价值判断:涨停板的投资机会和风险提示(5月29日)|证券市场观察-钛媒体官方网站 为什么价值创造,才是市值管理的核心-钛媒体官方网站 3只航空航天类股票已准备好乘上售后市场反弹的东风-钛媒体官方网站 我们看好的戴尔股票涨势惊人,我们会继续坚持持有-钛媒体官方网站 A股连续下跌,市值蒸发近40亿元,君实生物深陷合规漩涡?-钛媒体官方网站 霸王茶姬进韩国,排队188分钟,带来哪些启示? 宁德时代掏30亿建了全球第一的“储能擂台”,储能行业还有什么秘密? 小扎要和老黄“亲儿子”抢饭吃-钛媒体官方网站 Digital Quant 2026 量化交易大赛收官:真实资金、真实数据、真实竞争定义“AI 量化新标准” 中餐出海进阶:狂飙过后,该算账了-钛媒体官方网站 【数智周报】华为发表半导体韬定律,5年内冲刺等效1.4nm制程;MiniMax将A股上市;宇树科技冲刺科创板;Anthropic融资650亿美元,投后估值超OpenAI-钛媒体官方网站 “既要又要”时代,雅迪摩登解锁女性出行最优解-钛媒体官方网站 700亿融资赶紧到位吧,DeepSeek开始限制重生、修改次数了-钛媒体官方网站 铜价奔向10.5万背后: 新能源吃铜,铜也正在改变新能源的胃口 一只“死鸡”,能骗走你多少钱?-钛媒体官方网站 供应商变股东:存储芯片三巨头联手入股Anthropic,AI供应链的权力结构正在重组-钛媒体官方网站 市场不会永远低估腾讯-钛媒体官方网站 分析师观点汇总:英伟达仍是AI核心引擎;沃尔玛等五只股票受关注-钛媒体官方网站 2026上海SNEC前瞻:从“反内卷”到“反谍”,从旧范式到新生态-钛媒体官方网站 段永平,又给老家捐了1万股茅台-钛媒体官方网站 告别“邮政内循环”,中邮人寿迎来首位“外来”掌舵人-钛媒体官方网站 没有下一个泡泡玛特-钛媒体官方网站 AI 编程终于有全局视野了,3 万 Star 项目补齐最大短板-钛媒体官方网站 社区硬折扣超市狂飙的AB面-钛媒体官方网站 3小时卖爆2200万!铜师傅借“修仙”翻红,但离飞升还差几个本命法宝?-钛媒体官方网站 新茶饮“蛇吞象”,柠季洽购哈根达斯?-钛媒体官方网站 一手实测,Opus 4.8 Vs ChatGPT 5.5 Vs Kimi 2.6 ,谁最可用?-钛媒体官方网站 Anthropic估值万亿,但Claude 4.8没那么惊艳-钛媒体官方网站 Claude Opus 4.8:两个0%背后的商业逻辑-钛媒体官方网站 拿下世界杯,小红书里能不能长出另一个足球“社区”?-钛媒体官方网站 一个60亿美妆品牌决定去做药-钛媒体官方网站 全国30%的教室都需要它,江西这个“木匠窝”,何以托举教育事业的过去和未来?-钛媒体官方网站 动漫暑期档:年番保基本盘,新题材赌未来-钛媒体官方网站 新鲜零食融资百亿,零食版“蜜雪冰城”要来了?-钛媒体官方网站 从IP到AI,名创优品「十元店」的翻身仗-钛媒体官方网站 没有大厂总部,萧山凭什么抢下AI制高点?-钛媒体官方网站 《ENEMY》筹备中长剧,影视圈又从短视频「捞人」了-钛媒体官方网站 婴儿期的自变量上门保姆应该“0元购”-钛媒体官方网站 量子计算迎来“晶圆厂时刻”,谁先受益?-钛媒体官方网站 Edge AI Daily 早报(5月30日)-钛媒体官方网站 科创新源2.45亿控股东莞兆科,盈利压力凸显加码散热谋变 | 并购一线-钛媒体官方网站 China's Agricultural Robot Startup is Now Valued at over 500 Mln Yuan in Three Months After Inception-钛媒体官方网站 Hangzhou-based Dexterous Robotic Hand Startup Raises Nearly RMB 1 Billion in Six Months-钛媒体官方网站 减持与开庭赛跑,庄园牧场IPO承诺成“空头支票”,前老板携国资血亏上演罗生门-钛媒体官方网站 绿皮火车,怎么就成了3万亿的好生意?-钛媒体官方网站 尼泊尔的草,中国人的宝-钛媒体官方网站 160亿,深圳“四小龙”跑出首个IPO-钛媒体官方网站 435 万的法拉利Luce,撕掉超豪华遮羞布-钛媒体官方网站 浙江小县城“老头乐”,又要IPO了-钛媒体官方网站 Anthropic发布Claude Opus 4.8,重点是:“我不会骗你”-钛媒体官方网站 华为发布“韬(τ)定律”,重构后摩尔时代的中国技术路径-钛媒体官方网站 法拉利第一台电车,绕开了保时捷和仰望-钛媒体官方网站 被AI替代的人,和没被替代的人,差在哪?-钛媒体官方网站 疯狂的Anthropic-钛媒体官方网站 2026世界杯,为什么小红书买了,抖音没买?-钛媒体官方网站 炒币年赚80亿,以色列Biotech顿悟了-钛媒体官方网站 全球创新药最后一个万亿级未开垦市场-钛媒体官方网站 李开复背叛李开复-钛媒体官方网站 年赚27亿、复合增长62%,卖给美国人的阿麦斯凭什么逆势冲刺“中国糖果第一股”?-钛媒体官方网站
GPT-5.6来了:旗舰版碾压GPT-5.5,价格却没涨-钛媒体官方网站
字母AI2026.06.27 09:45 · 来自北京全文4097字00:00 / 11:29 · 2026-06-27 · via 钛媒体:引领未来商业与生活新知

文 | 字母AI

GPT-5.6来了,但……这是个什么型号?

这次OpenAI没有沿用过去大家熟悉的Pro、Mini、Instant这类命名,而是一次性端出了三个名字:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna。

Sol是太阳,Terra是地球,Luna是月亮。

听起来很花哨,像一个新的模型宇宙。但它其实还是我们熟悉的那套产品分层:一个最强的旗舰模型,一个日常使用的均衡模型,一个便宜、快速、适合大规模调用的轻量模型。

OpenAI官方说法是:GPT-5.6系列会在未来几周全面开放,但目前先应美国政府要求,在Codex和API中向一小群“值得信赖的合作伙伴”进行有限预览。

让我们先来了解一下已公开的情报。

 最高档和GPT 5.5同价

OpenAI这次给GPT-5.6分了三档:Sol、Terra、Luna。

按照官方说法,Sol是旗舰模型,Terra是面向日常工作的均衡模型,Luna则是快速、便宜的轻量模型。

三档模型一口气全放了出来,基本对应大模型产品里最常见的三层结构:最强模型负责能力上限,中间模型负责大多数日常任务,轻量模型负责速度、成本和高并发调用。

从价格就能看出三者的层级。

按照OpenAI公布的API价格,GPT-5.6按每100万token计费:Sol是输入5美元、输出30美元;Terra是输入2.5美元、输出15美元;Luna是输入1美元、输出6美元。

相信大家可能注意到了:GPT-5.6 Sol虽然是新一代旗舰模型,但价格对齐的是GPT-5.5标准版,而不是GPT-5.5 Pro。

Terra则直接降到GPT-5.5的一半,Luna只有GPT-5.5的五分之一。

GPT-5.5 Pro依然是当前OpenAI最贵的模型,价格是输入30美元/百万token,输出180美元/百万token,价格是GPT-5.5标准版和GPT-5.6 Sol的6倍。也不知道之后会不会再出一个“更适合专业任务”的GPT-5.6 Universe(只是开玩笑)。

Sol是这次GPT-5.6系列里的最高档,也是官方公告里花最多篇幅介绍的模型。

OpenAI把GPT-5.6 Sol称为目前最强模型,重点展示了它在写代码、生物研究和网络安全上的能力。

简单说,Sol的定位是“最会干活的模型”,它对应的不是普通聊天场景,是更复杂、更接近真实工作的任务。

比如在代码场景里,它可以围绕一个目标持续推进:先理解问题,再拆步骤,然后调用工具、运行命令、检查结果,出错了再改,直到任务完成。

为了支撑Sol处理更难的任务,OpenAI给GPT-5.6引入了两个新机制。

第一个叫max reasoning effort,可以翻译成“最大推理强度”。

通俗理解,就是让Sol有更多时间想清楚问题、花更长时间进行深度推理,适合那些不能靠第一反应解决的复杂任务。

第二个叫ultra mode,可以理解为“超强模式”。

这个模式的重点是让多个子智能体一起参与复杂任务,可以理解为:过去是一个AI助手自己干活,现在是一个“AI经理”带着几个小助手分头处理问题,从而加快复杂工作的推进。

Terminal-Bench 2.1就是一个更接近真实开发流程的测试,考的是模型能不能在命令行环境里一步步解决问题。GPT-5.6 Sol在该测试中拿到了88.8%的高分,Ultra模式下得分更高。

OpenAI特别提到,等模型更广泛开放时,还会公布一套更完整的评测结果。

Terra是中间档。

OpenAI对Terra的介绍没有那么长,但定位很清楚:它是面向日常工作的均衡模型。

也就是说,它不一定追求最强,但要在效果、速度和成本之间取得平衡。官方强调,Terra的能力接近GPT-5.5,但价格便宜一半。

在OpenAI的设想中,Terra很可能才是GPT-5.6系列里最常用的那一档。普通办公任务很多时候不需要Sol那样的最高能力,但需要稳定、便宜、好用。

在Terminal-Bench 2.1测试中,GPT-5.6 Terra拿到了84.3%,和Claude Fable 5持平。

Luna则是最低成本档。

OpenAI对Luna的定位也很简单:快,便宜,它适合大量、高频、对成本敏感的任务。

比如批量摘要、文本分类、信息抽取、简单问答等等,这些任务本身不一定复杂,但调用量可能非常大。Luna的作用,就是把这些轻量任务用更低成本跑起来。

这三档模型,Sol负责最高能力,Terra负责日常工作,Luna负责速度和成本,听起来花哨,但OpenAI只是把大模型行业已经很成熟的分层重新包装了一遍。

不过我觉得名字什么的并不重要,便宜好用就行。

性价比这一块儿

只看官方公告,GPT-5.6 Sol这次放出的benchmark并不算多。OpenAI自己也说,现在只是为了让外界提前了解模型性能,所以先分享一组评估结果。

但放出来的这组benchmark方向很明确,集中展示了三个领域:代码、生物学和网络安全。

前面提到的Terminal-Bench 2.1就属于代码方向,它考的是模型能不能在命令行环境里完成真实开发流程,包括规划、反复修改、调用工具和验证结果。

除了代码,OpenAI还重点提到了一个生物学benchmark:GeneBench v1。

GeneBench v1评估的是长周期的基因组学和定量生物学分析任务,重点看模型能不能处理更接近真实科研流程的分析问题。

按照OpenAI的说法,GPT-5.6 Sol在GeneBench v1上比GPT-5.5表现更强,而且使用的token更少。

第三个重点方向是网络安全。OpenAI称,GPT-5.6 Sol是它目前最强的网络安全模型,尤其是在长周期安全任务上(包括漏洞研究和漏洞利用相关任务)。

这里有一个benchmark叫 ExploitBench——它不是一般的安全问答,是更接近漏洞利用场景的评估。

OpenAI称,在ExploitBench上,GPT-5.6 Sol的表现可以和Mythos Preview媲美,但只用了大约三分之一的输出token。

虽然,官方给出的这张图上还有一定差距。

可以看出,OpenAI这次反复强调:他们在能力强的同时,效率也特高。

更少的输出token,意味着模型完成同类任务时可能更简洁、更少绕路,也可能意味着实际调用成本更可控。

OpenAI还提到了另一个网络安全benchmark:ExploitGym。

这个benchmark是UC Berkeley研究人员与OpenAI以及其他前沿实验室合作创建的。OpenAI说,在ExploitGym上,GPT-5.6 Sol、Terra、Luna三档模型都显示出明显的网络安全能力提升,而且随着推理强度提高,表现也会变强。

意思是,GPT-5.6的提升不只是模型本体变强,也和推理方式有关。给模型更多时间思考、让它做更长链条的推理,结果就会更好。

关于有限预览

如果说Sol、Terra、Luna是GPT-5.6表面上的变化,那么更值得关注的事情是,OpenAI这次没有直接全面开放。

按照官方公告,目前GPT-5.6只会先在Codex和API中,向一小群“值得信赖的合作伙伴”进行有限预览。

并且,这次有限预览是“应美国政府要求”进行的,参与预览的合作伙伴名单已经和美国政府共享。

最近一段时间,美国政府正在明显加强对前沿AI模型的介入,尤其是那些具备更强代码、网络安全和agent能力的模型。

今年6月,美国政府发布了新的AI网络安全相关行政令,提出要建立一个自愿框架,让前沿模型开发者在模型更广泛发布前,与政府进行接触和评估。

法律界对这份行政令的解读是:它名义上不是强制许可、也不是正式审批制度,但已经搭起了一个政府参与模型发布前评估的制度框架。

GPT-5.6 Sol“先小范围预览、名单与政府共享”的发布模式,可以看做前沿模型的发布流程里,第一次出现了清晰的政府介入痕迹。

OpenAI自己也在公告里解释,之所以采取这种方式,是为了和政府一起探索一个可重复的流程,用来支持未来的模型发布。

政府介入背后,核心原因是网络安全。

官方公告里,网络安全占了非常大的篇幅:OpenAI一边强调GPT-5.6 Sol是它目前最强的网络安全模型,能在漏洞研究、漏洞分析、安全防御等长周期任务上提供更强帮助;另一边又花了大量篇幅解释,它没有跨过自己的Cyber Critical门槛。

OpenAI的准备框架里,把高风险能力分成不同等级。达到High,意味着模型可能放大已有的严重风险;达到Critical,则意味着模型可能带来前所未有的新型严重风险。

OpenAI反复强调GPT-5.6 Sol没有达到Cyber Critical,其实是在告诉政府、客户和公众:这个模型很强,尤其在网络安全任务上很强,但还没有强到可以自主完成最危险的网络攻击链。

网络安全能力就像一把双刃剑,它越强,越能帮防御者找漏洞、写补丁、做安全测试;但也正因为它很强,政府也会担心它被滥用。

虽然OpenAI承认这次发布需要和政府一起摸索流程,但它也在官方公告里明确说明,他们不认为这种政府访问流程应该成为长期默认机制。

理由是:如果最强工具总是被拖延开放,用户、开发者、企业、网络防御者和全球合作伙伴都会更晚拿到最好的工具。

某种意义上,前沿模型正在进入一个新的发布阶段。

当大模型的能力集中到代码、生物、网络安全和智能体执行这些领域,它就会开始被当成一种可能影响现实世界安全的技术。

而一旦技术被这样看待,发布权就很难再完全留在公司自己手里。