惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

人人都是产品经理
人人都是产品经理
Apple Machine Learning Research
Apple Machine Learning Research
云风的 BLOG
云风的 BLOG
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
量子位
GbyAI
GbyAI
腾讯CDC
T
Tailwind CSS Blog
博客园 - Franky
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
D
Docker
G
Google Developers Blog
aimingoo的专栏
aimingoo的专栏
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
Stack Overflow Blog
Stack Overflow Blog
Hugging Face - Blog
Hugging Face - Blog
小众软件
小众软件
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
N
Netflix TechBlog - Medium
Jina AI
Jina AI
IT之家
IT之家
Y
Y Combinator Blog

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了!
GPT-5.6首批实测来了!精准狙击Mythos
听雨 · 2026-06-10 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-06-10 14:45:09 来源:量子位

本月发布!

听雨 发自 凹非寺
量子位 | 公众号 QbitAI

刚刚,Anthropic放出藏了俩月的大杀器——Claude Fable 5Mythos 5,无异于扔下一枚炸弹。

现在压力直接给到OpenAI。

同一时间,GPT-5.6也泄露了。

上周开始,OpenAI已测试内部代号为keplerkindle的两个新检查点。kindle-alpha被曝已选为发布候选。

GPT-5.6的内部测试版本,开始在海外开发者和泄露圈里被疯狂实测。代号、候选版本、跑分体感,全被翻了出来。

无论是争抢IPO,还是旗舰模型撞车,两家「你递表我也递表」「你发新模型我也发新模型」。

纯纯是打得不可开交。

但问题是,GPT-5.6真的能打过Mythos吗??

GPT-5.6浮出水面

截至目前,OpenAI对GPT-5.6还是零官宣,尚未正式发布。

不过,海外不少网友已经对还没公开的「内部检查点」做了探针测试。

所谓检查点(checkpoint),就是模型在训练过程中某个时间点存下的一份参数快照。

OpenAI内部会存很多份,横向比较,再从里面挑一个认为「够好、可以拿去发」的版本,这个版本就叫发布候选版(RC)。

从上周开始,OpenAI内部正在测两个新检查点,代号分别是kindle和kepler。其中kindle-alpha被选为发布候选版。

从流出的体感来看,GPT-5.6这次最被反复提及的升级,是前端/UI生成

网友Pankaj Kumar的说法是,kindle-alpha的前端生成能力大幅提升,不需要复杂的提示词或额外技巧,就能直接产出更强的界面输出

此外,它的视觉能力也很能打,在图像理解和图像引用类任务上表现不错,整体在推理、编码、UI生成上都有明显改善。

这是网友Chris实测kindle的效果,使用medium档位:

而这是另一位网友此前在非推理版本Joule上实测的效果:

可以看出前者精美很多。

但网友Leo拿同一个prompt、在xhigh档位上分别实测了kepler和kindle两个版本。

发现kindle比起kepler,反而还退步了。

嗯…这效果确实很难评。

他甚至判断,OpenAI很可能还会继续打磨,不排除最后弃用kindle这个候选版

最新消息是,kindle已被移出Arena,出现了一个新模型Levi

有网友猜测Levi也可能是GPT-5.6内部版本的一个代号,并对比了它和GPT-5.5的前端能力:

【此处无法插入视频,遗憾……可到量子位公众号查看~】

可以看出Levi的前端也挺能打的,风格清爽简约,富有高级感,细节处理也很到位。

不过有网友调查后发现,Levi可能来自Meta,而非GPT-5.6。

那么,GPT-5.6究竟能打过Mythos吗?

网友mark_k声称,GPT-5.6「在多个agentic coding基准上击败Mythos」。

但目前来看,更有说服力的是前面展示的网友Leo的实测。他认为GPT-5.6的情况不容乐观:

kindle相比kepler是退步。以它目前的形态,会被Mythos轻松击败

6月,上演御三家「速度与激情」

6月,夏天来了,大模型圈也是火热起来了。

海外AI御三家的模型发布时间全撞在了一起:Fable 5、Gemini 3.5 Pro、GPT-5.6,上演了一出「生死时速」。

而且打的是同一批能力——推理、智能体、编码、前端生成。

有意思的是,三家虽然都把节点压在6月,但到现在真正把卷子交上来的,只有A社一家

Gemini 3.5 Pro在5月19日的谷歌I/O大会上亮相,主打200万token上下文和Deep Think推理。

但还未正式上线,官方定于6月正式可用。

GPT-5.6,消息传出是本月晚些时候发布

这也给OpenAI的处境添了一层张力:对手已经把分数贴出来了,内部可能还在为该交哪一版RC纠结。

但除了跑分,定价也是一个重要因素。

Fable 5和Mythos 5统一定价为每百万输入Token10美元、每百万输出Token50美元。

约为现有Opus的两倍。

如果GPT-5.6在能力上和Mythos打平甚至略输,但价格便宜得多,那它在真实采用率上还是有可能扳回一城的~

目前,OpenAI还未有任何官方公告,真正的对决要等GPT-5.6正式版和Fable正面跑分那一刻——

这个月内大概率见分晓,敬请期待吧~

参考链接:
[1]https://x.com/mark_k/status/2063922897341567488?s=20
[2]https://x.com/AiBattle_/status/2064078302394917157?s=20
[3]https://x.com/pankajkumar_dev/status/2063272015214354908?s=20
[4]https://x.com/synthwavedd/status/2063245096951160865?s=20
[5]https://x.com/ChrissGPT/status/2063135842906808579?s=20
[6]https://x.com/koltregaskes/status/2062806155139912164?s=20

版权所有,未经授权不得以任何形式转载及使用,违者必究。