惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 聂微东
F
Fortinet All Blogs
H
Help Net Security
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
DataBreaches.Net
MyScale Blog
MyScale Blog
B
Blog
I
InfoQ
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
GbyAI
GbyAI
Google DeepMind News
Google DeepMind News
IT之家
IT之家
The GitHub Blog
The GitHub Blog
有赞技术团队
有赞技术团队
博客园_首页
L
LangChain Blog
V
V2EX
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
T
The Blog of Author Tim Ferriss
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - Franky

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
OpenAI o3封王,4比0横扫马斯克Grok 4!全球大模型对抗赛完美...
新智元 · 2025-08-10 · via 人人都是产品经理

决赛前,它是沉默、精准、不可一世的冠军候选;决赛后,它成了连续送子、失误连连的背景板。Grok 4经历了从神坛到谷底的戏剧性一天,它的轰然倒塌,也成就了o3的不败王者神话。

在Kaggle AI国际象棋锦标赛中,OpenAI o3以摧枯拉朽之势横扫大热门Grok 4,勇夺首届AI国际象棋表演赛冠军!

这不仅是一场代码与算法的较量,更被视为科技巨头OpenAI与xAI之间的一场「代理人战争」。

稍早的季军战中,Gemini 2.5 Pro击败o4-mini,将铜牌收入囊中。

全球顶尖的生成式AI模型,通过国际象棋,展开了一场关乎战略与推理核心能力的巅峰对决。

本次大赛由谷歌旗下平台Kaggle主办,目的是摆脱传统基准测试的束缚,在真实、复杂的游戏环境中,检验大模型的批判性思维、战略规划和临场应变能力。

参赛的AI棋手阵容堪称豪华:

  • OpenAI:o3,o4mini
  • xAI:Grok4
  • Google:Gemini2.5Pro,Flash
  • Anthropic:Claude4
  • DeepSeek:R1
  • Moonshot:KimiK2

比赛规则极具挑战性,旨在模拟更接近人类的思考方式:

禁止使用专业象棋引擎:所有决策必须源于模型自身的通用推理能力。

君子动口不动手:模型必须以完整的自然语言句子来下达指令,而非直接操作棋盘。

时间限制:每步棋有60分钟的思考时间。

防错机制:连续三次给出无法执行的错误指令,直接判负。

四分之一决赛呈现出强弱分明的态势。

OpenAI的o3、xAI的Grok 4、谷歌的Gemini Pro等顶尖模型均以4-0的悬殊比分横扫对手,轻松晋级。

半决赛中,Grok 4与谷歌Gemini Pro的对决成为了整个赛事唯一的悬念。双方你来我往,异常胶着。

最终,Grok 4在决胜局中凭借更胜一筹的推理能力,以3-2惊险胜出。

o3则以绝对优势,再次4-0轻松击败了同门师弟o4 mini。

01 万众瞩目的决赛:o3 4-0 Grok 4

直到半决赛结束,Grok 4看上去都势不可挡,冠军似乎已是其囊中之物。

Grok极少在代码中输出下棋思路,这种沉默被视为一种信号:一个精准、致命、无需向任何人解释的冷酷杀手。

这场决赛因奥特曼和马斯克两位创始人的恩怨情仇而备受瞩目。

然而,决赛日风云突变,Grok的强者光环轰然破碎。

OpenAI的o3从开局就展现出系统、稳定的策略,棋路清晰,步步为营。

最终,o3以4-0的压倒性比分干净利落地击败Grok 4,从开赛到夺冠未失一局,成就了真正的不败王者。

Grok的失误来得又早又频繁,而o3则毫不手软,招招致命。

第一局: 刚一开局,Grok 就毫无征兆地送了一个关键的象。在子力处于劣势的情况下,Grok还主动找对手兑子——这完全违背了落后不兑子的象棋常识。几个回合的低级失误后,o3轻松将杀,先下一城。

第二局: 双方进入了著名的西西里防御毒兵变例。如果说b2兵对人类棋手是毒药,那a2兵对AI来说简直是致命病毒。Grok走出了一步惊天大漏,吃掉了一个有白方骑士守护的兵。送上如此大礼,o3自然轻松笑纳胜局。

第三局: Grok 执白首次在比赛中摆出马洛奇结构,局面一度非常理想,让人以为那个强大的Grok又回来了——难道它前两局是在演戏吗?然而,一步直接送掉了自己的骑士,让所有幻想化为泡影。随后,Grok接连送掉了皇后、一个车,最终输掉了比赛。

第四局: 这是最富戏剧性的一局。开局不久,轮到o3犯下大错,白送了皇后,局面岌岌可危。但正如解说嘉宾、特级大师Hikaru Nakamura所说,棋盘上依然暗藏杀机。

o3展现了惊人的韧性,通过一个精彩的战术组合技,奇迹般地夺回了皇后。

比赛拖入残局,尽管o3仅多一个兵,本是和棋局面。但Grok再次暴露了它在残局计算上的致命弱点,o3对残局的理解显然更深,步步紧逼,最终将兵升变为皇后,完成了绝杀。

凭借这场标志性的胜利,o3成为了首届Kaggle AI象棋赛的王者,Grok 4则遗憾地与冠军失之交臂。

02 季军战:o4-mini 1.5-2.5 Gemini 2.5 Pro

谷歌自家的Gemini 2.5 Pro与o4-mini的季军争夺战,虽然不像决赛那样一边倒,但也但也远非势均力敌。

最终,Gemini 以三胜一和的战绩,稳稳地站上了领奖台。

尽管比分悬殊,但Gemini的对局堪称一团糟,棋局质量远不及冠军o3。

Gemini的表现时好时坏,第一局的进攻还算有模有样,但第三局的和棋则更像是整场比赛的缩影:双方都下得稀里糊涂,失误不断,即使手握巨大优势也迟迟无法转化为胜势,局面如过山车般起伏。

不过,瑕不掩瑜,凭借更强的综合实力,Gemini为东道主谷歌赢得了一枚宝贵的铜牌。

谷歌将如何通过这次比赛来改进其AI,令人期待.

03 赛后声音与反思

世界棋王Magnus Carlsen一针见血:「o3的棋力大约相当于国际等级分1200分,Grok 4只有800分左右。」

1200分是业余俱乐部棋手的平均水准,而800分基本是刚入门的初学者。

这与世界顶尖人类棋手超过2700分的水平相去甚远。

Carlsen认为,这次比赛让我们得以一窥AI真实的思考过程。

面对Grok 4的惨败,马斯克迅速在X上挽尊:「xAI基本没在象棋上花功夫,下棋对Grok来说只是个附加功能。」

Kaggle的雄心不止于此。

AI象棋锦标赛将作为一个持续性的评估标准,未来还将扩展到围棋、狼人杀、模拟经营等更复杂的游戏。

编辑:英智

本文由人人都是产品经理作者【新智元】,微信公众号:【新智元】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Pixabay,基于 CC0 协议。