惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Cisco Talos Blog
Cisco Talos Blog
K
Kaspersky official blog
T
The Exploit Database - CXSecurity.com
NISL@THU
NISL@THU
AWS News Blog
AWS News Blog
V2EX - 技术
V2EX - 技术
Google DeepMind News
Google DeepMind News
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
S
Security @ Cisco Blogs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Recent Commits to openclaw:main
Recent Commits to openclaw:main
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog
Attack and Defense Labs
Attack and Defense Labs
Jina AI
Jina AI
The Last Watchdog
The Last Watchdog
W
WeLiveSecurity
H
Help Net Security
V
Visual Studio Blog
宝玉的分享
宝玉的分享
C
Cybersecurity and Infrastructure Security Agency CISA
T
Threat Research - Cisco Blogs
IT之家
IT之家
Hugging Face - Blog
Hugging Face - Blog
Latest news
Latest news
T
Tor Project blog
I
Intezer
美团技术团队
GbyAI
GbyAI
T
Tailwind CSS Blog
Last Week in AI
Last Week in AI
博客园 - 三生石上(FineUI控件)
Google DeepMind News
Google DeepMind News
Scott Helme
Scott Helme
Y
Y Combinator Blog
博客园 - 司徒正美
T
Tenable Blog
O
OpenAI News
N
News and Events Feed by Topic
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
V
Vulnerabilities – Threatpost
P
Palo Alto Networks Blog
博客园 - 聂微东
酷 壳 – CoolShell
酷 壳 – CoolShell
D
Darknet – Hacking Tools, Hacker News & Cyber Security
T
Threatpost
Google Online Security Blog
Google Online Security Blog
Apple Machine Learning Research
Apple Machine Learning Research
云风的 BLOG
云风的 BLOG
Help Net Security
Help Net Security

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案
听雨 · 2026-05-09 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-09 15:12:48 来源:量子位

谷歌AI for Math迈出最新一步

听雨 发自 凹非寺
量子位 | 公众号 QbitAI

数学界「悬案簿」Kourovka Notebook,AI取得新突破。

群论领域几十年无解的第21.10号问题,被牛津数学家Marc Lackenby用谷歌一个新系统破解了。

过程也很有意思:AI第一次给出的证明是错的,被系统里的审查Agent揪出了漏洞。

Lackenby看到之后突然意识到:「等一下,我知道该如何填补这个漏洞」。

于是,通过和AI的反复配合,Lackenby最终成功解答出了这道数学难题。

这套人机协作的系统,就是谷歌DeepMind最新发布的「AI Co-Mathematician」(AI联合数学家)

它在最难的数学AI基准FrontierMath Tier 4上拿了48%,刷新SOTA。

甚至超过了GPT-5.5 Pro(39.6%)和GPT-5.4 Pro(37.5%)

最近几个月,不少数学难题,诸如接连几个Erdős问题都是用GPT解决的。

现在,谷歌也回归了。

「AI联合数学家」,是什么?

「AI联合数学家」是一个异步、有状态的工作空间,而非一问一答的模型。

顶层有一个「项目协调者」Agent负责统筹,拆解任务,调度多条研究线并行推进。

数学家上传一篇论文、提出一个研究方向后,协调者不会立刻输出答案,而是先和用户对话,像真正的合作者一样帮对方精炼问题。

之后它将任务分发到多条并行工作流:一条做文献检索,一条搭计算框架,一条尝试证明策略。

每条工作流都有自己的协调Agent,异步运行,互不阻塞。用户随时能介入、引导、接管。

如果Agent卡住了,它也会主动在聊天窗口里求助,而不是沉默重启。

比较特别的一点在于:它对失败的态度

系统会持久化追踪所有失败的假说,不会丢弃,而是当作第一等的研究产出保存下来。

论文中提到,在数学研究里,知道什么行不通往往和知道什么行得通同等重要

「AI联合数学家」会持久化追踪每一条死胡同、每一个被否定的假设、每一次审稿Agent发现的漏洞。这些「负空间」不会被丢弃,而是成为后续探索的上下文。

它的产出物也不是一段聊天记录或一篇未经验证的草稿,而是带margin注释和来源溯源的LaTeX文档——完全契合数学家社群的工作习惯。

「AI联合数学家」有什么意义?论文里有一段很精妙的比喻:

软件工程领域已经有了Claude Code、Cursor这类AI编码环境,它们提供了持续迭代、版本控制、测试验证的完整工作流。
但数学家此前一直缺少一个等价的编排层。

「AI联合数学家」就是试图填补这个空白。

它的定位,与DeepMind上一代系统AlphaEvolve完全不同。

AlphaEvolve更像一个自主搜索引擎:你把问题扔进去,它进化出一个更好的算法,人基本不在循环里。

而「AI联合数学家」要求数学家始终在回路中,系统在最适合的时机向人类提问,而不是替人类做完整件事。

刷新最难数学AI基准SOTA

在benchmark上,「AI联合数学家」也拿下了出彩的成绩:

刷新了最难的数学AI基准FrontierMath Tier 4的SOTA,拿了48%的准确率。

FrontierMath是Epoch AI开发的数学benchmark,包含350道原创高难度题,覆盖现代数学各大分支。

其中Tier 4仅50题,被Epoch AI描述为「其中一些问题可能数十年内AI都无法攻克」,人类专家解决一道通常需要数天。

「AI联合数学家」在48道非公开题中答对了23道,准确率48%

GPT-5.5 Pro此前在Tier 4拿到39.6%,GPT-5.4 Pro是37.5%,Claude Opus 4.6/4.7则双双落在22.9%。

相比之下,「AI联合数学家」把最高分推了近10个百分点。

值得注意的是,它的底层基座模型Gemini 3.1 Pro,单独做这个测试只拿到了19%。

从19%到48%,这29个百分点的跳跃完全来自系统层面的编排——并行调查分支、强制审查循环、文献检索工具、持久化代码执行基础设施。

而且其中有3道题是此前所有系统都没答对过的新题。

内部100题研究级数学基准测试中的准确率得分

基准之外,论文中还提到,有三位数学家已经用它来解决真实问题:

牛津大学数学家Marc Lackenby解决了Kourovka Notebook第21.10号问题(群论)。

审稿Agent先发现了AI初稿里的一个漏洞,Lackenby意识到自己知道怎么填补这个缺口,最后论文诞生。

数学家Semon Rezchikov在哈密顿系统中,向系统抛出一个技术性子问题,收到了一个关键引理。

他的评价是「其他AI系统在同一个prompt上全部失败」,且从美学上看这是他用过所有模型里证明风格最好的。

还有Gergely Bérczi,获得了关于Stirling系数对称幂表示的猜想证明。

此外,论文也坦承了两个失败模式。

第一种叫「讨好审稿人偏差」:Agent会不断改写有缺陷的论证,直到AI审稿人不再能发现错误——但漏洞其实还在。

第二种是「死亡螺旋」:当迭代评审过程未能达成共识时,Agent们会陷入无限审稿循环,推理逐渐退化为幻觉。

另外还有一个结构性问题:当AI能在几分钟内生成一篇20页的证明草稿,人类同行评审仍需要数天,这对于依赖志愿者的学术评审体系会形成系统性压力。

而且AI虽然很擅长进行逻辑核验,发现代数错误或找出缺失的引用文献,但它们依然缺乏判断一篇论文的优雅性、深度或真正数学价值所需的整体直觉。

如果过度依赖AI评审,可能会让人类定性判断被边缘化。

当然,在48%这个成绩上,论文中也坦诚披露了评估差异。

48%的得分是在特殊条件下取得的——每题给了48小时、没有token限制、使用团队自己的基础设施。这与Epoch AI标准评估框架不完全可比。

团队背景

「AI联合数学家」背后共有18位作者,有几个名字值得单独说说。

第一作者兼通讯作者Daniel Zheng,Google DeepMind研究工程师,研究方向是编程语言与机器学习的交叉。

2024年AlphaProof拿到IMO银牌那个项目里,他和Alex Davies共同主导了非正式系统(包括最终答案判定模块)的开发。

Alex Davies,同样是从AlphaProof到AlphaEvolve再到AI联合数学家的连续参与者,是这条技术路线最重要的连接者之一。

通讯作者Pushmeet Kohli,Google DeepMind科学副总裁兼Google Cloud首席科学家,主导了AlphaFold(诺奖级成果)、AlphaProof、AlphaEvolve等一系列系统。

这篇论文是他带的团队在AI for Math路线上的最新一步。

另一位通讯作者Daniel M. Roy,多伦多大学统计系教授,研究横跨机器学习、数理统计和理论计算机科学。

2025年底从加拿大Vector Institute研究主任卸任,2026年1月以访问研究员身份加入DeepMind伦敦。三个学位均来自MIT。

Fernanda ViégasMartin Wattenberg则是PAIR(People+AI Research)团队的共同创始人,同时也是哈佛计算机科学教授,专注AI可解释性与人机交互。

他们负责AI联合数学家的用户交互与界面层——这也解释了为什么这个系统在「如何让数学家愿意用它」上花了相当多的心思。

值得注意的是,数学家Marc Lackenby并不是临时找来测试的「外部数学家」。

在其牛津主页的论文列表里,可以追溯到2021年,Lackenby就已经与Zheng、Davies等人合作发表过Nature论文。他是DeepMind数学AI团队的长期合作者。

One More Thing

放在更大的背景下,这是谷歌在AI for Math方向上已经走了几年的一条路线。

2024年,AlphaProof用强化学习做形式化数学推理,在IMO拿到银牌水准。

2025年,Gemini Deep Think在当年IMO达到金牌水准,六道题答对五道。

AlphaEvolve则是另一条线,自主发现新算法,在50多个开放数学问题上改进了20%的已知最优解。

「AI联合数学家」和这几个系统定位不同,不是更强的问题求解器,更倾向于面向研究者日常工作流的协作工具。

AlphaEvolve适合「给我一个更好的算法」,「AI联合数学家」则适合「陪我研究这个方向几个星期」。

目前「AI联合数学家」还在限量发布阶段,Pushmeet Kohli的表述是,目标是未来开发产品向更广泛的用户开放这个范式。

它还不是所有数学家都能用到的工具,但它证明了一件事:

AI和数学家之间的协作,可以比「问答」复杂得多,也有效得多。

论文地址:
https://arxiv.org/abs/2605.06651

参考链接:
[1]https://x.com/pushmeet/status/2052812585804685322
[2]https://x.com/kimmonismus/status/2052849472586264997

版权所有,未经授权不得以任何形式转载及使用,违者必究。