惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
Martin Fowler
Martin Fowler
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
C
Cisco Blogs
Last Week in AI
Last Week in AI
T
The Blog of Author Tim Ferriss
The GitHub Blog
The GitHub Blog
T
Tenable Blog
A
Arctic Wolf
小众软件
小众软件
Google DeepMind News
Google DeepMind News
aimingoo的专栏
aimingoo的专栏
PCI Perspectives
PCI Perspectives
博客园 - 司徒正美
The Last Watchdog
The Last Watchdog
H
Hacker News: Front Page
Application and Cybersecurity Blog
Application and Cybersecurity Blog
Stack Overflow Blog
Stack Overflow Blog
N
News and Events Feed by Topic
Security Archives - TechRepublic
Security Archives - TechRepublic
博客园 - 【当耐特】
S
Security @ Cisco Blogs
P
Proofpoint News Feed
Cloudbric
Cloudbric
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Jina AI
Jina AI
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
月光博客
月光博客
Schneier on Security
Schneier on Security
Hacker News: Ask HN
Hacker News: Ask HN
V
Visual Studio Blog
D
DataBreaches.Net
H
Help Net Security
www.infosecurity-magazine.com
www.infosecurity-magazine.com
Project Zero
Project Zero
阮一峰的网络日志
阮一峰的网络日志
Cyberwarzone
Cyberwarzone
博客园 - Franky
Y
Y Combinator Blog
Spread Privacy
Spread Privacy
N
News and Events Feed by Topic
The Cloudflare Blog
Simon Willison's Weblog
Simon Willison's Weblog
S
SegmentFault 最新的问题
W
WeLiveSecurity
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
I
Intezer
Hugging Face - Blog
Hugging Face - Blog
Attack and Defense Labs
Attack and Defense Labs

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网 智元邓泰华宣布:具身智能行业进入「部署态」 | 雷峰网 独家丨前安克研发总监丁准离职创业,获头部美元基金押注 | 雷峰网 曝DeepSeek V4将于本周发布,梁文锋对外融资20亿;雷军在服务区被堵车里维权?小米徐洁云回应;宇树H1半马被担架抬离赛道丨雷峰早报 | 雷峰网 广州一斗虾赛现场各路选手比拼蒸馏,现场诞生近50个“技能包” | 雷峰网 智元 ×Hitch Open|深耕具身智能,共建全球物理智能学术生态 | 雷峰网 2026广汽科技日重磅发布五大核心技术,以“科技向心”引领智能出行时代 | 雷峰网 一汽大众与卓驭科技的七年协同,交出一份燃油车智能化的成绩单 | 雷峰网 腾讯的长青游戏,今天又进化了一次 | 雷峰网 智己LS8上市:24.98万起售,刘翔站台的这台「最强8系」能打吗? | 雷峰网 全球1100万台出货,追觅打造最聪明的扫地机 | 雷峰网 阶跃率先跑通“中国版 Grok 上车”量产交付!超级 Eva 搭载极氪8X 今起上市 物理AI时代,为什么需要一颗“舱驾融合”芯片? | 雷峰网 逸安启欢迎问界加入,与宝马、梅赛德斯-奔驰携手, 共同推进中国豪华超充网络的发展 | 雷峰网 逐际动力开源 FluxVLA Engine:专为具身智能打造的标准化VLA工程底座 | 雷峰网 独家丨AWS大中华区多位L8高管迎来变动,SA部门负责人代闻离职 | 雷峰网 头部品牌 “加码”东南亚 泡泡玛特新品在Lazada发售 | 雷峰网 D19起售价21.98万元,零跑能成为9系SUV的“破局者”吗? | 雷峰网 全球首款!进迭时空 RISC-V AI CPU K3 成功适配 OpenHarmony 6.1 4小时闭门会,15位运动科技创业者聊透了哪些「不能公开说」的真相 | 雷峰网 在女性黑客松上,看见AI硬件的另一种可能 | 雷峰网 Plaud 爆火后,YoooClaw 要改写 AI 硬件的剧本 黄仁勋:DeepSeek在华为芯片上发布「很可怕」;抖音集团副总裁辟谣郭达雅亿元年薪入职字节;五角大楼与通用、福特等汽车制造商讨论造军火 | 雷峰网 正式官宣!佑驾创新与荣耀(HONOR)达成合作,以“无人车+机器人”打通全链路无人化闭环 | 雷峰网 解耦性能与厚重,英特尔AI高静Plus正在重写游戏本定义 | 雷峰网 独家丨Somnia Lab 完成千万美元天使轮融资,瞄准人机关系入口与万亿级具身情感生态 | 雷峰网 腾讯发布并开源混元世界模型 2.0,一句话造出3D世界,兼容游戏引擎! | 雷峰网 阿里发布世界模型HappyOyster,与谷歌Genie3竞争 | 雷峰网 从「集体暴跌」到「双轨分化」:一篇论文误读如何撕开DDR真实行情? | 雷峰网 格力高管炮轰友商被狂怼:又当又立!「真铜实料」这四字不姓格;美国将退还超1万亿元关税;品牌GMV高速增长,速卖通将成品牌出海全新主场 | 雷峰网 全球线上首发!辉瑞新一代减重药先维盈®开启预售服务,美团买药又下一城 | 雷峰网 傲基「生死局」:绝地反杀与盈利迷途 | 雷峰网 阿里ATH发布AI开发工具Meoo,已打通阿里云核心产品 | 雷峰网 美团闪购升级闪电仓供应链服务平台:向全行业商家开放即时零售供应链基建 | 雷峰网 阿里云连续5年稳居游戏云市场份额第一! | 雷峰网 与阿里成立合资公司后,新世界旗下Gmarket商品交易额(GMV)实现双位数增长 | 雷峰网 度小满发布DXMClawPay 面向Skill开发者提供一站式支付接入方案 | 雷峰网 滴滴自动驾驶全球化布局加快,年内在阿联酋开展试点 | 雷峰网 金立创始人刘立荣消失8年后最新动向:疑在印尼卖家具;月薪3万,DeepSeek聘人去内蒙草原守机房;比亚迪坪山园区大火,公司回应火势已扑灭 | 雷峰网 水下绞杀:清洁机器人渠道里的生意与生死 | 雷峰网 墨腾报告:东南亚电商平台成交额五年翻三倍 三大平台瓜分万亿市场 | 雷峰网 火山引擎:Seedance 2.0 API 服务全面开放 | 雷峰网 中远海运特运X火山引擎:“数字员工”驶向智慧航运新蓝海 | 雷峰网 重新认识具身行业,从自变量的这封邀请函开始 | 雷峰网 做了5年3D打印机,我发现了世界模型的Scaling Law | 雷峰网 别克×火山引擎:至境E7行业首发搭载豆包大模型最新版 | 雷峰网 强强联手,追觅牵手阿里速卖通,将在海外加大投入 | 雷峰网 推理卡毛利率下滑超7%,天数智芯「降价换量」的买卖值不值? | 雷峰网 明日新程完成连续两轮融资,领跑Harness群体多智能体赛道 | 雷峰网 「作弊」内幕曝光!3DMark回应将某知名国产手机除名;李想朋友圈炮轰东风日产恶意拉踩,后者高管回应;美的空调又发行业首创产品 | 雷峰网 50万起步的蔚来ES9,能否站稳高端? | 雷峰网 汽车行业已在阿里云上使用超10万卡“真武”PPU研发智驾 | 雷峰网 百度智能云联合多家头部具身智能企业,打造具身智能数据超市 | 雷峰网 从汽车到物理 AI:何小鹏眼中的智能汽车下半场 | 雷峰网 首个跑通端到端闭环的全模态安全脱敏的龙虾盒子,无问芯穹InfiniClaw Box让本地龙虾也能放心用! | 雷峰网 当参数不再决定胜负,AI时代的企业级SSD靠什么「赢」?|MemoryS 2026 | 雷峰网 独家丨继大疆押注后,智能派再获数亿元融资,或与拓竹正面硬刚 | 雷峰网 阿里视频生成大模型Wan2.7登顶DesignArena榜单 | 雷峰网 KV Cache需求暴涨32倍,AI如何重写存储产业链的「旧分工」?| MemoryS 2026观察 | 雷峰网 微软小冰,生不逢时 | 雷峰网 豆包APP实时语音通话升级全双工模型 抗干扰与低时延能力提升 | 雷峰网 中国充电联盟与万勋科技联合发布《中国新能源汽车自动充电用户行为洞察报告》加速自动充电规模商用 | 雷峰网 继“同事.skill”走红,周鸿祎回应“把自己炼成AI分身”:这才是数字分身的正确未来 | 雷峰网 章鱼动力获得新加坡顶级风投 K3领投的数亿元投资 | 雷峰网 港中文薛天帆团队:实现 4K 全景视频生成,普通视频也能「长出空间」丨CVPR 2026 | 雷峰网 独家丨前大疆T4悍将谢博文:从具身机器人转战桌面CNC,深圳再启「无限工坊」 | 雷峰网 2026淘宝直播三大主线:提效新品,造优质主播差异化,增优质内容曝光 | 雷峰网 阿里云百炼上线Agent记忆库,让「龙虾」应用更懂用户 | 雷峰网 百度官宣!Create2026百度AI开发者大会定档5月13至14日 | 雷峰网 印度禁止中国大陆产摄像头监控:花高价大批替换,国产厂商回应;传宇树科技与阿里达成出海战略合作;DeepSeek上线专家模式 | 雷峰网 20分钟破1000万!首日破3000万!创想三维2026全球3D打印类目众筹王者!AI+生态双向助推,3D打印布道者重新定义3D打印生态! | 雷峰网
GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
2026-06-26 · via 雷峰网
GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
Coding Agent 的下一站,是动态交互系统的构建。

    作者丨GameCraft-Bench Team

过去一年,代码智能体(Coding Agent)发展迅速。从编写简单的单一脚本、修复局部 BUG,到跨文件完成长序开发任务,模型能力正在不断提升。

以“一句话生成游戏”为代表,AI 正在大幅降低游戏构建门槛。过去需要开发者熟练掌握引擎架构、手写逻辑代码的开发工作,现在可以通过自然语言快速生成原型,甚至生成可运行的游戏项目。这也让规模化由 AI 创造交互式体验变得前所未有地现实。

但问题是:这些从零自动生成的游戏,真的“能玩”吗?

如果生成的代码只是“看起来逻辑合理”,但在真实的引擎环境中根本跑不起来,或者视觉表现与玩家交互一塌糊涂,那么在这些只看静态代码的基准里刷出高分的 Agent,就很难真正胜任现实中的游戏开发场景。

香港中文大学(深圳)、深圳河套学院等高校联合腾讯的最新研究 GameCraft-Bench 正是要解决这个问题:

如何构建一个基于真实游戏引擎、产物完整可运行、且能通过真实玩家多模态交互来验证的 AI 游戏生成评测基准。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

论文链接:https://arxiv.org/abs/2606.17861

项目主页:https://tongxuluo.github.io/gamecraft-bench-website

评估代码:https://github.com/tongxuluo/gamecraft-bench

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

01

为什么不直接用现有的评测基准?

过去已经提出了一些与游戏生成相关的评估基准,那我们为什么还要重新确立一个新的评估基准 GameCraft-Bench 呢?核心原因是:现有的基准很难全面、真实地衡量端到端的可玩性。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

表. GameCraft-Bench与已有的游戏生成评估基准的对比。

1. 真实引擎的整合难度被低估。 像 OpenGame-Bench 主要针对 Web 网页游戏,缺乏对真实游戏引擎(如 Unity、Godot)生态的考察;

2. 缺乏端到端的产物完整性。 GameDevBench 确实引入了真实引擎(Godot),但它主要关注基于游戏的局部代码修改和确定性测试,而非要求大模型从零交付一个完整的交互式游戏产物;

3. 动态交互的结果很难自动验证。 评估一个游戏,不能只看代码有没有语法错误。摄像机偏移对不对?UI 有没有重叠?按下跳跃键后角色是否真的起跳了?这些游玩过程中的“行动-响应”循环,传统的静态代码测试根本无法捕捉。

所以,传统的评测环境可能适合考察基础编程能力,却不适合考察复杂的交互式系统生成。

GameCraft-Bench 要解决的,就是如何将游戏生成的评测拉回到“引擎基础”、“产物完整性”和“交互验证”这三个游戏开发最核心的维度上。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

02

GameCraft-Bench 如何把代码测试变成真实游戏评测?

GameCraft-Bench 的构建思路可以概括为一句话:先在真实引擎中约束开发规范,再把生成的项目转化为可运行、可观察、可验证的交互环境。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

图. GameCraft-Bench 完整的端到端的评估过程。

具体来说,GameCraft-Bench 选用了轻量级、节点树结构清晰、且支持原生 2D 和无头(headless)模式执行的 Godot 4 引擎作为底层环境。

系统会首先向代码智能体提供一份自然语言游戏设计文档(Game Design Document, GDD)。这份文档相当于游戏开发的“施工图”:它会描述核心机制、操控方式、胜利条件以及视觉表现要求。随后,智能体不能只提交零散的代码片段,它必须根据说明,自动编写 GDScript 脚本、配置场景树(Scene Tree)、挂载美术资产,并最终交付一个包含入口场景和输入映射的、可直接启动的完整游戏项目。

GameCraft-Bench 不再“考算法题”,而是在回答一个更重要的问题:AI 到底能不能像人类开发者一样,驾驭真实的引擎工具?

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

03

有了产物还不够,关键是过程能交互、结果能验证

构建出完整的引擎项目只是第一步。对游戏来说,产物真正有价值,是因为它能承载玩家的操作、记录系统状态,并给出实时的视觉反馈。

因此,每个由 AI 生成的 Godot 项目都会被自动编译启动。GameCraft-Bench 配备了一套基于演示回放(Replay)与多模态模型的自动评测流程:

  • Agent 需要随游戏项目一起提交演示轨迹(Demo Trace),记录一系列键盘与鼠标操作(例如:按下“向右”和“跳跃”),用于展示关键游戏功能和场景。

  • 评测系统会在全新的游戏实例中重放这些操作轨迹,自动录制游戏运行过程,并从录制视频中采样关键画面作为评测证据。

  • 多模态大模型(VLM)作为裁判,根据游戏设计要求,对回放过程中呈现出的游戏行为、视觉反馈与状态变化进行评分,判断任务是否真正完成。

这种设计避免了让评测器自行探索游戏玩法,从而将评测重点放在“Agent 是否成功构建并展示了目标游戏能力”上,而不是“评测器是否能够发现这些能力”。

对于机制验证任务,系统会检查角色是否能够按要求移动、跳跃、攻击或触发指定机制;对于表现验证任务,系统通过回放录像中的可见证据,判断血条变化、状态切换、胜负界面等要求是否得到满足。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

表. GameCraft-Bench包含的140个游戏的家族分布。

基于这套机制,GameCraft-Bench 形成了一套极其硬核的基准:覆盖 15 个主流游戏家族(从平台跳跃、塔防策略到模拟经营等),共计 140 个深度的开发任务

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

04

评估的不仅是机制骨架,还有完整的产物表现

很多自动生成的游戏原型,看起来有代码、有循环,但对玩家来说根本没法玩。

因为一个真实的游戏往往不是“按键能动”就结束了,而是要提供完整的心流体验:要有明确的关卡内容、要处理复杂的碰撞判定、要有计分板和 UI 界面,还要有胜利与失败的状态流转。

因此,GameCraft-Bench 在构建评测体系时,不会盲目只看核心逻辑,而是将评估维度精细化:

  • 核心机制(Core Mechanics): 角色移动、物理碰撞、核心动作是否符合预期?

  • 内容深度(Content Depth): 游戏是否有足够的关卡元素?敌人生成是否合理?难度曲线是否存在?

  • 反馈与可读性(Functional Visuals): 游戏在游玩过程中的可读性与即时视觉反馈是否完备(如可读的游戏状态、警告提示、任务目标以及在 1280×720 分辨率下的 UI 稳定性)?

  • 美术与呈现(Art and Presentation): 动画是否流畅播放?视觉特效(如受击特效)是否完整?UI 画面是否风格一致且美观?

这些维度并不是通用打分项,而是会结合具体游戏任务映射到对应的由人类专家标注的细粒度 Rubric 上进行评估。评测关注的不是“某个游戏像不像另一类游戏”,而是“它是否实现了自己设计文档中承诺的玩法与体验”。

为了进一步验证这套自动评测体系本身的可靠性,在基准构建完成后,团队又专门对 Judge 的稳定性与一致性进行了分析。在固定游戏项目、轨迹、视频与 Rubric 的条件下,多次评测结果波动极小;而在引入人工评测进行校准后,Judge 与人工评测对比整体一致,仅在内容丰富度与表现质量上略偏宽松。这说明该 Judge 并非随机主观判断,而是能够稳定反映游戏实际完成度。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

05

真实评测揭示的残酷真相:前沿模型在游戏生成上依旧薄弱

把评测标准拉到如此真实的维度后,前沿模型的真实表现到底怎么样?

测试结果揭开了冰冷的现实:端到端复杂交互系统的生成,远未被解决。 即使是当前最顶尖的代码智能体,在这个基准上的总分也往往难以突破及格线。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平
  • 总分普遍未达及格线,端到端交互生成远未解决。数据清晰地表明,即使是当前处于第一梯队的最顶尖智能体组合(Opus-4.7 high),其系统生成的综合总分也仅为 41.46% ;紧随其后的 GPT-5.5 high 评分为 39.49% 。绝大多数模型的总分均在 40% 以下。这直接用数据揭示了在面对复杂的端到端闭环系统构建时,现有前沿模型的技术瓶颈。

  • 核心机制与后续系统扩展表现出严重的“数据疲软”。对比各项细分指标可以发现,模型在“核心机制(Mechanics)”上的得分率是全场最高的 ,例如 Opus-4.7 high 和 GPT-5.5 high 分别能够达到 55.34% 和 54.36% 。然而,一旦涉及到系统的深度扩展与综合表现,数据便出现明显下跌 — 在“内容深度(Depth)”维度上,两者的得分分别降至 39.48% 和 38.61% ;在“艺术表现(Art)”上,更是进一步走低至 36.86% 和 32.94% 。这意味着模型仅能勉强写出基础的代码逻辑框架,却极度缺乏将系统做深、做完整的交付能力 。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

06

典型模型行为诊断:Kimi-K2.6 与 MiMo-V2.5-Pro

对开发链路中工具调用序列的量化统计表明,代码智能体的工具使用偏好直接决定了系统级任务的收敛效率 。Kimi-K2.6 的视觉反馈闭环与 MiMo-V2.5-Pro 的重度执行形成了鲜明对照 :

高效的视觉反馈闭环(Kimi-K2.6)

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

图. Kimi-K2.6 在 Strategy-Skirmish 上的视觉反馈过程。

  • 数据特征:在 140 项任务中,Kimi-K2.6 表现出极强的动态视觉自检倾向 ,平均每项任务调用“渲染屏幕检查工具”(Rendered-screen inspections)达 21.41 次(中位数 19 次) ,仅有 4 项任务完全未调用该工具 。

  • 行为模式:在 Strategy-Skirmish 实验中,它通过高频的渲染画面回读,成功将画面转化为有效的调试信号 。这使其精准定位了代码编译正常但实际运行错位的逻辑缺陷(如单位放置偏离、状态指示丢失),并逆向校正了网格系统与回合指示器布局 。这种模式实现了视觉感知引导的精准迭代,有效摆脱了一次性代码合成的随机性 。

低效的终端调试泥潭(MiMo-V2.5-Pro)

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

图. MiMo-V2.5-Pro 在 140 个任务中的工具使用情况。左图: 得分与工具调用总次数之间的关系。右图: 工具调用类型的总体构成。

  • 数据特征:MiMo-V2.5-Pro 表现为典型的“前置代码堆砌、后置重度执行”模式 。在其全部工具调用中,Shell 命令行执行(Bash)占比高达 56.3% ,而代码阅读与编辑(Read + Edit)仅占 16.5% 。统计表明,其工具调用总量与最终交付得分几近无关联(相关系数 r = +0.016) 。

  • 行为模式:MiMo 倾向于在缺少运行验证前快速生成全量文件 ,导致后续阶段陷入冗长的命令行修补路径中 。在 5 个零分任务中,MiMo 虽然顺利通过了工程编译(Valid Build) ,却由于将海量算力耗费在局部的 Bash 调试中,最终漏掉了闭环评测所必需的交互轨迹文件(Demo Traces)交付 。这用失败实验证明了单纯堆砌命令行执行量无法确保全局任务的有效收敛 。

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

07

写在最后:Coding Agent 的下一站,是动态交互系统的构建

作为通向完全自主 AI 游戏生成的第一步,GameCraft-Bench 依然有它的边界(例如目前聚焦 2D 引擎,且裁判机制尚未接入音频多模态评估)。但它指明了一个不可逆转的趋势:

Coding Agent 的竞争,正在从“模型能不能把代码写对”,走向“模型能不能交付一个真正可运行、可交互、体验连贯的软件系统”。

传统的代码评测(如 LeetCode 题目补全)最容易规模化,但与真实软件工程存在巨大鸿沟;而直接评测真实游戏产物足够硬核,却需要极高的多模态验证和引擎打通成本。

GameCraft-Bench 试图走在这条难而正确的路上:

从自然语言的 GDD 出发,约束在真实的 Godot 引擎中开发,再把最终产物转化为可运行、可输入、可多模态验证的动态环境。

所以,GameCraft-Bench 真正回答的不是“哪个模型写脚本更快”,而是:

当大模型试图接管复杂软件开发的全流程时,我们如何系统性地检验它们是否真的理解了“人机交互”的本质?

AI 编程时代,模型会越来越强。

但能让模型真正走向工业级落地、甚至有一天独立创造出 3A 大作的,可能正是这些不再妥协于静态代码、敢于直面引擎真实运行和多模态交互的残酷世界。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

GAIR Paper 107|高校联合腾讯发布 GameCraft-Bench:AI已能端到端开发游戏,Claude Opus 四成达到可玩水平

扫描上方二维码

关注雷峰网(公众号:雷峰网)学术专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知