惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园_首页
Vercel News
Vercel News
Last Week in AI
Last Week in AI
罗磊的独立博客
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
IT之家
IT之家
美团技术团队
U
Unit 42
Google DeepMind News
Google DeepMind News
P
Proofpoint News Feed
J
Java Code Geeks
V
V2EX
量子位
腾讯CDC
S
SegmentFault 最新的问题
The GitHub Blog
The GitHub Blog
G
Google Developers Blog
D
DataBreaches.Net
雷峰网
雷峰网
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
博客园 - 聂微东
L
LangChain Blog
C
Check Point Blog

博客园 - bregman

codexapp不能显示数学公式问题 统计用户使用目录 intel mac 安装 最新版torch node安装 使用Codex问题 litellm 使用介绍 容器中pytorch的cpu速度很慢,原因找到了 KL 散度 podman 替代docker 【代码片段】key-value格式解析 安装 flash-attention windows通过ssh去连接Linux服务器 大模型课件 CSE 234: Data Systems for Machine Learning 大模型训练ultrascale-playbook bash脚本片段 mac 下镜像使用 使用大模型 调用本地大模型 语言模型资料 使用Python内置的 pdb 模块 debug 快手MARM 文章理解 【脚本片段】cat中防止变量替换
测评数据集和大模型报告
bregman · 2026-02-13 · via 博客园 - bregman

参考 https://www.minimax.io/news/minimax-m25


以下是四个 AI 评测基准的对比总结:

基准 领域 数据来源 样本量 任务形式 核心指标 防数据污染策略 代表意义
SWE-Bench Verified 软件工程 真实 GitHub Issue + PR(Django、scikit-learn 等) 500 个(从 2,294 个人工筛选) 给定仓库和 Issue,生成代码补丁修复问题 Resolved Rate(解决率) 人工审核去噪 AI 能否像真正的工程师一样修复真实代码
HMMT 25 数学推理 哈佛-MIT 数学竞赛 2025 年真题 每年竞赛题量级 解答高难度数学竞赛题(代数、组合、几何、数论) 正确解题率 使用最新年份题目 AI 数学推理能力的天花板测试
LiveCodeBench 编程 / 算法 LeetCode、Codeforces、AtCoder 等平台新题 持续增长 代码生成、自我修复、执行预测等 Pass@1(一次通过率) 持续收集新发布的竞赛题 AI 编程能力的"活"基准,动态防泄露
ARC-AGI-V2 抽象推理 / 通用智能 François Chollet(Keras 作者)团队设计 数百道 根据示例推断网格变换规则并应用到新输入 正确率 每题规则独特,无法靠记忆 衡量 AI 是否接近 AGI 的试金石

一句话总结

  • SWE-Bench Verified → 能不能修 Bug 🛠️
  • HMMT 25 → 能不能做奥数 🧮
  • LiveCodeBench → 能不能刷题 💻
  • ARC-AGI-V2 → 能不能举一反三 🧠