惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

小众软件
小众软件
A
About on SuperTechFans
博客园 - Franky
Engineering at Meta
Engineering at Meta
Recent Announcements
Recent Announcements
云风的 BLOG
云风的 BLOG
B
Blog
Microsoft Security Blog
Microsoft Security Blog
L
LangChain Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
U
Unit 42
Martin Fowler
Martin Fowler
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
博客园 - 叶小钗
Vercel News
Vercel News
Apple Machine Learning Research
Apple Machine Learning Research
The Cloudflare Blog
Last Week in AI
Last Week in AI
腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
爱范儿
爱范儿
V
V2EX
G
Google Developers Blog

博客园 - bregman

codexapp不能显示数学公式问题 统计用户使用目录 intel mac 安装 最新版torch node安装 使用Codex问题 litellm 使用介绍 容器中pytorch的cpu速度很慢,原因找到了 KL 散度 podman 替代docker 【代码片段】key-value格式解析 安装 flash-attention windows通过ssh去连接Linux服务器 大模型课件 CSE 234: Data Systems for Machine Learning 大模型训练ultrascale-playbook bash脚本片段 mac 下镜像使用 使用大模型 调用本地大模型 语言模型资料 使用Python内置的 pdb 模块 debug 快手MARM 文章理解 【脚本片段】cat中防止变量替换
测评数据集和大模型报告
bregman · 2026-02-13 · via 博客园 - bregman

参考 https://www.minimax.io/news/minimax-m25


以下是四个 AI 评测基准的对比总结:

基准 领域 数据来源 样本量 任务形式 核心指标 防数据污染策略 代表意义
SWE-Bench Verified 软件工程 真实 GitHub Issue + PR(Django、scikit-learn 等) 500 个(从 2,294 个人工筛选) 给定仓库和 Issue,生成代码补丁修复问题 Resolved Rate(解决率) 人工审核去噪 AI 能否像真正的工程师一样修复真实代码
HMMT 25 数学推理 哈佛-MIT 数学竞赛 2025 年真题 每年竞赛题量级 解答高难度数学竞赛题(代数、组合、几何、数论) 正确解题率 使用最新年份题目 AI 数学推理能力的天花板测试
LiveCodeBench 编程 / 算法 LeetCode、Codeforces、AtCoder 等平台新题 持续增长 代码生成、自我修复、执行预测等 Pass@1(一次通过率) 持续收集新发布的竞赛题 AI 编程能力的"活"基准,动态防泄露
ARC-AGI-V2 抽象推理 / 通用智能 François Chollet(Keras 作者)团队设计 数百道 根据示例推断网格变换规则并应用到新输入 正确率 每题规则独特,无法靠记忆 衡量 AI 是否接近 AGI 的试金石

一句话总结

  • SWE-Bench Verified → 能不能修 Bug 🛠️
  • HMMT 25 → 能不能做奥数 🧮
  • LiveCodeBench → 能不能刷题 💻
  • ARC-AGI-V2 → 能不能举一反三 🧠