惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
Microsoft Azure Blog
Microsoft Azure Blog
F
Fortinet All Blogs
B
Blog RSS Feed
Last Week in AI
Last Week in AI
The Cloudflare Blog
大猫的无限游戏
大猫的无限游戏
人人都是产品经理
人人都是产品经理
P
Proofpoint News Feed
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Microsoft Security Blog
Microsoft Security Blog
博客园 - 三生石上(FineUI控件)
Y
Y Combinator Blog
GbyAI
GbyAI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
小众软件
小众软件
雷峰网
雷峰网
C
Check Point Blog
阮一峰的网络日志
阮一峰的网络日志
博客园 - 叶小钗
博客园 - 司徒正美
U
Unit 42
量子位

博客园 - bregman

codexapp不能显示数学公式问题 统计用户使用目录 intel mac 安装 最新版torch node安装 使用Codex问题 litellm 使用介绍 容器中pytorch的cpu速度很慢,原因找到了 KL 散度 podman 替代docker 【代码片段】key-value格式解析 安装 flash-attention windows通过ssh去连接Linux服务器 大模型课件 CSE 234: Data Systems for Machine Learning 大模型训练ultrascale-playbook bash脚本片段 mac 下镜像使用 使用大模型 调用本地大模型 语言模型资料 使用Python内置的 pdb 模块 debug 快手MARM 文章理解 【脚本片段】cat中防止变量替换
测评数据集和大模型报告
bregman · 2026-02-13 · via 博客园 - bregman

参考 https://www.minimax.io/news/minimax-m25


以下是四个 AI 评测基准的对比总结:

基准 领域 数据来源 样本量 任务形式 核心指标 防数据污染策略 代表意义
SWE-Bench Verified 软件工程 真实 GitHub Issue + PR(Django、scikit-learn 等) 500 个(从 2,294 个人工筛选) 给定仓库和 Issue,生成代码补丁修复问题 Resolved Rate(解决率) 人工审核去噪 AI 能否像真正的工程师一样修复真实代码
HMMT 25 数学推理 哈佛-MIT 数学竞赛 2025 年真题 每年竞赛题量级 解答高难度数学竞赛题(代数、组合、几何、数论) 正确解题率 使用最新年份题目 AI 数学推理能力的天花板测试
LiveCodeBench 编程 / 算法 LeetCode、Codeforces、AtCoder 等平台新题 持续增长 代码生成、自我修复、执行预测等 Pass@1(一次通过率) 持续收集新发布的竞赛题 AI 编程能力的"活"基准,动态防泄露
ARC-AGI-V2 抽象推理 / 通用智能 François Chollet(Keras 作者)团队设计 数百道 根据示例推断网格变换规则并应用到新输入 正确率 每题规则独特,无法靠记忆 衡量 AI 是否接近 AGI 的试金石

一句话总结

  • SWE-Bench Verified → 能不能修 Bug 🛠️
  • HMMT 25 → 能不能做奥数 🧮
  • LiveCodeBench → 能不能刷题 💻
  • ARC-AGI-V2 → 能不能举一反三 🧠