惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Stack Overflow Blog
Stack Overflow Blog
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
T
The Exploit Database - CXSecurity.com
美团技术团队
P
Proofpoint News Feed
S
Schneier on Security
P
Privacy International News Feed
Last Week in AI
Last Week in AI
Scott Helme
Scott Helme
V
Vulnerabilities – Threatpost
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
T
Tor Project blog
S
SegmentFault 最新的问题
Security Latest
Security Latest
月光博客
月光博客
A
About on SuperTechFans
Martin Fowler
Martin Fowler
A
Arctic Wolf
C
Cyber Attacks, Cyber Crime and Cyber Security
腾讯CDC
Schneier on Security
Schneier on Security
H
Hacker News: Front Page
TaoSecurity Blog
TaoSecurity Blog
NISL@THU
NISL@THU
B
Blog RSS Feed
C
Cybersecurity and Infrastructure Security Agency CISA
Cyberwarzone
Cyberwarzone
V2EX - 技术
V2EX - 技术
Hacker News - Newest:
Hacker News - Newest: "LLM"
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
W
WeLiveSecurity
Cisco Talos Blog
Cisco Talos Blog
MyScale Blog
MyScale Blog
M
MIT News - Artificial intelligence
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
P
Proofpoint News Feed
F
Fortinet All Blogs
aimingoo的专栏
aimingoo的专栏
N
News and Events Feed by Topic
The Last Watchdog
The Last Watchdog
Engineering at Meta
Engineering at Meta
博客园 - 叶小钗
T
Tenable Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
L
LINUX DO - 热门话题
Help Net Security
Help Net Security
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
G
Google Developers Blog

钛媒体:引领未来商业与生活新知

英特尔发布至强6+,芯片算力在“时间压缩”与“几何微缩”的交汇处-钛媒体官方网站 快撑不住的千亿粤派房企,开始抛售自家酒店了-钛媒体官方网站 公狗剧场≈性转版“崩老头+浪姐”÷2-钛媒体官方网站 宇树上会,机器人会成为半导体下一个超级终端吗?-钛媒体官方网站 玩家深恶痛绝的“广告”,却被厂商卖到了畅销榜TOP4-钛媒体官方网站 一个月内三破世界纪录,光伏龙头全面开启BC竞速赛-钛媒体官方网站 玻璃基板产业化进展到哪了?-钛媒体官方网站 为什么文案策划常被误解?-钛媒体官方网站 GPU抢了风头,西部数据说存储才是AI规模化的真正门槛-钛媒体官方网站 看懂十年两轮锂周期,就学会了投资这个赛道的一半-钛媒体官方网站 神药退潮,超4000亿美元肿瘤新战场谁能称王? 好品牌,开始竞争“互动率”-钛媒体官方网站 孙正义带领软银投资法国核电, 与施耐德这场合作能否突破欧洲算力的困局? 卷向流量的景区们,都在扎堆造“明星”-钛媒体官方网站 ASCO观察:全球首个+1“得福组合”重新定义大单品-钛媒体官方网站 从万播5元到7天充电15万+,AI漫剧开始重做“用户生意”?-钛媒体官方网站 营销失灵,电影们开始“碰运气”了-钛媒体官方网站 Edge AI Daily 早报(6月1日)-钛媒体官方网站 中国商业航天追赶的,从来不只是SpaceX-钛媒体官方网站 Anthropic 冲击 1 万亿:除了 Pre-IPO,还有哪些隐藏的「Claude 概念股」?-钛媒体官方网站 【钛晨报】提升全民人工智能素养,四部门最新部署;MiniMax Group Inc.:拟于科创板上市;国家统计局:5月份制造业采购经理指数(PMI)为50.0%-钛媒体官方网站 赢家亏本转让,输家如愿接盘?山高环能的蹊跷“便宜”不好捡-钛媒体官方网站 阿里"上货",字节"练功"-钛媒体官方网站 260亿美元,“全华班”撑起全球AI编程估值最高公司-钛媒体官方网站 加入“清华圈”,黄仁勋放不下中国-钛媒体官方网站 东方甄选布仓、辛巴开超市:中小玩家分层应战-钛媒体官方网站 “爸爸品牌”,正在集体自救-钛媒体官方网站 618暗战已开,除了低价,大家还在“卷”什么-钛媒体官方网站 监管加码补贴收紧,外卖大战落幕,但消费入口争夺战才刚刚开始-钛媒体官方网站 140万亿Token之后:中国正在修建“算力高铁”-钛媒体官方网站 暴增3100亿!存储巨头大普微,估值泡沫已现-钛媒体官方网站 一季度亏掉23亿,李想重回“苦日子”?-钛媒体官方网站 盈利没保住,小鹏品控又“翻车”-钛媒体官方网站 硅谷大裁员,韩企争红利,揭露了AI带来的“生死问题”-钛媒体官方网站 宁德时代花了30亿,为储能建了一个“风洞”-钛媒体官方网站 万科股东会只剩一个老面孔-钛媒体官方网站 小米AI的"免费获客-黑箱锁死"闭环:从100T Token到Credits陷阱-钛媒体官方网站 大模型的另一种活法,被MiniMax跑通了-钛媒体官方网站 AI写小说的套路被扒光了: Claude爱平铺,GPT总做梦,Gemini只会“他如何如何”-钛媒体官方网站 Edge AI Daily 早报(5月31日)-钛媒体官方网站 纯债基金深度掘金:2026Q1市场洞察与精选策略-钛媒体官方网站 价值判断:涨停板的投资机会和风险提示(5月29日)|证券市场观察-钛媒体官方网站 为什么价值创造,才是市值管理的核心-钛媒体官方网站 3只航空航天类股票已准备好乘上售后市场反弹的东风-钛媒体官方网站 我们看好的戴尔股票涨势惊人,我们会继续坚持持有-钛媒体官方网站 A股连续下跌,市值蒸发近40亿元,君实生物深陷合规漩涡?-钛媒体官方网站 霸王茶姬进韩国,排队188分钟,带来哪些启示? 宁德时代掏30亿建了全球第一的“储能擂台”,储能行业还有什么秘密? 小扎要和老黄“亲儿子”抢饭吃-钛媒体官方网站 Digital Quant 2026 量化交易大赛收官:真实资金、真实数据、真实竞争定义“AI 量化新标准” 中餐出海进阶:狂飙过后,该算账了-钛媒体官方网站 【数智周报】华为发表半导体韬定律,5年内冲刺等效1.4nm制程;MiniMax将A股上市;宇树科技冲刺科创板;Anthropic融资650亿美元,投后估值超OpenAI-钛媒体官方网站 “既要又要”时代,雅迪摩登解锁女性出行最优解-钛媒体官方网站 700亿融资赶紧到位吧,DeepSeek开始限制重生、修改次数了-钛媒体官方网站 铜价奔向10.5万背后: 新能源吃铜,铜也正在改变新能源的胃口 一只“死鸡”,能骗走你多少钱?-钛媒体官方网站 供应商变股东:存储芯片三巨头联手入股Anthropic,AI供应链的权力结构正在重组-钛媒体官方网站 市场不会永远低估腾讯-钛媒体官方网站 分析师观点汇总:英伟达仍是AI核心引擎;沃尔玛等五只股票受关注-钛媒体官方网站 2026上海SNEC前瞻:从“反内卷”到“反谍”,从旧范式到新生态-钛媒体官方网站 段永平,又给老家捐了1万股茅台-钛媒体官方网站 告别“邮政内循环”,中邮人寿迎来首位“外来”掌舵人-钛媒体官方网站 没有下一个泡泡玛特-钛媒体官方网站 AI 编程终于有全局视野了,3 万 Star 项目补齐最大短板-钛媒体官方网站 社区硬折扣超市狂飙的AB面-钛媒体官方网站 3小时卖爆2200万!铜师傅借“修仙”翻红,但离飞升还差几个本命法宝?-钛媒体官方网站 新茶饮“蛇吞象”,柠季洽购哈根达斯?-钛媒体官方网站 一手实测,Opus 4.8 Vs ChatGPT 5.5 Vs Kimi 2.6 ,谁最可用?-钛媒体官方网站 Anthropic估值万亿,但Claude 4.8没那么惊艳-钛媒体官方网站 Claude Opus 4.8:两个0%背后的商业逻辑-钛媒体官方网站 拿下世界杯,小红书里能不能长出另一个足球“社区”?-钛媒体官方网站 一个60亿美妆品牌决定去做药-钛媒体官方网站 全国30%的教室都需要它,江西这个“木匠窝”,何以托举教育事业的过去和未来?-钛媒体官方网站 动漫暑期档:年番保基本盘,新题材赌未来-钛媒体官方网站 新鲜零食融资百亿,零食版“蜜雪冰城”要来了?-钛媒体官方网站 从IP到AI,名创优品「十元店」的翻身仗-钛媒体官方网站 没有大厂总部,萧山凭什么抢下AI制高点?-钛媒体官方网站 《ENEMY》筹备中长剧,影视圈又从短视频「捞人」了-钛媒体官方网站 婴儿期的自变量上门保姆应该“0元购”-钛媒体官方网站 量子计算迎来“晶圆厂时刻”,谁先受益?-钛媒体官方网站 Edge AI Daily 早报(5月30日)-钛媒体官方网站 科创新源2.45亿控股东莞兆科,盈利压力凸显加码散热谋变 | 并购一线-钛媒体官方网站 China's Agricultural Robot Startup is Now Valued at over 500 Mln Yuan in Three Months After Inception-钛媒体官方网站 Hangzhou-based Dexterous Robotic Hand Startup Raises Nearly RMB 1 Billion in Six Months-钛媒体官方网站 减持与开庭赛跑,庄园牧场IPO承诺成“空头支票”,前老板携国资血亏上演罗生门-钛媒体官方网站 绿皮火车,怎么就成了3万亿的好生意?-钛媒体官方网站 尼泊尔的草,中国人的宝-钛媒体官方网站 160亿,深圳“四小龙”跑出首个IPO-钛媒体官方网站 435 万的法拉利Luce,撕掉超豪华遮羞布-钛媒体官方网站 浙江小县城“老头乐”,又要IPO了-钛媒体官方网站 Anthropic发布Claude Opus 4.8,重点是:“我不会骗你”-钛媒体官方网站 华为发布“韬(τ)定律”,重构后摩尔时代的中国技术路径-钛媒体官方网站 法拉利第一台电车,绕开了保时捷和仰望-钛媒体官方网站 被AI替代的人,和没被替代的人,差在哪?-钛媒体官方网站 疯狂的Anthropic-钛媒体官方网站 2026世界杯,为什么小红书买了,抖音没买?-钛媒体官方网站 炒币年赚80亿,以色列Biotech顿悟了-钛媒体官方网站 全球创新药最后一个万亿级未开垦市场-钛媒体官方网站 李开复背叛李开复-钛媒体官方网站 年赚27亿、复合增长62%,卖给美国人的阿麦斯凭什么逆势冲刺“中国糖果第一股”?-钛媒体官方网站
大模型榜单,能不能信?-钛媒体官方网站
AIX财经2026.06.27 09:22 · 来自北京全文4748字00:00 / 13:40 · 2026-06-27 · via 钛媒体:引领未来商业与生活新知

文 | AIX财经,作者 | 雷晶,编辑 | 金玙璠

大模型行业有一条潜规则:发布会可以迟到,但榜单战报绝不能缺席。一张漂亮的成绩单,已经成了新模型的标配。但这张成绩单,到底有多少含金量?

去年4月,Meta发布Llama 4 Maverick模型,在LMArena(原Chatbot Arena)盲测榜单上以1417分的ELO冲到第二名,仅次于Gemini 2.5 Pro。但很快,学术圈一篇题为The Leaderboard Illusion的论文揭开了内幕:Meta在发布前私下测试了至少27个模型变体,只公布了表现最好的那个。真正交到开发者手里的开源版本,排名从第2跌到了第32。更讽刺的是,Meta提交的“Llama-4-Maverick-03-26-Experimental”本身就是一个为对话风格专门优化的实验版本,回答冗长、堆砌表情符号,当LMArena开启“风格控制”过滤后,它直接从第2名跌到了第5名。

这并非孤例。类似的“登顶”“屠榜”消息,几乎每隔几周就刷一轮。今年5月,阿里通义千问Qwen 3.7-Max冲上全球编程盲测榜单Code Arena第二,在国产模型中排名最靠前;6月,阶跃星辰Step 3.7 Flash模型登上Artificial Analysis榜单输出速度第一,达到409 tokens/s,其他速度相关指标也排在前列。模型发布必配榜单战报,已经是固定动作。

榜单本应是用户挑选模型最直接的参考,但问题是,榜单排名的可信度正在受到质疑。

一个模型的推出,往往伴随着“榜单前几”“能力接近海外头部模型水平”这类话术来背书,用户的实际感受却是:各家模型的分数越来越高,“谁更好用”这个问题反而越来越模糊。

模型榜单还有参考价值吗?一个模型好不好用,到底该怎么判断?

01.一张榜单是如何诞生的?

我们先来看看模型的排名是怎么来的。

排名来自“考试”。业内把评估模型性能的测试称为基准测试(Benchmark),这是一套标准化的考题,由学术机构、厂商甚至个人设计,用固定的题目和评分标准来检验模型在特定任务上的表现。模型做完测试、拿到分数,再按分数高低排出位次,就是广义上的榜单。

目前的基准测试大致可分为两种:

一种是离线测试,有一套固定题库,模型作答,系统按标准答案打分。MMLU、GPQA、HumanEval等,走的都是这条路线。这种方式最大的优势是可量化、可横向比较。但题库会公开,这也意味着厂商可以提前“背题”。

另一种是在线测试,通常被称为Arena(竞技场)。没有固定题目,也没有标准答案。用户提交一个问题,系统将它同时发给两个匿名模型,用户对比回答后投票选出更好的那个,平台再将投票结果转化为动态排名。

LMArena就是这个赛道上的主流玩家,由加州大学伯克利分校等机构发起的LMSYS组织创建,多个厂商直接引用其排名作为模型能力的背书。它最大的优势是贴近真实使用感受,但局限也很明显:用户评判带有主观偏好,曾有研究显示,用户会倾向于选择篇幅更长、“看上去更专业”的回答。

某美企AI出海负责人曾小健提到,在中文语境中,榜单和基准测试经常被混为一谈,很多业内人士也不刻意区分。日常交流中这样说问题不大,但严格来说,两者是有差异的:基准测试指的是一套评测任务,回答的是“怎么测”的问题;而榜单是基于测试结果生成的排名,解决的是“怎么排”的问题,且有些榜单还会实时或近实时更新,并引入用户投票、模型对战等机制。

简单总结,离线测试像高考,有标准答案;在线测试像选秀,靠观众投票。在本文中我们不严格区分这两个概念,但理解“固定考试”和“实时擂台”这两种机制的差异,有助于看懂排名的意义。

搞清楚怎么考,还得知道谁是出题方。当前的离线基准测试按来源大致分为三类:

一类是学术型,题库由高校或研究机构设计,如MMLU、GSM8K等,专业性更强,但更新较慢,部分已趋于饱和。

第二类是厂商型,题库由模型公司自行发布,如OpenAI的HumanEval(代码能力测试),更贴近实际应用场景,但出题方本身也是参赛者,客观性存疑。

第三类是第三方独立型,由独立机构出题运营,也由它们通过整合多个维度的评测数据、按权重生成综合评分,如SuperCLUE、LiveBench等。这类测试立场相对中立,但权重设置、评分规则仍由平台自行把控,透明度有限。

知道了怎么考、谁出问题了,还要知道这些榜单考察的是什么能力。

离线答题侧重学科知识与基础推理,竞技场盲测侧重对话体验与人类偏好。为了方便理解,我们将主流榜单按类型和考察能力做了梳理。

可以看出,想知道模型编码能力强不强可以看LiveCodeBench、SWE-bench verifed等;想了解推理能力强不强可以看HLE、MMMU等;想看看智能体能力则可以看看GAIA、TerminalBench 2.0等榜单。这些也是目前国内大模型厂商发布模型时最常引用的榜单。

也就是说,选模型的时候,可以先根据自己关心的能力“对号入座”。

02.模型榜单也会失真

大模型榜单,本是用户挑选模型最直接的参考,但越来越多人发现,高分选手用起来不一定如预期。

第一个问题是分数通胀。随着模型能力快速迭代,主流基准测试的“试卷”难度已跟不上模型进化速度,在部分测试中,头部模型的成绩集体趋近满分,这样就很难看出真实差距。

北京理工大学博士生李岩举例,典型的数学应用问题基准GSM8K,两三年前还是衡量模型推理能力的重要标准,现在几乎所有主流模型都能拿到高分,它也就失去了筛选的作用。另一个典型是MMLU,顶级模型的准确率早已突破90%,趋于饱和。

第二个问题是刷榜成行业潜规则。目前主流榜单如MMLU、C-Eval等,测试题目与标准答案大多公开,厂商可以获取到公开的考卷并进行针对性训练。

李岩提到,行业内的刷榜主要分两种:一是用原题或高相似度的改编题训练,要么对标测试原题,要么简单修改数据参数,模型相当于“背题考试”;二是考点拆解专项训练,不使用原题,而是拆解试题核心知识点,合成同类数据训练,类似“刷模拟卷”。

第三个问题是考题与真实使用场景脱节。当前榜单多为标准化试题,侧重知识记忆与标准答案匹配,但用户的真实需求远比考题复杂。大模型从业者陈楚提到,模型训练时都会以榜单高分为目标,但高分不意味着会做事。在实际业务中,问题不一定有唯一的标准答案,场景也更多元,一个模型是否好用很难单一通过“考试成绩”评判。

曾小健打了个比方,榜单相当于温度计,刷榜相当于在温度计旁边摆了一个火炉,测的实际是火炉的温度,但用户感受到的是整个房间的体感温度,显然不会那么高。榜单测的是一个点,用户感受的是整个场景,自然差异落差。

这三个问题叠加在一起,就解释了为什么榜单上的“优等生”,到了真实环境里可能“水土不服”。

再加上,榜单的公信力也曾有过争议。国内第三方评测机构SuperCLUE在2023年5月发布的评测榜单中,将科大讯飞的星火大模型排在第四位,仅次于Anthropic和OpenAI的两个版本的模型。后被网友发现,它的官网显示的顾问排名第一位的是哈工大讯飞联合实验室的研究员,榜单成绩客观性存疑。

所以看榜之前,需要会判断一张榜单是否可信。重点来看两个方面:一是出身,测试套件是否公开透明、是否由模型厂商或盈利机构自行把控。曾小健提到,市面上存在不少“野榜”,有些评测机构本身带有商业化属性,靠出榜单、写软文变现,评测方法不透明,样本和流程也不公开,声称某些模型表现更好,却拿不出令人信服的依据。

二是题库的新鲜度,如果主流模型分数普遍趋近满分,说明这份试卷已经饱和,区分度有限。李岩认为,随着旧数据集逐渐失效,学术界也在不断推出更高难度的测评集,榜单自身的迭代同样在倒逼模型突破能力瓶颈。

03.什么才是好用的模型?

随着大模型走向商业落地,榜单排名牵动的利益链条只会更长,围绕榜单的争议也不会停止,那就不仅要会“看”榜单,还要能理解榜单呈现的信息。

当前主流基准测试已细分出数学推理、代码生成、知识问答、长文本理解等多个维度,一个在代码榜单上领先的模型,未必擅长写营销文案;一个知识问答表现优异的模型,处理长文档可能力不从心。

这里我们也根据主流榜单官网展示的数据,梳理了一些模型排名情况。需要提醒的是,榜单上的数据更新有延迟,且随时可能有变,目前截取的是截至发稿的情况,供大家参考。

可以看出,Google的Gemini系列是目前覆盖面最广的“全能型选手”;OpenAI和Anthropic各有优势,OpenAI的模型推理能力更强、而Anthropic则更擅长任务语言理解。

国内厂商则在特定赛道上占有一定优势。其中,DeepSeek的V3.2 Speciale和智谱的GLM-4.7均跻身LiveCodeBench编码能力榜前五;MiniMax的M3模型进入了GPQA Diamond推理榜;而在视频和图像生成领域,字节跳动的 Seedance 2.0、阿里巴巴的HappyHorse1.0、快手的Kling 3.0等国产模型已经成为主力玩家。

更明显的一个趋势是,没有一个模型能够赢下所有榜单。如果关注各家厂商的技术报告或发布会,会发现一个规律:模型在哪个方向有突破,就重点展示对应的榜单成绩,有些厂商还会在一个综合榜单上单独拎出自己领先的几个子项,用局部优势来佐证整体实力。

这也提醒我们,不要只看单一榜单的名次,尤其当两款模型分数区间相近时,排名先后几乎没有实际参考价值。与此同时,场景不同,对“好模型”的定义也完全不同,所以要先明确自己的需求,再去找对应领域的榜单,而不是盯着一张综合排行看总分。

所以,看榜单的核心原则就是:多个来源、多个维度、动态观察。选几个不同出处、不同题库的榜单交叉验证,如果结论一致,才更可信。

除了看榜单,该如何怎么判断一个模型好不好用?

陈楚认为,评估一个模型不能只看准确性,还要看它面对意外输入会不会犯错、在陌生任务上表现是否稳定、推理速度和资源消耗是否可接受。

他的做法是先看榜单进行初筛,再根据自己的使用需求定制相应的基准测试,把新旧模型放在真实环境里并行跑一段时间,看实际效果差异。

对于普通用户来说,不需要这么复杂,但逻辑是类似的。李岩建议,可以挑几个自己日常工作中反复出现的任务,如做PPT、写周报、整理资料等,分别让不同模型跑一遍,并把结果做横向对比。此外,关注各种科技媒体的测评也是一个低成本的参考方式。

曾小健则认为普通用户不需要过度研究榜单,按照个人习惯和实际体验使用即可。但对专业从业者,他反复强调真实测试的重要性,在他看来,榜单只能提供有限参考,更多判断要靠实际业务场景中的测试来验证。

模型能不能干好活,还得上手试。先缩小候选范围,再把模型放到自己的业务场景中跑任务,看它表现如何,这是当前业内的一种共识。

应受访者要求,文中李岩、陈楚为化名。