惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
博客园 - 【当耐特】
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
G
Google Developers Blog
博客园 - 叶小钗
大猫的无限游戏
大猫的无限游戏
P
Proofpoint News Feed
J
Java Code Geeks
U
Unit 42
云风的 BLOG
云风的 BLOG
阮一峰的网络日志
阮一峰的网络日志
N
Netflix TechBlog - Medium
宝玉的分享
宝玉的分享
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Docker
V
Visual Studio Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
H
Help Net Security
V
V2EX
T
Tailwind CSS Blog

博客园 - KAI智习

大模型榜单周报(2026/02/15) 大模型榜单周报(2026/02/08) 大模型榜单周报(2026/01/31) 英伟达20亿美元注资CoreWeave扩建算力中心,OpenAI招聘放缓引发AI效率思考,千问PC和网页端上线国内最强推理模型 大模型榜单周报(2026/01/24) 大模型榜单周报(2026/1/17) 英伟达调整芯片供应,谷歌XR眼镜曝光,蚂蚁国际与谷歌联手发布"通用商务协议",Vercel发布Agent Browser操控网页 大模型榜单周报(2026-01-04) 腾讯开源10亿参数3D动作模型,小米MiMo公测延续至2026年,MiniMax M2.1编程模型发布,京东上线自营机器人租赁业务 OpenAI估值达5000亿美元、Meta收购Manus、三星芯片模型瘦身90%,混元1.5版开源翻译模型 OpenAI探索广告变现与人才布局,千问引领AI生态变革,Trae月活破160万 大模型榜单周报(2025/12/27) OpenAI ChatGPT功能大升级,NVIDIA斯坦福开源游戏AI,通义千问Qwen Code生态扩展,中国AI产业突破万亿大关 智谱MiniMax竞速上市,字节新模型数学推理突破,清华开源视频生成技术,AI监管政策出台 Google与OpenAI绘图工具遭滥用,阿里巴巴开源语音模型,知乎发布AI产品榜单,Jan团队发布Jan-v2-VL-Max 谷歌发布Gemma Scope 2,钉钉推出AI操作系统与硬件,苹果初代智能眼镜细节曝光 ChatGPT可手动"调温"、谷歌推出 A2UI 标准、通义千问推出 Qwen-Image-Layered 模型、多智能体可信标准在ITU立项 大模型榜单周报(2025/12/20) 微软联手Kimi、Mistral OCR 3模型发布、Claude AI推出新"任务模式"、Amazon组建全新AI组织、QQ音乐推本地化AI作曲
大模型榜单周报(2026/01/10)
KAI智习 · 2026-01-11 · via 博客园 - KAI智习

1. 本周概览

本周大模型领域多项技术突破引人注目,包括NVIDIA发布Rubin平台大幅降低成本、OpenAI推出健康垂直领域功能,以及上海AI Lab开源Yume1.5世界模型实现效率飞跃。同时,OpenRouter模型调用量排名出现显著变化,Claude Sonnet 4.5超越Grok Code Fast 1成为整体调用量冠军,行业格局正在发生微妙调整。

2. 重点关注事件

  • NVIDIA于1月5日发布Rubin平台,对六款全新芯片采用软硬件极致协同设计,将推理token成本最多降低至NVIDIA Blackwell平台的十分之一,在MoE模型训练中使用的GPU数量仅为Blackwell平台的四分之一,大幅提升了AI计算经济性。
  • OpenAI于1月7日发布ChatGPT健康功能,在ChatGPT中拥有独立空间,对话、已连接的应用和文件均与其他聊天内容隔离存储,标志着AI在垂直领域应用的进一步深化。
  • DeepSeek R1论文于1月8日更新,增加64页内容,v2版本论文披露了R1训练全路径、「Aha Moment」的数据化验证、自适应算力分配、失败总结等核心技术细节。
  • 上海AI Lab于1月9日联合多家机构开源Yume1.5世界模型,在长视频生成中实现了近似恒定计算成本的全局记忆访问,模型推理效率提升70倍,推动了世界模型技术发展。

3. 榜单变化

  • OpenRouter模型调用量排名:整体调用量方面,Claude Sonnet 4.5超越Grok Code Fast 1排名第一;Gemini 3 Flash Preview由第6名上升2名到第4名;MiMo-V2-Flash(free)下降两名,排名第5。编程调用量方面,Grok Code Fast 1保持第1;Claude Opus 4.5排名第2,上升2名;MiniMax M2.1新上榜排名第3。
  • OpenRouter公司市占率排名:Google继续保持第1;Anthropic市占率上升4.3%(12.9% → 17.2%),排名升至第2;xAI、OpenAI分别位列第3、4名,OpenAI市占率上升3.1%(8.0% → 11.1%);DeepSeek份额下降4.5%(13.3% → 8.8%),排名相应下降3名位列第5;小米、MistralAI、z-AI保持第6、7、9名;MiniMax上升到第8名,替代上周Qwen的位置。
  • 图像编辑能力榜单:在Image Edit Arena中,qwen-image-edit-2511新上榜排名第9;在Artificial Analysis Image Editing Leaderboard中,Wan 2.6超过Nano Banana到榜单第5位。
  • GPQA榜单:GPT-5.1 High、GPT-5 Medium新上榜,并列第6位。
  • GAIA榜单:Nvidia的Nemotron-ToolOrchestra-0106和Nemotron-ToolOrchestra-0107新上榜,排名前两位。

4. OpenRouter排行榜

测评类型 第一名 第二名 第三名
模型调用量 Claude Sonnet 4.5 Grok Code Fast 1 Gemini 2.5 Flash
公司市占率 Google Anthropic xAI
编程模型调用量 Grok Code Fast 1 Claude Opus 4.5 MiniMax M2.1

各公司按不同能力领域排名汇总

测评类型 领先公司
大语言模型 Text Arena Google、xAI、Anthropic、OpenAI、百度、智谱、阿里巴巴、月之暗面
编程能力 LMArena Anthropic、OpenAI、Google
编程能力 LiveCodeBench OpenAI、Anthropic、Google
代码工程任务能力 SWE-benchLite 基于Claude、Gemini、GPT、Qwen、DeepSeek开发的开源系统
图像编辑和生成能力 Image Edit Arena OpenAI、Google、字节、Reve
文生图能力 Text-to-Image Arena OpenAI、Google、Black Forest Labs、腾讯、字节
图像编辑和生成能力 Image Editing Leaderboard OpenAI、Google、字节、Black Forest Labs、阿里巴巴、Reve
文生图能力 Text to Image Leaderboard OpenAI、Google、Black Forest Labs、字节、ImagineArt
GPQA OpenAI、Google、xAI、Anthropic、阿里巴巴
FrontierMath OpenAI、Google、月之暗面、Anthropic、xAI
Humanity's Last Exam Google、OpenAI、Anthropic
GAIA Nvidia、Suzhou AI Lab&Shuqian Tech、Microsoft AI Asia -Ads、LR AILab of Lenovo CTO Org等

关注我,第一时间掌握更多AI前沿资讯!