惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

云风的 BLOG
云风的 BLOG
The GitHub Blog
The GitHub Blog
Y
Y Combinator Blog
博客园 - 三生石上(FineUI控件)
T
The Blog of Author Tim Ferriss
宝玉的分享
宝玉的分享
Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
V
Visual Studio Blog
小众软件
小众软件
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
MongoDB | Blog
MongoDB | Blog
V
V2EX
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 【当耐特】
Microsoft Azure Blog
Microsoft Azure Blog
The Cloudflare Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Engineering at Meta
Engineering at Meta
L
LangChain Blog
Martin Fowler
Martin Fowler
GbyAI
GbyAI
博客园 - 司徒正美

博客园 - KAI智习

大模型榜单周报(2026/02/15) 大模型榜单周报(2026/02/08) 大模型榜单周报(2026/01/31) 英伟达20亿美元注资CoreWeave扩建算力中心,OpenAI招聘放缓引发AI效率思考,千问PC和网页端上线国内最强推理模型 大模型榜单周报(2026/01/24) 大模型榜单周报(2026/1/17) 英伟达调整芯片供应,谷歌XR眼镜曝光,蚂蚁国际与谷歌联手发布"通用商务协议",Vercel发布Agent Browser操控网页 大模型榜单周报(2026/01/10) 腾讯开源10亿参数3D动作模型,小米MiMo公测延续至2026年,MiniMax M2.1编程模型发布,京东上线自营机器人租赁业务 OpenAI估值达5000亿美元、Meta收购Manus、三星芯片模型瘦身90%,混元1.5版开源翻译模型 OpenAI探索广告变现与人才布局,千问引领AI生态变革,Trae月活破160万 大模型榜单周报(2025/12/27) OpenAI ChatGPT功能大升级,NVIDIA斯坦福开源游戏AI,通义千问Qwen Code生态扩展,中国AI产业突破万亿大关 智谱MiniMax竞速上市,字节新模型数学推理突破,清华开源视频生成技术,AI监管政策出台 Google与OpenAI绘图工具遭滥用,阿里巴巴开源语音模型,知乎发布AI产品榜单,Jan团队发布Jan-v2-VL-Max 谷歌发布Gemma Scope 2,钉钉推出AI操作系统与硬件,苹果初代智能眼镜细节曝光 ChatGPT可手动"调温"、谷歌推出 A2UI 标准、通义千问推出 Qwen-Image-Layered 模型、多智能体可信标准在ITU立项 大模型榜单周报(2025/12/20) 微软联手Kimi、Mistral OCR 3模型发布、Claude AI推出新"任务模式"、Amazon组建全新AI组织、QQ音乐推本地化AI作曲
大模型榜单周报(2026-01-04)
KAI智习 · 2026-01-07 · via 博客园 - KAI智习

1. 本周概览

DeepSeek在市占率方面表现突出,份额增加显著。同时,通义实验室开源了GUI智能体MAI-UI,涵盖从端侧小模型到云端大模型的多个尺寸版本。此外,DeepSeek提出了名为「mHC(流形约束超连接)」的新架构,能够在增加极少训练时间开销的情况下实现显著性能提升。

2. 重点关注事件

  • 通义实验室于12月26日开源GUI智能体MAI-UI,提供从2B端侧小模型到235B云端大模型四个尺寸版本,覆盖全场景部署需求,论文地址:https://arxiv.org/abs/2512.22047
  • DeepSeek于12月31日提出名为「mHC(流形约束超连接)」的新架构,在27B参数模型上,仅增加约6.7%的训练时间开销,即可实现显著性能提升,论文地址:https://arxiv.org/abs/2512.24880

3. 榜单变化

  • OpenRouter模型调用量变化:Grok Code Fast 1、Claude Sonnet 4.5保持前两位;小米发布的MiMo-V2-Flash (free)从第4名上升至第3名;编程调用量方面,Grok Code Fast 1保持第1,Devstral 2 2512 (free)上升6名至第2位,MiMo-V2-Flash新上榜位列第8。
  • OpenRouter公司市占率变化:Google保持第1位,DeepSeek份额上升3.7%(从9.6%增至13.3%),位列榜单第2名;xAI市占率下降3%(从14.4%降至11.4%),OpenAI市占率下降2.5%(从10.5%降至8.0%);小米、MistralAI、Qwen、z-AI保持第6-9名。
  • 大语言模型Text Arena榜单:GLM-4.7新晋榜单第17名,模型评分基于预发布测试,可能会随公开发布后社区反馈和投票的演变而发生变化。
  • 编程能力WebDev Arena榜单:minimax-m2.1-preview新晋榜单第6名,紧跟gemini-3-flash之后,超过glm-4.7,评分基于预发布测试。
  • 图像编辑能力Artificial Analysis Image Editing Leaderboard:Wan 2.6新晋榜单第7名,排名在Nano Banana之后。

4. OpenRouter排行榜

测评类型 第一名 第二名 第三名
模型调用量 Grok Code Fast 1 Claude Sonnet 4.5 MiMo-V2-Flash (free)
公司市占率 Google DeepSeek Anthropic
编程模型调用量 Grok Code Fast 1 Devstral 2 2512 (free) Gemini 3 Flash Preview

各公司按不同能力领域排名汇总

测评类型 领先公司
大语言模型 Text Arena Google、xAI、Anthropic、OpenAI、百度、智谱、阿里巴巴、月之暗面
编程能力 LMArena Anthropic、OpenAI、Google
编程能力 LiveCodeBench OpenAI、Anthropic、Google
代码工程任务能力 SWE-benchLite OpenAI、Google、阿里巴巴、月之暗面等
图像编辑和生成能力 Image Edit Arena OpenAI、Google、字节、Reve
文生图能力 Text-to-Image Arena OpenAI、Google、Black Forest Labs、腾讯、字节
图像编辑和生成能力 Image Editing Leaderboard OpenAI、Google、字节、Black Forest Labs、阿里巴巴、Reve
文生图能力 Text to Image Leaderboard OpenAI、Google、Black Forest Labs、字节、ImagineArt
GPQA 榜单 OpenAI、Google、xAI、Anthropic、阿里巴巴
FrontierMath 榜单 OpenAI、Google、月之暗面、Anthropic、xAI
Humanity's Last Exam 榜单 Google、OpenAI、Anthropic
GAIA 榜单 Suzhou AI Lab&Shuqian Tech、Microsoft AI Asia -Ads、LR AILab of Lenovo CTO Org等

关注我,第一时间掌握更多AI前沿资讯!