惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
博客园 - 叶小钗
WordPress大学
WordPress大学
N
Netflix TechBlog - Medium
M
MIT News - Artificial intelligence
美团技术团队
aimingoo的专栏
aimingoo的专栏
博客园_首页
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Microsoft Security Blog
Microsoft Security Blog
Last Week in AI
Last Week in AI
The GitHub Blog
The GitHub Blog
小众软件
小众软件
T
Tailwind CSS Blog
Martin Fowler
Martin Fowler
B
Blog RSS Feed
月光博客
月光博客
量子位
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Hugging Face - Blog
Hugging Face - Blog
IT之家
IT之家
Y
Y Combinator Blog
B
Blog
MyScale Blog
MyScale Blog

博客园 - 狂师

AI越来越强了,为什么测试人反而越来越累!(为打工人发声) AI 都会写代码了,还要不要学传统编程了? (强烈建议阅读) BrowserAct,给AI Agent配一个真实浏览器,从安装到实战 2026 性能测试工具大盘点:13 款主流压测工具,测试工程师必备! 最近火爆出圈的,FDE 到底是个什么岗位? 2026年AI编程工具大全,33个主流工具一次看懂 为什么都说要做自动化测试,落地却这么难!(附自动化测试的四种死法) AI 测试工具收藏了几十篇,一篇没看?我建了个学习圈子,专治这种... 别只会用 Postman 了,这 15 款接口测试工具你可能还不知道 公司从零开始推自动化测试,如何落地? AI 测试提效 | 别搞万能 Skill,推荐5 个 Agent Skill 串起 UI 自动化执行到报告生成全流程 为什么团队用了 AI 之后,测试质量反而下降了! 阿里开源:skill-up,一款Agent Skill 评测工具! 整理了一份 DeepSeek Harness 必备插件清单! 我的免费 AI 测试开发学习路线,开源了! UI自动化测试提效必备Skill!一套CI流水线编排 Skill 可以直接抄了... AI 测试丨一句指令生成测试报告,带失败截图、操作录屏、Trace、日志,这套 Skill 思路可以直接抄... AI 测试提效丨从失败排查到自动修复,分享我的Playwright+Skill UI自动化测试失败诊断提效方案! AI 测试 | 把 UI 自动化测试执行固化成五步流程,这套 AI Skill 思路可以直接抄 智谱GLM-5.3+ZCode Agent,真实项目第一手实测! 从 0 到 1,DeepSeek Harness 保姆级安装与使用教程! 一个测试负责人的崩溃:该做的都做了,线上还是炸了 Agent质量怎么评? 想做测试工具却不会写代码?怎么办? 用AI做自动化测试,哪些是真不行,哪些是你不会用? 天天用 Claude Code/Codex,你知道它实际发给模型什么吗?被这开源工具扒光了... 推荐一款开源 Skill:让 AI Agent 给你做一份"能改"的 PPT,支持 上千套模板! AI 测试提效 | UI 自动化测不出样式 bug?分享 ui-visual-assert + Skill 视觉断言与多浏览器适配方案 公司不给你配 AI,你会自己掏钱吗? AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案
2026年9月大模型最新排行榜,30款主流AI大模型,第一名有点意...
狂师 · 2026-09-07 · via 博客园 - 狂师

今天给大家整理一份最新的主流大模型排名,数据来自 AIHOT 大模型排行榜,一共 30 款在榜模型。

先说三个直接看点。

榜首不是 OpenAI 也不是 Anthropic,是 Meta 9 月 2 日刚上线的 Muse Spark 1.3,发布三天就登顶。

前十里国产占了两席,Kimi K3 第 6,GLM-5.3 第 8。另外上下文窗口已经卷到百万 token 起步,前 30 里一大半都是 100 万级。

下面按名次过一遍,起码大家可以知道,当前最强的AI大模型都是哪些。

好,下面进入正文。

第一梯队(前 10)

1. Muse Spark 1.3(Meta)

Meta 的新旗舰,9 月 2 日上线,三天冲上榜首,104.8 万 token 上下文,把 Llama 时代慢半拍的帽子摘了。

官网 ai.meta.com

2. GPT-6 Astra(OpenAI)

9 月 3 日发布的那位主角,编程和计算机操作是强项,105 万 token 上下文,API 定价输入 10 美元、输出 50 美元每百万 token。

官网 openai.com

3. Claude Fable 5(Anthropic)

Anthropic 6 月上线的口碑款,第三方 Artificial Analysis 综合指数长期第一,长文写作和代码是传统强项,100 万 token 上下文。

官网 claude.com

4. Claude Opus 5(Anthropic)

7 月底上线的 Claude 家旗舰,推理深度和 agent 任务表现出众,和 Fable 5 一高一快形成双线布局。

官网 claude.com

5. GPT-5.6 Sol(OpenAI)

上一代主力,7 月上线,综合能力依然稳在前五,性价比比 GPT-6 亲民,目前大量生产环境还在它上面跑。

官网 openai.com

6. Kimi K3(Moonshot AI)

月之暗面 7 月的新旗舰,国产阵营当前排位最高的一档,104.8 万 token 上下文,长文本功底延续了一贯优势。

官网 kimi.com

7. Gemini 3.8 Flash(Google)

Google 9 月 2 日刚发的 Flash 新版,多模态能力是家族招牌,速度快价格低,日常任务的性价比之选。

官网 gemini.google.com

8. GLM-5.3(Z.ai)

智谱 8 月中的新旗舰,榜单前十里唯一冲到这个位次的国产开源系,131 万 token 上下文是全榜最大的一档。

官网 z.ai

9. Grok 4.6(xAI)

马斯克家的 8 月新版,50 万 token 上下文,接入 X 的实时信息是独门优势,风格奔放。

官网 x.ai

10. Gemini 3.7 Flash(Google)

8 月中上线的上一版 Flash,和 3.8 同门打配合,价格进一步下探,大批量调用的常客。

官网 gemini.google.com

第二梯队(11-20)

11. Muse Spark 1.2(Meta)

8 月上线的上一代,被 1.3 顶下去一天就掉到第 11,迭代节奏肉眼可见地快。

官网 ai.meta.com

12. GPT-5.5(OpenAI)

4 月上线的上一代主力,综合均衡,生态成熟度最高的一档,存量用户依然庞大。

官网 openai.com

13. Qwen3.8 Max(Alibaba)

通义 7 月的旗舰款,国产第一梯队,中文场景和多语言能力强,100 万 token 上下文。

官网 tongyi.aliyun.com

14. GPT-5.6 Terra(OpenAI)

5.6 系列的另一个变体,和 Sol 同天上线,侧重方向不同,面向特定负载优化的思路从这代开始铺开。

官网 openai.com

15. Claude Opus 4.8(Anthropic)

5 月底的 Opus 系上一代,agent 和工具调用能力当时就是第一档,现在看依然能打。

官网 claude.com

16. Qwen3.8 Flash Next(Alibaba)

通义 8 月底上线的 Flash 迭代号,走轻量低价路线,批量调用和边缘场景的选择。

官网 tongyi.aliyun.com

17. Claude Opus 4.7(Anthropic)

4 月版本,Opus 系的稳定中间代,不少团队的存量生产模型。

官网 claude.com

18. GLM-5.3 Flash(Z.ai)

GLM-5.3 的轻量版,8 月底上线,和旗舰同款 131 万上下文,主打便宜量大,国产性价比代表。

官网 z.ai

19. Muse Spark 1.1(Meta)

7 月版本,Meta 这一年三代连发,节奏拉满。

官网 ai.meta.com

20. GPT-5.4(OpenAI)

3 月上线的过档型号,5.5 出来后退居二线,存量依然不少。

官网 openai.com

第三梯队(21-30)

21. DeepSeek V4 Pro 0813(DeepSeek)

深度求索 8 月的 Pro 版,V4 系列的重炮,开源路线加低价是招牌,104.8 万 token 上下文。

官网 deepseek.com

23. Claude Sonnet 5(Anthropic)

6 月底的新 Sonnet,轻快路线的中坚,日常开发场景的性价比款。

官网 claude.com

24. GPT-5.6 Luna(OpenAI)

5.6 系列第三个变体,和 Sol、Terra 组团覆盖不同场景。

官网 openai.com

25. Gemini 3.6 Flash(Google)

7 月版 Flash,多模态加低价,走量主力。

官网 gemini.google.com

26. Claude Opus 4.6(Anthropic)

2 月的版本,年初的旗舰,现在看是家族里的上上一代。

官网 claude.com

27. Gemini 3.5 Flash(Google)

5 月版 Flash,Google 的 Flash 系基本两三个月一更,卷得厉害。

官网 gemini.google.com

28. GLM-5.2(Z.ai)

6 月的上一代旗舰,GLM 系稳步爬坡的一代。

官网 z.ai

29. Qwen3.8 27B(Alibaba)

通义 8 月的 27B 小尺寸版本,端侧和私有化部署的常客。

官网 tongyi.aliyun.com

30. DeepSeek V4 Flash 0731(DeepSeek)

V4 的轻量版,7 月底上线,131 万 token 上下文,走量的便宜选择。

官网 deepseek.com

写在最后

翻完这 30 款,最直观的感受是节奏

Meta 一年三代连发把榜首抢了,OpenAI 用一个 GPT-6 带着一串 5.x 变体铺满中间段位,Google 靠 Flash 系两三个月一更走量,头部四家各走各的路。

国产这边值得多说一句,Kimi K3 和 GLM-5.3 双双进了前十,Qwen 和 DeepSeek 稳在第二梯队,和海外的差距从名单上看已经不明显了,加上价格普遍只有海外同档的几分之一,实际用起来的性价比很突出。

照例提醒一下,榜单只反映综合评测的相对位次,选型还是看场景,写代码、跑 agent、做中文内容,各家各有强项,别只盯第一名买。

最后,AIHOT的访问入口,如果有需要的同学,可以直接打开PC浏览器,访问快捷导航网站https://www.kjdaohang.com/newest 在最新上架菜单中找到(也可以直接站内搜索),里面收录了大量实用好用我自己每天真实有在用的工具。