惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

腾讯CDC
Microsoft Azure Blog
Microsoft Azure Blog
L
LangChain Blog
Y
Y Combinator Blog
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
B
Blog RSS Feed
MongoDB | Blog
MongoDB | Blog
Jina AI
Jina AI
D
Docker
B
Blog
Engineering at Meta
Engineering at Meta
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
I
InfoQ
G
Google Developers Blog
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
The GitHub Blog
The GitHub Blog
T
The Blog of Author Tim Ferriss
大猫的无限游戏
大猫的无限游戏
阮一峰的网络日志
阮一峰的网络日志
U
Unit 42

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
模型测评:GLM-5.2 大战 Claude Opus 4.8
sit_forget (坐忘) · 2026-06-14 · via LINUX DO - 最新话题

:robot: 祖传 Bug 模型大比拼:GLM-5.2 Thinking vs Claude Opus 4.8 Max 最新实测

:bar_chart: 最新模型测试战报

:rocket: GLM-5.2 Thinking (ZCode 3.0):

96分。1. 解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。
中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。
耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。
评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。

:high_voltage: Claude Opus 4.8 Max (Cursor Max Mode):

100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。


企业微信截图_1781436663167
image

:speech_balloon: 说下感受:

第一次用这两个工具。

  • ZCode 3.0: 不仔细看,以为是Codex呢,太像了。非常省Token,整个任务下来,上下文窗口使用30k,人家Cursor起手就是30k。
  • Cursor: Pro套餐,高级模型处理中等任务的话,一个月也就能用67次。Composer 2.5还拉跨,这种情况怎么和Claude/Codex竞争?
    然后他们说Composer 3.0是用2.5自主开发的,真替他们捏把汗。上下文消耗119k,也不知道是cursor的问题,还是claude max想太多。

国产模型进步非常快,GLM-5.2和Qwen 3.7 Max可以说是一线前沿模型了。体感上的区别是,gpt和claude处理这种问题,仅需要一个平A,而国产模型见面直接开大了,想的非常多。


:file_cabinet: 原始测试记录:

📦 点击展开 / 折叠查看 29 款模型完整评测历史

祖传bug测了几个模型的能力:

  1. minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。
  2. mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。
  3. glm 5: 发现并解决问题,但只从表面上解决了。
  4. claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。
  5. GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。
  6. **kimi-2.5:**未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)
  7. Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)
  8. claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。
  9. glm 5.1: 同claude 4.6 Sonnet。
  10. doubao-seed-2.0-code: 同kimi-2.5
  11. qwen3.6-plus preview free: 同glm 5
  12. stepfun/step-3.5-flash:free: 同glm 5.1。
  13. Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。
  14. kimi-k2.6: 同claude 4.6 opus。
  15. GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。
  16. **deepseek v4 pro (stepFun路由,思考强度未知):**同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。
  17. claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。
  18. mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。
  19. 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。
  20. MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。
  21. Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。
  22. Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。
  23. DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。
  24. grok build 0.1: 未发现问题。提示后,只解决了表面问题(不如kimi k2.5)。同Gemini 3.5 Flash (High),但不如它快。
  25. composer 2.5: 同claude 4.6 Sonnet(发现并解决表面问题。发现深层问题,但改错了),错误相同。这一点表现不如kimi k2.6(发现深层问题,没有自动修改,能提示用户需要手动修改。)
  26. MAI-Code-1-Flash: 未发现问题。错误的修改了两处不是bug的代码,不想提醒它再试一次了,和MiniMax 2.7坐一桌吧
  27. kimi-k2.7-code: 同 claude 4.6 opus(发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。)
  28. GLM-5.2 Thinking (ZCode 3.0): 1. 96分。解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。
  29. Claude Opus 4.8 Max (Cursor Max Mode): 100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。