惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

酷 壳 – CoolShell
酷 壳 – CoolShell
Microsoft Security Blog
Microsoft Security Blog
Recent Announcements
Recent Announcements
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
罗磊的独立博客
腾讯CDC
云风的 BLOG
云风的 BLOG
月光博客
月光博客
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 三生石上(FineUI控件)
宝玉的分享
宝玉的分享
U
Unit 42
I
InfoQ
D
DataBreaches.Net
Blog — PlanetScale
Blog — PlanetScale
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
V
V2EX
美团技术团队
IT之家
IT之家
Stack Overflow Blog
Stack Overflow Blog
F
Fortinet All Blogs
GbyAI
GbyAI
S
SegmentFault 最新的问题

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
模型测评:GLM-5.2 大战 Claude Opus 4.8
sit_forget (坐忘) · 2026-06-14 · via LINUX DO - 最新话题

:robot: 祖传 Bug 模型大比拼:GLM-5.2 Thinking vs Claude Opus 4.8 Max 最新实测

:bar_chart: 最新模型测试战报

:rocket: GLM-5.2 Thinking (ZCode 3.0):

96分。1. 解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。
中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。
耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。
评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。

:high_voltage: Claude Opus 4.8 Max (Cursor Max Mode):

100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。


企业微信截图_1781436663167
image

:speech_balloon: 说下感受:

第一次用这两个工具。

  • ZCode 3.0: 不仔细看,以为是Codex呢,太像了。非常省Token,整个任务下来,上下文窗口使用30k,人家Cursor起手就是30k。
  • Cursor: Pro套餐,高级模型处理中等任务的话,一个月也就能用67次。Composer 2.5还拉跨,这种情况怎么和Claude/Codex竞争?
    然后他们说Composer 3.0是用2.5自主开发的,真替他们捏把汗。上下文消耗119k,也不知道是cursor的问题,还是claude max想太多。

国产模型进步非常快,GLM-5.2和Qwen 3.7 Max可以说是一线前沿模型了。体感上的区别是,gpt和claude处理这种问题,仅需要一个平A,而国产模型见面直接开大了,想的非常多。


:file_cabinet: 原始测试记录:

📦 点击展开 / 折叠查看 29 款模型完整评测历史

祖传bug测了几个模型的能力:

  1. minimax 2.7: 未发现问题。提示到具体代码行,仍然不承认有问题。
  2. mimo-v2-pro: 怀疑到具体行数,这个位置是对的,但最终判定不是bug。
  3. glm 5: 发现并解决问题,但只从表面上解决了。
  4. claude 4.6 opus: 发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。
  5. GPT 5.4 xhigh: 发现了用户都没想到的深层问题,自动修改,一次改对。
  6. **kimi-2.5:**未发现问题。然后提示代码行号,态度转变发现并解决表面问题。同时发现深层问题,但改错了。(速度很慢,比GTP还慢)
  7. Gemini 3.1 pro preview(Copilot): 同glm 5。(速度快,比其他快10倍)
  8. claude 4.6 Sonnet: 发现并解决表面问题。发现深层问题,但改错了。和kimi-2.5错的一样。
  9. glm 5.1: 同claude 4.6 Sonnet。
  10. doubao-seed-2.0-code: 同kimi-2.5
  11. qwen3.6-plus preview free: 同glm 5
  12. stepfun/step-3.5-flash:free: 同glm 5.1。
  13. Gemini 3.1 pro (Antigravity): 发现了用户都没想到的深层问题,自动修改,一次改对。深层次问题用最少的代码修复,比GPT 5.4灵性。
  14. kimi-k2.6: 同claude 4.6 opus。
  15. GPT 5.5 xhigh: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。
  16. **deepseek v4 pro (stepFun路由,思考强度未知):**同claude 4.6 opus,能提示潜在问题,也分析的透彻。太慢了11分钟,26个请求,所有测试里最慢的。
  17. claude 4.7 opus max: 同claude 4.6 opus,对于潜在问题没有自动处理,提出3个选项,第一个选项是Gemini 3.1 pro (Antigravity)那个改动最少,最灵性的。耗时2分钟,15个请求。
  18. mimo-v2.5-pro: 同claude 4.6 opus。耗时2分钟。共测试4次,有2次没检查出问题,不稳定。
  19. 新增Gemini 3.5 Flash (High) (Antigravity 2.1): 未发现问题。提示到具体代码行,只从表面上解决了。速度非常快,42秒。
  20. MiniMax M3 Free: 1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。表现大于GPT 5.4 xhigh。使用的是opencode免费版,耗时7m51s。看思考过程,该想到的都想到了,不该读的文件也读了,行为和deepseek v4有点像。如果使用token plan和MiniMax code,也许速度会快点。
  21. Qwen 3.7 Max: Qoder IDE,开启Spec驱动。Max解决了表面问题。第二层深度问题提供三个方案,最好的方案和GPT 5.4相同,这点不及Opus 4.7,GPT 5.5合Gemini 3.1。第三层问题,也就是公共库的bug,提供两个方案改或不改,但如果选了不改,却没有本地规避,不及GTP 5.5。是第二个发现第三层bug的老师。
  22. Qwen 3.7 Plus: Qoder IDE,开启Spec驱动。同claude 4.6 Sonnet。
  23. DeepSeek V4 Pro: Qoder IDE,开启Spec驱动。解决表面问题。第二层改错了。竟然发现第三层引用的库的bug,没有改动库,本地业务代码优雅规避,这点同GPT 5.5,也是第三个发现三层bug的老师。但第二层改错了。
  24. grok build 0.1: 未发现问题。提示后,只解决了表面问题(不如kimi k2.5)。同Gemini 3.5 Flash (High),但不如它快。
  25. composer 2.5: 同claude 4.6 Sonnet(发现并解决表面问题。发现深层问题,但改错了),错误相同。这一点表现不如kimi k2.6(发现深层问题,没有自动修改,能提示用户需要手动修改。)
  26. MAI-Code-1-Flash: 未发现问题。错误的修改了两处不是bug的代码,不想提醒它再试一次了,和MiniMax 2.7坐一桌吧
  27. kimi-k2.7-code: 同 claude 4.6 opus(发现并解决表面问题。发现深层问题,没有自动修改,能提示用户需要手动修改。)
  28. GLM-5.2 Thinking (ZCode 3.0): 1. 96分。解决表面问题。2. 解决深层问题。3. 发现引用的库的bug,没有改动库,没改本地代码规避库的bug。第四个发现三层bug的老师。中间改错了一次,错误和glm-5.1相同,但自己马上意识到改错,自动回滚了。耗时17分18秒。非常慢,不知道是不是下午的问题,中间还跳出一次人机认证。所有模型中最慢的,打破deepseek 11分钟的记录。评分和Qwen 3.7 Max一样,96分,但太慢了,排它后面吧,给Qwen升到97分。
  29. Claude Opus 4.8 Max (Cursor Max Mode): 100分。同GPT 5.5 xhigh(1. 解决表面问题。2. 解决深层问题,改动代码量比5.4少,比gemini3.1多。3. 发现引用的库的bug,没有改动库,本地业务代码优雅规避。),但gpt-5.5只用了2分多钟。第5个发现三层bug的老师。Cursor竟然没有计时功能,估计4分钟以上吧。