惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园 - Franky
D
Docker
Jina AI
Jina AI
The GitHub Blog
The GitHub Blog
博客园 - 聂微东
B
Blog RSS Feed
大猫的无限游戏
大猫的无限游戏
M
MIT News - Artificial intelligence
Vercel News
Vercel News
Microsoft Security Blog
Microsoft Security Blog
博客园 - 叶小钗
爱范儿
爱范儿
D
DataBreaches.Net
Hugging Face - Blog
Hugging Face - Blog
IT之家
IT之家
Recent Announcements
Recent Announcements
U
Unit 42
腾讯CDC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
宝玉的分享
宝玉的分享
量子位
Stack Overflow Blog
Stack Overflow Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Microsoft Azure Blog
Microsoft Azure Blog

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
编程能力哪家强(2026年初) - 少数派
2026-01-31 · via 少数派

最强编程模型,在2024年底,毫无疑问是claude 3.5断档式领先

2025年过去了,编程这个赛道打得火热,也确实打出了变化

先说目前,我日常使用最多的模型,在公司是claude sonnet 4.5,在家是gpt 5.2 medium 和 extra high

开发常规需求,中低难度的开发任务,可以用这些模型:

claude sonnet 4.5

gpt 5/5.1/5.2 medium

gpt 5/5.1/5.2 codex medium

解bug,查问题等复杂的开发任务,可以使用这些模型:

gpt 5/5.1/5.2 extra high

gpt o3

claude opus 4.5 thinking budget开到最大

复杂问题上,从o3开始,gpt模型就开始断档式领先,至今没有能替代的

o3也是第一个能用来写代码的openai模型,在此之前的4o、4.1什么的,没一个能打的

等等,gemini去哪了,怎么没提到他

原因是gemini无论2.5pro还是3 pro,用来写代码都一般,只比国产模型强那么一丢丢,基本上不考虑用它来写代码

除了写代码之外,三大模型我是这样用的:

gemini做调研、出方案、画图

claude写写文章

所以现在看,2025年无可替代的不是claude,而是gpt

claude小气,不让用就不用了,没啥影响,gemini有没有都行

如果gpt不让用了,就麻烦了


写代码这件事,其实很难,难在用户预期的上限极高,大到能不能自己跑3个月,帮我写一款操作系统,小到把这行代码改成xxx

复杂的编程任务要求模型有高智商只是一方面,这里面的需求空间其实非常大,比如说:

异步长时间运行:长程规划在2025年上半年还是claude的绝技,只此一家能做好长程规划,到年底,gpt玩宝可梦也能玩好几天了

听懂需求:有些很偏科的模型(xx coder之类的)听不懂需求,自然就做不对题。在qwen coder plus之前,qwen家的coder模型全都听不懂需求,在kimi k2之前,kimi家的模型也存在一样的问题,现在基本上都能听懂需求了,有点像当时的claude sonnet 3.5

审美在线:UI交互设计对模型的审美有要求,用户认为这也是编程能力的一部分,属于隐性要求。像gpt的模型,审美就不咋地,UI设计上gemini最强,从2.5pro开始就领先了,claude排第二,爱用经典的tailwind蓝紫风格

长时间运行,举个例子,gpt 5.x用得久了,我现在也能接受AI写个代码要跑20分钟~半小时

甚至前一周AI自主跑过2小时,下次细说

单从AI自主运行时间的变化,就能发现,人对AI的期待提高了非常多,我已经在谋划用AI写个编程语言了,以后或许会写操作系统

所以反过来看,claude有可能成也编程败也编程,如果一个模型编程能力非常强,它是偏科的,而现实世界的问题是复杂多面的,需要水桶模型,有理由相信一个能搞定蛋白质结构,有尖端科研能力的模型,能帮我搞定写代码这种简单的事情,模型的上限决定了它的应用场景大小

从模型在复杂问题上的能力表现来看:

o3、gpt5是巨大的突破

claude 3.7有突破,claude 4.0略微突破,claude 4.5没感觉到变化

gemini 2.5是突破自己,3没感觉到变化,nano banana算是异军突起,整体来看gemini模型能力本身,目前没啥能打的,老三是尴尬的


再说国产模型,2025这一整年,qwen、kimi、glm三家基本上都达到了claude sonnet 3.5的程度,写代码能用,但是没有那么好用。并且很有意思的是,这三家基本上在同一时间点取得了这个突破

在2025年之前,不客气的说,用不了,根本用不了

这方面的追赶是肉眼可见的,并且另一方面,国外的领先的3家,似乎也陷入了瓶颈,单就编程这个场景,达到o3或者gpt5的水平就足够了,中间档是claude sonnet 3.7 thinking

也就是说,国产模型在编程赛道,距离够用还差1.5步,加油

2027,希望能用国产模型,实现写代码自由