惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Stack Overflow Blog
Stack Overflow Blog
T
Tailwind CSS Blog
Recent Announcements
Recent Announcements
宝玉的分享
宝玉的分享
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
P
Proofpoint News Feed
D
Docker
Google DeepMind News
Google DeepMind News
aimingoo的专栏
aimingoo的专栏
B
Blog RSS Feed
Microsoft Security Blog
Microsoft Security Blog
博客园 - 【当耐特】
M
MIT News - Artificial intelligence
云风的 BLOG
云风的 BLOG
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
WordPress大学
WordPress大学
IT之家
IT之家
H
Help Net Security
Apple Machine Learning Research
Apple Machine Learning Research
Martin Fowler
Martin Fowler
S
SegmentFault 最新的问题
B
Blog
D
DataBreaches.Net

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
GPT-5.5真要换主力吗 - 少数派
2026-04-24 · via 少数派

我先说结论

我这两天盯着这波反馈看,心情其实有点复杂。。。。

一方面是兴奋,卧槽,OpenAI 好像真的把“综合第一”的气场又抢回来了。

另一方面是有点慌的一笔,因为这次大家夸的不是某一个 demo 很炸,也不是某一个榜单高了 3 分,而是更可怕的东西:它开始在真实工作里,越来越像一个能持续交付的人。

如果你本来就靠模型写代码、啃资料、做方案、拉长任务链,我觉得 GPT-5.5 很值得立刻进主力测试池。

但如果你只是偶尔聊天、写两段文案,也别急着宣布旧模型死了。模型切换这事,永远不是粉圈站队。

为什么这次讨论密度这么高

我自己判断一个模型是不是“真升级”,不会先看它会不会说漂亮话。

我先看四件事:

  • 它能不能处理硬问题,而不是只会顺嘴回答。
  • 它能不能把长计划一直记着,不中途跑偏。
  • 它能不能在真实任务里把活做完,而不是只会写个计划书。
  • 它是不是在不同任务形态里都同步变强,而不是单点超神。

这也是为什么这次 GPT-5.5 会显得很不一样。

Artificial Analysis 那条评测动态,核心意思很直接:OpenAI 在他们的综合智能指数里重新拉开身位,而且不是只赢一个指标,而是在多个 headline evaluation 上一起抬升。这里面最值得注意的不是“第一”两个字,而是它在知识、幻觉控制、agent 任务这些维度同时变强。

这说明什么?

说明它不是那种“考试型天才”,而更像“工作型选手”。

最关键的细节,其实来自一线使用者

Ethan Mollick 的判断我挺看重,因为他不太像那种一上来就喊神迹的人。他的说法非常克制:GPT-5.5 Pro 现在是“for today”处理硬问题最好的模型。

这个“for today”我很喜欢。

既不神化,也不嘴硬。

就是承认此时此刻,它最好。

另一条让我印象特别深的是 Dan Shipper 的体验。他说很多模型的问题是“会写一个很厉害的计划,然后被这个计划吓住”,但 GPT-5.5 会直接把事情做下去。他们拿它测 coding、知识工作,还提到它能在几个小时里一直握住复杂计划,不被已有代码带偏,甚至在 Senior Engineer benchmark 上明显拉开差距。

这句话其实比任何跑分都狠:

很多模型会想。

但少数模型开始会干活了。

我自己的判断标准

1. 真正的分水岭,不是回答质量,而是持续性

过去很多模型第一轮回答已经挺像样了,问题出在第 8 轮、第 20 轮、第 2 小时。

上下文一长,它就开始失忆、绕圈、偷懒、装懂。

如果 GPT-5.5 真像这些早测者说的那样,能在长任务里维持计划、维持标准、维持执行力,那这不是“小升级”,这是工作方式层面的 change。

2. “通用最强”不等于人人都该立刻换阵营

Mollick 另一条提醒也很重要:不要每次有新模型发布,就急着换供应商、急着宣布谁赢了。

我完全同意。

因为主力模型的选择,本质上不是看谁今天最风光,而是看谁在你的任务栈里最稳。

比如:

  • 如果你主要是高难度推理、复杂 coding、长任务交付,那 GPT-5.5 现在看起来确实很有吸引力。
  • 如果你已经有一套跑得很顺的工作流,切换成本、提示词迁移、团队习惯,这些都是真成本。
  • 如果你只是轻量使用,榜单第一带来的体感差距,可能没有想象中那么大。

3. 真正让我在意的,是它开始具备“主力人格”

我最近越来越觉得,大家以前讨论模型,经常像在讨论一个很聪明的回答机器。

但现在不是了。

现在我们在选的,其实是一个数字合作者。

你会不会把复杂任务交给它。 你敢不敢让它连续跑两小时。 它交回来的东西,你是想返工,还是能直接接着推进。

这才是主力模型的标准。

再往上看一层

最近也不知道为啥,我会反复想到一件事:

AI 最吓人的进步,从来不是某次答对了特别难的问题。

而是它越来越像一个能进入工作流、进入习惯、进入日常决策的人。。。。

一旦模型跨过这个门槛,很多人就不会再把它当“工具栏里的一个选项”,而会把它当默认协作者。

这才是真正的迁移。

也是最难逆转的迁移。

最后总结

所以我的判断很明确:

GPT-5.5 这波最值得重视的,不是“又一个更强模型来了”,而是它在公开反馈里第一次很集中地呈现出一种特质:能打硬仗,能拉长线,能真的把活往前推。

这和会聊天,不是一回事。

当然,这些结论目前主要还是基于早期测试者和公开动态,很多具体场景还需要你自己上手验证。

但如果你问我,这轮更新值不值得认真看?

值。

而且不是看热闹的那种值,是可能会改你工作习惯的那种值!!!

#GPT55 #OpenAI #模型选择 #大模型