





















我这两天盯着 X 上这波 GPT-5.5 讨论,最大的感受其实不是“卧槽,又第一了”。。。。
而是,终于开始有人用一种很务实的方式夸模型了:不是夸它会背答案,不是夸它 demo 漂亮,而是夸它真的能把生产功能做出来。
这个区别非常大。
因为过去很多模型的问题,不是不会写代码。
是它会在前 10 分钟把你哄得特别开心,后 2 小时把你气得慌的一笔!!!
计划写得像 CTO,落地像实习生。
我自己判断一个 coding 模型能不能真进生产,不看它会不会一把梭哈生成 500 行代码。
我看 4 件事:
说白了,生产环境拼的从来不是峰值智商。
拼的是稳定性、连续性、还有出错之后会不会继续把事情做完。
这波里我最在意的一条反馈,来自 Dan Shipper。
他不是只说“很强”,而是给了几个很具体的信号:
最后这个细节我觉得信息量巨大。。。。
它说明一件事:未来未必是“一个模型包打天下”,而更像是“规划层”和“执行层”分开,各自用最擅长的模型。
这才像真正的工程系统,不像神话。
另一边,X 上被疯狂转发的一组 benchmark 也很说明问题:
这些分数当然不等于你的线上事故率会直接归零。
但它至少说明,大家讨论的已经不是“它会不会写贪吃蛇”,而是“它能不能在终端、浏览、复杂软件工程任务里稳定干活”。
很多人低估了一件事。
AI 编程最烦人的,不是它代码差一点。
而是它总爱摆出一种“我完全懂了”的样子,然后开始漫无目的地改。。。。
这次 GPT-5.5 被夸得最狠的地方,恰恰不是文学性的“更聪明”,而是一种更像同事的执行感:
我也不知道这是不是一个真正意义上的“拐点模型”,但我觉得它至少第一次让我愿意把标准改一下:
以前我默认 AI 只能做副驾驶。
现在我会认真考虑,某些工程流程是不是已经可以让它做主驾,人类做 code review 和兜底。
不是说你今天就可以把团队裁了,哈哈哈,不至于。
但有几件事会很快发生:
真正稀缺的会变成:
你不只是写代码的人。
你是把任务分配给模型、挑模型、审结果、接回系统上下文的人。
Dan 提到的“一个模型出 plan,另一个模型执行”,我觉得会越来越常见。
以后大家比的不是谁家模型一句话最强。
而是谁的工作流最成熟。
我一直觉得,一个模型配不配叫“生产级”,看它能不能帮你减少真实世界里的犹豫。
不是让你惊艳 30 秒。
是让你在周二凌晨改线上 bug 的时候,真的敢把一部分活交给它。
这次 GPT-5.5 被很多人叫 daily driver,我一点都不意外。
因为“能上生产”这四个字,听起来朴素,实际上比所有榜单第一都更有含金量。
榜单是热闹。
交付才是文明。
#AI编程 #GPT55 #Agent工程 #VibeCoding #开发效率
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。