惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
M
MIT News - Artificial intelligence
D
Docker
S
SegmentFault 最新的问题
B
Blog
Apple Machine Learning Research
Apple Machine Learning Research
博客园_首页
博客园 - 【当耐特】
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
The GitHub Blog
The GitHub Blog
Y
Y Combinator Blog
腾讯CDC
阮一峰的网络日志
阮一峰的网络日志
U
Unit 42
C
Check Point Blog
GbyAI
GbyAI
美团技术团队
Recent Announcements
Recent Announcements
F
Fortinet All Blogs
量子位
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
V
Visual Studio Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
G
Google Developers Blog

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
现在的模型真的有实质性的提升吗?
CxMYu · 2026-05-11 · via LINUX DO - 最新话题

从几个月前用 4.5 / 5.2 那代模型,到现在的 4.7 / 5.5,我最大的感受只有一句话:
0→1 用 Claude 4.7、GPT 5.5 让 AI 一直堆屎山,好像确实可行,一旦基于原项目续写,没有一个模型能做到及格
这种感觉,几个月前是这样,几个月过去后,居然还是这样

0→1

这一点我得承认,新模型更猛了;给个大概方向,它能一口气吐出一套能运行的代码,看着贼唬人
一旦review就是灾难

原项目续写

几个月来,我的体感几乎原地踏步,甚至有些模型还后退了

  • 无视项目既有约定;
  • 局部能看,全局灾难;
  • 总是习惯于写代码的时候偷摸改改已有代码,嗯?试图优化写法?,maybe

模型输出的代码语法正确、跑得通,代码结构一塌糊涂,review更是灾难;这种问题在 4.7、5.5 身上,一点没少
在日常的真实项目续写里,它们的表现依然算不上合格
有同感的来聊聊,是不是我的用法有问题,还是大家都这样

CxMYu 2

尤其是现在ALL IN AI CODING的情况下写py代码,真的致命,每天要做无数次决策,从开始的review到后面的妥协,从早上的严格要求到下班前的能跑就行,前额叶受损严重,甚至感觉比以往写代码更累了

Bin29 (Bin) 5

这个维护呢,一般都是人类来指挥的,就是解耦意识只有人类会有。模型现在训练为了拿到更好的分,都喜欢写兜底代码(有可能成为屎山,各种功能都上了),讨人类的喜欢,这种代码可能不易于维护,但是绝对会拿更高的分数。

举个例子,GPT就很喜欢这样做,你说这里有bug,明明这个bug最好是要修复掉错误逻辑才OK的,但是可能代价太大了,要改好几处,他就给你写了一个兜底代码绕过去,能跑就OK了,能马上治好你的焦虑,他就高分了,高兴了。

user1703 (怒 天) 6

AI的智能程度想要提升,怎么也要以年为单位,半年的小版本提升不会有那么大的改善。
还有就是我记得AI润色也是不允许被直接发出来的,最好注意一下。

CxMYu 7

现在的模型倾向于优先找一套“解决方案”来solve 代码问题,这不是写代码的逻辑

模型倾向于找你指令的漏洞在你不注意的地方来糊弄你

ping200 (不求而得) 8

看上去挺好,一般情况下也挺好,当你付出更多精力的时候,就开始暴露问题。

Foredawn (叶子) 9

你的发言咋AI味这么重,是不是AI用多了人机一体了(无恶意)

CxMYu 10

前额叶爆炸了,已经习惯下班前让它快速糊弄一下 commit了

mengnankk (爱玩草莓派游戏) 11

对的,AI写的代码总是喜欢兜底,然后加上一群无所谓的代码,而且逻辑拆分也很有问题,得仔细地review才行

是这样的 只是为了更快的完成任务 代码生成的很丑陋
但是为了让他写的更加像人又要加上很多控制词 摸索起来也挺麻烦的

raftsuki (raftsuki963) 13

挺认同一个B站UP的话,在一个AI大黑箱里面,同一个模型不同的版本,几乎像是两个独立的模型。高版本不一定比低版本的更好

mi_tu (mi tu) 14

除了gpt5.5和5.2眼前一亮,剩下的从opus4.5到现在感觉确实没啥区别

tutudaishi (tutudaishi) 15

感觉确实每天面对ai写的code,一直去看头都大了,特别是改了几轮,token飞起但是问题没有解决的时候

beyonca (beyonca) 16

各位回复的时候能不能说下是针对哪一个ai的评价,好做参考

CxMYu 17

目前是深度使用gpt5.5xhigh,绝对的超雄模型,无限放大指令且容易钻牛角尖的模型
特别容易针对于一个看似可行的解决方案进行“长篇大论”的代码修改,
claude4.7 只能说差强人意,还是4.6好使

touma99 (冬马99) 18

:smiling_face_with_tear:酒馆玩家表示,提升确实没有想象的那么大。大部分的模型感觉并不是那么明显。甚至还是在退步的。

用AI写代码产出代码,然后用AI产出的代码训练AI,如果没有人工审核,依据熵增定律,最终会成为混乱的状态。

admini (admini) 20

使用的时候给出详细的提示词和规定范围这样实现一个方法或功能还是可以。让其直接续写需要查看原先代码,而且训练的数据和手写的命名等其他区别,导致偏移比较严重。生成的结果也就不怎么好。

opus 4.7开倒车,开创先例:sweat_smile:,没有安全感的模型,原因不明,尔等写代码的,懒得查了