惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

大猫的无限游戏
大猫的无限游戏
D
DataBreaches.Net
M
MIT News - Artificial intelligence
量子位
N
Netflix TechBlog - Medium
The Cloudflare Blog
The GitHub Blog
The GitHub Blog
P
Proofpoint News Feed
人人都是产品经理
人人都是产品经理
B
Blog RSS Feed
B
Blog
博客园_首页
博客园 - Franky
MyScale Blog
MyScale Blog
有赞技术团队
有赞技术团队
Apple Machine Learning Research
Apple Machine Learning Research
MongoDB | Blog
MongoDB | Blog
云风的 BLOG
云风的 BLOG
爱范儿
爱范儿
H
Help Net Security
Y
Y Combinator Blog
Stack Overflow Blog
Stack Overflow Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell

博客园 - 狂师

AI 都会写代码了,还要不要学传统编程了? (强烈建议阅读) BrowserAct,给AI Agent配一个真实浏览器,从安装到实战 2026 性能测试工具大盘点:13 款主流压测工具,测试工程师必备! 最近火爆出圈的,FDE 到底是个什么岗位? 2026年AI编程工具大全,33个主流工具一次看懂 为什么都说要做自动化测试,落地却这么难!(附自动化测试的四种死法) AI 测试工具收藏了几十篇,一篇没看?我建了个学习圈子,专治这种... 别只会用 Postman 了,这 15 款接口测试工具你可能还不知道 2026年9月大模型最新排行榜,30款主流AI大模型,第一名有点意外... 公司从零开始推自动化测试,如何落地? AI 测试提效 | 别搞万能 Skill,推荐5 个 Agent Skill 串起 UI 自动化执行到报告生成全流程 阿里开源:skill-up,一款Agent Skill 评测工具! 整理了一份 DeepSeek Harness 必备插件清单! 我的免费 AI 测试开发学习路线,开源了! UI自动化测试提效必备Skill!一套CI流水线编排 Skill 可以直接抄了... AI 测试丨一句指令生成测试报告,带失败截图、操作录屏、Trace、日志,这套 Skill 思路可以直接抄... AI 测试提效丨从失败排查到自动修复,分享我的Playwright+Skill UI自动化测试失败诊断提效方案! AI 测试 | 把 UI 自动化测试执行固化成五步流程,这套 AI Skill 思路可以直接抄 智谱GLM-5.3+ZCode Agent,真实项目第一手实测! 从 0 到 1,DeepSeek Harness 保姆级安装与使用教程! 一个测试负责人的崩溃:该做的都做了,线上还是炸了 Agent质量怎么评? 想做测试工具却不会写代码?怎么办? 用AI做自动化测试,哪些是真不行,哪些是你不会用? 天天用 Claude Code/Codex,你知道它实际发给模型什么吗?被这开源工具扒光了... 推荐一款开源 Skill:让 AI Agent 给你做一份"能改"的 PPT,支持 上千套模板! AI 测试提效 | UI 自动化测不出样式 bug?分享 ui-visual-assert + Skill 视觉断言与多浏览器适配方案 公司不给你配 AI,你会自己掏钱吗? AI 测试提效 | 脚本能跑但总挂?分享我的 ui-testscript-enhancer + Skill UI 自动化健壮性增强方案 AI 测试提效 | 告别手工写脚本,分享我的 Playwright + Skill 批量生成 UI 自动化脚本方案
为什么团队用了 AI 之后,测试质量反而下降了!
狂师 · 2026-09-02 · via 博客园 - 狂师

一、AI 提效之后,往往先崩的是质量

前两天刷到一篇同行的复盘。

「AI 提效半年后,我们的测试团队规模反而更大了」

用AI 提效半年,人数不降,反而变更多了?

这位老哥是认真做过团队实践的,观察写得很扎实。提测质量肉眼可见地下滑,需求做漏了,单位时间里测试捞出来的 bug 反而变多,最后测试团队加了 23% 的人,还是喊不够用。

然后我去自己的微信或和星球群里翻了翻聊天记录,发现类似的吐槽就没停过。

有个同学说,以前开发提测,至少自己心里有数,现在提上来的代码,开发自己都讲不清里面干了啥。

还有个说得更直白。产品经理拿 AI 写需求文档,开发拿 AI 总结需求文档,然后用 AI 把总结写成代码。

一条链路跑下来,全程无人知晓。

坦率的讲,我一点都不意外。

我做过一次公开的实测,拿一套电商项目的需求文档,让 AI 批量生成测试用例。

效率确实吓人。人工要写两天的用例,AI 几分钟出了两三百条,格式工整,字段齐全,看起来专业得不行。

然后我对其中一组 261 条用例做了质量评审。用我自研的评审 Skill,五个维度打分,七项量化指标,逐条过。

结果是什么呢。

261 条里,评审完能直接用的,只有 26.4%。

一半以上要人工改了才能用,还有两成干脆是错的。预期结果写着「页面展示正确」,提示信息是一对空引号,标题说测 A 功能,步骤里跑的却是 B。

你想想看,最气人的地方在哪。

AI 生成的东西,长了一张「好像都对」的脸。

这也是为什么我后来专门造了两个 Skill。一个 review-testcase,专门审 AI 生成的用例,一个 api-testscript-optimizer,专门给 AI 生成的脚本做体检。

经常有同学问我,AI 都能生成用例了,你为什么还要做质检工具。

现在你有答案了。因为裸奔的 AI 产出,真的会出事。

把这件事想透,其实就一句话。

AI 把「生成」的成本打到了接近零,但「验证」的成本,一分钱没降。

以前一个开发一天写 500 行代码,他自己至少读过每一行。现在 AI 一天给他 5000 行,他还是一个人,还是那双眼睛。

产量翻了十倍,质检员没变。

生产线提速了,质检工序还在用手搓。

更麻烦的是,AI 的错误和人的错误不是一个物种。人会犯懒,会漏写边界,这些毛病测试摸得很熟,闭着眼都知道往哪捞。AI 的错误是幻觉,是自信满满地编一个不存在的接口字段,是用一本正经的语气写错业务逻辑。

人的错误会心虚,AI 的错误永远理直气壮。

这才是最消耗测试的。

二、锅不在 AI,在用法和业务

写到这里,你可能以为我接下来要批判 AI 了。

还真不是。我得给它说句公道话。

质量下降这个锅,归根到底,并不是AI的错,更不是AI 能力不行,你想想我们是怎么用它的。

质量下降,我认真扒了一遍,核心就两个原因。一个是用法,一个是业务。

先说用法

同一个 AI,在不同人手里,是两件完全不同的东西。

会用的同学,把需求拆成小块一点点喂,把团队的历史坑、业务规则、边界条件全部交代清楚,出来的东西自己先过一遍,改完再验。AI 在他手里是个越用越顺手,业务上下文喂得越多,产出越来越贴合实际。

不会用的同学,需求文档原封不动整个丢进去,出来什么用什么。AI 的产出在他那里没有草稿这个概念,直接是成品。他甚至没意识到,AI 是在拿通用知识猜他的业务,猜中是运气,猜错是日常,而且猜错的部分,长得特别像对的。

再说业务

业务这块,AI 的表现是分裂的。

增删改查、表单流程、标准后台这类活,套路固定,模式成熟,AI 交付的质量确实能打。很多团队用 AI 用得风生水起,基本都赢在这类场景,他们的「AI 真香」,是真的。

但业务一复杂,特别是诸如管理后台这类,光开关就有几百个,金融计费、库存扣减、订单状态流转,还有十年老系统里那些没写在任何文档里的隐藏规则,这些知识根本不在 AI 的脑子里,在老员工的脑子里。人拿到一条用例能脑补出背后的门道,但AI 看不懂就是真看不懂。

所以你看,同一个 AI,有人用出五倍提效,有人用出一堆线上事故。差别从来不在工具,在用法,在把它塞进了什么业务。

说到底,提效省下来的时间,本来就有一大块该花在验证上,只是被我们顺手也省掉了。

省掉的那部分,迟早变成 bug 连本带利地还回来。

其实测试人自己身上,就挂着一面镜子。

十几年前自动化测试刚铺开的时候,一模一样的事情发生过一遍。一批团队火速把手工用例翻译成脚本,点了运行,绿灯,收工,感觉质量从此有保障了。

后来呢。脚本三天两头挂,挂了就重跑,维护不过来就放着烂,最后自动化变成一堆没人敢信的遗产。

整个行业用好几年才把这件事整明白。自动化测试,自动化的是执行,思考从来没有被自动化过。

现在AI时代,只是同一部电影,换了一批演员,重新上映。

所以聊到这里,我反倒觉得这事对测试人来说,听着不像坏消息。

生成越便宜,验证越值钱。AI 把代码和用例的产量打上去之后,整个团队最稀缺的,恰恰是那个能拍板说「这玩意到底对不对」的人。

三、给用 AI 提效的测试同学,几条实在建议

如果你正在被 AI 提测的质量折磨,下面这些是我自己每天在用的。不止用例生成,从上下文喂法到使用技巧,一次讲完。

1、把 AI 当新人带,上下文喂到位

别整篇需求一把梭。拆成小块,一次让它干一件事。团队的业务规则、历史坑点、字段约束、上线红线,这些「老员工默认知道」的东西,AI 一概不知道,你得白纸黑字喂给它。

喂得越多,它猜得越少。这是所有技巧里投入产出比最高的一条。

2、把AI 的产出当作是草稿,用不用决策留给人

哪怕它一次做对了九成,最后一成也得你亲手过。不是不信它,是过这最后一成的成本,本来就是你的岗位价值所在。

3、产出进流程前,必须过一道质检

用例也好脚本也好,这个环节不能省,谁劝都不好使。质检本身也要标准化,别靠手感 review,用维度,用指标,用 checklist,让每一次验收都有据可查。

4、让 AI 去干它真正擅长的活

用例生成只是入门。解读十年老系统、梳理没人看得懂的祖传代码、批量造测试数据、归因失败日志、把散落在聊天记录和口头交接里的业务规则整理成文档,这些活 AI 又快又稳。

这里有个进阶玩法。先让 AI 把老系统里的隐性知识挖出来整理好,再把这些上下文喂回去生成用例,质量和你硬丢一份需求文档过去,完全不是一个档次。

5、把 AI 犯过的每一个错,沉淀成回归用例

它编过一个不存在的字段,下次就拿这个考它。它的错题本越厚,它在你这个业务上就越老实。

6、复杂业务留一手,简单业务放手跑

增删改查这类标准场景,放心交给 AI,你抽查就行。计费、扣减、状态流转这类高风险路径,AI 出初稿,关键分支必须人肉再走一遍。

知道哪里能放手,比任何使用技巧都值钱。

AI 负责快,你负责对。

这两件事凑在一起,才有可能真正提效。