惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
S
SegmentFault 最新的问题
Engineering at Meta
Engineering at Meta
量子位
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
Google DeepMind News
Google DeepMind News
博客园_首页
云风的 BLOG
云风的 BLOG
月光博客
月光博客
I
InfoQ
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Vercel News
Vercel News
美团技术团队
Microsoft Security Blog
Microsoft Security Blog
P
Proofpoint News Feed
D
Docker
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
博客园 - 叶小钗
Martin Fowler
Martin Fowler
雷峰网
雷峰网
酷 壳 – CoolShell
酷 壳 – CoolShell
J
Java Code Geeks
Microsoft Azure Blog
Microsoft Azure Blog

News Hacker | 极客洞察

Rockstar GTA 6 团队组工会:薪酬透明、灵活工时、反 crunch 古罗马公寓:日常、城市规划与沉浸式体验 AI时代的专家价值:验证、经验与大学角色 Chad Whitacre 退 tech 转离线:Home Depot、印刷杂志、东正教社区 本地 Git remote:共享、隔离与 GitHub 误解 AI只该做琐事,别替代人情与创作 AISlop:检测 AI 生成代码坏味道的多语言 CLI 英国低价值采购系统:每月零申报的官僚负担 郁金香狂热:泡沫神话与理性争议 用 LLM 写代码,也要让人比模型更累 AI会重演前端“失去的十年”吗? AI 编程提产却压缩思考,工程质量与协作承压 Cloudflare 多 agent AI 代码评审引发成本与流程争议 500K AI电影“戛纳首映”被质疑只是公关噱头 8×H200跑2B模型到3k tok/s,“标准GPU”标题引争议 防水夹克演化:材料回潮、帽兜变迁与AI争议 意大利人与荷兰人教学时共享手势本能 Claude Code 隐藏配置考古:文档滞后、版本易碎与自动执行争议 大众汽车用 client assertion 阻断 Home Assistant 接入 Zot 支持 Claude Opus 4.8,评论聚焦 Claude Code 计费与 harness 神秘 Hy3 LLM 在 OpenRouter 霸榜:便宜、刷量与隐私争议 佛州 Blue Origin New Glenn 静态点火爆炸,堪比 N1 联网汽车监控升级:数据售卖、监管失灵与断网自保 Blue Origin New Glenn静态点火爆炸,发射台损毁恐延一年 住宅建造为何难规模化:地段、法规、偏好与收入 十种基础云:观云分类、光学现象与云计算误会 据称被 Shopify 收购后,Garnix 关停并开源 Bot Company疑借Airbnb私测家务机器人,致房屋受损 Coalton:Common Lisp 上的静态类型 Lisp,讨论集中在上手与类型建模 ktx:面向 data agents 的开源可执行上下文层,自动生成语义层与业务 wiki
LLM 把“It’s not just X. It’s Y”写成 AI 味,em dash 也被误伤
2026-06-01 · via News Hacker | 极客洞察

🤨LLM 把“It’s not just X. It’s Y”写成 AI 味,em dash 也被误伤

🎯 讨论背景

这篇帖子围绕一篇把 “It’s not just X. It’s Y” 视为 AI 文风信号的文章展开,评论区把问题扩展到 em dash、固定句式和 README 模板化写法。很多人默认讨论的是 LLM(大语言模型)在后训练阶段会把高频句型放大,尤其是 SFT(监督微调)和 RLVR(基于可验证奖励的强化学习)可能让输出更像模板。也有人强调这些表达本来就属于正常英语,真正的问题是模型过度复用后让它们在“人类文本”里也显得可疑。另一些评论把焦点放在写作习惯上:为了避开 AI 误判,人类可能开始回避本来没问题的标点和句式,甚至通过先用 English 推理再翻译来减少这些痕迹。

📌 讨论焦点

AI 味还是正常英语

有人把这类固定句式看成 AI 文本的“水印”,认为只要能让人类少写这些套路,就值得付出代价。也有人强烈反对,指出 “align with”、em dash 以及 “It’s not just X. It’s Y” 本来就是合法且常见的英语结构,并不因 LLM 过度使用就失去正当性。还有人直接说,模型爱用不代表文章说法就是神谕,最多只能说明它们把普通语言放大成了可疑信号。更现实的一点是,过度依赖这些特征会逼着写作者自我审查,甚至连非英语母语者也会通过先用 English 推理再翻译来规避痕迹。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11]

训练后处理把模型推向模板化

讨论把这种句式的高频出现,部分归因于 LLM 的后训练阶段。有人猜测 RLVR 可能会提升“not X, but Y”这类结构的比例,也有人认为更像是 SFT 把模型训练成了 mad-libs 式模板机。另有评论回顾早期 reasoning 风格,模型会直接吐出 “Wait...”“Hmm...” 之类填充词,像是在 token stream 里拼装思考过程。更进一步的解释是 mode collapse 和 synthetic data 形成反馈回路,让少数高频句式越滚越大。

[来源1] [来源2] [来源3] [来源4] [来源5]

README 和代码文档的固定套路

在 code base 和 README 里,评论者列出另一批常见套路,比如 “No X, No Y, No Z.”、 “Here is X - it makes Y” 以及滥用 emoji 勾叉。有人拿自己在 LLM 时代之前写的 README 反证:这些结构并非 AI 独有,em dash 也只是人类长期使用的标点之一。争议点在于,punctuation 到底只是一个 signal,还是足以说明文本来自机器;不少人认为它最多是线索,不是保证。还有人提到,某些 bot 会刻意把 em dash 换成 hyphen 来躲避检测,说明“像不像 AI”已经变成一种可被反向操作的外观游戏。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6] [来源7] [来源8] [来源9] [来源10] [来源11]

反讽式复读标题

不少回复故意沿用同一套 “It’s not just X. It’s Y” 句型来玩梗。有人连发 “smoking gun”“full picture”“key takeaways” 之类表述,把文章里反感的套路直接演给大家看。还有人把句式继续扩写成“not just an unlock. It's a major discovery.”,明显是在嘲讽这种修辞过于自我膨胀。整体上,这种反讽说明大家不是只在讨论 AI 文风,而是在拿这篇文章本身做一次语言学式的拆台。

[来源1] [来源2] [来源3] [来源4] [来源5] [来源6]

📚 术语解释

RLVR: reinforcement learning via verifiable rewards,一种基于可验证结果进行强化学习的后训练方法。

SFT: supervised fine-tuning,监督微调,用标注数据把模型进一步推向特定输出风格。

mode collapse: 模式坍缩,指模型输出多样性下降,反复产出少数高概率模板。

synthetic data: 合成数据,指模型生成后再拿来训练的数据,可能让某些句式自我强化。

AI tell: 能让文本看起来像机器生成的线索或破绽。