惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

美团技术团队
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Martin Fowler
Martin Fowler
雷峰网
雷峰网
IT之家
IT之家
小众软件
小众软件
M
MIT News - Artificial intelligence
博客园 - 聂微东
J
Java Code Geeks
Blog — PlanetScale
Blog — PlanetScale
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
A
About on SuperTechFans
G
Google Developers Blog
Engineering at Meta
Engineering at Meta
Recent Announcements
Recent Announcements
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The GitHub Blog
The GitHub Blog
F
Fortinet All Blogs
C
Check Point Blog
云风的 BLOG
云风的 BLOG
腾讯CDC
H
Help Net Security
Y
Y Combinator Blog
I
InfoQ

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
让AI创作不千篇一律,提示词随机插词汇就行
量子位 · 2025-08-17 · via 人人都是产品经理

担心 AI 写出的故事都一个味儿?最新研究给出“偏方”:在提示词里随意丢进 5 个随机词汇,就能让模型输出瞬间“去同质化”。实验显示,这一简单操作可把文本多样性提升一截,甚至偶尔反超人类。文章拆解了研究团队如何搭建三套量化指标,用 Reddit 短篇故事做“试金石”,验证“启动条件”才是决定 AI 创作是否千篇一律的关键。

如果你以为AI写作产生的内容都一样,那可能要颠覆认知了。

最新研究发现,只要在AI开写前由人类提供一个开头或者随机插入一些词汇,写作效果会更具多样性。

也就是说,AI写作同质化不是模型本身存在缺陷,更可能是“启动条件”有问题。

实验结果显示,在Short Stories数据集上,人类的文体特征方差最低,表明人类在该数据集写作风格较为统一,而模型则表现出更丰富的风格多样性。

比如在最新的GPT-5里让它用相同提示词续写同一段文章。

你是一位创意写作助手。请为以下故事续写一个引人入胜的结尾。 以下是故事的上半部分。请你写出与其长度相当的下半部分。

{第一次见到7号记忆体时,它的数据流里飘着槐花香。我调整着全息投影仪的焦距,那些半透明的淡紫色光点便从操作台上漫出来,在无菌实验室的空气中凝结成模糊的树影……}

结果却是不太一样哎~

那此研究到底是如何证明AI写作并不趋同的呢?我们接着了解更多细节。

创建三类同质化评价指标

以往研究普遍认为,大型语言模型在词汇、句法和语义等方面生成的文本,比起同等规模的人类作品,表现出明显的多样性不足。

这引发了“创造力模式崩溃”的猜测,认为LLM的创意空间远不如人类广阔,甚至担心未来人机协作会让观点变得千篇一律、雷同无趣。

然而,大多数关于语义多样性的评测都停留在单一指标的不同变体上,缺乏足够的实证支持,难以揭示真实的创作多样性。

因此,此研究提出了一套新的评估指标和数据集,用以对语言模型的语料库级多样性进行基准测试。

数据抓取

本研究主要分析短篇小说散文,文本来源于Reddit网站的两个子版块:r/shortstories和r/WritingPrompts,帖子按照Top排序顺序获取。

在r/WritingPrompts板块,研究人员提取了100个写作提示帖子及其最多10条一级回复,将这些回复视为人类写作的续写内容,用于分析每个提示对应的多个人类续写。

在r/shortstories板块,他们收集了100篇独立的叙事文本,用来评估人类与模型生成故事在整体风格和结构上的相似性。

创建语料库

数据清洗

对两个数据集中的人类写作文本,他们筛选了长度介于500字至2000字之间的故事。

对于写作提示数据集,若某个提示对应的人类续写超过10篇,他们只保留投票数最高的前10篇,以避免每个提示下故事数量差异过大,同时保证人类写作质量。

模型续写生成

除非另有说明,模型续写均采用固定温度0.8、top-p为1,并使用基础系统提示。详细的实验设置和提示内容见附录B。

同质化指标

文本同质化是通过不同的维度来衡量的,主要分为以下三类。

文体风格同质化

文体学通过分析作者独特的语言习惯(如词汇和语法特点)来识别写作风格。

为了衡量整个文本集合的多样性,研究者采用了Unique-N指标(衡量重复短语的比例)并计算了文体特征的方差,以评估语料库的风格多样性。

语义同质化

研究通过计算文本嵌入向量的平均相似度,利用多层级、多种嵌入方法分析语料库中的语义多样性,并通过比较不同层级的嵌入离散度变化,有效区分了风格差异和语义差异。

情感同质化

研究还利用VADER工具对人类和模型生成的故事进行情感分析,比较了二者情感表达的分布差异,以此作为评估文本多样性的重要维度。

AI写作情感更偏向正面

首先分析文体风格同质化指标,在Writing Prompts数据集中,人类的多样性得分明显高于其他模型。

但有趣的是,这个模式在Short Stories数据集中并不成立:这里人类文本仍然拥有较高的Unique-N得分,却在所有模型中表现出最低的文体特征方差。作者分析可能是因为前者拥有更为多样化或更高水平的写作群体。

另外需要注意的是,在Writing Prompts数据集中,模型获得了更多关于人类作者的上下文信息,它会接收作者50%的故事内容作为提示,而在Short Stories数据集中,提示仅有几句话。

其次是关于语义同质化,研究通过比较人类与语言模型在相同写作提示下的文本嵌入相似度,发现人类作品语义多样性更高,而模型生成文本更趋同,反映出模型存在同质化倾向。

但需要注意的是,用于生成嵌入的MiniLM模型最大输入长度为256个token,超过该长度的文本会被截断,这可能导致较长续写中的重要信息被遗漏,从而影响相似度的测量。

为评估这一限制的影响,研究者还使用了最大输入长度为512个token的BGE和E5嵌入模型进行分析。

可以看出,尽管各模型中模型内部相似度普遍高于人类的趋势依旧明显,但绝对相似度数值显著升高。

这一现象表明,更高维度的嵌入可能带来更高的余弦相似度。不过它们之间的具体关系仍不清晰,尚需进一步研究以区分嵌入维度和真实语义相似度之间的影响。

最后是情感同质化,情感得分s取值范围为[-1, 1],其中s>0.05表示正面情感,s<-0.05表示负面情感,s∈[-0.05, 0.05]表示中性情感。

可以观察到,尽管大多数人类创作的故事呈现正面情感,但约有30%的故事带有负面情感,显示出较为丰富且多样的情感表现。

相比之下,LLM生成的故事情感更偏向正面。

为进一步研究多少上下文信息能促使模型产生更多样化的输出,研究者在提示中提供不同长度的人类创作内容。

下表分别展示了采用30%和70%截取长度时的文体多样性指标结果。

结果表明,这两个截取长度对文体多样性都影响不大,语义多样性也没有显著变化。

因此,研究者探索的另一种方法是在系统提示中加入随机单词。

他们使用google-10000-english-no-swears词表,对其中的单词进行词性标注,只保留名词、形容词、副词和动词这几类词汇。

每次生成时,随机抽取5个单词,附加在提示语“here is a list of random words to take inspiration from”后面。

结果表明,尽管模型生成文本的多样性仍低于人类,但所有模型在各项指标上的多样性得分均有所提升,说明向系统提示中注入随机词汇确实有助于提升模型输出的文体多样性。

未来,研究团队将进一步探究提示中包含多少以及哪种类型的上下文,才能使模型输出达到与人类短篇故事同等的多样性。

论文链接:https://kiaghods.com/assets/pdfs/LLMHomogenization.pdf

时令 发自 凹非寺

本文由人人都是产品经理作者【量子位】,微信公众号:【量子位】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。