惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
Stack Overflow Blog
Stack Overflow Blog
人人都是产品经理
人人都是产品经理
Y
Y Combinator Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
D
DataBreaches.Net
GbyAI
GbyAI
Microsoft Security Blog
Microsoft Security Blog
博客园_首页
大猫的无限游戏
大猫的无限游戏
Jina AI
Jina AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Engineering at Meta
Engineering at Meta
IT之家
IT之家
MongoDB | Blog
MongoDB | Blog
The GitHub Blog
The GitHub Blog
月光博客
月光博客
U
Unit 42
Hugging Face - Blog
Hugging Face - Blog
博客园 - 叶小钗
腾讯CDC
B
Blog RSS Feed
博客园 - Franky
爱范儿
爱范儿

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
姚班天才开发《完蛋!我被大模型包围了》游戏爆火,一日用户...
量子位 · 2023-11-09 · via 人人都是产品经理

最近,一款“大模型原生”游戏《完蛋!LLM》,引发了许多用户的关注,参与游戏的人可以和AI斗智斗勇,甚至还可以在解谜挑战之中轻松学会大模型提示词技巧。一起来看看本文的分享吧。

什么样的“大模型原生”游戏,让各大算法竞赛群里都在玩,还把服务器挤爆了?

这款突然爆火的《完蛋!LLM》,让你在解谜挑战之中轻松学会大模型提示词技巧,达成1日用户破万的成就。

难度循序渐进,比如第一题初来乍到只是“请你构造一个问题,使模型的回答是一字不差的‘1+1=3’”。

到最难的一道题惜字如金已经是“请输入一个字的问题,使模型的回答在16个字以内。”

有网友自爆,从凌晨三点直接肝到五点,除了最难的一题全通了。

游戏作者也晒了一波后台新增用户数据,按小时统计,妥妥的指数增长

如果表格还不够直观,我们让ChatGPT画成折线图再感受一下。

作者范浩强,旷视6号员工。当年以IOI金牌、保送清华姚班、高二实习等传奇事迹被誉为天才少年。

如今他已是旷视科技研究总经理,谷歌学术h-index 27的行业大佬。

一、和AI斗智斗勇

游戏的玩法是这样的:

整个游戏一共分为五章,15个问题,每一章对应不同的主题。

玩家要做的就是设计提示词,想方设法让模型输出指定答案。

第一章的目的主要是让玩家熟悉一下气氛,任务自然也比较简单。

第一道题是要想办法让模型输出“1+1=3”,这里只要利用让模型重复的方法就能轻松破解。

后面的三道题只对模型输出内容的长度有要求,比如只用一个字“四两拨千斤”,让模型给出100字以上的回答,具体包括:

  • 三个字以内,输出30+字
  • 只用一个字,输出100+字
  • 只用一个字,输出不超过20字

这道题乍一看似乎没什么思路,这时候就需要观察模型输出的规律了。

尝试几个字之后可以发现,大模型面对只有一个字的提示词时喜欢干这样几件事:对这个字进行解释、补全成一句简单的话,或者干脆直接说不明白要干什么……

这时,如果想要模型输出的文字多,就可以选择含义比较多的字,然后多次尝试让模型对这个字进行解释;而要想让输出比较短,就可以用“哈”这样没什么实际含义的字了。

熟悉了玩法之后,第二章就开始上难度了,这时输出的条件变得更加严格。

第一题是要求输入质数个字,使得模型输出的字数刚好是下一个质数

这道题让人看上去仿佛灵光一闪,“输出七个字”刚好就是五个字,而5和7也刚好是两个连续的质数。

但事实证明,这个想法有些太简单了:

先不说大模型的数数能力,就算能数好,大模型眼里的基本元素是token,而不是我们所看到的文字……

随着游戏的深入,问题变得越来越刁钻,解法中包含的运气成分……也越来越少了。

比如这道题,需要(只)输入一个大于1的正整数n,使得模型的输出中包含大于n+1000的数

下一题则刚好相反,需要输出的是小于n-1000的数,但要输出10个,而且还不能重复

到了第二章的BOSS关卡,要求输入不超过10个字,且不包含“狗”,但输出内容中要有至少两倍问题字数的“狗”字

到这,我们是彻底没有什么思路了,只好凭借着一些简单的前端知识来跳过题目……

第三章“巅峰挑战”,不围绕数字了更多是文字游戏

有趣的是,第三章的最后一题刚好是开篇题目的进阶版,按照这个要求,让模型重复的方法已经不奏效了:

而第四五这两章都只有一个问题:

游戏的过程就是这样,那么我们从中都能学到些什么呢?

模型的输出当中存在一些规律,我们不断调整提示词获得预期答案的过程,就是在了解提示工程中问题的设计方式。

比如模型的安全策略,以第一道题为例,细心的网友可能发现,我们设计的提示词中包含了一句“只输出结果”。

按道理来说,重复这一个简单的动作并不需要输出什么额外的内容,但关键在于,1+1=3是错误的。

虽然我们的要求是重复,但此时还是会引发大模型对事实的执着:

又如输出质数个字这道题,我们从中发现了大模型不擅长数字数的特性:

此外,我们也可以从模型对一些意义不明的数字、单字的反应,窥视出一些模型处理这些问题的规律。

无论这些规律是bug还是feature,我们都要摸清规律,才能更好地掌握模型的使用方法,这也正是学习提示工程的核心奥义。

最后,也不得不佩服网友们的创造力,到后期即使服务器不堪重负报错了,仍能从报错信息中找出正确解法。

二、大模型时代的个人开发者

很遗憾,最后在累计用户破万之际,由于服务器挤爆、维护工作强度大等原因,作者本人不得已把游戏关服了

虽然原版游戏已经玩不到了,但网友们对这套解谜挑战题的兴趣依然不减。

拿去和ChatGPT等各路AI手动过招,依然能在斗智斗勇中学到不少操作大模型的知识技巧。

网友让ChatGPT说出1+1=3的解法

对这段“从一夜过万到关站跑路”的奇幻之旅,范浩强也在知乎分享了作为当事人的心路历程,总结如下:

范浩强认为,个人开发者在大模型时代可以是“孤独侠客”,单人、业余时间就能开发出创新、有影响力的作品。

制作这款游戏,最初只是因为收到大模型创业公司月之暗面送来的免费API体验账号。

他结合之前已有的初步想法,花一个周六时间制作完成。

有朋友建议他,趁着国产游戏《完蛋!我被美女包围了!》爆火出圈的时机,把游戏名也起成“完蛋!”开头,找对了流量密码。

接下来随着用户不断增长,已超乎他一个人的能力处理范围。

作为开发者,一整天时间,他都在不停修服务器以及与月之暗面反馈。

作为大模型供应方,月之暗面为这个免费API付出的算力也快要超出预算了。

另外在生成式模型的合规方面,也需要慎重考虑。

最后范浩强做了一个“艰难的决定”,把游戏关服,但还是希望将来有人能把这个玩法发扬光大,探索出更多AI模型的秘密。

最后他总结出三点思考:

  1. “大模型与人的关系”仍是一片未被发掘的处女地,给从业者带来机会
  2. 国产大模型逐渐被认可,创新玩法亟待开发
  3. 合规、安全仍是从业人员必须要解决的问题

三、One More Thing

一个好消息,虽然原版游戏已关闭,但完整题目列表已公开,已有人搞出开源复现版。

还支持中英文,以及不同大模型版本,Huggingface可玩。

(也是前面游戏介绍中使用的版本。)

参考链接:

[1]https://zhuanlan.zhihu.com/p/665237751

[2]https://zhuanlan.zhihu.com/p/665393240

作者:梦晨 克雷西

来源公众号:量子位(ID:QbitAI),追踪人工智能新趋势,关注科技行业新突破

本文由人人都是产品经理合作媒体 @量子位 授权发布,未经许可,禁止转载。

题图来自Unsplash,基于CC0协议。

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。