













看图说话的能力人人皆有,可是如何根据图片给出机智巧妙的回答则是一个难题。我们用"一图胜千言"来强调图像在传达信息方面的强大能力,然而在网络上分享图片时,"字越少,事越大",一段简短的文字就足够快速地传达关键信息。到底如何正确地吐槽?由于文化特色,各种语言都以类似形式流传于网络社区:英文有Reddit、推特,日文集中于大喜利,中文则散落在各大社交媒体的热评,直到盘成电子包浆。为了统一概念,本文将此类欢乐向的吐槽都简称为大喜利。
来源
大喜利来源于歌舞伎中的“大切” ,原意指演出的最后一幕的最终场景,现在由于电视节目《笑点》“大喜利”环节的普及,和金发肌肉艺人El Chicken Rice(aka松本人志)『一人ごっつ』节目的影响下,大喜利逐渐演变为以针对题目给出荒诞不经的回答,或是从照片中想象出有趣的台词并作答的形式为主流。
如果想品鉴一张图的配词是否足够有趣,点赞数无疑是最好的选择,但受到时效性、文化背景等影响,无法理解图片与文字的关系也在所难免——“我觉得很尬”“这哪里好笑了”“完全get不到”。要是以“不好笑、稍微好笑、好笑”的三分制标准来评判,网上能检索到的数据基本来自The New Yorker旗下的Cartoon Caption Contest和来自bokete.jp的日式神吐槽,后者也是各大网站流传meme的常客。
出题
Cartoon Caption Contest 于1998年首次举办,自2005年开始常规连载,由时任漫画编辑 Robert Mankoff 主持。杂志每周都会发布一幅需要配字的漫画,邀请读者在网站或者Ins上提交回答,然后编辑部会从中选出三位决赛选手,最后由读者投票选出冠军。漫画大多为黑白风格,偶尔会引入彩色。每周投稿数大约在五千个。
bokete则发源于大喜利的玩法,不限于漫画这一风格,文字题、图片题、填空题都有自己的一席之地。目前投稿数已经超过一亿个。
回答
怎样才能回答出好笑的大喜利呢?以下是我观察到的一些方法论:
语句简洁
出乎意料、违背预期:非常宽泛的分类,代表作是电台里提到的笨蛋节奏的回答
夸张、荒诞、超现实
想象角色的语言:根据表情、姿势和穿着,想出合适的台词
哥们就喜欢俗的
意义不明
人物自带梗:脑洞大开、心胸开阔
综艺
除了上述一板一眼你问我答的传统交互方式,众多“大喜利+X”的节目风格被逐渐开发出来。
千原Junior的座王
由搞笑艺人千原Junior策划并主持的节目,每期节目邀请多位艺人作为玩家参与抢椅子游戏,椅子上写着“大喜利”“模仿”“歌曲配词”等主题,没有抢到椅子的艺人需要对坐上某张椅子的艺人发起挑战,根据主题进行表演,胜者可留下来继续抢椅子,直到决出最后的冠军“座王”。
滑狼
大喜利+狼人杀的巧妙结合。“滑狼”取日文中“冷场”的谐音,把狼人杀的白天环节改为大喜利+讨论,滑狼为准备好的冷场回答,所以谁的大喜利环节冷场了就容易被怀疑成滑狼而被票出去。由于玩家各自的大喜利和狼人杀水平参差不齐,经常有“狼人杀有多强,大喜利有多冷场”的环节。
佐久間宣行のNOBROCK TV
知名制作人佐久間宣行在YouTube上更新的硬核搞笑节目,不仅限于大喜利,正经电视上不让播的企划这里都有。
AI大喜利
相比于相声小品脱口秀还需要剧本,大喜利突出一个异想天开、张口就来,只要说的怪话够多,指不定哪天就被顶上热评。 日剧《重启人生》的编剧笨蛋节奏,在IPPON大奖赛中6次获得优胜;Lawrence Wood 周周参加 Cartoon Caption Contest ,8次被选为最佳回答;NOBROCK TV里发掘的前AKB成员福留光帆,赌博啃老buff叠满,尼崎不养无趣之人。
那AI能否通过学习大喜利的答题方式来模仿人类呢?我试着爬了 Cartoon Caption Contest 和 bokete的数据。Cartoon Caption Contest清点下来365张图片可用,取每张前100个回答,微调语句为“Write a funny caption”,数据在这儿。bokete由于网站推送机制,为了避免一年内的回答有点赞波动,所以取前七百万个问题,如果该问题的最高赞回答获得的星星数超过100则保留,筛选下来有384k的数据,数据在这儿。
后来按星星数降序观察每张图片的回答,大约有一半都是文字题和填空题,喂给GPT发现OCR识别效果不佳,典型的如下图。
所以本次训练基本围绕不含文字的图片来展开。先反向使用OCR粗筛一遍,如果识别出文字则不要,没识别出文字则保留,然后人工再细筛一遍。最后由于回答都是日文,而且基于日文的大模型不咋用,就全给翻译成中文,数据在这儿。中文的微调语句是“根据图片给出有趣巧妙的回答”,日文的则是“写真で一言”。只有前100k的数据是因为一半是图片题,剩下一半由于长尾分布,梗比较一般就都砍了,留下100k,但也不代表个个都好笑啊,有些梗我也闹不明白。
以下是一些训练参数:
基础模型:qwen2vl
微调方式:数据量充足,采用SFT微调
微调参数:max_length=1024(短就是好!), num_train_epochs=1, per_device_train_batch_size=1, gradient_accumulation_steps=1
训练设备:10 * 4090D
训练时长:22小时
推理效果
模型在这儿,显存实际占用40G以上,4 * 24GB以上可运行,看看实际效果。
1 / 9
图片来自第二十七届IPPON大奖赛,我觉得“车检”“你刚才说了‘小鬼’吧?”“啊,你也是来避难的吗?”这三个还不错,其他一般。
结语
随着大模型发展和输入语料的提升,各家模型的进步程度有目共睹。如果有人想继续开发,有几个方向可供参考:
增加文字问答,以弱智吧为例
增加DPO,调整为三分制的训练模式
增加中文社区的评论交互,但是搜集数据困难
搞笑没有正确答案,正经大模型的错误回答也能被拿来当meme传播,创新、简洁、有趣是大喜利不变的主题。
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。