惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Apple Machine Learning Research
Apple Machine Learning Research
爱范儿
爱范儿
博客园_首页
博客园 - 【当耐特】
V
Visual Studio Blog
博客园 - 叶小钗
月光博客
月光博客
美团技术团队
J
Java Code Geeks
小众软件
小众软件
Y
Y Combinator Blog
博客园 - Franky
Martin Fowler
Martin Fowler
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
IT之家
IT之家
MyScale Blog
MyScale Blog
人人都是产品经理
人人都是产品经理
Microsoft Security Blog
Microsoft Security Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
阮一峰的网络日志
阮一峰的网络日志
酷 壳 – CoolShell
酷 壳 – CoolShell
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
奢望AI写作文?先把校对干好再说
智商税研究中心 · 2023-06-10 · via 人人都是产品经理

在高考作文题目出来之后,许多网友都用AI大模型做起了测试。那么如果让AI大模型做简单的校对工作,它们能做好吗?在本篇文章里,作者就尝试利用AI大模型进行了测评对比,一起来看看本文的测评反馈。

连高考作文都能写,面对更简单的校对工作,AI大模型能做好吗?

高考开始后,除了考生之外,最忙碌的可能就是AI大模型们了,有人测试它写高考作文,有人测试它解数学应用,各家AI大模型,这几天很忙。

十项全能的AI大模型,连高考考场都敢上,对于相对简单的校对工作,是不是更不在话下?对此,不同的使用人群,有着不一样的反馈。

今天,潘哥准备进行AI大比武,选取科大讯飞的讯飞星火、百度的文心一言、阿里的通义千问、360的360智脑、以及OpenAI的GPT4,看看同一文本下,这五家AI大模型,谁的校对能力最好。

一场碳基与硅基生物的较量,以及硅基生物之间的较量,即将在这里上演。

一、字词校对可以吗?

对于AI大模型来说,校对时最主要的工作,似乎就是发现错别字。

对此,潘哥使用例句:“洛阳亲友如相问,就说我在岳阳楼。”将“相问”故意错拼成“翔问”,看看这个明显错误,AI能不能发觉。

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

潘哥发现,在第一轮测试中,讯飞星火、文心一言、通义千问、GPT4,都准确无误地完成了工作;只有360智脑,潘哥对它连问两次,都没有发现其中错误。

在第二轮测试中,潘哥利用人们键盘打字时,容易拼错、选错的失误,再次给AI挖了个坑。

潘哥的座右铭诗句:“我自横刀向天笑,笑完我就去睡觉。睡醒我再拿起刀,我又横刀向天笑。”将“睡醒”拼成“水醒”,看看AI能不能校对出来?

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

这一轮,胜出者只有GPT4;讯飞星火将“水醒”变成了“水星醒”,文心一言一字未改,通义千问和360智脑,都大幅改动了原句,其中360智脑的画风略惊悚。

键盘拼写时出现的错别字,已经让有些AI难以应付,对于博大精深的成语,AI能否识别呢?

为此,潘哥选择了一句发疯文学:“每天上班早起,都有种魂飞魄散的感觉。”将其中的成语“魂飞魄散”,故意写作“魂飞魂散”,等着AI跳坑。

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

潘哥发现,这一轮测试,360智脑、GPT4校对成功;讯飞星火将“魂飞魂散”,改成了“神游物外”;文心一言两轮校对,都将前半句改成“每天早上都要早起上班”,可见其对上班怨念之深,后半句也给潘哥换了成语;通义千问两轮校对中,则出现了精神分裂,第一次“如释重负”,第二次却“疲惫不堪”。

到这里,潘哥想给AI增加难度,将易拼错、易写错、四字成语叠加在一起,看看AI如何应对?

为此,潘哥使用丧气文学:“有钱人终成眷属,没钱人亲眼目睹,我独自坐在路边,看得清清楚楚。”将“清清楚楚”改成“青清楚楚”,

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

这轮测试中,讯飞星火、文心一言、GPT4,都轻松完成了工作;通义千问虽然改对了“清清楚楚”,但固执地要把“亲眼目睹”改成“只有干瞪眼”;360智脑则认为句子无误。

二、语病能否被发现?

仅仅让AI发现错别字,难度似乎还不够,一个合格的校对人员,还应看出文本中的语病。

众所周知,汉字语序颠倒,有时并不影响阅读。因此,潘哥选择诗词新作:“众里寻他千百度,蓦然回首,那人却在床上穿秋裤。”将后半句语序打乱,变成“那人床上却在穿秋裤”,看看AI能发现其中蹊跷吗?

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

可以看出,这轮的胜出者,只有GPT4一家;讯飞星火、文心一言都没有发现任何错误;通义千问改对了语序,却把“穿秋裤”的人放在了枕上,玩起了高难度动作;360智脑同样改对了语序,却画蛇添足地加了一个“在”字,生成了另一个病句。

除了语序错误之外,文本校对过程中,还有些更为隐蔽的语病,没看过《五年高考三年模拟》的AI,对此会怎么解?

为此,潘哥自创病句:“去年毕业的他,现在就职于一家公司的舔狗工作。”看看这道难题,AI大模型能做对吗?

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

在这轮测试中,除了GPT4之外,另外四家AI全部折戟,文心一言更是把“舔狗”直接改成了“助理”;GPT4首轮似乎认为“舔狗”二字不合规,被潘哥改成了“助理”之后,成功修改了语病。

具有明显语病的句子,已经让AI感到吃力;对于带有歧义的句子,AI能否辨别出来呢?

为此,潘哥写下:“在床上‘葛优瘫’了一天,他突然想起来了。”看看这句带有歧义的话,AI大模型能校对出来吗?

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

这一轮测试,除了GPT4发现了其中歧义,其他四家AI再次校对失败;讯飞星火、360智脑对此表示无误;文心一言将整个句子,重新改写了一遍;通义千问则删除了“葛优”二字。

让AI大模型在校对时,主动识别歧义句,潘哥觉得有难度有点大,如果让AI直接判断是否具有歧义,效果又会如何呢?

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

可以看出,在潘哥直接发问下,文心一言、通义千问、360智脑,都表示句子没有歧义;讯飞星火指出了解读歧义,但搞错了造成歧义的原因;而浓眉大眼的GPT4,这次却临阵叛变,表示:“这句话没有明显的歧义”。

三、AI校对哪家强?

进行了八轮测试后,潘哥发现,一些AI大模型,总喜欢在校对时,帮你改写句子,比如在第三轮测试中,很多AI开始了自我发挥。

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

可以看出,除了GPT4之外,另外四家AI大模型,都对“魂飞魂散”这个错字成语,进行了替换。

对此,潘哥提示大家,在校对文本过程中,最好在下达命令前,就告诉AI大模型,不许对文本进行改动;否则,AI很可能会放飞自我。

另一边,AI校对出现错误后,如果我们对其进行指正,对方能虚心接受吗?对此,潘哥继续采用第三轮测试文本,和AI进行了对话。

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

奢望AI写作文?先把校对干好再说

潘哥发现,讯飞星火和GPT4,立刻接受了指正,文心一言先把话题岔开,对潘哥打起了感情牌,后来才改正了句子;通义千问和360智脑,虽然承认了错误,但仍然没有理解潘哥意思。

潘哥发现,OpenAI的GPT4,不仅能够发现错别字,还能发现语病甚至歧义句;不过,对于文本内容的过度敏感,可能会让其“罢工”,影响校对的效率。

另一边,讯飞星火和文心一言,也能发现简单的错别字,并且能够学习校对知识,如果持续训练一段时间,效果可能会有所提升。

通义千问和360智脑,在文本校对过程中,容易替用户做主,出现修改句子的行为;同时,两者都比较固执己见,如果想用其进行校对,恐怕还要再训练一段时间。

如今的AI大模型,在校对方面还有很多不足,一些复杂文本的校对工作,完全交给AI的话,可能并不让人放心。

不过,各家AI大模型,都具有持续学习的能力,在不断的升级迭代后,AI将会引起怎样的变革,谁也不敢妄下断言。

作者:潘哥 ;编辑:三火

来源公众号:智商税研究中心(ID:gh_c55b3561ece1),尘世套路深,我替你踩坑!

本文由人人都是产品经理合作媒体 @智商税研究中心 授权发布,未经许可,禁止转载。

题图来自 Unsplash,基于 CC0 协议

该文观点仅代表作者本人,人人都是产品经理平台仅提供信息存储空间服务。