



















本文总字数约9000字,结构如下,你可以根据需求跳转阅读:
叠个甲先:❗❗❗本文无任何利益相关,均从个人工作场景需求出发,从个人体验的视角给予评价!仅供参考!
作为一个外行,AI(下文AI特指大语言模型)的革命性的确让我震惊。看到国内外大模型竞相涌现、持续激烈竞争,但互动形式却始终围绕着「对话」窗口这种形式,除了少数文字工作者,大部分人们对于AI总是用之即弃。这也让我思考,除了文字,AI还能做些什么?
作为一个数字劳动者、文字工作者,我每天打交道最多的信息形式,就是文字了。从输入的视角看,如果按照每分钟能够接收的信息量来评判信息密度,文本的信息密度无疑是最高的,还可以通过细读、泛读、略读等方式实现自我调整,输入效率整体最高。从输出的视角看,如果按照修改原信息的难易程度来评判信息处理效率,文字的信息处理效率无疑也是最高的,而想要处理一个音频或图片中的信息,则需要经过专业软件,还需要专业能力的支持,这对普通用户来说显然并非易事。因此,大部分普通用户往往选择最普通的方式——人工转换,就是把音频边听边记或手动把图片中的文字打出来,我那个年过五旬的老师就是这样干的(😂)。
| 数据形态 | 定义 | 应用场景示例 | 信息密度 | 信息处理效率 |
|---|---|---|---|---|
| 文本 | 以字符编码表示的信息,包括文字、符号、数字等。 | 新闻文章、书籍、代码、电子邮件、社交媒体帖子 | 高(200-500不等)较 | 较高 |
| 音频 | 以波形数据表示的声音信息。 | 音乐、语音、音效、播客低 | 低(100-300字) | 低 |
| 图像 | 以像素点阵或矢量图形表示的视觉信息。 | 照片、插图、图表、扫描文档 | 一般情况下较低 | 中 |
| 视频 | 结合图像和音频的动态视觉和听觉信息。 | 电影、电视节目、在线课程、视频会议 | 一般情况下较低 | 低 |
回顾上文案例:输入一张图片,判断人流量大小,输出决策信息——AI就是这样提高了生产效率。而背后的核心能力,就是通过将图片信息精确转化为文本信息,即多模态能力。我隐隐感觉,多模态能力仿佛才是AI的大招,但现在好像被大多数普通用户忽视了。
在我近期的工作中,有大量需要从纯图片PDF中识别文字的工作,当我无数次点击鼠标敲击键盘,使用传统OCR工具进行这项枯燥无味的工作时,一个想法冒了出来:为啥不试试AI大模型呢?在这一需求的驱动下,这篇文章就此诞生。
近年来,从我个人的体验和感受出发, OCR好像凭借“火箭般”的速度迅速普及,几乎成了我们生活中“随处可用”的存在。无论是扫描文件、识别快递单号、识别车牌,还是在日常翻译、识别票据中,OCR工具的存在为我们提供了极大的便利。深度学习技术的出现和发展可能发挥了功不可没的作用。以下是我常用的一些OCR工具:
问题在于:尽管现有的OCR工具几乎满足了我学习和工作中的大部分需求,但其中仍然存在一个“致命缺陷”——格式和排版。大多数传统OCR程序在识别文本时会忽略掉换行、空格、序号、表格结构、缩进、加粗、下划线等关键信息,导致输出结果往往是纯文本或仅含少量排版信息。这种情况不仅降低了信息密度,还增加了后续处理的工作量。这一需求的存在导致了本文的诞生。
毫无疑问,传统OCR和AI多模态各有优劣,AI大模型的发展解决了许多未曾解决的问题,但并不意味着能解决好以往已经解决的问题,AI大模型并不完美(或许到AGI的时刻会变得接近完美吧)。因此,面对这两种截然不同、各有优劣的技术,作为一个工具使用者、一个用户,理性选择一定是:谁好用谁,效能第一。传统OCR能高效解决的场景,就不用AI多模态;反之亦然。最后,在AI的帮助下,我想从用户使用体验的视角出发,来看看传统OCR和AI多模态到底谁更强(更能实现效率提升)。
| 传统OCR | AI多模态大模型 | 谁赢谁输 | |
|---|---|---|---|
| 原理 | 基于预定义的字符模板和图像处理算法 | 基于深度学习模型,从多个模态数据中提取特征并融合 | / |
| 使用便利性 | 普遍易用,操作简单,已有大量效率工具 | 操作较为复杂,大都需要网页对话 | 传统 |
| 识别精度 | 较好 | 依照模型能力,一般较好 | AI |
| 复杂识别 | 对复杂场景识别效果较差 | 对复杂场景识别效果好 | AI |
| 识别范围 | 仅限于识别图像中的文字 | 可以识别图像中的文字,并理解图像内容,进行多模态信息检索 | AI |
| 功能扩展性 | 功能相对固定,扩展性有限 | 可扩展性强,可结合其他功能,例如图像生成、语音识别等 | AI |
| 速度 | 速度快 | 依赖模型生成速度,一般较慢 | 传统 |
| 费用 | 基础功能大都免费,复杂功能收费 | 暂时免费 | 平局 |
| 输出长度 | 依照图片内容而定 | 依赖于模型输出长度,可能不完整 | 传统 |
| 稳定性 | 每次输出内容基本一致 | 依赖于模型能力和模型参数 | 传统 |
| 用户体验 | 简单易用,满足基础需求 | 功能强大,但操作可能更复杂 | 传统 |
(❗❗❗以上内容纯主观,欢迎补充讨论~)
好吧,这样看的话打了个4比4,算是平局了,看样子AI对于我们用户来说也没那么强。可以看到,AI多模态模型的关键词是:复杂,但慢且不方便,现在的 AI 多模态模型就像个爱思考、爱琢磨的小助手,对待图片总是要仔细端详,然后娓娓道来,效率嘛……确实有点慢。而传统OCR的关键词是:快、方便,但只能做简单题,就像是一个不管三七二十一按固定公式走的机器人。因此,下文的评测数据也将围绕着「复杂」展开,请看。
为了评测现有AI大模型的多模态能力,我在ChatGPT老师的协助下编写了一个「OCR识别助手」的Prompt,作为所有参赛选手的初始任务要求。请注意,本次评测的重点并不在于多模态模型对图像内容的理解能力,例如物体识别的精度或场景识别的准确度等视觉识别指标。相反,我们更关注的是模型在OCR方面的表现,包括对文本内容的准确识别、文本排版结构的重构,以及各种格式特征(如字体、字号、分段等)的识别和呈现能力,我想这也是大多数文字工作者会遇到的场景和需求。Prompt如下:
请充当万能识别OCR助手,将图片中的所有文字、排版、图片内容信息完整输出,严格使用Markdown格式,100%忠实于图片内容与结构,无任何内容缺失或更改。保留所有文字、标点、空格、标题、分段、列表、引用、字体样式(如加粗、斜体、下划线)、字体大小等。数学公式使用LaTeX语法,代码按Markdown代码块格式输出,表格使用Markdown表格格式并完整呈现所有列与行。严格还原所有缩进、对齐、图标、分割线等布局。如果图片无文字信息,则简洁输出这个图片中的内容、场景、细节等信息。请严格遵循:输出的第一个字符即为图片内容,不得添加任何说明、解释、前缀、后缀内容。绝对禁止省略任何字符、符号或内容,忠实呈现原始内容和结构,不得生成主观信息,禁止生成解释或扩展性描述。不得省略任何内容,不得使用省略号代替内容。
还是在ChatGPT老师的帮助下,我将使用以下三个指标作为量分标准,分别是:
考题类型分为以下5类:
❗❗❗请注意:评测纯主观,仅是我站在用户体验的视角给出的主观判断,同时,由于模型输出并不完全绝对,此次评测仅供参考。各位可以按照自己的需求自行判断,欢迎讨论~
出题者及阅卷者:ChatGPT、我;
参赛选手:Claude(Poe-3.5 Sonnet)、Gemini(1.5 Pro 002)、Reka Chat、智谱、KIMI、通义千问、豆包、文心一言、海螺AI、零一万物、腾讯元宝。(以上均为已推出多模态大模型的厂商,除Claude、Gemini外,均采用网页端)
❗❗❗以下内容纯主观,欢迎补充讨论~
❗❗❗本文无任何利益相关,均从个人工作场景需求出发,从个人体验的视角给予评价!仅供参考!




❗❗❗请注意:以下均是个人娱乐化的主观表达,各大模型可能擅长不同方面,在此种任务表现不佳并不代表其整体能力的不足,仅供参考。
面对复杂表格识别、混合信息识别等任务,腾讯元宝不畏艰难,敢于奋斗,最后一个出场,但却拿下了完美的成绩,所有数据均识别正确,且每行每列数据均对齐,格式完美复现,已经能与Claude战得平分秋色,当属「黑马」无疑。


Kimi作为大模型界最先出圈的选手,在此次考试中,严格按照考试要求和题目内容做大,绝不乱写乱画,表现出来典型的「好学生」品格,在各方面都表现优异。比如:在第四题的作答中,Kimi是一个忠实听话的助手,完美呈现图中的文字信息,不让干的事儿坚决不干。

「Reka大模型是由Reka AI公司开发的先进多模态大型语言模型,具备强大的多模态理解和生成能力,支持多种语言,并拥有128K的上下文窗口和卓越的推理能力。它在图像识别、多语言翻译和自动内容生成等领域展现出广泛应用潜力。」第一次用的确还挺惊艳,但这次评测证明,这伙计太不听话了,而且不愧是外国血统,对中文的识别和支持简直一塌糊涂。我愿称它为已读乱回选手、摆烂大王、宕机分子、胡编乱造第一名…..(纯主观,可能该模型更擅长图像理解而非文字识别)请看:


文心一言作为国内大模型“领路人”,说是有【具备强大的语言理解和生成能力,能够处理多种语言,并在多个领域展现出应用潜力。它在多轮对话、文本生成、翻译等方面表现出色,尤其在中文处理和中国文化理解上具有明显优势。】但这次评测下来,技术实力硬不硬不知道,反正嘴挺硬,每次识别不出来就给自己找补、瞎编,是一名不懂装懂选手。奇怪的是,不给Prompt的效果反而更好,搞不明白🙂(纯主观)请看:

海螺AI:海螺AI的页面更新后,确实变得好好看!但是一考试就显原形了。每道题都不认真审题、不听话,也不认真答题,胡编乱造,用省略来偷懒。


更多有意思的完整版考试过程请看:「报告」-AI纪元大评测:OCR技术哪家强
❗❗❗本文无任何利益相关,评分均从个人工作场景需求出发,从个人体验的视角给予评价!仅供参考!
激动人心的时刻!可以看到,腾讯的元宝竟然排在了第一位,妥妥的黑马!Kimi一如既往的稳定,Claude毕竟是国外的,对中文的识别的确不及预期;通义和Gemini也基本能满足需求,排名靠前。以下还有具体报道!(分数计算是根据上述4个评价指标、4个考试类型计算得出,满分80分。)
| 🏆 排名 | 模型 | 总分 📊 | 荣誉称号🫡 |
|---|---|---|---|
| 🥇 第一名 | 腾讯元宝 | 64.5 | 最佳黑马:免费又好用 |
| 🥈 第二名 | KIMI | 60.5 | 稳如老狗:忠诚助手 |
| 🥉 第三名 | Claude | 59.5 | 不愧是最强大模型(之一) |
| 🌟 第四名 | 通义千问 | 57.5 | 综合王者(但没有很强的点) |
| 🌟 第四名 | Gemini | 57.5 | 能看出来它真的想对你好 |
| 🔹 第六名 | 豆包 | 56.5 | 有亿点自己的想法 |
| 🔸 第七名 | 智谱 | 55 | 比通义弱一点点的综合王者 |
| 📉 第八名 | 海螺AI | 43.5 | 表面看着强,实际菜还爱玩 |
| ⚠️ 第九名 | 文心一言 | 29.5 | 还是算了吧 |
| 🔻 第十名 | Reka Chat | 25 | 狗都不用 |




无论是在实际工作使用AI的过程中,还是在与传统OCR工具的比拼、在多模态能力的评测里,我都深深感到:这种网页对话形式使得AI使用便捷性大大降低,成为了AI融入生活的一大阻碍。每次调用AI多模态能力往往需要进行打开网页、输入Prompt、输入图片等等复杂操作,这极大影响了原本的工作进程,发生效率损耗。幸好,AI大模型的API接口,让提高使用便捷性的憧憬成为可能。因此,在我的一通折腾下,我的DIY -「万能识别」Quicker动作诞生了!在这个动作的加持下,AI多模态模型的使用便捷性至少能与传统OCR工具媲美了!请继续往下看。

从实际体验中我深刻感受到,AI多模态能力对于处理复杂图片信息具有革命性的优势,能够精确识别文字,并最大化地保留格式、字体样式、排版等信息,这极大提高了工作效率。但是,目前使用AI多模态能力的方式,大多是通过一系列【进入大模型官网、点击上传图片、选择文件夹图片、等待模型回复、自行复制输出结果】这种使用便捷性极差的方式,这对于一个懒人来说可以说是麻烦至极了。因此,能否像传统OCR工具一样,实现AI多模态能力无缝融入我的工作过程呢?这就是「万能识别」的诞生。
| 模型 | 优点 | 缺点 | 免费额度 |
|---|---|---|---|
| 智谱 | 速度较快、准确度高 | 单次输出长度较短(最多约1600字) | 多模态模型可领取的免费tokens大于2000万,但有效期1个月 |
| 通义千问 | 单次输出长度较长(最多约3000字),某些场景很准确,连续对话性能较好 | 容易识别错误、识别不稳定、准确性差 | 多模态模型免费赠送100万tokens,有效期6个月 |
| 混元 | 速度快、准确性高、单次输出长度较长(最多约4000字) | 模型输入较少、连续对话性能差、模型有时候不听话 | 多模态模型免费赠送100万tokens,有效期1年 |
在使用这个动作之前,我想回到上一部分的讨论中,再次强调,如果你有「复杂」场景需求(复杂表格场景、复杂结构化文字场景、混合信息场景、图片解读场景),那么这个动作会很适合你。同样,对于部分简单识别任务,AI的低效率可能会让人崩溃,更推荐传统OCR工具。
| 模型 | API Key获取网址 | 简要教程 | 免费额度查询 |
|---|---|---|---|
| 智谱 | 智谱AI开放平台 | 注册登录,进入网站后点击右上角API密钥,进入页面后创建即可获取 | 资源包管理-智谱AI开放平台 |
| 通义千问 | 阿里云百炼 | 注册登陆,右上角头像点击API-KEY,进入页面后点击【创建我的API-KEY】即可获取 | 模型免费额度 |
| 混元 | 立即接入 - 腾讯混元大模型 - 控制台 | 注册登录,进入网站后点击【使用OpenAI SDK方式接入】中的API KEY,进入页面后点击创建即可获取 | 资源包管理 - 腾讯混元大模型 - 控制台 |
文字教程请点击:「万能识别」动作教程
基本流程是:
- 未开启「继续输出」功能:点击动作—》触发截图—》截图完成后发送给AI大模型—》蹦出大模型回复预览弹窗—》Markdown结果自动复制到剪贴板;
- 开启「继续输出」功能:点击动作—》触发截图—》截图完成后发送给AI大模型—》蹦出大模型回复预览弹窗—》Markdown结果自动复制到剪贴板—》蹦出是否继续输出弹窗—》点击是—》蹦出大模型再次输出后的全部输出弹窗(自动合并),并自动复制到剪贴板。
具体演示请看视频:「万能识别」- Quicker动作教程_哔哩哔哩_bilibili
这篇文章前前后后折腾了十几二十天,从在科研工作中感受到对AI多模态的强烈需求开始,我就思考着如何让AI多模态提高工作效率。这一通折腾下来,「万能识别」这个Quicker动作已经把我的这个需求完美地满足了,在我的调试和实践中,的确感受了AI的强大能力,尤其是有些模型突然蹦出几句很有道理的话,让我为之一惊。回顾这段时间,我突然想起来之前看过的文章,Kimi的杨植麟在采访中说:
“如果能被更底层的东西解释,就不应该在上层过度雕花。有一句重要的话我很认同:如果你能用Scale解决的问题,就不要用新的算法解决。新算法最大价值是让它怎么更好的Scale。当你把自己从雕花的事中释放出来,可以看到更多。”
这是「第一性原理」的强有力证明。传统OCR工具仿佛就是在上层过度雕花的代表,而AI多模态则代表着Scale Law的强大作用。在可预见的未来,Scale Law或者说第一性原理可能成为解决很多复杂问题的可选项,过度雕花可能成为一个万不得已的备选。对我来说,作为一个用户,传统OCR并不是比AI多模态低一等的工具,他们都能实现我的需求,满足我的需要,本质上并无差别。 毋庸置疑,我们已身处AI时代,这场革命正席卷全球,深刻地改变着各行各业。然而,AI对日常生活的影响看似强大却又有限,对占世界绝大多数的普罗大众来说,它或许只是个聊天工具或者娱乐消遣的新方式。我想,只有等到AI真正普惠大众之时,才能算是「第一性原理」的最终胜利吧。
感谢阅读!希望能帮到你!如果帮到你一点点,可以点个赞点个充电评个论哦~
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。