惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
阮一峰的网络日志
阮一峰的网络日志
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Apple Machine Learning Research
Apple Machine Learning Research
小众软件
小众软件
博客园 - 司徒正美
Last Week in AI
Last Week in AI
爱范儿
爱范儿
罗磊的独立博客
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
博客园_首页
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
The Cloudflare Blog
雷峰网
雷峰网
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
WordPress大学
WordPress大学
Jina AI
Jina AI
人人都是产品经理
人人都是产品经理
量子位
V
V2EX
博客园 - 叶小钗
宝玉的分享
宝玉的分享
T
Tailwind CSS Blog

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
97毫秒!百度 PP-OCRv6 把 OCR 带进毫秒时代
2026-06-15 · via 雷峰网

近日,百度文心正式发布新一代OCR模型PP-OCRv6,一次性推出Tiny、Small、Medium三档模型,支持 50 多种语言,覆盖浏览器端、嵌入式设备到服务器等主流场景。公开结果显示,PP-OCRv6再次刷新OCR领域评测纪录,综合性能位居全球第一。

其中,PP-OCRv6 Tiny的尺寸仅1.5MB,可直接部署于本地浏览器环境,单图预测最快仅需 97 毫秒。用户数据无需上传云端即可完成OCR处理,在保障隐私安全的同时,大幅降低部署门槛。有开发者评价,PP-OCRv6可能是全球唯一可在浏览器环境运行的高精度OCR模型,为 Agent 装上一双眼睛,能够在智能办公、教育、工业等场景提供更加轻量、高效的视觉感知能力。

在性能方面,PP-OCRv6在保持轻量化优势的同时进一步提升识别精度和推理速度,综合性能显著增强。PP-OCRv6在文本检测和文本识别任务中分别取得86.2和83.2的成绩,双双刷新此前由PP-OCRv5保持的OCR领域最佳水平,整体表现领先于Qwen3-VL-235B、GPT-5.5、Gemini-3.1-Pro等国内外主流多模态大模型,在OCR专业任务上展现出更强竞争力。



97毫秒!百度 PP-OCRv6 把 OCR 带进毫秒时代

作为文心大模型多模态能力的重要组成部分,PP-OCR系列近年来持续推进文本检测与识别技术升级,先后推出PP-OCRv1至PP-OCRv6等多个版本。目前,PP-OCR系列所在的PaddleOCR项目已支持超110种语言识别,服务覆盖全球170多个国家和地区。

凭借轻量化、高精度等特点,PP-OCR系列已被广泛集成至UmiOCR、MinerU、TurboOCR等业界OCR工具链中,并应用于文档解析、数据处理、知识库构建等场景,成为开发者和企业常用的开源OCR解决方案之一;同时,PP-OCR系列也成为各大模型团队开展数据预处理、文档解析和知识提取的重要工具,为模型训练与应用落地提供支持。在GitHub上,PaddleOCR的Star数量已突破8.22万,超过谷歌旗下开源OCR标杆产品Tesseract OCR,成为全球最受关注的开源OCR项目之一。

目前,PP-OCRv6 已上线 PaddleOCR 官网,用户可通过网页或API方式快速使用,代码和模型权重也已开源至Github 和 HuggingFace,服务广大用户下载和使用。

  • PaddleOCR官网:paddleocr.com

  • Github:github.com/PaddlePaddle/PaddleOCR

  • HuggingFace:https://huggingface.co/collections/PaddlePaddle/pp-ocrv6