惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Hacker News: Ask HN
Hacker News: Ask HN
H
Help Net Security
Microsoft Azure Blog
Microsoft Azure Blog
B
Blog RSS Feed
Jina AI
Jina AI
Stack Overflow Blog
Stack Overflow Blog
量子位
博客园_首页
Vercel News
Vercel News
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
Forbes - Security
Forbes - Security
IT之家
IT之家
N
News and Events Feed by Topic
S
Security Affairs
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Webroot Blog
Webroot Blog
Recorded Future
Recorded Future
L
LangChain Blog
Y
Y Combinator Blog
AI
AI
MyScale Blog
MyScale Blog
大猫的无限游戏
大猫的无限游戏
小众软件
小众软件
Know Your Adversary
Know Your Adversary
AWS News Blog
AWS News Blog
Help Net Security
Help Net Security
Cyberwarzone
Cyberwarzone
L
Lohrmann on Cybersecurity
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Google Online Security Blog
Google Online Security Blog
V2EX - 技术
V2EX - 技术
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
PCI Perspectives
PCI Perspectives
I
Intezer
T
Tenable Blog
G
Google Developers Blog
Application and Cybersecurity Blog
Application and Cybersecurity Blog
T
Troy Hunt's Blog
L
LINUX DO - 最新话题
云风的 BLOG
云风的 BLOG
C
CXSECURITY Database RSS Feed - CXSecurity.com
有赞技术团队
有赞技术团队
O
OpenAI News
P
Proofpoint News Feed
TaoSecurity Blog
TaoSecurity Blog
C
Check Point Blog
Last Week in AI
Last Week in AI
S
Schneier on Security
Simon Willison's Weblog
Simon Willison's Weblog
Blog — PlanetScale
Blog — PlanetScale

如鱼饮水

2026 年 IMO 的几何题的解答 本地部署Gemma4-26B-A4B模型 不间断空格的处理方法 一个VSCode插件:支持TikZ预览 在Neovim中支持LuaLaTeX高亮 2026年全国I卷压轴题的解答 2026年北京高联预赛的几何题的解答 垂足三角形、等角共轭点与「六点圆」 本地部署 Hy-MT2 翻译模型 Vibe Coding一个Python版本的pdf2svg 2026 年 USAMO 的几何题的解答(一) 使用天地图API进行坐标反查 使用 Vibe Coding 编写一个属于自己的 VSCode 插件 尝试使用MinerU 使用VSCode编辑Markdown的几个常用设置 在WSL上挂载U盘 在使用LuaLaTeX时控制中英文字符的间距 使用vLLM框架加速PaddleOCR-VL 关于PaddleOCR-VL和PaddleOCR对数学类书籍识别的对比 尝试使用PaddleOCR-VL 关于DeepSeek-OCR和PaddleOCR对数学类书籍识别的对比 白嫖Kaggle平台部署DeepSeek-OCR 关于联想拯救者R9000P的若干问题的解决方法 尝试使用DeepSeek-OCR 使用text-autospace为中英文混排自动添加空格 优化深色模式下的评论系统 让过长的 KaTeX 公式支持横向滚动 在深色模式下自动切换 SVG 的颜色 2025 年高联二试(B 卷)几何题的解答 2025 年高联二试(A 卷)几何题的解答 2025 年 CGMO 的几何题的解答(二)
尝试使用 DeepSeek-OCR 2
西风冷香 · 2026-02-04 · via 如鱼饮水

1月份,DeepSeek发布了DeepSeek-OCR 2,使用了新的视觉编码器。我尝试使用新的模型对小蓝本进行OCR,和之前的结果进行对比。

1. 代码

具体的识别代码见pdf2md.py,基本上和V1版本是一致的,稍微修改几个参数即可。

尝试过使用vLLM进行加速,但是没有成功。我的笔记本电脑显存有8G,但可分给vLLM的显存只有6.92G(对应的配置是gpu_memory_utilization=0.865),再高了就分配失败(即使关了独显直连也是这样)。这样加载完模型之后,还差0.38G才够KV缓存占用。无奈只能放弃了。

在下面的对比图片中,左侧是V1版本的结果,右侧是V2版本的结果。

  1. 能够正确识别多行公式并使用aligned环境。

  2. 漏图的情况大大减少,例如

  1. 对于数学公式内的相似符号、文字的识别正确率略有提升,例如

3. 退步

上面只是一些细微方面的进步,但是退步却是大面上的。

  1. 之前V1版本,对于简单的公式更倾向于识别成数学公式,而V2版本则更倾向于识别成普通的文字。例如

这点其实是V1版本的DeepSeek-OCR相较于MinerU和PaddleOCR-VL最让我满意的地方。而这个优势在V2模型中彻底丧失了。

这也带来的另外一个问题,就是有的时候识别出了数学公式,但是却没有把它放到正确的环境中,例如

这种情况在PaddleOCR-VL的识别结果中也多次出现。

  1. V2版本的DeepSeek-OCR虽然识别图像的准确率提高了很多,但是却出现了一个V1版本没有出现过的问题,就是在排版的时候,图片和图片的标题分开了,没有放到一起,例如

几乎所有的图片有这个问题。这又和PaddleOCR-VL表现一致了。

检查了一下区域检测结果,V1版本把图片的标题识别成了image_caption,而V2版本则是识别成了figure_title

又检查了一下之前PaddleOCR-VL的区域检测结果,果然也是识别成了figure_title。终于找到这个问题的原因了。

  1. V2版本还出现了一次大标题识别错误的情况:

看了一下区域监测结果:

识别区域是对的,但是不知道为什么最终的输出出了问题。这个问题之前从来没有出现过。

之前各个模型都有把大标题当成页眉忽略掉的情况(猜测这和标题下方的长实线有关),但是没有出现过只识别了一半的情况。

4. 整体评价

从最终的结果来看,DeepSeek-OCR 2的实际可用能力相较于原来的V1版本大大降低。如果选择一个版本的识别结果作为底本进行校对,我宁愿选择V1版本的识别结果。

V2版本带来的进步,第1个可以通过脚本进行批量替换解决,第2个和第3个都是只有在少数地方才能享受到的,而退步的前两种情况则是对几乎所有内容的识别都有影响。