惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
D
DataBreaches.Net
F
Fortinet All Blogs
阮一峰的网络日志
阮一峰的网络日志
博客园_首页
Apple Machine Learning Research
Apple Machine Learning Research
H
Help Net Security
M
MIT News - Artificial intelligence
美团技术团队
人人都是产品经理
人人都是产品经理
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
The Cloudflare Blog
有赞技术团队
有赞技术团队
L
LangChain Blog
博客园 - Franky
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 【当耐特】
S
SegmentFault 最新的问题
V
Visual Studio Blog
Blog — PlanetScale
Blog — PlanetScale
Hugging Face - Blog
Hugging Face - Blog
B
Blog
I
InfoQ

thinkingReed

ColPali:使用视觉语言模型的高效文档检索 VisionThink:通过强化学习实现高效的视觉语言模型 ChartMoE:使用混合专家架构的图表理解方法 基于标记级相关性引导的压缩方法以实现高效的多模态文档理解 PACT:基于剪枝和聚类的Token减少方法 DocLayLLM:一种用于富含文本的文档理解的高效多模态大语言模型扩展方法 mPLUG-DocOwl 2:高分辨率文档理解的布局感知压缩方法 mPLUG-DocOwl 1.5 研究报告:模型架构与位置编码机制 mPLUG-DocOwl:面向无OCR文档理解的统一结构学习 QG-VTC:基于问题引导的视觉Token压缩方法 MinerU 技术报告:高精度文档内容提取解决方案 StrucTexT:多模态Transformer的结构化文本理解框架 TabPedia:统一的表格理解视觉语言模型 Pix2Struct:截图解析作为视觉语言理解预训练方法 TextMonkey:用于文档理解的无OCR大型多模态模型 Swin Transformer:分层视觉Transformer Vision Transformer:将Transformer应用于图像分类任务 领域特定的大语言模型用于通过有标签数据监督微调的暖通空调系统故障诊断 将知识从大模型迁移到小型下游模型
DocPedia:频域方法实现高分辨率文档理解
2025-04-15 · via thinkingReed
中国科学技术大学 :一种无OCR的文档理解方法 大型多模态模型:DocPedia,用于多功能的无OCR图像处理,解析分辨率高达2560×2560的图像 在频域空间处理:直接在频域而非像素空间处理视觉输入,能够使用有限数量的