惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The GitHub Blog
The GitHub Blog
I
InfoQ
U
Unit 42
WordPress大学
WordPress大学
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Apple Machine Learning Research
Apple Machine Learning Research
J
Java Code Geeks
月光博客
月光博客
D
Docker
Stack Overflow Blog
Stack Overflow Blog
D
DataBreaches.Net
阮一峰的网络日志
阮一峰的网络日志
Blog — PlanetScale
Blog — PlanetScale
V
Visual Studio Blog
博客园 - 聂微东
A
About on SuperTechFans
腾讯CDC
Jina AI
Jina AI
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
博客园 - 【当耐特】
罗磊的独立博客
博客园 - 三生石上(FineUI控件)
M
MIT News - Artificial intelligence

Java for You

GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u 智能体上线最难的不是提示词:Agents API开始托管运行时 - Java for You - java4u AI任务一多就堵车:问题可能不在模型速度 - Java for You - java4u AI能写无人机控制代码后,安全边界不能只守提示词 - Java for You - java4u AI代码扫描能批量开了,但它还不能替你挡住合并 - Java for You - java4u 机器人动作误差降近九成,真正该先看数据切分 - Java for You - java4u 图片一多首字就慢?用EPD拆开多模态推理三段路 - Java for You - java4u 蛋白预测快2.9倍,科学AI最难的是让整条流水线不空转 - Java for You - java4u NVIDIA把供应链专家经验训练进模型,关键不是换一个更大模型 - Java for You - java4u
票据抽取不一定要上最大模型:先看版式是否真的变化 - Java f...
蜗牛 · 2026-09-16 · via Java for You

电路微距

文档抽取最常见的浪费,是把所有票据都交给最贵、最大的视觉语言模型。9月14日一项预印本在750份留出合成支票上比较11种系统,报告经过3000份样本微调的最佳开源视觉语言模型F1超过0.98,并高于该任务中的所有零样本商业系统。它不是“开源全面胜出”的证明,却给出一个更实用的选型原则:先判断文档变化和错误代价,再选模型。

研究比较了什么

论文覆盖三种商业系统、两种推理模型、五种开源VLM(Vision-Language Model,视觉语言模型)的预训练与微调版本,以及一个OCR(Optical Character Recognition,光学字符识别)加正则表达式基线。作者同时比较质量、延迟、治理和总成本,试图把实验分数转成具体部署决策。

官方摘要称,在这批合成支票上,微调后最佳开源模型F1超过0.98;F1是精确率与召回率的调和平均。GPT-5在商业系统中F1领先,Claude Sonnet 4.5在日期字段上表现异常。这里必须强调:数据是合成支票,版式、语言、扫描噪声和供应商分布有限;一类模型在一个字段失效,也不能外推到它在所有文档任务上的能力。

mermaid diagram

先用任务形状选方案

如果表单模板固定、字段坐标稳定,OCR加规则常常更便宜、更容易解释。它的弱点是遇到新版式、手写内容或模糊扫描时规则会碎裂。VLM能同时看文字和布局,适合供应商众多、字段位置变化的单据,但输出格式、日期理解和幻觉需要约束。

微调适合样本量大、字段长期稳定、错误成本足以覆盖训练与运维的场景。论文中的3000份样本说明一个小而专的数据集可能比直接调用通用模型更有价值,但真实项目还要付标注、版本升级、GPU和监控成本。若每月只有几百张低风险文档,零样本API加人工复核可能更经济。

具体例子是报销支票。金额错一位会直接影响付款,备注字段错一个标点却影响有限。系统应按字段设阈值:日期、金额、收款人采用双重校验,低置信度转人工;备注可允许更宽松的相似度。只报整体F1会让大量容易字段掩盖少数关键错误。

一套最小验证方法

先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层。把最新模板和最差扫描件留到测试集,避免随机切分让近乎重复的样本同时进入训练和测试。定义严格的字段规范,例如日期统一成ISO 8601格式,金额禁止千位分隔歧义,缺失值必须输出空而不是猜测。

然后让至少三条路线在同一数据上运行:OCR加规则、通用VLM、目标领域微调模型。记录字段级精确率与召回率、每页延迟、每千页成本、人工复核分钟数、失败是否可解释,以及敏感文档是否离开受控环境。不要只测干净图片,还要加入旋转、阴影、裁切、低分辨率和新模板。

我的判断与风险

我的核心判断是,文档AI已经进入“窄任务工程”阶段。通用大模型提供强基线,真正决定生产效果的往往是字段定义、数据切分、异常路由和返工闭环。一个较小模型若能针对稳定分布微调,完全可能在成本和准确率上赢过零样本大模型;一旦版式漂移,它也可能迅速失效。

论文仍是预印本,且摘要没有提供足以复现所有成本假设的完整生产环境。F1超过0.98不代表每100张只错两张,因为F1按字段聚合,错误可能集中在少数文档。合成数据也无法覆盖真实欺诈、印章遮挡、纸张老化和地域格式。采购或迁移前必须用自有文档做盲测。

上线前检查表

  • 每个关键字段单独设指标,不用一个总体F1决定上线。
  • 保留传统OCR规则基线,确认VLM提升值是否覆盖新增成本。
  • 训练集与测试集按模板和时间隔离,防止近重复泄漏。
  • 为低置信度、格式冲突和新模板设置人工回退。
  • 记录模型版本、原图、输出与人工修改,建立回归集。
  • 敏感票据先确认存储、跨境、删除和审计要求。
  • 每次模板或模型升级后重跑噪声与边界样本。

若文档量很小、格式极稳,微调通常不划算;若错误会直接触发付款、诊疗或法律动作,也不适合无人工复核的端到端自动化。

你的文档抽取项目最难的是识别文字、理解版式,还是为每个错误找到责任人?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。