惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
博客园 - 司徒正美
WordPress大学
WordPress大学
爱范儿
爱范儿
小众软件
小众软件
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
罗磊的独立博客
博客园_首页
V
V2EX
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
T
Tailwind CSS Blog
大猫的无限游戏
大猫的无限游戏
The Cloudflare Blog
MyScale Blog
MyScale Blog
IT之家
IT之家
H
Help Net Security
Blog — PlanetScale
Blog — PlanetScale
Microsoft Security Blog
Microsoft Security Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Recent Announcements
Recent Announcements
F
Fortinet All Blogs
The GitHub Blog
The GitHub Blog
Y
Y Combinator Blog
人人都是产品经理
人人都是产品经理

Java for You

《深入分析Java Web技术内幕》.pdf - Java for You - java4u 《JAVA网络编程》.pdf - Java for You - java4u 《Java 工程师成神之路》.pdf - Java for You - java4u Copilot开始统计“真正用过什么”:AI落地终于不只看活跃人数 - Java for You - java4u 多Agent最怕的不是答错,而是崩溃后不知道做到哪一步 - Java for You - java4u Claude放宽生命科学限制:代价是验证、分级和30天留存 - Java for You - java4u Anthropic公开内部AI研发速度:真正该盯的是三个分母 - Java for You - java4u 4 bit模型为何不等于显存缩小四倍?量化账单这样算 - Java for You - java4u GPU抢不到就换一种:训练任务需要先声明可替代性 - Java for You - java4u Agent不是多想几步就能上线:用状态机管住自动行动 - Java for You - java4u 数据不能集中,算力也不统一:联邦学习终于面对运维现实 - Java for You - java4u OpenAI开始公开模型失配个案:真正重要的是这套报告制度 - Java for You - java4u 广告开始和你对话:Sponsored Agents改变的不是文案 - Java for You - java4u 语义相近却总找错资料?从Embedding看懂向量检索 - Java for You - java4u AI算力开始听电网指挥:比换GPU更现实的增产方法 - Java for You - java4u 临床AI别再只比像不像标准答案,先算医生少改了多少 - Java for You - java4u AI做长程科研,真正稀缺的不是更多Agent而是反证链 - Java for You - java4u AI代码审计最危险的不是漏报,而是团队开始不再相信它 - Java for You - java4u 100万Token不等于模型全记住:从KV Cache看懂长上下文成本 - Java for You - java4u AI写歌有了工程图:YuE2把旋律和和弦放回可编辑层 - Java for You - java4u Claude接入十余种金融系统后,真正稀缺的是可追溯的审批链 - Java for You - java4u 本地语音AI不等于零风险:VoiceStudio最值得看的三条边界 - Java for You - java4u AI代码评审开始跑测试,真正该升级的是团队证据链 - Java for You - java4u 4万星的Agent技能提醒我们:答案太全也可能不可用 - Java for You - java4u 流式JSON为什么总报错?理解结构化输出就能接稳AI接口 - Java for You - java4u 一个浏览器看见飞机船舶与卫星,空间智能的门槛变了 - Java for You - java4u 编码Agent搬出编辑器后,本地优先工作台在解决什么 - Java for You - java4u AI写代码开始像带团队:Qwen Code补上工作流控制台 - Java for You - java4u AI会聊天却不会改3D模型?从Pascal 1.0看懂MCP工具调用 - Java for You - java4u 让AI审科学公式,它最适合当比较员而非裁判 - Java for You - java4u
票据抽取不一定要上最大模型:先看版式是否真的变化 - Java f...
蜗牛 · 2026-09-16 · via Java for You

电路微距

文档抽取最常见的浪费,是把所有票据都交给最贵、最大的视觉语言模型。9月14日一项预印本在750份留出合成支票上比较11种系统,报告经过3000份样本微调的最佳开源视觉语言模型F1超过0.98,并高于该任务中的所有零样本商业系统。它不是“开源全面胜出”的证明,却给出一个更实用的选型原则:先判断文档变化和错误代价,再选模型。

研究比较了什么

论文覆盖三种商业系统、两种推理模型、五种开源VLM(Vision-Language Model,视觉语言模型)的预训练与微调版本,以及一个OCR(Optical Character Recognition,光学字符识别)加正则表达式基线。作者同时比较质量、延迟、治理和总成本,试图把实验分数转成具体部署决策。

官方摘要称,在这批合成支票上,微调后最佳开源模型F1超过0.98;F1是精确率与召回率的调和平均。GPT-5在商业系统中F1领先,Claude Sonnet 4.5在日期字段上表现异常。这里必须强调:数据是合成支票,版式、语言、扫描噪声和供应商分布有限;一类模型在一个字段失效,也不能外推到它在所有文档任务上的能力。

mermaid diagram

先用任务形状选方案

如果表单模板固定、字段坐标稳定,OCR加规则常常更便宜、更容易解释。它的弱点是遇到新版式、手写内容或模糊扫描时规则会碎裂。VLM能同时看文字和布局,适合供应商众多、字段位置变化的单据,但输出格式、日期理解和幻觉需要约束。

微调适合样本量大、字段长期稳定、错误成本足以覆盖训练与运维的场景。论文中的3000份样本说明一个小而专的数据集可能比直接调用通用模型更有价值,但真实项目还要付标注、版本升级、GPU和监控成本。若每月只有几百张低风险文档,零样本API加人工复核可能更经济。

具体例子是报销支票。金额错一位会直接影响付款,备注字段错一个标点却影响有限。系统应按字段设阈值:日期、金额、收款人采用双重校验,低置信度转人工;备注可允许更宽松的相似度。只报整体F1会让大量容易字段掩盖少数关键错误。

一套最小验证方法

先抽取200至500份真实历史文档,按模板、扫描质量、语言和时间分层。把最新模板和最差扫描件留到测试集,避免随机切分让近乎重复的样本同时进入训练和测试。定义严格的字段规范,例如日期统一成ISO 8601格式,金额禁止千位分隔歧义,缺失值必须输出空而不是猜测。

然后让至少三条路线在同一数据上运行:OCR加规则、通用VLM、目标领域微调模型。记录字段级精确率与召回率、每页延迟、每千页成本、人工复核分钟数、失败是否可解释,以及敏感文档是否离开受控环境。不要只测干净图片,还要加入旋转、阴影、裁切、低分辨率和新模板。

我的判断与风险

我的核心判断是,文档AI已经进入“窄任务工程”阶段。通用大模型提供强基线,真正决定生产效果的往往是字段定义、数据切分、异常路由和返工闭环。一个较小模型若能针对稳定分布微调,完全可能在成本和准确率上赢过零样本大模型;一旦版式漂移,它也可能迅速失效。

论文仍是预印本,且摘要没有提供足以复现所有成本假设的完整生产环境。F1超过0.98不代表每100张只错两张,因为F1按字段聚合,错误可能集中在少数文档。合成数据也无法覆盖真实欺诈、印章遮挡、纸张老化和地域格式。采购或迁移前必须用自有文档做盲测。

上线前检查表

  • 每个关键字段单独设指标,不用一个总体F1决定上线。
  • 保留传统OCR规则基线,确认VLM提升值是否覆盖新增成本。
  • 训练集与测试集按模板和时间隔离,防止近重复泄漏。
  • 为低置信度、格式冲突和新模板设置人工回退。
  • 记录模型版本、原图、输出与人工修改,建立回归集。
  • 敏感票据先确认存储、跨境、删除和审计要求。
  • 每次模板或模型升级后重跑噪声与边界样本。

若文档量很小、格式极稳,微调通常不划算;若错误会直接触发付款、诊疗或法律动作,也不适合无人工复核的端到端自动化。

你的文档抽取项目最难的是识别文字、理解版式,还是为每个错误找到责任人?

关注「蜗牛聊AI」,一起看懂技术变化背后的真正机会。


本文首发于 java4u.cn,转载请注明出处。