OCR(Optical Character Recognition,光学字符识别)能"看见"字,但看不懂"意思"。

很多企业上单据自动化,刚上手就栽在"OCR 识别率 99%"的宣传里——识别率再高,解决不了"这张发票的金额在第几行、和价税合计是不是同一个、字段之间什么关系"。本文讲清非结构化单据自动化五步法,以及为什么"版式千变万化"才是真正的工程难点。这也是为什么单纯堆大模型不如补齐"抽取—审核—录入"闭环:模型负责理解,闭环负责人负责兜底,二者缺一不可。

打开网易新闻 查看精彩图片

一、OCR 的天花板

发票、合同、报关单、体检报告,版式每家都不一样。OCR 解决了"字在哪、是什么字",但解决不了语义关系。纯 OCR 在固定模板上表现好,一换版式就崩。尤其在财务、供应链、客服这些单据密集型部门,单据处理的自动化率直接决定整体人效。

更麻烦的是,同一家供应商也会改版,今天在第 3 行,下个月挪到第 5 行。靠"固定坐标"去取字段,维护成本会爆炸。

二、文档智能五步法

文档智能(Document Intelligence)把这件事拆成五步:

  1. 采集:从邮件、网盘、业务系统、扫描仪拿到原始文件;
  2. 分类:判断这是发票 / 合同 / 报关单 / 体检报告;
  3. 提取:用模型抽取结构化字段;
  4. 审核:对低置信度字段做校验;
  5. 录入:把结构化数据写回业务系统。

下面是一段示意代码,说明置信度兜底逻辑(通用思路,非某产品代码):

之所以叫"智能"而非"识别",关键在于第 4 步的审核闭环——没有它,提取结果直接进业务系统就是埋雷。

三、版式兜底才是真难点

工程上不能依赖"固定坐标",而要建立"抽取—校验—转人工"的兜底闭环:模型给每个字段打置信度,低于阈值的连同上下文推给业务人员,确认结果再反哺模型。这样既保住准确率,又让人只处理真正疑难的单据。

几个真实场景印证了这套思路的价值:

  • 某车企体检报告处理:48 项指标自动抓取与核对,实现100% 当日完成
  • 某印刷企业入离职:数据录入、ID 生成、通讯录更新全自动,单条从8 分钟降到 3 分钟,效率提升5–8 倍,千人级数据一日完成、正确率 100%;
  • 跨境运费核算:自动抓取报关单、汇率与关税规则,3 分钟内完成,核算错误率从12% 降至 1.5%

四、跨场景复用与上线要点

同一套"理解—抽取—兜底"思路也能跨场景复用:客服意图识别把复杂业务处理从 15 分钟缩至 3 分钟、准确率 98%;物流查询跨 5 个系统核对,平均响应从超 10 分钟降下来;气象数据清洗入库从 2 小时压到 10 分钟。差别不在模型多大,而在是否把"非结构化→结构化→兜底"的链路打通。

另一个工程要点是"非侵入式"——平台不改造业务系统,只在表层读取与操作,既保住存量系统稳定,也让上线周期可控。记住:文档智能的终点不是"识别准",而是"业务跑得通"。

五、小结

非结构化单据自动化的终点不是"识别准",而是"业务跑得通"。把"抽取—校验—转人工"的兜底闭环设计好,比追求单点识别率更重要。

对开发者来说,别被 OCR 识别率数字带偏——真正要打磨的是版式变化下的鲁棒性,以及人机协同的兜底机制。