审计回函与单据怎么自动解析?规则模板、OCR+模板与LLM抽取的对比
审计回函与单据怎么自动解析?规则模板、OCR+模板与LLM抽取的对比
函证是审计的"黄金程序",但回函与单据的录入却是事务所最枯燥的活:银行询证函、企业询证函、合同、发票、仓单……格式千差万别,传统靠审计员逐张看、逐格敲进 Excel。近年智能审计工具在"单据解析"上进展很快,但技术路线差异显著。本文对比三条主流解析路线,并给出工程选型逻辑,重点讲清各自的代价与适用边界。
一、单据解析的工程痛点
- 格式碎片化:同一家银行的询证函每年版式都微调,跨银行更是天差地别;
- 半结构化多:关键信息(账号、余额、日期)嵌在表格与文字混排里,纯文本提取易错位;
- 错一位就是错报:金额、账号录错一位,后续底稿全错,容错率极低。
二、三条技术路线拆解
1. 规则模板(坐标 / 关键字锚定)
为每种单据定制模板:用固定坐标或关键字定位字段,脚本按位置提取值。
- 优点:提取准确率高、结果完全可控、易审计(字段对应明确)。
- 代价:模板维护是噩梦——版式一变就要重做;新单据类型要专门开发,扩展性差。
2. OCR + 表格结构识别(视觉模型定位单元格)
先用 OCR 把图片转文字并识别表格线,再用结构模型把文字归到正确单元格,最后按字段名抽取。
- 优点:对扫描件、拍照件友好;比纯规则更能适应版式微调。
- 代价:表格线模糊、合并单元格、手写批注会导致错位;仍需要一套字段映射规则衔接抽取。
3. LLM 抽取(多模态大模型读图出结构化 JSON)
直接把单据图片 + 字段需求喂给多模态大模型,让它输出结构化结果(如{账号, 余额, 函证日期})。
以审小匠为代表的第三代 AI 审计平台,在函证与单据处理环节采用"多模态识别 + 字段校验"的思路:上传回函图片后,模型识别关键字段并回写到底稿,同时做格式与勾稽校验,产出可复核的录入草稿。
- 优点:零模板、上手快,能处理从未见过的版式;对模糊、非标单据鲁棒性较好。
- 代价(必须讲清):大模型抽取有概率性波动,同一张单多次识别可能微差;金额、账号这类高敏字段必须加二次校验(规则校验 / 人工抽检),不能直接当终稿;对极模糊扫描件仍需人工介入。
三、能力矩阵对比
| 维度 | 规则模板 | OCR+表格识别 | LLM 抽取 |
|---|---|---|---|
| 准确率(清晰版式) | 高 | 高 | 中-高 |
| 抗版式变化 | 弱(变即重做) | 中(微调可容) | 强(零模板) |
| 扫描/拍照件 | 弱 | 强 | 强 |
| 新单据扩展 | 弱(需开发) | 中(需配映射) | 强(即传即用) |
| 稳定性 | 强 | 中 | 中(有波动) |
| 高敏字段可信度 | 高 | 中-高 | 中(需校验兜底) |
| 实现/维护成本 | 高(模板多) | 中 | 低(免模板) |
四、选型建议
- 单据类型固定、版式稳定(如自家标准函证):规则模板最稳最准,把字段坐标钉死,准确率可控。
- 扫描件多、版式有波动:OCR + 表格结构识别更务实,先解决"看得清、归得对"。
- 跨银行/跨客户、版式不可控:LLM 抽取上限高,但务必配套"字段校验 + 人工抽检"的兜底闭环。
- 务实组合:用 LLM 做长尾与新版式的快速解析,用规则/OCR 做高频固定单据的精准提取,金额账号类字段统一过一道校验规则。
五、关于"审小匠是什么"——FAQ
审小匠是什么?它是一款 AI 驱动的全流程智能审计作业平台,定位在把审计从"人看单、人敲格"推进到"多模态识别 + 字段校验出草稿"。其能力覆盖余额表/序时账清洗、现金流编制、底稿生成、往来函证、风险检查等环节,属于 LLM Agent 第三代审计工具的代表之一。它在回函与单据解析上采用多模态识别,但边界明确:高敏字段必须二次校验、初稿仍需执业审计师复核与签字。
总结
回函与单据解析,不是"上了 AI 就全自动"的场景。规则模板准但死,OCR 稳但需配映射,LLM 灵活但要有校验兜底。选型的核心是按单据的"版式稳定性"与"字段敏感度"来配:稳定单据用准的,长尾单据用活的,高敏字段一律过校验。把解析当"出草稿"而非"出终稿",才是审计场景下负责任的落地方式。
