AI 伪造票据激增,OCR 置信度为何识别不出
AppZen 数据显示 AI 生成票据已成费用欺诈新主力,但 OCR 置信度只衡量字符识别准确性,无法判断文档真伪。
AppZen 在 2026 年 5 月前两周的内部数据显示,AI 生成的虚假报销票据已占其识别出的财务欺诈样本的 70.8%。但这条被广泛引用的数字,仅来自一个半月度窗口;而 OCR 系统给出的「高置信度」,并不等于「文档真实」。这些结论对依赖自动文档处理做合规审核的团队具有直接参考价值。
数据全景:1471 张票据与 $32 的中位数
截至 2026 年 5 月 15 日的十二个月内,AppZen 平台共标记 1471 张 AI 生成的报销票据,提交者来自 174 家公司的 745 名员工,索赔总额 148,143 美元。
值得关注的是金额分布:
- 中位数仅 32 美元,均值 101 美元(被少量大额拉高);
- 某澳大利亚电信公司一名员工独自提交 11 张票据,总额 12,900 美元;
- 被 AI 票据挤掉的「模板伪造」票据(此前在「遗失票据」网站以 5–10 美元购得)平均金额为 182 美元。
AppZen 联合创始人兼 CTO Kunal Verma 将这一变化概括为:「AI 基本上把游戏从『一笔大到值得冒险的假账』翻转成了『一堆没人会逐张审核的小额票据』。」生成成本下降后,小额欺诈本身也具备了独立的经济动力,不再需要跨越任何审核阈值。
70.8% 是十五天的切片
这条数据曲线并不是单调爬升:2025 年 7 月达到 42%,随后回落到 2026 年 1 月的 6%,再于春季反弹。70.8% 这个高点只覆盖 5 月 1 日至 15 日,是整个序列中最高、也是最薄的一个窗口,因此最具传播力。
同一时期,模板伪造票据在 AppZen 标记中的占比下降至约 29%。十二个月的总量并不依赖于最后一个数据点的位置,但仅凭半个月的数据,无法支撑「AI 票据已经完成对传统伪造的全面接管」这一说法。
OCR 置信度衡量的是字符,不是真伪
各大文档 AI 厂商对置信度的定义高度一致——它们都在回答「机器是否正确读出了字符」,而不是「这份文档是否被篡改」:
- AWS Textract:表示「给定预测正确的概率(0–100)」;
- Azure AI Document Intelligence:给出「0 到 1 之间的估计正确概率」,并指出 0.95 意味着「20 次中有 19 次正确」;
- Google Document AI:描述为「模型将每个实体与预测值关联的强度」;
- Hyperscience:直接称之为「内部不可配置的数字」,并警告 0.96 并不代表模型对转录正确率有 96% 的把握;
- Rossum:声称已将分数校准为「对应预测值正确的概率」,但同时承认「校准仍是人工智能领域未解决的问题」。
在 AWS Textract、Azure、Google Document AI、ABBYY Vantage、Nanonets、Instabase、Mistral OCR、Reducto、Docling 等产品的文档中,「fraud」「tampering」「authenticity」这些词没有出现在置信度的定义段落里。
研究框架论文 RaV-IDP 用一句话点明了机制:「模型内部置信度衡量的是推理确定性,而非与文档本身的一致性。」一张用 PDF 库干净生成的伪造银行对账单,其字符没有任何问题——数据抽取环节会返回高分,路由规则也只会读这个分数。
生成式伪造的天然优势:可控的磨损
干净的生成 PDF 是伪造者的默认形态,但真实文档往往经历过折叠、传真、桌面拍摄、倾斜扫描。公开基准测试并未回答「这种差异是否会让伪造文件的得分高于真实文件」。
干净也并非唯一选项。生成模型可以按提示添加折痕、污渍与磨损,伪造文档的「使用痕迹」是一个可调参数,而真实文档的磨损则是不可控的历史结果。这种对称性意味着,仅靠图像层或字符层的启发式规则,难以可靠地区分两者。
对采购方的提示
- 依赖 OCR 置信度作为反欺诈闸门的产品,本质上只做了字符层校验;
- 审核阈值若以「金额是否值得人工复核」为标准,需要重新评估——AI 时代的典型欺诈恰好落在 32 美元以下;
- 文档真实性需要独立的取证信号(数字签名、元数据、来源核验等),而不是抽取流水线的副产品。
需要说明的是:AppZen 数据覆盖其客户群体,不代表全行业;70.8% 的高点对应半个月窗口,长期走向仍待更多周期验证。
