快速答案:将提取、校验和放行分开

先选定有权处理的源文件,清点全部页面。再判断相关页面或区域需要读取内嵌文本、进行 OCR,还是交给人看原图。每个字段同时保留原文、规范值、字段含义和来源位置。随后检查格式、表格行关系与计算关系,由审核人确认后,才将记录放行到获准的目标系统。

这些是不同的判断。文字可能读对了,却放进了错误的字段;值可能符合格式,却与另一页冲突。即使提取完全正确,源文件也可能只是一份未批准的报价,或来自身份尚未核实的发送者。

一次性处理少量文件,认真复核的工作表可能已经足够。需要持续处理时,先自动化稳定、可重复的规则,并建立异常队列,再考虑授予写入权限。不要把“每个单元格都有内容”当作验收标准。

先定义审核人能查证的字段记录

从输出结构开始,而不是只告诉 AI“把所有信息提取出来”。明确每个字段的含义、类型、是否必填、可有几个值,以及缺失或模糊时如何处理。供应商编号即使全是数字,也通常应保留为标识符字符串,不能随手转成数值。

以下六组信息把 PDF 与拟写入的业务记录连接起来。

记录分组 最低限度的有用信息 为什么需要
来源与版本 文档标识、选定文件、字节哈希、接收时间、版本及访问范围 区分原件、派生图片、修正版和重复上传
页面与位置 PDF 页索引、印刷页码、矩形或多边形、坐标单位、旋转和裁切参照 让审核人直接找到字段,而不是在整份文件里搜索
字段含义 结构版本、字段名、类型、允许值、单位和数量约束 防止把相似名称下的日期或数量放进另一个字段
原值与规范值 可见原文、拟采用的类型化值、地区格式规则和转换过程 让删掉前导零或更改小数分隔符的过程可查
校验与异常 检查结果、冲突输入、缺失/不可读/未设置状态及复核原因 防止把所有空值变成零或凭空补全
放行与更正 审核人、确认版本、目标字段映射、写入状态及更正关联 将提取确认与修改业务系统的权限区分开

提取工具可能只提供其中一部分。工作流需要在其他位置保留缺失的上下文,或者明确该要求尚未满足。置信度不能替代字段原文;如果争议发生在某一个数量上,只有整份文档的链接也不够。

配套 PDF 刻意混合了两种页面:第 1、2 页包含生成的文本,第 3 页是没有 OCR 文本层的合成纯图像页。来源说明和候选 CSV 解释各个字段。这不是客户资料、不是从纸质原件扫描得到的文件,也不是性能基准测试。

下载九项复核工作表,定义自己的获准处理流程。练习时先打开三页虚构 PDF,阅读中文来源说明,再将候选字段 CSV来源哈希及坐标清单对照。PDF 使用英文标签,中文来源说明完整解释相同数值和规则。

用六个实际标准判断提取结果

页面覆盖: 处理的是所有必要页面和附件,还是只处理了能找到文字的页面?某页文本提取结果为空,不证明页面本身空白。应对照页面清单,检查每个必需字段引用了哪些页。

字段与行的对应关系: 数值是否属于该标签、该行、该文档部分?表格解析可能一个数字都没丢,却把数量分配到了错误的商品。要检查对应关系,而不只是看预期字符是否在结果里出现。

来源位置的准确性: 渲染、旋转或裁切之后,审核人能否打开正确区域?必须保存坐标约定。例如 Amazon Textract 的边界框以左上角为原点,数值相对于页面宽高。这是比例,不是像素,也不是 PDF 点单位。Amazon Textract 边界框说明

规范化是否保留含义: 原始写法和解析后的值是否都保留?没有规则时,03/04/2026 的日月顺序并不明确;1.008,00 则需要正确的小数约定。类型转换本身是一种解释,不能在结果里消失。

异常的含义: 字段在原文里缺失、看不清、互相冲突、明确尚未设置,还是不适用?这些情况可能需要不同处理。“To be confirmed”不是 OCR 失败,更不能据此编一个交付日期。

放行之后能否更正: 审核人或解析器后来改了字段,能否找到受影响的目标记录并修正?重新生成一个 CSV,不会自动撤回错误通知、删除重复记录或恢复下游计算。

比较工具也应使用这些标准:相同的文档类型、语言、重要字段和放行要求。不能凭一张干净样张,或者一个从不展示异常的演示,就判定哪个产品更好。

AI PDF 数据提取工作流的九项检查

1. 确认收到的是哪个文件,但不要把文件一致当作真实可信

在许可范围内保留原文件或受控引用,记录大小和接收时间;如果符合存储控制要求,可以计算加密哈希。派生图片、OCR 副本和脱敏工作文件应有独立标识,同时关联到原文件。

哈希相同有助于识别同一份字节内容,但不能证明文件由谁签发、其中陈述是否真实,或发送者是否有采购授权。重新编码的 PDF 可能表达相同业务信息,却有不同哈希。因此,哈希也不应成为唯一的业务去重规则。

使用获准的文件接收和解析环境。扩展名和声明的内容类型不足以构成防护,解析过程还需要资源限制和访问控制。OWASP 建议采用多层上传防护,并提醒公共扫描服务可能造成敏感文件泄露。OWASP 文件上传指南

2. 确认文档类型、版本和提取目的

先确定 PDF 是报价、订单、发票、交付文件、申请表,还是另一种已支持的文档。同一个标签在不同文件里可能含义不同。发票日期不等于要求交货日期,报价金额也不是已批准付款金额。

记录所选版本、续页和修订关系。收到一张更新页面时,要判断它替换原文档的哪一页,还是属于另一份文件。不能因为文件名里有同一个编号,就把新版封面与旧版明细拼在一起。

陌生模板或混合文档应先进入分类复核,不要直接套用其他文档的提取规则。标志和外观相似可以作为线索,但不证明签发者身份或当前权限。本步的通过条件是:文档类型受支持,选定版本有依据,而不是分类器显示了一个很高的置信度。

3. 检查页面是否齐全,顺序是否正确

对照 PDF 页数、印刷页码、续页说明和预期章节,同时保留软件使用的页索引与纸面页码。样例中的页索引 2 对应印刷页码“3 / 3”;换成带封面或附录的文件,这个关系可能不同。

检查缺页、重页、旋转和裁切问题,不要默默修改来源。刻意保留的空白页不一定是缺页;反过来,没有可提取文本的页面也可能包含整份文件唯一的总额。

样例第 2 页明确写了表格在第 3 页继续。如果流程把两张有文本的页面当成全部文档,就会漏掉最后一个商品和金额汇总。正确做法是处理图像页或交给审核,而不是因为文本解析器返回空字符串,就判定第 3 页不重要。

4. 按页面和区域选择文本解析或 OCR

内嵌文本提取读取 PDF 中保存的文本信息,OCR 则识别图片里的文字。一份混合 PDF 可能同时需要两者。第 1 页适用的方法,不一定适合整份文件。

pypdf 文档区分了数字生成、扫描和带 OCR 层的 PDF,并明确说明 pypdf 本身不是 OCR 引擎。文档也解释了定位文本和图像文本给提取带来的困难。这些区别有助于选择处理路径,但不能推导出某一种方法永远正确。pypdf 文本提取说明

检查分栏阅读顺序、小字、合并单元格、复选框、手写内容,以及对目标字段有影响的符号和分隔符。如果隐藏文本层与可见页面不一致,应保留冲突。可能需要更清晰的来源,或另一种获准的解析方法。不能为了让金额对平,就悄悄猜一个看不清的数字。

记录解析器或模型版本,以及输入语言支持的假设。本指南有英文、中文和日文版本,不等于某个提取服务就支持这三种输入语言。必须另行核对准备使用的具体模型和操作。

5. 保留来源位置,也保留表格外的解释

给每个字段附上页面引用和区域;涉及表格时,还要保留行列关系。一个由多行计算出来的总额,需要关联所有参与计算的来源值,不能只指向显示结果的最后一页。

不要丢掉改变字段含义的附近说明。Microsoft 的布局文档介绍了单元格及其位置,同时指出:在指定的 2024-11-30 版本中,表格和图片的边界区域不包含关联的标题与脚注。因此,只裁出表格,可能遗漏单位或计价条件。这是特定版本的文档说明,并非声称所有解析服务都如此。Microsoft Document Intelligence 布局说明

坐标转换也要单独检查。例如在一个独立的计算示意中,1000 × 1400 像素页面上的 left 0.1、top 0.2、width 0.3、height 0.04,分别对应 100、280、300、56 像素。这组数不是样例 PDF 自动检测出的字段框。改变渲染尺寸、裁切或旋转后,应更新转换关系,再向审核人显示高亮区域。

6. 检查类型和规范化,不要删掉原有含义

日期应依据文件明确声明的格式,或经过确认的结构规则。样例第 1 页明确写着 DD/MM/YYYY,因此 03/04/2026 应规范为 2026-04-03。按月在前解析,会得到一个格式正确却含义错误的日期。如果没有格式声明或其他可靠证据,就应请求澄清,而不是猜测。

保留标识符字符。按照样例规则,Q-00742 与 Q-742 是两个不同字符串。同样,数量 8 不能变成另一行的数量 2,只因为两者都属于合法整数。

币种和金额分开存储,保留原始标点,并采用声明的小数约定。本文件的 1.008,00 表示 1008.00。如果金额解析器直接删掉所有标点,或默认另一种地区格式,就可能得到完全不同的值。

空值必须有原因。样例交付日期应保留 null,并标记 not_set,因为来源明确说稍后确认。缺失、不可读和不适用应继续分开。目标系统是否允许日期尚未确定,是另一条结构规则,不能成为编造日期的理由。

7. 交叉核对计算关系与字段关系

只检查文档实际支持的关系。对含明细的报价,可以核对数量乘单价、行金额合计、小计、税额和总额。其他文档可能需要检查开始日期不晚于结束日期,或同一编号在多页保持一致。

采用适当的十进制计算,并明确舍入规则。不要为了让异常消失而设置宽泛容差。定位失败检查涉及的字段,保留其来源值,再判断哪个来源或解释需要纠正。

样例三行分别为:12 × 25.00 = 300.00、8 × 37.50 = 300.00、2 × 120.00 = 240.00 欧元,合计 840.00 欧元;加上示例税额 168.00,得到 1008.00 欧元。候选总额 100.80 的差额为 −907.20 欧元。这个检查揭示冲突,但在真实业务中,算术本身不能证明应覆盖哪一个源字段。

8. 识别重复候选和复核信号,不要直接断言欺诈

先用文件标识识别完全相同的上传,再结合业务键和所选版本寻找其他重复候选。同一报价可能重新导出,元数据随之改变;两份不同报价也可能恰好有相同日期和总额。相似度必须结合上下文解释。

置信度可以帮助安排复核优先级,但阈值应取决于字段和用途。Amazon Textract 的指南明确将阈值选择与应用场景关联。不要把文档里的某个示例阈值当成通用验收线,也不要把模型置信度等同于在自己资料上测得的准确率。Amazon Textract 最佳实践

把结构冲突、意外文本层和异常元数据当作待调查信号。异常不等于篡改、不诚实或欺诈的证据。身份验证、签名验证和受监管决策,应留在提取系统之外,除非已经单独定义并经过专业审核。

9. 先复核异常,再授权写入目标系统

向审核人同时展示原始区域、候选值、规范化规则、失败检查和相关相邻字段。允许其纠正或拒绝解释,并记录原因和版本。对后果重大的字段,不能仅凭置信度取消必要的人审。

字段接受和整条记录放行是两件事。必需编号或总额仍然错误时,其他字段提取正确,也不能使整条记录可用。样例规定四个实质错误未解决前不得放行;这是一条教学规则,不是所有 ERP 的通用设置。

完成上述检查后,才考虑通过获准的集成写入。检查目标记录是否已存在,约定如何识别重试,保存写入结果。如果目标系统已接收记录,但本地收到失败响应,重试不应盲目再建一条。后来需要纠错时,应关联先前记录,不能以为重新生成提取结果就撤销了旧动作。

完整案例:90% 的填写率不等于 90% 的正确率

先打开三页虚构报价,再看候选 CSV。第 1、2 页是文本页,第 3 页是干净的合成图像页,刻意不放 OCR 层,其中包含最后一项商品与金额汇总。这个设计演示混合输入的边界,并不复现真实扫描中所有噪点、模糊和破损。

十个候选字段由编辑人工编写,其中刻意放入四个错误;没有声称它们来自某个 AI 模型。参考值在 PDF 中可见,来源说明提供规范化规则和字段位置。

字段 候选值 应采用的解释 复核结果
报价编号 Q-742 第 1 页 Q-00742 拒绝:保留编号字符
签发日期 2026-03-04 按声明的 DD/MM/YYYY 得到 2026-04-03 拒绝:日月颠倒
币种 EUR 第 1 页 EUR 一致
AX01 数量 12 第 2 页,12 件 一致
BX02 数量 2 第 2 页,8 件 拒绝:数量与商品对应错误
CX03 数量 2 第 3 页,2 件 一致
小计 840.00 第 3 页 EUR 840.00 一致
示例税额 168.00 第 3 页 EUR 168.00 一致
总额 100.80 原文 1.008,00,即 EUR 1008.00 拒绝:金额解释错误
交付日期 null / not_set 尚未设定,原文为“To be confirmed” 一致:标量为空不等于提取失败

十个标量单元格中,九个非空:9 / 10 = 90%。按人工答案表核对,包括正确表示“尚未设置”的交付日期在内,六个字段一致:6 / 10 = 60%。这些比例只描述这组人工构造的候选值,不是 OCR 准确率、客户结果或厂商比较。

按样例的放行规则,更正前可放行记录是 0 / 1 = 0%,因为编号、日期、BX02 数量和总额仍然有误。只报告填满率,会掩盖这个实际使用层面的结果。

算术可以独立复算:300.00 + 300.00 + 240.00 = 840.00 EUR840.00 + 168.00 = 1008.00 EUR100.80 - 1008.00 = -907.20 EUR。20% 税率是虚构教学设定,不是对真实报价适用税率的建议。

本地文件检查确认 PDF 有三页,六个字段区域含可提取文本,合成的第 3 页没有文本层;三页均已渲染并目视检查。这些检查验证教学文件的构造,不验证 OCR 服务的性能。本案例没有运行 OCR 引擎、托管提取 API 或 OpenMax 处理流程。

选择能满足证据要求的最简单方法

少量且有权处理的文档,可以人工录入并对照来源区域。它有人力成本,但不需要建立新管线。人工阶段也应使用与自动化一致的字段定义和规范化规则,方便后续迁移。

熟悉的文本型模板,可以优先考虑确定性的解析与规则。原生文本提取能够保留一些全部转成图片后可能丢失的信息。不过,同一方法也可能在字体、布局或模板更新后失效。应测试实际文档类型,不要把 PDF 当作一种完全统一的输入。

扫描页或结构复杂的页面,可以评估 OCR 和布局分析,用来取得文字、位置和表格结构。核对具体操作的语言支持、大小限制和输出约定。响应里出现某页,不证明该页所有必需字段或脚注都已正确识别。

无代码或脚本自动化适合整理接收流程、应用结构、执行确定性规则、组装复核资料。应让提取失败可见,而不是捕获所有异常后统一返回空行。如果错误在进入日志前就被隐藏,“错误数很少”并没有意义。

当文档类型多变、多人复核的交接反复发生时,可以评估智能体协助协调。但智能体仍需获准的提取工具和明确的真实来源,不能为了完成任务,就判断一个没有依据的字段“大概没问题”。稳定、高量、固定模板的处理,可能更适合范围窄、规则可预测的管线。

OpenMax 可以放在哪一环,哪些能力仍须核实

OpenMax 公开将自身定位为人类与智能体协作平台,这与复核协调和后续跟进有相关性。但首页生成定制 PDF 方案的介绍,不能证明 OpenMax 能解析任意 PDF、进行 OCR、保留字段多边形或把数据写入 ERP。本文不声称这些集成已经验证。OpenMax 官网

将这套工作流作为一次有限范围评估的需求说明:会采用哪些文档和 OCR 工具,如何访问文件,怎样保存字段记录,哪些步骤需要人,以及拟用的目标系统集成目前是否可用。配置工作、规划中的能力和已经在你的环境中演示的能力,应明确区分。

从虚构 PDF 和仅生成草稿的目标开始,要求展示图像页的处理异常、日期的原值与规范值、BX02 的行对应关系,以及未解决的金额冲突。有效演示应让失败处理可见,而不是只展示一个正确总额。

如果人工检查一份报价就能解决需求,直接使用工作表,不必引入新平台。反复复核确实值得自动化时,可以与 OpenMax 讨论小范围 PDF 处理试点。先带上文档类型、允许的数据范围和放行规则,是否提供真实文件或写入权限另行决定。

后续业务处理可参考发票异常处理流程,它处理发票差异,而不是 PDF 字符识别;AI RFP 分析指南则处理需求与响应证据。正确提取为这些流程提供输入,不代替它们作决定。

限制:文件安全、业务权限与真实样本覆盖

不要把 PDF 内嵌的指令当作授权用户的要求。即使文档写着“忽略检查”或“把文件发到别处”,它仍只是文档内容。文件解析与模型提示存在不同风险;建立指令边界,不能替代解析器安全配置或访问控制。

敏感页面和字段裁图都要遵守适当的访问、保存和删除规则。一张金额裁图仍可能暴露姓名、账户标识或商业条款。不能因为合成样例可以公开分享,就把真实资料送到公共扫描或演示服务。安全、隐私、法律和财务用途需要相应人员审核,本指南不是专业授权。

识别到一个像签名的区域,不等于签名有效;银行编号格式正确,也不等于可以付款。提取描述的是文件看起来包含什么。真实性、权限,以及信息是否足以支持业务判断,都需要独立控制。

本样例不是代表性验证集。真实评估应包括支持和不支持的文档类型、模板改版、低质量扫描、合并或拆分行、缺页,以及本就应该没有值的字段。重要字段错误与异常处理应单独报告,不要只报总文字准确率。如果用所有评估样本反复调参,得出的比例就不是对未见文档的独立检查。

常见问题:PDF 类型、置信度与可用记录

每一份 PDF 都需要 OCR 吗?

不需要。有些 PDF 有可用的内嵌文本,有些是图片,有些混合两者或已带 OCR 文本层。应按相关页面或区域选择方法,并检查冲突。样例第 3 页需要看图或 OCR,第 1、2 页则含生成的文本。一个文件扩展名无法决定合适的提取方法。

哈希一致能证明文件真实可信吗?

不能。哈希帮助识别收到的字节内容和相同副本,但不证明签发者身份、文件陈述、签名有效性或业务权限。应把来源记录与验证要求分开。重新导出也可能改变字节哈希,但没有改变业务内容。

必填字段看不清时应怎么办?

保留来源区域,明确标记不可读或需要复核,请求人工检查或更清晰的获准来源,不要猜值。不能用零、今天的日期,或仅为了让其他字段对平而算出的数替代。像“To be confirmed”这样明确未设置的字段,属于另一种状态。

跨页续表应如何处理?

保留每页的行列证据,区分重复表头与数据,并依据可靠上下文连接行。纳入表格外的脚注和单位,判断续页是增加商品,还是补完被拆开的同一行。关系不明确时,应继续复核,而不是仅按视觉位置匹配。

OpenMax 能直接把提取字段写入我的 ERP 吗?

本文没有验证该集成。应针对实际环境与 OpenMax 确认当前可用性、字段映射、访问权限和人审要求。即使连接器能工作,提取成功也不代表有生产写入授权。从合成文件和草稿输出开始,在扩大使用之前检查防重复与更正处理。

来源、作者及这个案例能证明什么

本文由 OpenMax 内容团队为 OpenMax 网站编写,是与产品相关的编辑指南,不是独立产品认证。2026 年 9 月 2 日发布,2026 年 9 月 4 日修订。文中工具行为依据本次修订时核查的文档,可能随版本或操作变化。

主要来源支持正文附近的具体事实:pypdf 的文本与 OCR 区别Microsoft 的布局和表格区域说明Amazon Textract 坐标约定按应用选择置信度阈值的建议OWASP 上传防护OpenMax 公开定位。这些机构没有审核或背书本教学练习。

PDF、字段框、候选错误与参考答案均为原创虚构教学资料。本地验证检查的是文档结构和案例算术,不是已部署 OCR 的性能。这里没有客户效果、吞吐量、准确率保证、真实供应商身份或付款批准。请用这些资料定义自己在获准评估中需要检查的内容。