# 虚构 PDF 数据提取案例：来源说明

本资料配合 `ai-pdf-data-extraction-workflow-fictional-quote.pdf` 使用。它是人工编写的教学文件，不是客户提交的供应商报价、法律文件、发票、OCR 基准测试或 OpenMax 执行记录。名称、编号、商品、数量和金额均为虚构，报价没有真实签发者或签名。

## 实际文件包含什么

PDF 共三页，每页为 600 × 840 点。第 1、2 页含正常生成的文本；第 3 页由人工编写的页面栅格化而成，以图片嵌入，没有 OCR 文本层。合成源图为 1250 × 1750 像素，不是对纸质文件拍照或扫描所得。三页均明确标识为虚构案例。

第 1 页给出报价编号 Q-00742、版本 B、日期 03/04/2026、币种 EUR，以及交付日期“To be confirmed”。文件明确规定日期为 DD/MM/YYYY，句点作千位分隔符，逗号作小数分隔符，并要求保留标识符字符。因此日期应为 2026-04-03，无需猜测所属地区。交付日期为 null，状态为 not_set，不是零、不可读或今天的日期。

第 2 页开始商品表。AX01 为 12 件，单价 EUR 25.00，行金额 EUR 300.00；BX02 为 8 件，单价 EUR 37.50，行金额 EUR 300.00。续页提示明确指向第 3 页。表格下方另有单位和币种说明，用来展示仅裁切表格区域可能漏掉的解释。

第 3 页重复表头，增加 CX03：2 件，单价 EUR 120.00，行金额 EUR 240.00。小计 EUR 840.00，示例税额 EUR 168.00，总额 EUR 1008.00，原文显示为 `1.008,00`。20% 税率仅是公开声明的计算假设，不是某地税法或建议。

## 如何读取候选 CSV

`ai-pdf-data-extraction-workflow-fields-example.csv` 包含十个人工构造的候选字段，首行是表头。包含逗号的原值按标准 CSV 规则用引号包围。不要通过简单的逗号分割来解析这个文件。

- quote_id：候选 Q-742 丢掉了字符，预期 Q-00742。
- issue_date：候选 2026-03-04 颠倒了文件声明的日月顺序，预期 2026-04-03。
- currency：EUR 一致。
- line1_qty：12 与 AX01 一致。
- line2_qty：2 对应 CX03，不是 BX02；BX02 预期为 8。
- line3_qty：2 与 CX03 一致。
- subtotal：840.00 一致。
- tax：168.00 一致。
- total：100.80 不是 1.008,00 的正确规范值，预期 1008.00。
- delivery_date：CSV 值为空，同时 value_state=not_set，正确表示日期尚未设置。不能仅因标量单元格为空就判定提取失败。

错误由作者刻意设置，没有声称某模型产生了这些输出。十个标量字段中九个非空，填写率为 90%；十个字段中六个与人工答案一致，匹配率为 60%，包括正确表示的未设置日期。两者都不是产品准确率。按案例规则，四个实质错误未解决前整条记录不得放行，因此更正前可放行记录为 0/1。

## 计算与来源定位

12 × 25.00 + 8 × 37.50 + 2 × 120.00 = 840.00 EUR。示例税额为 840.00 × 20% = 168.00 EUR；840.00 + 168.00 = 1008.00 EUR。候选总额与核对总额的差为 100.80 − 1008.00 = −907.20 EUR。计算能揭示矛盾，但在真实资料中不构成覆盖原文总额或判定哪项输入错误的授权。

`ai-pdf-data-extraction-workflow-source-manifest.json` 保存实际 PDF 的 SHA-256、页面模式和十个人工设定的字段矩形。这些是围绕可见值布置的坐标，不是 OCR 模型检测结果。`page_index` 从 0 开始；`printed_page` 保留可见页码。矩形以未旋转的 600 × 840 点页面左上角为原点，记录 x/y/宽/高，并给出归一化比例。哈希识别这份字节内容，不证明供应商身份或文档真实性。

独立的坐标算术示例采用 left=0.1、top=0.2、width=0.3、height=0.04，对应 1000 × 1400 像素渲染中的 left=100、top=280、width=300、height=56。这不是 PDF 内任何字段的实际裁切坐标。页面旋转、裁切或输出尺寸变化时，应重新计算实际转换。

## 检查了什么，没有检查什么

本地检查覆盖三页结构、原文件哈希、六个有文本的字段区域、第 3 页无文本层、候选答案和十进制计算。三张渲染页已逐页目视核对可读性、商品对应和来源总额。这不是 OCR 评估，没有运行 OCR 引擎、托管提取 API 或 OpenMax 工作流。合成图刻意保持清晰，不代表真实文件的所有缺陷。

评估真实系统时，应补充获准使用的旋转页、低质量扫描、合并单元格、模板修订、脚注丢失和不支持语言等案例。保留独立答案集，将精确字段正确性、异常发现和整条记录放行分开。敏感或后果重大的用途需由相关专业人员审核，本练习本身不授予上传、存储、付款或写入权限。
