核心 GUIDE

PRACTICEFOUNDATION6 分钟阅读

Document Extraction 是保留 Evidence 的 Transformation

Document Extraction 应把复杂 Source 转成 Structured Evidence,同时保留 Location、Provenance 与 Uncertainty。

核心心智模型

Extraction 是从 Source Artifact 到 Structured Field 的可追溯 Transformation:每个重要 Value 都应该保留足够 Provenance,能够回到产生它的 Page、Region、Table、Row 或 Passage。

为什么重要

AI 可以快速把 PDF、Scan、Spreadsheet 与混合文档转成方便使用的 JSON,但如果 Value 在结构化过程中失去 Source Context,这种便利会变成风险。一个数字可能来自错误列,Footnote 可能改变含义,OCR 也可能悄悄改掉 Unit。只有当 Extraction 保留 Evidence,并显式暴露 Uncertainty 时,后续 Analysis 才真正可辩护。

01

分离 Capture、Normalization 与 Validation

第一步先 Capture Source-local Evidence,例如 Text Block、Table Cell、Coordinate 或 Page Reference。第二步把 Evidence Normalization 成 Target Schema,但不要丢失 Original Representation。最后验证 Type、Unit、Required Field 与 Cross-field Constraint。遇到 Ambiguous Extraction 时,应保留 Candidate Value 或明确 Low-confidence State,而不是为了填满字段制造确定性。

02

例子:提取 Quarterly Revenue

一份 Report 中有 Revenue Table,单位是 Millions,同时 Footnote 排除了一个 Business Unit。Extractor 除了保存 Numeric Value,还记录 Page、Table、Row、Column、Unit 与 Footnote Reference。之后 Analysis 才能区分真正的 Revenue Change、Parsing Error,以及 Reporting Definition 的变化。

常见失败模式

  • 只把 Value 压平成 JSON,不保留 Source Location 与 Provenance。
  • 静默转换 Unit 或 Date,却不保留 Original Value。
  • 强迫不确定 Cell 输出唯一答案,而不是保留 Ambiguity。

工程启发

  • 对高影响 Extracted Field 附带 Source Coordinate 或 Stable Citation。
  • Extraction 后验证 Unit、Range 与字段关系,而不仅是 Syntax。
  • 保留 Raw Evidence,让争议 Value 可以重新检查。

关键结论

  1. 01Extraction Quality 包含 Provenance,不只是字段 Accuracy。
  2. 02Normalization 不应该破坏返回 Source 的路径。
  3. 03不确定 Extraction 在 Verification 前应该继续保持不确定。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

先结构化分析,再综合PREREQUISITE