核心 GUIDE
Document Extraction 是保留 Evidence 的 Transformation
Document Extraction 应把复杂 Source 转成 Structured Evidence,同时保留 Location、Provenance 与 Uncertainty。
核心心智模型
Extraction 是从 Source Artifact 到 Structured Field 的可追溯 Transformation:每个重要 Value 都应该保留足够 Provenance,能够回到产生它的 Page、Region、Table、Row 或 Passage。
为什么重要
AI 可以快速把 PDF、Scan、Spreadsheet 与混合文档转成方便使用的 JSON,但如果 Value 在结构化过程中失去 Source Context,这种便利会变成风险。一个数字可能来自错误列,Footnote 可能改变含义,OCR 也可能悄悄改掉 Unit。只有当 Extraction 保留 Evidence,并显式暴露 Uncertainty 时,后续 Analysis 才真正可辩护。
01
分离 Capture、Normalization 与 Validation
第一步先 Capture Source-local Evidence,例如 Text Block、Table Cell、Coordinate 或 Page Reference。第二步把 Evidence Normalization 成 Target Schema,但不要丢失 Original Representation。最后验证 Type、Unit、Required Field 与 Cross-field Constraint。遇到 Ambiguous Extraction 时,应保留 Candidate Value 或明确 Low-confidence State,而不是为了填满字段制造确定性。
02
例子:提取 Quarterly Revenue
一份 Report 中有 Revenue Table,单位是 Millions,同时 Footnote 排除了一个 Business Unit。Extractor 除了保存 Numeric Value,还记录 Page、Table、Row、Column、Unit 与 Footnote Reference。之后 Analysis 才能区分真正的 Revenue Change、Parsing Error,以及 Reporting Definition 的变化。
常见失败模式
- 只把 Value 压平成 JSON,不保留 Source Location 与 Provenance。
- 静默转换 Unit 或 Date,却不保留 Original Value。
- 强迫不确定 Cell 输出唯一答案,而不是保留 Ambiguity。
工程启发
- 对高影响 Extracted Field 附带 Source Coordinate 或 Stable Citation。
- Extraction 后验证 Unit、Range 与字段关系,而不仅是 Syntax。
- 保留 Raw Evidence,让争议 Value 可以重新检查。
关键结论
- 01Extraction Quality 包含 Provenance,不只是字段 Accuracy。
- 02Normalization 不应该破坏返回 Source 的路径。
- 03不确定 Extraction 在 Verification 前应该继续保持不确定。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。