核心 GUIDE
Metadata Retrieval(元数据检索)
Metadata Retrieval 使用 Tenant、Document Type、Date、Authority、Product 等 Structured Field 约束或排序 Evidence,避免让 Semantic Similarity 独自决定候选集合。
核心心智模型
把 Metadata 看成显式 Retrieval Boundary。Semantic Similarity 回答“什么看起来相关”,Metadata 回答“哪些 Record 在这个 Query 下有资格参与竞争”。
为什么重要
Vector Search 可能找到语义很近、但属于错误 Customer、Jurisdiction、Version 或 Time Period 的 Evidence。Metadata Filter / Boost 可以在候选阶段就建立可解释边界,通常也比让模型或 Reranker 在错误候选集中事后修复更可靠。
01
先过滤 Eligibility,再优化 Relevance
识别定义 Hard Scope 的 Field,例如 Tenant、Permission、Locale、Lifecycle State、Effective Date,并在 Candidate Retrieval 前或过程中应用。Recency、Document Class 等 Soft Metadata 可以作为 Ranking Feature。严格 Filter 前要测 Tagging Quality 与 Recall,Trace 中记录实际 Filter/Boost,便于诊断 Miss。
02
示例:正确 Policy Text 来自错误 Region
Semantic Retriever 回答 UK Refund Question 时返回高度相似的 US Policy,因为两份文档措辞几乎相同。加入 Region 与 Effective-date Metadata 后,Candidate 被限定在真正适用的 Policy Universe,Semantic Ranking 与 Reranking 才在合法候选内比较 Relevance。
常见失败模式
- 用 Semantic Similarity 补偿缺失的 Tenant 或 Permission Boundary。
- 依赖严格 Metadata Filter,却没有检查 Record Tagging 是否完整。
- 把 Metadata 只当 UI 展示字段,而不纳入 Retrieval Logic。
工程启发
- 代表硬业务边界的 Field 应优先用于 Eligibility。
- 依赖 Strict Predicate 前先测 Tagging Quality 与 Filter Recall。
- 在 Trace 中同时记录 Filter、Boost 与 Retrieved Evidence。
关键结论
- 01Metadata 可以决定哪些 Evidence 有资格参与 Relevance Competition。
- 02Hard Scope 应尽量在 Semantic Ranking 前 Enforcement。
- 03一旦 Filter 依赖 Metadata,Metadata Quality 就直接变成 Retrieval Quality。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。