核心 GUIDE
Vector Similarity 是 Retrieval Signal
Vector Similarity 衡量 Embedding Space 中的接近程度;它适合做 Candidate Retrieval,但不能等同 Truth、Authority 或最终 Task Relevance。
核心心智模型
Embedding 把 Content 映射成 Vector,Similarity Function 再对 Geometric Closeness 排序。这个 Score 只说明“在这个 Representation Model 下它们很接近”,并不说明 Source 正确、最新或足够。
为什么重要
Vector Search 看起来很 Semantic,因此团队很容易过度信任 Score。非常 Similar 的 Passage 可能已经过期、重复同一个 Source、缺失关键 Identifier,或者只是和主题相关却不适用于当前 User Situation。可靠 Retrieval 会把 Similarity 当成 Pipeline 中的一个 Feature,并结合 Lexical Signal、Metadata、Authority 与 Reranking。
01
Similarity 负责 Recall,之后再做更强 Selection
使用兼容 Embedding Model 对 Query 与 Candidate Chunk 编码,计算 Cosine Similarity 等指标,先取得较宽 Candidate Set。之后使用 Scope、Metadata、Source Authority、Recency 与 Exact Identifier 继续 Filter / Rank。需要通过 Labeled Query 评估 Recall,让 Threshold 与 Top-k 来自 Evidence,而不是拍脑袋。
02
例子:两份措辞很像的 Refund Policy
旧版和新版 Refund Policy 因为大部分 Wording 一样,在 Embedding Space 中非常接近。Pure Vector Similarity 可能把旧 Policy 排第一。加入 Effective-date Metadata 与 Source Priority 后,系统仍保留 Semantic Recall,但最终 Selection 会让 Current Controlling Policy 胜出。
常见失败模式
- 把 High Similarity Score 理解成 Factual Correctness。
- 没有按 Query Type Evaluation,就使用统一 Similarity Threshold。
- 因为 Embedding 看起来更智能,就忽略 Exact ID、Date 与 Authority。
工程启发
- 先测 Retrieval Recall,再调整 Generation Prompt。
- 任务需要时,把 Vector Similarity 与 Metadata、Lexical、Authority Signal 结合。
- 按 Query Slice 检查 False Positive 与 False Negative。
关键结论
- 01Similarity 是 Geometric Evidence,不是 Epistemic Authority。
- 02Retrieval Quality 由完整 Candidate-selection Pipeline 决定。
- 03Retriever 没有 Surface 的 Evidence,Model 无法可靠使用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。