核心 GUIDE

CONCEPTFOUNDATION6 分钟阅读

Vector Similarity 是 Retrieval Signal

Vector Similarity 衡量 Embedding Space 中的接近程度;它适合做 Candidate Retrieval,但不能等同 Truth、Authority 或最终 Task Relevance。

核心心智模型

Embedding 把 Content 映射成 Vector,Similarity Function 再对 Geometric Closeness 排序。这个 Score 只说明“在这个 Representation Model 下它们很接近”,并不说明 Source 正确、最新或足够。

为什么重要

Vector Search 看起来很 Semantic,因此团队很容易过度信任 Score。非常 Similar 的 Passage 可能已经过期、重复同一个 Source、缺失关键 Identifier,或者只是和主题相关却不适用于当前 User Situation。可靠 Retrieval 会把 Similarity 当成 Pipeline 中的一个 Feature,并结合 Lexical Signal、Metadata、Authority 与 Reranking。

01

Similarity 负责 Recall,之后再做更强 Selection

使用兼容 Embedding Model 对 Query 与 Candidate Chunk 编码,计算 Cosine Similarity 等指标,先取得较宽 Candidate Set。之后使用 Scope、Metadata、Source Authority、Recency 与 Exact Identifier 继续 Filter / Rank。需要通过 Labeled Query 评估 Recall,让 Threshold 与 Top-k 来自 Evidence,而不是拍脑袋。

02

例子:两份措辞很像的 Refund Policy

旧版和新版 Refund Policy 因为大部分 Wording 一样,在 Embedding Space 中非常接近。Pure Vector Similarity 可能把旧 Policy 排第一。加入 Effective-date Metadata 与 Source Priority 后,系统仍保留 Semantic Recall,但最终 Selection 会让 Current Controlling Policy 胜出。

常见失败模式

  • 把 High Similarity Score 理解成 Factual Correctness。
  • 没有按 Query Type Evaluation,就使用统一 Similarity Threshold。
  • 因为 Embedding 看起来更智能,就忽略 Exact ID、Date 与 Authority。

工程启发

  • 先测 Retrieval Recall,再调整 Generation Prompt。
  • 任务需要时,把 Vector Similarity 与 Metadata、Lexical、Authority Signal 结合。
  • 按 Query Slice 检查 False Positive 与 False Negative。

关键结论

  1. 01Similarity 是 Geometric Evidence,不是 Epistemic Authority。
  2. 02Retrieval Quality 由完整 Candidate-selection Pipeline 决定。
  3. 03Retriever 没有 Surface 的 Evidence,Model 无法可靠使用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Embedding 作为语义坐标PREREQUISITE