核心 GUIDE

SYSTEM_COMPONENTINTERMEDIATE6 分钟阅读

Dense、Sparse 与 Hybrid Retrieval

不同 Retrieval Signal 能捕获不同证据;Hybrid Retrieval 将语义相似与精确词项信号结合起来。

核心心智模型

Dense Retrieval 擅长寻找意义相近内容,Sparse Retrieval 擅长精确术语;可靠系统可以先同时扩大 Recall,再选择最终 Evidence。

为什么重要

纯 Vector Retrieval 容易漏掉 ID、Error Code、人名和精确条款;纯 Keyword Search 又可能漏掉 Paraphrase。Hybrid Retrieval 用多个 Signal 改善 Recall,再把更丰富的 Selection 交给后续 Ranking Stage。

01

先 Recall,再 Selection

Dense Retrieval 找语义相似 Passage,Sparse Retrieval 奖励词项重叠。Hybrid Stage 合并 Candidate,必要时再通过 Reranking 使用更丰富的 Query-Document Interaction 对它们评分。最终系统是一条 Pipeline,而不是一个万能 Similarity Score。

02

例子:同时按 Error Code 与语义查 Incident

用户询问“Agent Resume 时的 E_CONN_17”。Sparse Search 能精准找到这个 Error Code,Dense Search 则找到使用不同措辞描述 Resume Failure 的文档。Hybrid Retrieval 会保留两类 Candidate,随后交给 Reranker 决定最终 Evidence。

常见失败模式

  • 把 Embedding Similarity 当作所有 Query 的唯一检索信号。
  • 没有 Calibration 或 Evaluation 就直接混合 Dense 与 Sparse Score。
  • 只看最终 Answer Quality,从而隐藏 Retrieval 本身的问题。

工程启发

  • 先独立评测 Retrieval Recall,再评测 Generation。
  • 保留 Exact Identifier 与 Structured Filter 能力。
  • Candidate 很多但最终 Context 必须很小时使用 Reranking。

关键结论

  1. 01不存在一个 Retrieval Signal 能统治所有 Query。
  2. 02Hybrid Retrieval 首先是一种 Recall Strategy。
  3. 03Retriever 没找到的证据,Generator 无法凭空恢复。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。