核心 GUIDE
SYSTEM_COMPONENTINTERMEDIATE6 分钟阅读
Dense、Sparse 与 Hybrid Retrieval
不同 Retrieval Signal 能捕获不同证据;Hybrid Retrieval 将语义相似与精确词项信号结合起来。
核心心智模型
Dense Retrieval 擅长寻找意义相近内容,Sparse Retrieval 擅长精确术语;可靠系统可以先同时扩大 Recall,再选择最终 Evidence。
为什么重要
纯 Vector Retrieval 容易漏掉 ID、Error Code、人名和精确条款;纯 Keyword Search 又可能漏掉 Paraphrase。Hybrid Retrieval 用多个 Signal 改善 Recall,再把更丰富的 Selection 交给后续 Ranking Stage。
01
先 Recall,再 Selection
Dense Retrieval 找语义相似 Passage,Sparse Retrieval 奖励词项重叠。Hybrid Stage 合并 Candidate,必要时再通过 Reranking 使用更丰富的 Query-Document Interaction 对它们评分。最终系统是一条 Pipeline,而不是一个万能 Similarity Score。
02
例子:同时按 Error Code 与语义查 Incident
用户询问“Agent Resume 时的 E_CONN_17”。Sparse Search 能精准找到这个 Error Code,Dense Search 则找到使用不同措辞描述 Resume Failure 的文档。Hybrid Retrieval 会保留两类 Candidate,随后交给 Reranker 决定最终 Evidence。
常见失败模式
- 把 Embedding Similarity 当作所有 Query 的唯一检索信号。
- 没有 Calibration 或 Evaluation 就直接混合 Dense 与 Sparse Score。
- 只看最终 Answer Quality,从而隐藏 Retrieval 本身的问题。
工程启发
- 先独立评测 Retrieval Recall,再评测 Generation。
- 保留 Exact Identifier 与 Structured Filter 能力。
- Candidate 很多但最终 Context 必须很小时使用 Reranking。
关键结论
- 01不存在一个 Retrieval Signal 能统治所有 Query。
- 02Hybrid Retrieval 首先是一种 Recall Strategy。
- 03Retriever 没找到的证据,Generator 无法凭空恢复。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。