核心 GUIDE

CONCEPTFOUNDATION7 分钟阅读

Embeddings 与 Semantic Space

Embedding 把输入编码成向量,向量几何可以表达特定模型下的相似模式,用于 Retrieval 与聚类;但距离本身不等于意义、事实或 Source Authority。

核心心智模型

Embedding Space 是一个学习出来的表示坐标系。相近向量通常在该模型看来共享某些语义特征,但这种几何关系只是检索信号,并继承模型、数据、Chunking 和任务定义中的假设。

为什么重要

Embedding 是现代 Retrieval 的基础,但它常被误解成“把概念放进一个普适的意义地图”。实际效果取决于 Embedding Model 以及输入如何切分和预处理。两段内容可以因为主题相似而非常接近,却在日期、地区、产品版本或 Source Authority 上完全不同。

01

把表示看成与任务相关的测量

选择适合数据和 Retrieval 任务的 Embedding Model,对文档与 Query 使用一致的变换,并把过滤与治理所需 Metadata 和向量一起保存。应使用带标注的真实 Query 验证邻域质量,而不是只看 Demo。若任务依赖精确字符串、日期或 ID,则需要把语义几何与 Lexical、结构化信号组合。

02

示例:高度相似但 Authority 不同的政策

旧退款政策与新版政策大部分文字完全相同,因此 Vector 很接近。Semantic Retriever 把两者都召回并没有错,但最终必须由生效日期和 Source Priority 让当前政策胜出。Embedding 负责提供 Candidate,Pipeline 仍然负责 Authority 和最终选择。

常见失败模式

  • 把 Embedding Distance 当成客观的概念真值。
  • 更换 Embedding Model 后不重建或不验证已有向量。
  • 因为语义检索 Demo 看起来聪明,就放弃 Metadata。

工程启发

  • 先用真实 Query Slice 测 Retrieval Recall,再决定阈值和 top-k。
  • 把 Embedding Model、预处理和 Vector Index 一起版本化。
  • 需要精确约束时,把 Semantic、Lexical、Metadata 与 Authority 信号组合。

关键结论

  1. 01Embedding Space 是学习得到且依赖模型的。
  2. 02几何相似是 Retrieval 证据,不是最终 Authority。
  3. 03Representation、Retrieval 与 Ranking 应作为一个系统评测。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。