核心 GUIDE
Privacy 与 Data Boundary
AI System 必须显式定义哪些 Data 可以进入 Model、Log、Retrieval Index、Memory 与 Third-party Tool,因为每一次 Boundary Crossing 都会创造不同 Exposure 与 Retention Risk。
核心心智模型
Data 会跨越多个 Trust Domain。Privacy Engineering 应在信息被序列化进 Prompt 或持久化为 AI Context 之前,为每一类 Data 定义 Allowed Purpose、Destination、Retention Period 与 Access Control。
为什么重要
一个有用 AI Feature 很容易无意中复制大量 Sensitive Data。User Message 可能同时进入 Trace、Embedding、Long-term Memory、Support Ticket 与 External Model Call。Data 一旦扩散到多个 Surface,Deletion 与 Access Control 会更困难。明确 Data Boundary 可以减少不必要 Collection,避免 Private Information 仅仅因为“也许对 Model 有帮助”就变成 Ambient Context。
01
先 Classify Data,再决定它流向哪里
识别 Sensitive Field,以及每一次使用它的 Purpose。明确 Data 是否可以发送到 Model Provider、建立 Retrieval Index、写入 Durable Memory、进入 Observability 或暴露给 Tool。最小化 Payload,隔离 Tenant / User Scope,建立 Retention / Deletion Policy,并保存 Provenance,使 Embedding 等 Derived Data 也能追溯回 Source Lifecycle。
02
例子:构建 Support Knowledge Base
Product Documentation 可以被广泛 Index;Customer Ticket 则包含 Account Identifier 与 Private Conversation。系统把 Ticket 存在 Tenant-scoped Operational Storage,只在 Authorized Support Task 中检索很小的 Relevant Excerpt,而不是把 Ticket 混进 Global Knowledge Index,也不会把完整 Conversation 永久保存成 Reusable Memory。
常见失败模式
- 因为“更多 Context 可能更好”,把所有 Customer Field 都发给 Model。
- 认为 Embedding / Summary 是 Derived Data,所以天然不敏感。
- AI Trace 无限期保留,没有 Retention 或 Deletion Path。
工程启发
- 在 Model、Retrieval、Tool 与 Logging Boundary 都进行 Data Minimization。
- Tenant / User Scope 要贯穿 Index、Memory 等 Derived Artifact。
- 在 Data 被复制到多个 Subsystem 之前先设计 Deletion 与 Retention Behavior。
关键结论
- 01Privacy 是 Data-flow Architecture 问题。
- 02Derived AI Artifact 可能继承 Source 的 Sensitivity。
- 03Purpose、Scope 与 Retention 应在 Generation 开始前就限制 Context。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。