核心 GUIDE

PATTERNFOUNDATION7 分钟阅读

Privacy 与 Data Boundary

AI System 必须显式定义哪些 Data 可以进入 Model、Log、Retrieval Index、Memory 与 Third-party Tool,因为每一次 Boundary Crossing 都会创造不同 Exposure 与 Retention Risk。

核心心智模型

Data 会跨越多个 Trust Domain。Privacy Engineering 应在信息被序列化进 Prompt 或持久化为 AI Context 之前,为每一类 Data 定义 Allowed Purpose、Destination、Retention Period 与 Access Control。

为什么重要

一个有用 AI Feature 很容易无意中复制大量 Sensitive Data。User Message 可能同时进入 Trace、Embedding、Long-term Memory、Support Ticket 与 External Model Call。Data 一旦扩散到多个 Surface,Deletion 与 Access Control 会更困难。明确 Data Boundary 可以减少不必要 Collection,避免 Private Information 仅仅因为“也许对 Model 有帮助”就变成 Ambient Context。

01

先 Classify Data,再决定它流向哪里

识别 Sensitive Field,以及每一次使用它的 Purpose。明确 Data 是否可以发送到 Model Provider、建立 Retrieval Index、写入 Durable Memory、进入 Observability 或暴露给 Tool。最小化 Payload,隔离 Tenant / User Scope,建立 Retention / Deletion Policy,并保存 Provenance,使 Embedding 等 Derived Data 也能追溯回 Source Lifecycle。

02

例子:构建 Support Knowledge Base

Product Documentation 可以被广泛 Index;Customer Ticket 则包含 Account Identifier 与 Private Conversation。系统把 Ticket 存在 Tenant-scoped Operational Storage,只在 Authorized Support Task 中检索很小的 Relevant Excerpt,而不是把 Ticket 混进 Global Knowledge Index,也不会把完整 Conversation 永久保存成 Reusable Memory。

常见失败模式

  • 因为“更多 Context 可能更好”,把所有 Customer Field 都发给 Model。
  • 认为 Embedding / Summary 是 Derived Data,所以天然不敏感。
  • AI Trace 无限期保留,没有 Retention 或 Deletion Path。

工程启发

  • 在 Model、Retrieval、Tool 与 Logging Boundary 都进行 Data Minimization。
  • Tenant / User Scope 要贯穿 Index、Memory 等 Derived Artifact。
  • 在 Data 被复制到多个 Subsystem 之前先设计 Deletion 与 Retention Behavior。

关键结论

  1. 01Privacy 是 Data-flow Architecture 问题。
  2. 02Derived AI Artifact 可能继承 Source 的 Sensitivity。
  3. 03Purpose、Scope 与 Retention 应在 Generation 开始前就限制 Context。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

AI 结果的人类责任RELATED