核心 GUIDE

MENTAL_MODELINTERMEDIATE6 分钟阅读

AI System 的 Trust Boundary

Trust Boundary 标记 Data、Instruction 或 Action 在不同 Authority、Ownership 或 Reliability Assumption 的组件之间发生跨越的位置。

核心心智模型

不是所有 Token 都拥有同等 Authority。System Policy、User Intent、Retrieved Document、Tool Output 与 External Side Effect 来自不同 Trust Domain,必须用不同 Authority 与 Validation Rule 处理。

为什么重要

AI Application 常常把所有内容序列化进同一个 Context,视觉上会把 Trusted Policy 与 Untrusted Content 的差异抹平。网页文本可能夹带 Instruction,Tool 可能返回 Malformed Data,User 也可能请求自己无权执行的操作。显式 Trust Boundary 能把 Authority 留在 Runtime Policy,而不是让最有说服力的文本决定什么被允许。

01

标记 Source,并约束 Boundary Crossing

识别低信任信息进入高权限 Decision Domain 的位置:User Input 进入 Policy Logic、Retrieved Content 进入 Agent Context、Model Intent 进入 Tool、Tool Result 进入 Durable State。每个 Crossing 都定义 Sanitization、Validation、Permission Check 与 Provenance Requirement。Model 可以理解数据,但不能通过复述来提升它的 Authority。

02

例子:Retrieved Document 里的恶意 Instruction

Support Agent 检索到 Troubleshooting Page,其中有一句要求 Assistant 导出 Customer Record。Retrieval Relevance 并不会授予 Permission。Document 只能作为 Troubleshooting Evidence 使用,而 Runtime Tool Permission 与 System Policy 会阻止这个无关的 Data-export Action。

常见失败模式

  • 把 Trusted Policy 与 Untrusted Retrieved Instruction 混在一个无差别 Text Block。
  • 认为 Approved Retrieval System 返回的内容天然可信。
  • 让 Model Interpretation 在 Side-effect Boundary 自己决定 Authorization。

工程启发

  • 分别追踪 Provenance / Authority 与 Semantic Relevance。
  • Permission 在 Tool 或 Runtime Layer Enforcement,而不是靠 Natural-language Instruction。
  • 每个 State 或 Authority 改变的 Boundary 都显式设计 Validation。

关键结论

  1. 01Trust 是 Source 与 Authority 的属性,不是 Fluency 的属性。
  2. 02Retrieval 与 Tool Output 仍然属于需要验证的 External Input。
  3. 03即使 Model 被恶意文本说服,Runtime Boundary 也必须继续有效。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Prompt Injection 需要 Runtime DefensePREREQUISITE