核心 GUIDE
AI System 的 Trust Boundary
Trust Boundary 标记 Data、Instruction 或 Action 在不同 Authority、Ownership 或 Reliability Assumption 的组件之间发生跨越的位置。
核心心智模型
不是所有 Token 都拥有同等 Authority。System Policy、User Intent、Retrieved Document、Tool Output 与 External Side Effect 来自不同 Trust Domain,必须用不同 Authority 与 Validation Rule 处理。
为什么重要
AI Application 常常把所有内容序列化进同一个 Context,视觉上会把 Trusted Policy 与 Untrusted Content 的差异抹平。网页文本可能夹带 Instruction,Tool 可能返回 Malformed Data,User 也可能请求自己无权执行的操作。显式 Trust Boundary 能把 Authority 留在 Runtime Policy,而不是让最有说服力的文本决定什么被允许。
01
标记 Source,并约束 Boundary Crossing
识别低信任信息进入高权限 Decision Domain 的位置:User Input 进入 Policy Logic、Retrieved Content 进入 Agent Context、Model Intent 进入 Tool、Tool Result 进入 Durable State。每个 Crossing 都定义 Sanitization、Validation、Permission Check 与 Provenance Requirement。Model 可以理解数据,但不能通过复述来提升它的 Authority。
02
例子:Retrieved Document 里的恶意 Instruction
Support Agent 检索到 Troubleshooting Page,其中有一句要求 Assistant 导出 Customer Record。Retrieval Relevance 并不会授予 Permission。Document 只能作为 Troubleshooting Evidence 使用,而 Runtime Tool Permission 与 System Policy 会阻止这个无关的 Data-export Action。
常见失败模式
- 把 Trusted Policy 与 Untrusted Retrieved Instruction 混在一个无差别 Text Block。
- 认为 Approved Retrieval System 返回的内容天然可信。
- 让 Model Interpretation 在 Side-effect Boundary 自己决定 Authorization。
工程启发
- 分别追踪 Provenance / Authority 与 Semantic Relevance。
- Permission 在 Tool 或 Runtime Layer Enforcement,而不是靠 Natural-language Instruction。
- 每个 State 或 Authority 改变的 Boundary 都显式设计 Validation。
关键结论
- 01Trust 是 Source 与 Authority 的属性,不是 Fluency 的属性。
- 02Retrieval 与 Tool Output 仍然属于需要验证的 External Input。
- 03即使 Model 被恶意文本说服,Runtime Boundary 也必须继续有效。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。