核心 GUIDE
Runtime Enforcement
Runtime Enforcement 会把 Policy 从“建议”变成 Executable Constraint:即使模型提出不安全方案,系统仍能控制哪些 Action、Data 与 Side Effect 真正被允许通过。
核心心智模型
Prompting 影响 Model Behavior;Runtime Enforcement 约束 System Behavior。Gate、Scoped Credential、Validator、Schema、Approval Check 与 Deny Rule 都是 Outside-model Mechanism,可以让被禁止的 Action 无法发生或至少可被观察。
为什么重要
模型是 Probabilistic 且受 Context 影响,因此强 Prompt 可以降低 Unsafe Proposal,却无法把概率降到绝对零。Permission、Money、Privacy 与 Irreversible Action 如果只依赖 Persuasion,就形成单一脆弱层。Runtime Enforcement 为应用提供 Deterministic Leverage,也能产生 Policy 真正被执行的 Evidence。
01
在 Side Effect 穿过 Runtime 时放置 Hard Constraint
识别高后果 Capability Boundary,并在执行前 Enforcement:验证 Structured Input、检查 User/Task Authorization、Scope Credential、要求 Approval,并拒绝不允许的组合。Model Recommendation 可以保留用于 Diagnosis,但 Runtime 必须独立决定 Proposed Action 是否可执行。
02
示例:Prompt 写着“绝不导出 Customer Data”
Agent 被 Prompt 要求绝不导出完整 Customer Record,但一个 Injected Document 诱导它调用 Export Tool。如果 Runtime 使用 Broad Credential,Prompt Failure 就会直接变成 Breach。使用 Scoped Capability 与 External Export Deny Rule 后,不管模型输出什么,Proposed Call 都会被 Block 并记录。
常见失败模式
- 把 Prompt Refusal Language 当成 Sensitive Tool 的唯一保护。
- Side Effect 已发生后才设置 Runtime Gate。
- Enforcement Rule 没有 Observable Reason Code 或 Audit Evidence。
工程启发
- 在 Side Effect 执行前 Enforcement 高后果 Policy。
- Credential 与 Capability Scope 到 Current Task。
- 返回 Structured Block Reason,让 Failure 保持可诊断。
关键结论
- 01Runtime Enforcement 约束的是 Action,而不只是 Model Intention。
- 02Hard Guarantee 需要 Model 之外的 Control。
- 03被 Block 的 Action 应产生 Evidence,而不是静默消失。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。