核心 GUIDE

MENTAL_MODELFOUNDATION7 分钟阅读

Runtime Enforcement

Runtime Enforcement 会把 Policy 从“建议”变成 Executable Constraint:即使模型提出不安全方案,系统仍能控制哪些 Action、Data 与 Side Effect 真正被允许通过。

核心心智模型

Prompting 影响 Model Behavior;Runtime Enforcement 约束 System Behavior。Gate、Scoped Credential、Validator、Schema、Approval Check 与 Deny Rule 都是 Outside-model Mechanism,可以让被禁止的 Action 无法发生或至少可被观察。

为什么重要

模型是 Probabilistic 且受 Context 影响,因此强 Prompt 可以降低 Unsafe Proposal,却无法把概率降到绝对零。Permission、Money、Privacy 与 Irreversible Action 如果只依赖 Persuasion,就形成单一脆弱层。Runtime Enforcement 为应用提供 Deterministic Leverage,也能产生 Policy 真正被执行的 Evidence。

01

在 Side Effect 穿过 Runtime 时放置 Hard Constraint

识别高后果 Capability Boundary,并在执行前 Enforcement:验证 Structured Input、检查 User/Task Authorization、Scope Credential、要求 Approval,并拒绝不允许的组合。Model Recommendation 可以保留用于 Diagnosis,但 Runtime 必须独立决定 Proposed Action 是否可执行。

02

示例:Prompt 写着“绝不导出 Customer Data”

Agent 被 Prompt 要求绝不导出完整 Customer Record,但一个 Injected Document 诱导它调用 Export Tool。如果 Runtime 使用 Broad Credential,Prompt Failure 就会直接变成 Breach。使用 Scoped Capability 与 External Export Deny Rule 后,不管模型输出什么,Proposed Call 都会被 Block 并记录。

常见失败模式

  • 把 Prompt Refusal Language 当成 Sensitive Tool 的唯一保护。
  • Side Effect 已发生后才设置 Runtime Gate。
  • Enforcement Rule 没有 Observable Reason Code 或 Audit Evidence。

工程启发

  • 在 Side Effect 执行前 Enforcement 高后果 Policy。
  • Credential 与 Capability Scope 到 Current Task。
  • 返回 Structured Block Reason,让 Failure 保持可诊断。

关键结论

  1. 01Runtime Enforcement 约束的是 Action,而不只是 Model Intention。
  2. 02Hard Guarantee 需要 Model 之外的 Control。
  3. 03被 Block 的 Action 应产生 Evidence,而不是静默消失。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。