核心 GUIDE

PATTERNINTERMEDIATE6 分钟阅读

AI Capability 的 Least Privilege

只给 AI System 当前 Task 真正需要的 Permission,并尽可能限制 Scope 与 Duration;Irreversible Effect 需要更强 Gate。

核心心智模型

Permission 是 Runtime Capability,不是 Prompt 中的一句话。Least Privilege 会缩小 System 实际能够造成的影响,即使 Model 被 Confuse、Manipulate 或单纯判断错误。

为什么重要

Prompt Instruction 可以影响 Model Behavior,却不是 Hard Security Boundary。如果一个 Tool Credential 同时能读全部 Customer、删除数据与转账,那么一次 Planning Error 或 Prompt Injection 就可能升级成严重 Incident。Narrow Scope、Temporary Capability 与 Action-specific Approval 能独立于 Model Intent 降低 Blast Radius。

01

限制 Identity、Scope 与 Action

把每个 Task 映射到最少 Resource 与 Operation。使用 Scoped Credential / Capability Handle,把 Read 与 Write Permission 分开,并让 Destructive / High-value Operation 经过 Explicit Approval 或更强 Policy Check。限制必须由 Runtime 或 External Service Enforcement,Model 不能靠 Natural-language Request 扩大自己的 Authority。

02

例子:Support Agent 的 Account Access

Support Agent 可以读取当前 Customer Subscription,也可以发放规则内的小额 Credit;但它不能 Enumerate 全部 Customer、修改 Account Ownership 或调用通用 Payment API。超过 Threshold 的 Refund 需要单独 Approved Capability。即使 Retrieved Text 恶意要求更广 Access,Runtime 也没有可授予的 Permission。

常见失败模式

  • 为了方便,让所有 Agent Tool 共用一个 Broad API Key。
  • 依赖 System Prompt 警告,而不是 Permission Enforcement。
  • Task 完成后仍长期保留 Elevated Capability。

工程启发

  • 可行时分离 Read、Write 与 Destructive Capability。
  • 按 User、Resource、Amount 与 Time Scope Permission。
  • 把 Approval 看成 Capability Issuance,而不是一句 Conversational Consent。

关键结论

  1. 01Least Privilege 可以独立于 Model Quality 降低 Blast Radius。
  2. 02Permission 属于 Runtime Enforcement。
  3. 03High-impact Action 应要求更窄、更明确的 Capability。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Tool Contract 与 Schema 设计PREREQUISITEGuide
Runtime Enforcement vs Model PersuasionENABLES