核心 GUIDE
AI Capability 的 Least Privilege
只给 AI System 当前 Task 真正需要的 Permission,并尽可能限制 Scope 与 Duration;Irreversible Effect 需要更强 Gate。
核心心智模型
Permission 是 Runtime Capability,不是 Prompt 中的一句话。Least Privilege 会缩小 System 实际能够造成的影响,即使 Model 被 Confuse、Manipulate 或单纯判断错误。
为什么重要
Prompt Instruction 可以影响 Model Behavior,却不是 Hard Security Boundary。如果一个 Tool Credential 同时能读全部 Customer、删除数据与转账,那么一次 Planning Error 或 Prompt Injection 就可能升级成严重 Incident。Narrow Scope、Temporary Capability 与 Action-specific Approval 能独立于 Model Intent 降低 Blast Radius。
01
限制 Identity、Scope 与 Action
把每个 Task 映射到最少 Resource 与 Operation。使用 Scoped Credential / Capability Handle,把 Read 与 Write Permission 分开,并让 Destructive / High-value Operation 经过 Explicit Approval 或更强 Policy Check。限制必须由 Runtime 或 External Service Enforcement,Model 不能靠 Natural-language Request 扩大自己的 Authority。
02
例子:Support Agent 的 Account Access
Support Agent 可以读取当前 Customer Subscription,也可以发放规则内的小额 Credit;但它不能 Enumerate 全部 Customer、修改 Account Ownership 或调用通用 Payment API。超过 Threshold 的 Refund 需要单独 Approved Capability。即使 Retrieved Text 恶意要求更广 Access,Runtime 也没有可授予的 Permission。
常见失败模式
- 为了方便,让所有 Agent Tool 共用一个 Broad API Key。
- 依赖 System Prompt 警告,而不是 Permission Enforcement。
- Task 完成后仍长期保留 Elevated Capability。
工程启发
- 可行时分离 Read、Write 与 Destructive Capability。
- 按 User、Resource、Amount 与 Time Scope Permission。
- 把 Approval 看成 Capability Issuance,而不是一句 Conversational Consent。
关键结论
- 01Least Privilege 可以独立于 Model Quality 降低 Blast Radius。
- 02Permission 属于 Runtime Enforcement。
- 03High-impact Action 应要求更窄、更明确的 Capability。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。