核心 GUIDE
Attention Budget(注意力预算)
Context Window 变大并不等于有效 Attention 无限。每增加一段 Token 都会与真正相关的信息竞争模型注意力、Latency 与 Cost,因此 Context 仍然需要围绕任务证据做预算。
核心心智模型
把 Attention 看成一种稀缺资源分配问题。Context Capacity 回答“能装多少”,Attention Budget 回答“这次决策里哪些 Instruction、Evidence 与 State 值得占用模型有限的有效注意力”。
为什么重要
很多团队遇到回答变差时,会继续塞入更多文档、History 与 Example。Prompt 变长并不代表 Signal 变强,反而可能稀释重点。Attention Budget 迫使系统显式权衡 Relevance、Redundancy 与 Cost,并把基础层的 Context Window 机制连接到生产级 Context Engineering。
01
按决策价值分配 Context
先确定模型真正要做的 Decision,再为不可违反的 Instruction、当前 Task State 与足以改变决策的最小 Evidence Set 预留 Context。重复背景应删除,旧 Conversation 可压缩,补充细节按需 Retrieval。每增加一块 Context,都要验证它是否真的改善目标 Outcome,并值得额外 Token 与 Latency。
02
示例:客服 Agent 每次都携带完整账户历史
Support Agent 每次请求都带上几十页 Customer History、Product Documentation 与旧 Tool Trace。Refund Policy 虽然在 Context 里,却被大量背景淹没。改造后只保留当前 Policy、Active Order、Recent Turns,并把旧历史改成按需 Retrieval。重要 Evidence 在 Working Context 中占比提高后,回答质量反而更稳定。
常见失败模式
- 把最大 Context Window 大小等同于有效任务 Context。
- 不断增加 Retrieved Documents,却不测它们是否挤占更高价值 Evidence。
- 因为“删信息看起来更危险”而长期保留重复 History,最终稀释 Attention。
工程启发
- 优先给 Authority、Current State 与 Decision-changing Evidence 分配预算。
- 优先使用 Selective Retrieval 与 Compression,而不是永久累积 Prompt。
- 按每一块 Context 的边际 Outcome Gain 评估价值,而不是看它单独是否“信息丰富”。
关键结论
- 01Context Capacity 不等于 Effective Attention。
- 02Token 即使装得下,也可能让 Signal 变弱。
- 03Attention Budget 是从 Context Window 机制走向 Context Engineering 的关键桥梁。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。