核心 GUIDE

MENTAL_MODELINTERMEDIATE7 分钟阅读

Reasoning Budget(推理预算)

Reasoning Effort 是工程预算,不是免费的 Quality 开关。更多 Search、Deliberation 或 Model Effort 可能改善困难任务,但同时增加 Latency、Cost,甚至扩大 Error Exposure。

核心心智模型

Reasoning Budget 用来分配一个 Task 值得多少 Computation、Search Depth、Tool Use 或 Deliberation,以及何时必须 Answer、Escalate 或 Stop。合适预算取决于任务后果与边际 Evidence Gain。

为什么重要

永远最大化 Reasoning 的系统会变慢、变贵;永远最小化则会在 Ambiguous 或 Multi-step Task 上失败。预算化可以显式管理这种 Trade-off,让简单请求走低成本路径,把更深 Reasoning 留给额外 Evidence 真正可能改变决策的 Case。

01

根据 Uncertainty 与 Consequence 升级 Reasoning Effort

从最便宜但足够胜任的路径开始,并定义何时值得增加工作:Evidence Conflict、Low Confidence、High Consequence、Verification Failure 或 Unresolved Dependency。对 Step、Tool Call 与 Elapsed Time 设置显式 Ceiling。每增加一轮 Reasoning,都检查新 Evidence 是否真的改变 Decision;如果没有,就应 Stop 或 Human Escalation。

02

示例:所有客服问题都走最深 Agent Flow

Support Product 连 Password Reset 也走长 Planning Loop、多次 Search 与 Self-check,Latency 显著增加但 Quality 没有改善。改造后 Routine Intent 走 Bounded Direct Path,而 Payment Dispute 与 Policy Uncertainty 才获得更大的 Reasoning Budget 与 Verification。

常见失败模式

  • 把 Maximum Reasoning Effort 作为每个 Request 的默认值。
  • Evidence 已经不再改变 Decision,却继续增加 Step。
  • 对 Uncertain Long-horizon Task 不设置 Stop 或 Escalation Boundary。

工程启发

  • Reasoning Effort 随 Task Consequence 与 Uncertainty 调整。
  • 增加 Search 或 Deliberation 后测量 Marginal Evidence Gain。
  • 运行前就为 Step、Tool Call 与 Wall-clock Time 设置上限。

关键结论

  1. 01更多 Reasoning 并不单调地带来更好结果。
  2. 02Budget 会把 Reasoning Effort 变成显式的产品与可靠性决策。
  3. 03Stop Rule 是 Reasoning Design 的一部分,而不是事后补丁。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。