核心 GUIDE
Uncertainty Calibration
有用的 Uncertainty 意味着 Confidence 能跟真实 Error Risk 对齐,并进一步改变 System Action、Escalation 与 Communication。
核心心智模型
Calibration 描述 Confidence 与 Outcome 之间的关系:System 认为更确定的 Case 应该真实失败更少;Uncertainty 必须触发 Policy,而不是只作为装饰性措辞。
为什么重要
Language Model 在正确与错误时都可以同样流畅。要求模型输出一个百分比,并不会自动得到 Calibrated Probability。Application 需要 Empirical Evidence,知道哪些 Signal 真的预测 Failure,并为 Weak、Conflicting 或 Distribution-shifted Evidence 定义明确 Action。
01
把 Confidence Signal 与 Real Outcome 校准
选择 Application 可测量的 Confidence Signal,例如 Verifier Agreement、Retrieval Support、Classifier Score 或 Ensemble Variance。在 Labeled Representative Data 上检查不同 Confidence Bin 是否真的对应不同 Error Rate,再把 Threshold 连接到 Answer、Request More Evidence、Abstain 或 Escalate 等具体 Action。
02
例子:Data Extraction 中 Evidence 冲突
Extraction System 在 Table Text 中找到一个 Value,在附近 Note 中又找到另一个 Value。与其输出“95% confident”,系统检测 Evidence Conflict 并把 Field Route 到 Review。历史 Evaluation 显示,这个 Conflict Signal 比 Model Verbal Confidence 更能预测 Error。
常见失败模式
- 未经 Measurement 就把 Model Self-reported Confidence 当成 Calibrated。
- 用模糊措辞表达 Uncertainty,但 System 仍执行完全相同的 Action。
- 只在 Easy Data 上 Calibration,却把 Threshold 应用到 Shifted Production Distribution。
工程启发
- 在哪些 Decision Slice 使用 Threshold,就在哪些 Slice 测 Calibration。
- 优先 Evidence-based Uncertainty Signal,而不是 Confident Language。
- Evidence 不足时,把 Abstention 与 Escalation 当成正常 Outcome。
关键结论
- 01Confidence 只有在能预测 Error Risk 时才有用。
- 02Calibration 是 Empirical Property,不是 Tone-of-voice Feature。
- 03Uncertainty 应该改变 System 做什么。