核心 GUIDE

MENTAL_MODELINTERMEDIATE6 分钟阅读

Confidence、Variance 与 Sample-size Humility

AI Evaluation Result 是对 Variable System 的 Sampling;可信 Confidence 需要 Repeated Observation、Uncertainty Estimate 与足够 Sample。

核心心智模型

Measured Success Rate 是 Estimate,不是 Model 固有常数。它是否有用取决于 Sample Size、Trial Variance、Task Mix,以及这个 Slice 是否真的代表你要做的 Production Decision。

为什么重要

小 Eval Set 中只差几个 Example,就可能造成看起来很大的 Percentage Swing。Stochastic Generation 又增加一层 Variance,而 Aggregate Score 还能隐藏不稳定 Subgroup。缺少 Statistical Humility 时,团队可能因为 Noise-looking Improvement 发布 Regression,也可能因为一个 Tiny Slice 偶然失败而错误 Block 有价值 Change。

01

测量 Metric 周围的 Uncertainty

运行足够 Task 与 Repeated Trial,刻画真正影响 Product 的 Variability。Point Estimate 旁同时报告 Count、Interval 或其他 Uncertainty Summary。按 Predefined Slice 拆分结果,并让 Candidate 在 Matched Condition 下比较。对于高影响 Release Decision,需要足够 Evidence,确保结论不会因为合理 Sampling Noise 就轻易反转。

02

例子:20 个 Task 上 90% vs 95%

New Model 通过 19/20,Baseline 通过 18/20。直接宣布“提升 5 个百分点”会夸大 Sample 能支持的结论,因为只多一次 Failure 就会大幅改变故事。更大的 Matched Suite 与 Repeated Trial 才能判断 Improvement 是否稳定,而不是 Noise。

常见失败模式

  • 只报告 Percentage,不展示 Numerator 与 Denominator。
  • 每个 Task 只运行一次,就当 Stochastic Variance 不存在。
  • 用 Aggregate Improvement 掩盖 Critical Slice Regression。

工程启发

  • Rate 与 Score 旁边同时展示 Raw Count。
  • False Positive / False Negative 成本越高,越应该扩大 Sample。
  • 预先定义 Critical Slice,并单独检查它们的 Variance。

关键结论

  1. 01Point Estimate 需要 Uncertainty Context。
  2. 02Small Sample 容易制造过度自信的 Release Decision。
  3. 03Variance 是 System Behavior 的一部分,不应该被平均值掩盖。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Dataset Slice、Regression 与 Aggregate Improvement 陷阱ENABLES