核心 GUIDE
Confidence、Variance 与 Sample-size Humility
AI Evaluation Result 是对 Variable System 的 Sampling;可信 Confidence 需要 Repeated Observation、Uncertainty Estimate 与足够 Sample。
核心心智模型
Measured Success Rate 是 Estimate,不是 Model 固有常数。它是否有用取决于 Sample Size、Trial Variance、Task Mix,以及这个 Slice 是否真的代表你要做的 Production Decision。
为什么重要
小 Eval Set 中只差几个 Example,就可能造成看起来很大的 Percentage Swing。Stochastic Generation 又增加一层 Variance,而 Aggregate Score 还能隐藏不稳定 Subgroup。缺少 Statistical Humility 时,团队可能因为 Noise-looking Improvement 发布 Regression,也可能因为一个 Tiny Slice 偶然失败而错误 Block 有价值 Change。
01
测量 Metric 周围的 Uncertainty
运行足够 Task 与 Repeated Trial,刻画真正影响 Product 的 Variability。Point Estimate 旁同时报告 Count、Interval 或其他 Uncertainty Summary。按 Predefined Slice 拆分结果,并让 Candidate 在 Matched Condition 下比较。对于高影响 Release Decision,需要足够 Evidence,确保结论不会因为合理 Sampling Noise 就轻易反转。
02
例子:20 个 Task 上 90% vs 95%
New Model 通过 19/20,Baseline 通过 18/20。直接宣布“提升 5 个百分点”会夸大 Sample 能支持的结论,因为只多一次 Failure 就会大幅改变故事。更大的 Matched Suite 与 Repeated Trial 才能判断 Improvement 是否稳定,而不是 Noise。
常见失败模式
- 只报告 Percentage,不展示 Numerator 与 Denominator。
- 每个 Task 只运行一次,就当 Stochastic Variance 不存在。
- 用 Aggregate Improvement 掩盖 Critical Slice Regression。
工程启发
- Rate 与 Score 旁边同时展示 Raw Count。
- False Positive / False Negative 成本越高,越应该扩大 Sample。
- 预先定义 Critical Slice,并单独检查它们的 Variance。
关键结论
- 01Point Estimate 需要 Uncertainty Context。
- 02Small Sample 容易制造过度自信的 Release Decision。
- 03Variance 是 System Behavior 的一部分,不应该被平均值掩盖。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。