平均分可以掩盖尾部风险
整体分数升高,可以同时存在一个足以阻止发布的小规模高后果切片退化。
Agent v2 在总分面板上看起来更好了。你的任务不是继续调 Agent,而是调试 Evaluation:现有证据到底够不够支撑发布?
先处理问题,再阅读解释。
把结果整理成可以复用的判断。
整体分数升高,可以同时存在一个足以阻止发布的小规模高后果切片退化。
Evaluation 的样本分布决定哪些失败有足够权重进入总分,并真正影响发布。
有些安全条件不应该继续和其他简单场景求平均,而应该直接阻止发布。
当样本不足或 Judge 覆盖有限时,一个正向变化并不自动等于可信提升。
候选系统可能提高任务质量,同时让每个成功结果的成本变得更差。
把这次体验连接到概念、参考与迁移。
生产系统心智模型
AI 系统很少在所有场景里均匀失败。一个候选版本可能改善常见问题,却在长链路任务、少见工具序列或安全关键动作上退化。如果 Evaluation 把所有场景压成一个平均分,真正重要的失败就会消失在漂亮的 headline number 里。
偏 Demo 的数据集会过度强调团队已经知道怎么解决的场景。接近生产分布的数据集,会让困难和高后果场景拥有更合理的影响力。本实验使用固定的合成切片分数,让你把注意力集中在评测设计,而不是模型随机性。
全局阈值问的是“平均表现是否足够高”;veto 问的是“某种失败是否无论平均分多高都不可接受”。如果系统可以执行不可逆退款,一次安全退化就可能值得成为硬发布 Gate。
随着样本量增加,模拟中的证据区间会变窄,这展示了小样本为什么证据更弱。但从有偏分布中继续收集更多样本,并不会让它变得有代表性。样本量和数据集设计是两项独立决策。
确定性检查稳定、便宜,但可能漏掉语义或流程层面的缺陷;Rubric Judge 能覆盖更细的质量判断,却引入 Judge 噪声和成本;混合评测把互补方法组合起来。没有一种方法永远正确,关键是它是否覆盖你真正关心的失败模式。
所有切片分数、证据区间、Judge 噪声和成本都是用于教学的合成值。这里没有运行真实 LLM Judge、真实 Benchmark、客服流量或重复随机实验。真正的发布策略需要有代表性的数据、经过验证的 grader / verifier,以及组织自身的风险标准。
不是。总分是有价值的摘要,但不能覆盖关键切片退化或证据质量不足。
只有在样本有代表性、评分方法确实测量了目标行为时,更大的样本量才会提供更强证据。
不是。Veto 适合少量不可妥协的条件;硬 Gate 太多会让系统无法正常迭代。
因为工程证据本来就可能不充分。成熟的发布流程应该允许回答“现在还不知道”,而不是强迫每次噪声对比都二选一。
本实验独立重建公开 AI Evaluation 工程概念;所有数值都是合成教学值,不应被当作通用生产阈值。
LEARNING CONTEXT
当关键 Slice、不确定性或 Hard Veto 失败时,一个漂亮的 Aggregate Score 仍然是很弱的发布证据。
Mental Model
建议补充前置
进入这起事故前,没有必须完成的已发布前置内容。
迁移这个模型
新模型提高了平均成功率,却让最高风险的 2% 请求发生回归。什么证据会改变你的发布决定?
把这个判断带到另一个问题或构建中。
选择你会要求的数据分布、证据强度、Judge 策略、安全边界和经济约束。目标不是做出最高分,而是写出一套能够被辩护的发布政策。
开始挑战继续进入后续学习,把 Context、Harness、Graph 与 Evaluation 的权衡连接到完整生产系统。
获取 Production Labs