Evaluation 工程·进阶·25 分钟

Evaluation 失败实验

Agent v2 在总分面板上看起来更好了。你的任务不是继续调 Agent,而是调试 Evaluation:现有证据到底够不够支撑发布?

01

体验

先处理问题,再阅读解释。

正在加载实验…
02

反思

把结果整理成可以复用的判断。

关键要点

平均分可以掩盖尾部风险

整体分数升高,可以同时存在一个足以阻止发布的小规模高后果切片退化。

数据集构成是一项产品决策

Evaluation 的样本分布决定哪些失败有足够权重进入总分,并真正影响发布。

Veto 与权重不是一回事

有些安全条件不应该继续和其他简单场景求平均,而应该直接阻止发布。

证据强度很重要

当样本不足或 Judge 覆盖有限时,一个正向变化并不自动等于可信提升。

质量与经济性应该分别设 Gate

候选系统可能提高任务质量,同时让每个成功结果的成本变得更差。

03

深入理解

把这次体验连接到概念、参考与迁移。

生产系统心智模型

为什么更高的 Benchmark 分数,反而可能导向更差的发布决策?

AI 系统很少在所有场景里均匀失败。一个候选版本可能改善常见问题,却在长链路任务、少见工具序列或安全关键动作上退化。如果 Evaluation 把所有场景压成一个平均分,真正重要的失败就会消失在漂亮的 headline number 里。

有代表性的数据,比方便演示的数据更重要

偏 Demo 的数据集会过度强调团队已经知道怎么解决的场景。接近生产分布的数据集,会让困难和高后果场景拥有更合理的影响力。本实验使用固定的合成切片分数,让你把注意力集中在评测设计,而不是模型随机性。

阈值和 veto 回答的是两个问题

全局阈值问的是“平均表现是否足够高”;veto 问的是“某种失败是否无论平均分多高都不可接受”。如果系统可以执行不可逆退款,一次安全退化就可能值得成为硬发布 Gate。

更多样本降低不确定性,但修复不了错误覆盖

随着样本量增加,模拟中的证据区间会变窄,这展示了小样本为什么证据更弱。但从有偏分布中继续收集更多样本,并不会让它变得有代表性。样本量和数据集设计是两项独立决策。

Judge 策略会同时改变覆盖、噪声与成本

确定性检查稳定、便宜,但可能漏掉语义或流程层面的缺陷;Rubric Judge 能覆盖更细的质量判断,却引入 Judge 噪声和成本;混合评测把互补方法组合起来。没有一种方法永远正确,关键是它是否覆盖你真正关心的失败模式。

这里模拟的是什么?

所有切片分数、证据区间、Judge 噪声和成本都是用于教学的合成值。这里没有运行真实 LLM Judge、真实 Benchmark、客服流量或重复随机实验。真正的发布策略需要有代表性的数据、经过验证的 grader / verifier,以及组织自身的风险标准。

常见问题

总分最高的版本是不是就应该发布?

不是。总分是有价值的摘要,但不能覆盖关键切片退化或证据质量不足。

评测集是不是越大越好?

只有在样本有代表性、评分方法确实测量了目标行为时,更大的样本量才会提供更强证据。

是不是每个指标都应该变成硬 veto?

不是。Veto 适合少量不可妥协的条件;硬 Gate 太多会让系统无法正常迭代。

为什么发布决策可以是“证据不足”?

因为工程证据本来就可能不充分。成熟的发布流程应该允许回答“现在还不知道”,而不是强迫每次噪声对比都二选一。

本实验独立重建公开 AI Evaluation 工程概念;所有数值都是合成教学值,不应被当作通用生产阈值。

LEARNING CONTEXT

学习连接

当关键 Slice、不确定性或 Hard Veto 失败时,一个漂亮的 Aggregate Score 仍然是很弱的发布证据。

未看过

Mental Model

  • S07-M03Evaluation Environment 与 Verifier 设计
  • S07-M04Outcome Evaluation vs Trajectory Evaluation
  • S07-M05Dataset Slice、Regression 与平均提升陷阱
  • S07-M06Confidence、Variance 与 Sample-size Humility
  • S07-M07把 Cost、Latency、Quality 与 Release Veto 当成一个决策

建议补充前置

进入这起事故前,没有必须完成的已发布前置内容。

迁移这个模型

新模型提高了平均成功率,却让最高风险的 2% 请求发生回归。什么证据会改变你的发布决定?

查看完整学习路径
04

下一步

把这个判断带到另一个问题或构建中。

构建挑战

为一个可执行退款的客服 Agent 定义最小发布 Gate。

选择你会要求的数据分布、证据强度、Judge 策略、安全边界和经济约束。目标不是做出最高分,而是写出一套能够被辩护的发布政策。

开始挑战

你已经调试了 Evaluation,而不是只看总分。

继续进入后续学习,把 Context、Harness、Graph 与 Evaluation 的权衡连接到完整生产系统。

获取 Production Labs