Evaluation 失败实验
Agent v2 在总分面板上看起来更好了。你的任务不是继续调 Agent,而是调试 Evaluation:现有证据到底够不够支撑发布?
Evaluation 是一套发布决策系统,不是一个总分;代表性切片、证据强度、硬性 veto、Judge 覆盖范围和生产经济性共同决定“变好”是否可信。
团队改善了客服 Agent 的检索与工具调用,一个偏向 Demo 场景的评测显示 v2 明显胜出。被总分掩盖的问题是:长链路任务和高风险退款场景实际上退化了。
—
—
—
—
—
—
—
—
总分只是不同切片按权重混合后的结果。切换数据集预设,观察哪些失败被赋予足够权重,能够真正影响发布决策。
| 切片 | 权重 | v1 | v2 | Δ |
|---|
这里使用合成成本单位;成本 Gate 与质量 Gate 刻意保持独立。
为什么更高的 Benchmark 分数,反而可能导向更差的发布决策?
AI 系统很少在所有场景里均匀失败。一个候选版本可能改善常见问题,却在长链路任务、少见工具序列或安全关键动作上退化。如果 Evaluation 把所有场景压成一个平均分,真正重要的失败就会消失在漂亮的 headline number 里。
有代表性的数据,比方便演示的数据更重要
偏 Demo 的数据集会过度强调团队已经知道怎么解决的场景。接近生产分布的数据集,会让困难和高后果场景拥有更合理的影响力。本实验使用固定的合成切片分数,让你把注意力集中在评测设计,而不是模型随机性。
阈值和 veto 回答的是两个问题
全局阈值问的是“平均表现是否足够高”;veto 问的是“某种失败是否无论平均分多高都不可接受”。如果系统可以执行不可逆退款,一次安全退化就可能值得成为硬发布 Gate。
更多样本降低不确定性,但修复不了错误覆盖
随着样本量增加,模拟中的证据区间会变窄,这展示了小样本为什么证据更弱。但从有偏分布中继续收集更多样本,并不会让它变得有代表性。样本量和数据集设计是两项独立决策。
Judge 策略会同时改变覆盖、噪声与成本
确定性检查稳定、便宜,但可能漏掉语义或流程层面的缺陷;Rubric Judge 能覆盖更细的质量判断,却引入 Judge 噪声和成本;混合评测把互补方法组合起来。没有一种方法永远正确,关键是它是否覆盖你真正关心的失败模式。
这里模拟的是什么?
所有切片分数、证据区间、Judge 噪声和成本都是用于教学的合成值。这里没有运行真实 LLM Judge、真实 Benchmark、客服流量或重复随机实验。真正的发布策略需要有代表性的数据、经过验证的 grader / verifier,以及组织自身的风险标准。
常见问题
不是。总分是有价值的摘要,但不能覆盖关键切片退化或证据质量不足。
只有在样本有代表性、评分方法确实测量了目标行为时,更大的样本量才会提供更强证据。
不是。Veto 适合少量不可妥协的条件;硬 Gate 太多会让系统无法正常迭代。
因为工程证据本来就可能不充分。成熟的发布流程应该允许回答“现在还不知道”,而不是强迫每次噪声对比都二选一。
为一个可执行退款的客服 Agent 定义最小发布 Gate。
选择你会要求的数据分布、证据强度、Judge 策略、安全边界和经济约束。目标不是做出最高分,而是写出一套能够被辩护的发布政策。