Evaluation 失败实验

Production Lab 预览Evaluation 工程25 分钟

Agent v2 在总分面板上看起来更好了。你的任务不是继续调 Agent,而是调试 Evaluation:现有证据到底够不够支撑发布?

一句话理解

Evaluation 是一套发布决策系统,不是一个总分;代表性切片、证据强度、硬性 veto、Judge 覆盖范围和生产经济性共同决定“变好”是否可信。

天真的发布评测确定性教学模拟

团队改善了客服 Agent 的检索与工具调用,一个偏向 Demo 场景的评测显示 v2 明显胜出。被总分掩盖的问题是:长链路任务和高风险退款场景实际上退化了。

80
关键发布规则:退款安全切片的最低发布分数是 80;教学模拟中的单次成功成本预算上限为 0.100。
发布决策可以发布
v1 总分
v2 总分
总分变化
v2 关键安全分
退化切片
证据区间宽度
Judge 噪声指数
评测成本指数
当前诊断:
切片对比v1 → v2

总分只是不同切片按权重混合后的结果。切换数据集预设,观察哪些失败被赋予足够权重,能够真正影响发布决策。

切片权重v1v2Δ
经济性与证据
每个成功任务的成本v1 · v2

这里使用合成成本单位;成本 Gate 与质量 Gate 刻意保持独立。

你当前的评测策略
等待参数变化……
关键结论
平均分可以掩盖尾部风险整体分数升高,可以同时存在一个足以阻止发布的小规模高后果切片退化。
数据集构成是一项产品决策Evaluation 的样本分布决定哪些失败有足够权重进入总分,并真正影响发布。
Veto 与权重不是一回事有些安全条件不应该继续和其他简单场景求平均,而应该直接阻止发布。
证据强度很重要当样本不足或 Judge 覆盖有限时,一个正向变化并不自动等于可信提升。
质量与经济性应该分别设 Gate候选系统可能提高任务质量,同时让每个成功结果的成本变得更差。
生产系统心智模型

为什么更高的 Benchmark 分数,反而可能导向更差的发布决策?

AI 系统很少在所有场景里均匀失败。一个候选版本可能改善常见问题,却在长链路任务、少见工具序列或安全关键动作上退化。如果 Evaluation 把所有场景压成一个平均分,真正重要的失败就会消失在漂亮的 headline number 里。

有代表性的数据,比方便演示的数据更重要

偏 Demo 的数据集会过度强调团队已经知道怎么解决的场景。接近生产分布的数据集,会让困难和高后果场景拥有更合理的影响力。本实验使用固定的合成切片分数,让你把注意力集中在评测设计,而不是模型随机性。

阈值和 veto 回答的是两个问题

全局阈值问的是“平均表现是否足够高”;veto 问的是“某种失败是否无论平均分多高都不可接受”。如果系统可以执行不可逆退款,一次安全退化就可能值得成为硬发布 Gate。

更多样本降低不确定性,但修复不了错误覆盖

随着样本量增加,模拟中的证据区间会变窄,这展示了小样本为什么证据更弱。但从有偏分布中继续收集更多样本,并不会让它变得有代表性。样本量和数据集设计是两项独立决策。

Judge 策略会同时改变覆盖、噪声与成本

确定性检查稳定、便宜,但可能漏掉语义或流程层面的缺陷;Rubric Judge 能覆盖更细的质量判断,却引入 Judge 噪声和成本;混合评测把互补方法组合起来。没有一种方法永远正确,关键是它是否覆盖你真正关心的失败模式。

这里模拟的是什么?

所有切片分数、证据区间、Judge 噪声和成本都是用于教学的合成值。这里没有运行真实 LLM Judge、真实 Benchmark、客服流量或重复随机实验。真正的发布策略需要有代表性的数据、经过验证的 grader / verifier,以及组织自身的风险标准。

常见问题

总分最高的版本是不是就应该发布?

不是。总分是有价值的摘要,但不能覆盖关键切片退化或证据质量不足。

评测集是不是越大越好?

只有在样本有代表性、评分方法确实测量了目标行为时,更大的样本量才会提供更强证据。

是不是每个指标都应该变成硬 veto?

不是。Veto 适合少量不可妥协的条件;硬 Gate 太多会让系统无法正常迭代。

为什么发布决策可以是“证据不足”?

因为工程证据本来就可能不充分。成熟的发布流程应该允许回答“现在还不知道”,而不是强迫每次噪声对比都二选一。

AhaFrame 教学模拟说明 · 内容复核 2026-08-13. 本实验独立重建公开 AI Evaluation 工程概念;所有数值都是合成教学值,不应被当作通用生产阈值。
动手想一想

为一个可执行退款的客服 Agent 定义最小发布 Gate。

选择你会要求的数据分布、证据强度、Judge 策略、安全边界和经济约束。目标不是做出最高分,而是写出一套能够被辩护的发布政策。

开始挑战 →
你已经调试了 Evaluation,而不是只看总分。
继续进入后续学习,把 Context、Harness、Graph 与 Evaluation 的权衡连接到完整生产系统。
获取 Production Labs →