核心 GUIDE
Evaluation Environment 与 Verifier Design
AI Evaluation 的可信度取决于 Environment、Task Contract 与 Verifier 如何共同定义“什么才算真正成功”。
核心心智模型
把 Evaluation 看成一个可执行的质量主张:在受控且具有代表性的 Environment 中运行 Task,捕获 Evidence,再由一个或多个 Verifier 判断真正要求的 Outcome 是否发生。
为什么重要
AI System 可以生成非常有说服力的 Transcript,却没有完成底层任务。Agent Eval 尤其容易出现这种问题,因为 Tool、State Change 与 Multi-turn Interaction 提供了很多“看起来成功但 Postcondition 没成立”的路径。可靠 Eval 必须检查 Environment Outcome,保留 Trajectory 用于 Diagnosis,并让不同 Grader 分别处理最适合自己的验证问题。
01
围绕可观察的 Success 构建 Eval
先定义 Initial State 与 Success Criteria 清晰的 Task。让 Model 与 Harness 在能够暴露真实 Tool 和 Side Effect 的 Environment 中运行,并记录完整 Trial。Machine-checkable Invariant 使用 Deterministic Check;有限的 Qualitative Judgment 可以使用 Model-based Grader;Policy 或高歧义问题保留 Human Review。对于具有随机性的行为,需要重复 Trial,而不是把一次结果当成稳定结论。
02
例子:Coding Agent 说“已经修好了”
Coding Agent 修改 Repository 后报告成功。Verifier 不评价这句话写得多自信,而是检查最终文件、运行 Targeted Test,并确认没有修改禁止触碰的文件。Transcript 仍然保留用于解释 Failure,但真正决定 Pass/Fail 的是 Environment State 与 Executable Assertion。
常见失败模式
- 只评价最终自然语言 Answer,而不检查 Environment Outcome。
- 用一个脆弱 Grader 验证本来需要多种独立检查的属性。
- 只运行一次随机 Trial,就把结果当成稳定质量。
工程启发
- 在写 Evaluation Prompt 之前先定义 Success Criteria。
- 能直接测量的 Claim 优先使用 Executable 或 State-based Check。
- Trajectory 用于 Diagnosis,但不要把诊断材料与最终 Pass/Fail Contract 混为一谈。
关键结论
- 01Eval 是 Task、Environment、Trial 与 Verifier 组成的系统,而不是一条 Prompt。
- 02Outcome Check 比模型自述成功更强。
- 03Repeated Trial 与互补 Grader 能让 Evaluation Evidence 更可信。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。