核心 GUIDE

MENTAL_MODELINTERMEDIATE7 分钟阅读

Evaluation Environment 与 Verifier Design

AI Evaluation 的可信度取决于 Environment、Task Contract 与 Verifier 如何共同定义“什么才算真正成功”。

核心心智模型

把 Evaluation 看成一个可执行的质量主张:在受控且具有代表性的 Environment 中运行 Task,捕获 Evidence,再由一个或多个 Verifier 判断真正要求的 Outcome 是否发生。

为什么重要

AI System 可以生成非常有说服力的 Transcript,却没有完成底层任务。Agent Eval 尤其容易出现这种问题,因为 Tool、State Change 与 Multi-turn Interaction 提供了很多“看起来成功但 Postcondition 没成立”的路径。可靠 Eval 必须检查 Environment Outcome,保留 Trajectory 用于 Diagnosis,并让不同 Grader 分别处理最适合自己的验证问题。

01

围绕可观察的 Success 构建 Eval

先定义 Initial State 与 Success Criteria 清晰的 Task。让 Model 与 Harness 在能够暴露真实 Tool 和 Side Effect 的 Environment 中运行,并记录完整 Trial。Machine-checkable Invariant 使用 Deterministic Check;有限的 Qualitative Judgment 可以使用 Model-based Grader;Policy 或高歧义问题保留 Human Review。对于具有随机性的行为,需要重复 Trial,而不是把一次结果当成稳定结论。

02

例子:Coding Agent 说“已经修好了”

Coding Agent 修改 Repository 后报告成功。Verifier 不评价这句话写得多自信,而是检查最终文件、运行 Targeted Test,并确认没有修改禁止触碰的文件。Transcript 仍然保留用于解释 Failure,但真正决定 Pass/Fail 的是 Environment State 与 Executable Assertion。

常见失败模式

  • 只评价最终自然语言 Answer,而不检查 Environment Outcome。
  • 用一个脆弱 Grader 验证本来需要多种独立检查的属性。
  • 只运行一次随机 Trial,就把结果当成稳定质量。

工程启发

  • 在写 Evaluation Prompt 之前先定义 Success Criteria。
  • 能直接测量的 Claim 优先使用 Executable 或 State-based Check。
  • Trajectory 用于 Diagnosis,但不要把诊断材料与最终 Pass/Fail Contract 混为一谈。

关键结论

  1. 01Eval 是 Task、Environment、Trial 与 Verifier 组成的系统,而不是一条 Prompt。
  2. 02Outcome Check 比模型自述成功更强。
  3. 03Repeated Trial 与互补 Grader 能让 Evaluation Evidence 更可信。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Dataset Slice、Regression 与 Aggregate Improvement 陷阱PREREQUISITE
Outcome 与 Trajectory EvaluationPREREQUISITE
把成本、延迟、质量与 Release Veto 合并为一个决策ENABLES