核心 GUIDE
Verification 优先于 Introspection
当 Correctness 重要时,应检查 World 或 Independent Artifact,而不是询问模型它自己的 Reasoning 是否正确。
核心心智模型
Model 对“为什么自己是对的”的 Explanation 仍然是 Generated Output。Verification 使用 Independent Evidence——Test、Calculation、Source、Tool Result 或 State Check——并且必须有能力推翻 Model Claim。
为什么重要
Model 可以为 Wrong Answer 生成非常连贯的 Rationale,第二次 Self-check 也可能重复同一个 Hidden Assumption。Introspection 适合生成 Hypothesis,但不适合当 Correctness Guarantee。可靠 System 会把重要 Claim 移向具有不同 Failure Mode 的 External Evidence。
01
选择拥有独立 Evidence 的 Verifier
先明确哪一个 Claim 必须为真,再问什么 Observable Evidence 能建立它。Code 可以 Test,Calculation 可以 Recompute,Citation 可以回 Source 检查,Database State 可以 Query,Tool Side Effect 可以 Reconcile。Qualitative Property 可以使用 Model Critique,但需要用 Human / Deterministic Check 校准,而不是把 Self-consistency 当 Proof。
02
例子:Migration 是否保留了全部 Row?
Coding Agent 表示 Migration 很安全,并解释自己的 Reasoning。Verification 不评价 Explanation,而是在 Representative Fixture 上运行 Migration,比较 Row Count 与关键 Invariant,并测试 Rollback Behavior。Explanation 可以帮助 Review,但最终决定 Claim 是否接受的是 Executable Evidence。
常见失败模式
- 再问同一个 Model 一句“are you sure?”就称为 Verification。
- 把 Fluent Rationale 当成 Factual Correctness Evidence。
- Verifier 与 Generator 依赖同一个未经测试的 Assumption。
工程启发
- 把 Important Claim 转成 Observable Postcondition。
- 优先选择 Failure Mode 与 Generator 独立的 Verifier。
- 高后果 Correctness 中,Model Critique 只能是 Signal,不能是 Final Authority。
关键结论
- 01Self-explanation 不是 Independent Evidence。
- 02Verifier 必须能够证明 Model 是错的。
- 03Consequence 越高,Verifier 越应该独立且更强。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。