核心 GUIDE

PATTERNINTERMEDIATE7 分钟阅读

Checkpoint 与 Resume

长任务 Agent 只有把已完成的 Durable Work、外部副作用和下一步安全 Transition 写入显式 Checkpoint,才能在中断后可靠恢复,而不是重新猜测状态。

核心心智模型

Checkpoint 是对 Workflow State 的持久声明:哪些步骤已完成、产生了什么 Evidence、哪些 Side Effect 已经发生,以及下一步从哪里继续才安全。

为什么重要

没有 Checkpoint 时,Timeout 或进程重启会迫使长任务 Agent 依赖 Log 猜状态,甚至重新执行早先步骤。当这些步骤已经产生外部副作用时,Replay 可能造成重复支付、重复写入或重复发送。可靠恢复必须区分“确实已经发生”与“我们原本打算发生”。

01

在可恢复边界持久化状态

围绕昂贵计算、外部 Side Effect 和 Human Approval 选择 Checkpoint Boundary。保存 Workflow Version、已完成 Step ID、关键 Input/Output、外部 Operation ID 和 Verification Evidence。Resume 前检查 Checkpoint 是否仍符合当前 Dependency 与 Policy,再从下一条安全 Transition 继续,而不是盲目 Replay 全部 History。

02

示例:上传数据集后任务进程崩溃

Agent 收集 Source、标准化记录并上传数据集后 Worker 崩溃。Durable Checkpoint 已保存 Upload Object ID 与 Checksum。恢复后的 Worker 先验证对象而不是再次上传,然后继续 Analysis;如果 Checksum 已变化,则停止恢复并进入 Reconciliation。

常见失败模式

  • 只保存 Conversation Text,却丢失 Step State 和 Side Effect 状态。
  • 根据最后一行 Log 直接 Resume,不确认外部操作是否已经 Commit。
  • Workflow 版本变化后仍直接复用旧 Checkpoint,没有 Migration 或 Compatibility Check。

工程启发

  • 在高后果 Side Effect 前后都建立 Checkpoint。
  • 把 External ID 与 Verification Evidence 和 Workflow State 一起保存。
  • 恢复旧状态前验证 Workflow Version 与当前 Policy。

关键结论

  1. 01恢复需要 Durable Execution State,而不只是聊天记录。
  2. 02Checkpoint 标记中断后哪些事实可以信任。
  3. 03Resume 应先验证已有 Side Effect,再继续推进。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。