核心 GUIDE
Checkpoint 与 Resume
长任务 Agent 只有把已完成的 Durable Work、外部副作用和下一步安全 Transition 写入显式 Checkpoint,才能在中断后可靠恢复,而不是重新猜测状态。
核心心智模型
Checkpoint 是对 Workflow State 的持久声明:哪些步骤已完成、产生了什么 Evidence、哪些 Side Effect 已经发生,以及下一步从哪里继续才安全。
为什么重要
没有 Checkpoint 时,Timeout 或进程重启会迫使长任务 Agent 依赖 Log 猜状态,甚至重新执行早先步骤。当这些步骤已经产生外部副作用时,Replay 可能造成重复支付、重复写入或重复发送。可靠恢复必须区分“确实已经发生”与“我们原本打算发生”。
01
在可恢复边界持久化状态
围绕昂贵计算、外部 Side Effect 和 Human Approval 选择 Checkpoint Boundary。保存 Workflow Version、已完成 Step ID、关键 Input/Output、外部 Operation ID 和 Verification Evidence。Resume 前检查 Checkpoint 是否仍符合当前 Dependency 与 Policy,再从下一条安全 Transition 继续,而不是盲目 Replay 全部 History。
02
示例:上传数据集后任务进程崩溃
Agent 收集 Source、标准化记录并上传数据集后 Worker 崩溃。Durable Checkpoint 已保存 Upload Object ID 与 Checksum。恢复后的 Worker 先验证对象而不是再次上传,然后继续 Analysis;如果 Checksum 已变化,则停止恢复并进入 Reconciliation。
常见失败模式
- 只保存 Conversation Text,却丢失 Step State 和 Side Effect 状态。
- 根据最后一行 Log 直接 Resume,不确认外部操作是否已经 Commit。
- Workflow 版本变化后仍直接复用旧 Checkpoint,没有 Migration 或 Compatibility Check。
工程启发
- 在高后果 Side Effect 前后都建立 Checkpoint。
- 把 External ID 与 Verification Evidence 和 Workflow State 一起保存。
- 恢复旧状态前验证 Workflow Version 与当前 Policy。
关键结论
- 01恢复需要 Durable Execution State,而不只是聊天记录。
- 02Checkpoint 标记中断后哪些事实可以信任。
- 03Resume 应先验证已有 Side Effect,再继续推进。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。