恢复执行,但不要重放整个世界。
你负责一个处理 2,000 份文档的 Agent Workflow。
进程在数百次动作后消失,没有 Durable Checkpoint,Cancellation 被忽略,而外部 Tool 也不具备事务一致性。
在 Worker Loss 后恢复,同时避免 State Loss、重复 Side Effect 与过期 Job 无限运行。
没有 Recovery Semantics 的长时自治,会把普通基础设施故障变成静默数据损坏与成本失控。
Worker 在第 613 步消失;从头重跑会重复 147 个外部 Side Effect。
你负责一个处理 2,000 份文档的 Agent Workflow。
进程在数百次动作后消失,没有 Durable Checkpoint,Cancellation 被忽略,而外部 Tool 也不具备事务一致性。
在 Worker Loss 后恢复,同时避免 State Loss、重复 Side Effect 与过期 Job 无限运行。
没有 Recovery Semantics 的长时自治,会把普通基础设施故障变成静默数据损坏与成本失控。
Long-running Agent 需要 Durable Workflow State 与 Replay Semantics;Process Memory 和 Prompt History 都不是 Recovery Architecture。
Prompt History 不能替代 Workflow State。
每个 Resume Step 都需要 Side-effect Policy。
过期工作必须可预测地停止。
MENTAL MODEL
只有当已完成状态和 Side Effect 可以独立重建或验证时,Resume 才安全。
生产 Agent 需要 Durable Execution Record、Idempotent Side-effect Boundary、Resume Policy 和 Bounded Cancellation。这些 Guarantees 位于模型周围的 Runtime。
LEARNING CONTEXT
只有当已完成状态和 Side Effect 可以独立重建或验证时,Resume 才安全。
本次练习的 CONCEPT
建议补充前置
进入这起事故前,没有必须完成的已发布前置内容。
迁移这个模型
Tool 已经成功,但 Worker 在写 Checkpoint 前崩溃;什么证据能让 Resume 安全?