Agent Runtime·高级·17 分钟

Long-Running Agent Recovery Mission

Worker 在第 613 步消失;从头重跑会重复 147 个外部 Side Effect。

RECOVERY INCIDENT

恢复执行,但不要重放整个世界。

你负责一个处理 2,000 份文档的 Agent Workflow。

进程在数百次动作后消失,没有 Durable Checkpoint,Cancellation 被忽略,而外部 Tool 也不具备事务一致性。

目标

在 Worker Loss 后恢复,同时避免 State Loss、重复 Side Effect 与过期 Job 无限运行。

风险

没有 Recovery Semantics 的长时自治,会把普通基础设施故障变成静默数据损坏与成本失控。

一句话理解

Long-running Agent 需要 Durable Workflow State 与 Replay Semantics;Process Memory 和 Prompt History 都不是 Recovery Architecture。

正在加载 Mission Engine…

关键要点

Memory ≠ Durability

Prompt History 不能替代 Workflow State。

Replay 是 Contract

每个 Resume Step 都需要 Side-effect Policy。

Cancel 是 Guarantee

过期工作必须可预测地停止。

MENTAL MODEL

Durability 是 Workflow 属性,不是模型能力。

只有当已完成状态和 Side Effect 可以独立重建或验证时,Resume 才安全。

生产 Agent 需要 Durable Execution Record、Idempotent Side-effect Boundary、Resume Policy 和 Bounded Cancellation。这些 Guarantees 位于模型周围的 Runtime。

  • 持久化足够信息,能够重建真正完成了什么。
  • Replay 的安全粒度应与 Resume 粒度一致。
  • Cancellation 必须有明确且有界的运行语义。

LEARNING CONTEXT

可复用的 Mental Model

只有当已完成状态和 Side Effect 可以独立重建或验证时,Resume 才安全。

未看过

本次练习的 CONCEPT

  • concept-async-long-runningAsync 与 Long-running Task 生命周期
  • concept-checkpoint-resumeCheckpoint、可恢复状态与 Recovery
  • concept-interrupt-cancelInterrupt 与 Cancellation 语义
  • concept-bounded-autonomyBounded Autonomy、Termination 与 Escalation

建议补充前置

进入这起事故前,没有必须完成的已发布前置内容。

迁移这个模型

Tool 已经成功,但 Worker 在写 Checkpoint 前崩溃;什么证据能让 Resume 安全?

查看完整学习路径

把方法应用到真实 Outcome

用 Source、Context、Verification 和 Workflow 思维构建一本书的生产系统。

构建写书 Workflow