核心 GUIDE
Rollout 与 Fallback
AI Release 最安全的方式是逐步增加 Exposure,并准备经过测试的 Fallback;当新模型、Prompt 或 Dependency 失败时,产品仍能保留关键行为。
核心心智模型
Rollout 是一个限制 Blast Radius 的 Production Experiment;Fallback 是当 Evidence 触发 Veto 或 Dependency 不可用时,产品可以主动进入的预设计 Degraded Path。
为什么重要
模型或 Prompt Upgrade 可能提升总体指标,却破坏一个高价值 Slice;外部 Provider 也可能突然降级。直接把 100% Traffic 暴露给变更,就是把不确定性扩大成事故。Progressive Exposure 与 Explicit Fallback 让 Evidence Collection 保持可逆,并降低发现错误假设时的成本。
01
增加 Exposure 前先定义 Gate
选择 Internal Traffic、Percentage、Region 或 Customer Cohort 作为 Rollout Unit,并在上线前定义 Acceptance Metric、Veto Slice 和 Observation Window。Fallback 必须具体:Previous Model Version、Rule-based Behavior、Human Handoff 或 Reduced Capability。还要真正演练切换,并验证不同版本之间 State 是否兼容。
02
示例:新模型总体更好,却破坏 Tool Call
Model Upgrade 在总体 Eval 上更好,但某 Enterprise Workflow 的 Tool Argument Invalid Rate 上升。5% Rollout 在全面发布前暴露问题,Gate 因该 Slice 阻止继续放量,并把受影响 Traffic 路由回 Previous Model;团队无需盲目把整个产品全部回滚。
常见失败模式
- 上一阶段还没有足够 Evidence 就继续扩大 Traffic。
- 声称 Fallback 可用,却从未测试 State 与 Dependency Compatibility。
- 只使用 Global Quality Average,漏掉必须 Veto 的 Regression。
工程启发
- 预先注册 Rollout Gate、Veto 与 Observation Window。
- 让 Fallback Path 足够简单,可以定期演练。
- 切换版本时验证 State 与 Idempotency Behavior。
关键结论
- 01Rollout 通过限制 Blast Radius 来学习 Production Evidence。
- 02Fallback 是工程化产品路径,而不是事故时的愿望。
- 03Release Decision 必须有明确 Veto Slice。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。