核心 GUIDE
Online Monitoring(线上监控)
Offline Evaluation 用来预测能否发布;Online Monitoring 用来检查上线后真实 Traffic、Dependency 与 User Behavior 是否仍然符合发布时的假设。
核心心智模型
Monitoring 是 Expected Operating Envelope 与 Production Evidence 的持续比较。它应该观察 Input、Output、Latency、Failure、Cost 与 Business Outcome 的 Drift,而不是把系统健康压缩成一个平均分。
为什么重要
即使模型 Artifact 完全没有变化,线上行为仍可能变坏:Traffic Mix 变化、Knowledge 过期、Upstream API 故障、Prompt 演进、用户出现新的 Edge Case。团队需要能够把 Symptom 连接回 Trace 和 Evaluation Slice 的 Production Signal,才能决定 Continue、Degrade、Rollback 或 Investigate。
01
围绕 Release Hypothesis 监控关键 Slice
从发布前的 Risk 与 Acceptance Criteria 出发,发送稳定 Semantic Event,Trace 关键 Model/Tool Transition,并按有意义 Slice 跟踪 Input/Output Quality Proxy、Failure、Latency 与 Cost。Alert 应绑定可执行边界,同时保留代表性 Example 供 Diagnosis。Monitoring 触发的是 Decision Process,而不是根据噪声指标自动 Retrain。
02
示例:整体成功率没变,但一个地区失败
Support Agent 的 Global Resolution Rate 看起来不变,但新 Policy Rollout 让某个 Region Plan 的错误明显上升。Slice-aware Monitoring 捕获 Escalation 和 Wrong-source Retrieval 的局部增长,团队停止该 Segment 继续放量,同时保持其他 Traffic 在线并收集 Trace。
常见失败模式
- 只看 Aggregate Average,把重要 Slice 隐藏掉。
- 创建大量 Alert,却没有 Owner 和对应 Response Decision。
- 把线上 User Behavior 当成未经质疑的 Model Quality Ground Truth。
工程启发
- 每个 Alert 都应关联 Release Risk 与 Operational Response。
- 监控 Distribution 和 Critical Slice,而不只看 Global Mean。
- 保留代表性 Trace,让 Alert 可以被 Diagnosis,而不只是被确认。
关键结论
- 01Production Evidence 会持续检验 Release Assumption。
- 02Monitoring 需要 Actionable Slice 与明确 Owner。
- 03Online Signal 补充而不是替代 Controlled Evaluation。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。