核心 GUIDE

SYSTEM_COMPONENTINTERMEDIATE7 分钟阅读

Online Monitoring(线上监控)

Offline Evaluation 用来预测能否发布;Online Monitoring 用来检查上线后真实 Traffic、Dependency 与 User Behavior 是否仍然符合发布时的假设。

核心心智模型

Monitoring 是 Expected Operating Envelope 与 Production Evidence 的持续比较。它应该观察 Input、Output、Latency、Failure、Cost 与 Business Outcome 的 Drift,而不是把系统健康压缩成一个平均分。

为什么重要

即使模型 Artifact 完全没有变化,线上行为仍可能变坏:Traffic Mix 变化、Knowledge 过期、Upstream API 故障、Prompt 演进、用户出现新的 Edge Case。团队需要能够把 Symptom 连接回 Trace 和 Evaluation Slice 的 Production Signal,才能决定 Continue、Degrade、Rollback 或 Investigate。

01

围绕 Release Hypothesis 监控关键 Slice

从发布前的 Risk 与 Acceptance Criteria 出发,发送稳定 Semantic Event,Trace 关键 Model/Tool Transition,并按有意义 Slice 跟踪 Input/Output Quality Proxy、Failure、Latency 与 Cost。Alert 应绑定可执行边界,同时保留代表性 Example 供 Diagnosis。Monitoring 触发的是 Decision Process,而不是根据噪声指标自动 Retrain。

02

示例:整体成功率没变,但一个地区失败

Support Agent 的 Global Resolution Rate 看起来不变,但新 Policy Rollout 让某个 Region Plan 的错误明显上升。Slice-aware Monitoring 捕获 Escalation 和 Wrong-source Retrieval 的局部增长,团队停止该 Segment 继续放量,同时保持其他 Traffic 在线并收集 Trace。

常见失败模式

  • 只看 Aggregate Average,把重要 Slice 隐藏掉。
  • 创建大量 Alert,却没有 Owner 和对应 Response Decision。
  • 把线上 User Behavior 当成未经质疑的 Model Quality Ground Truth。

工程启发

  • 每个 Alert 都应关联 Release Risk 与 Operational Response。
  • 监控 Distribution 和 Critical Slice,而不只看 Global Mean。
  • 保留代表性 Trace,让 Alert 可以被 Diagnosis,而不只是被确认。

关键结论

  1. 01Production Evidence 会持续检验 Release Assumption。
  2. 02Monitoring 需要 Actionable Slice 与明确 Owner。
  3. 03Online Signal 补充而不是替代 Controlled Evaluation。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。