核心 GUIDE

RISKINTERMEDIATE7 分钟阅读

Distribution Shift(分布漂移)

Distribution Shift 指 Production Input、User、Tool 或 Environment 与原先 Evaluation 所覆盖的数据显著不同,使过去的 Quality Estimate 不再可靠。

核心心智模型

Evaluation Score 是对某个 Distribution 的声明,不是模型永久属性。输入分布变化后,旧分数只代表过去 Workload,除非关键 Slice 仍然匹配。

为什么重要

AI Product 即使不升级 Model 也会退化:新用户群进入、Document Style 改变、Tool Schema 演进、Fraud Pattern 变化、Policy 更新。识别 Distribution Shift 可以避免团队把固定 Benchmark 当成永远有效的生产保证。

01

比较 Production Slice 与 Evaluation Population

定义 Workload 的关键维度,例如 Intent、Language、Document Type、Consequence、Tool Path、Customer Segment,并同时监控它们的占比与 Error Rate。当某个 Slice 明显变化时,收集或 Replay 代表性 Case,再决定需要更新 Evaluation Data、Context/Retrieval、Routing、Training 还是 Product Boundary。

02

示例:Benchmark 仍然绿色,但新客户群已经改变

Support Assistant 原本主要在短英文 Ticket 与小客户上评估。Enterprise Launch 后出现长、多语言且带 Attachment 的请求。旧 Test Suite 仍然全绿,但 Escalation 与 Citation Error 上升。团队把新 Workload 建成显式 Slice,不再用旧 Average 为 Enterprise Traffic 背书。

常见失败模式

  • 把一套 Frozen Benchmark 永久当成 Representative。
  • 只看 Aggregate Quality,不看关键 Slice 的占比与错误变化。
  • 一发生 Shift 就直接 Retrain,而不先检查 Context、Routing 与产品边界。

工程启发

  • 每个 Quality Claim 都标记它对应的 Distribution。
  • 同时监控 Workload Composition 与 Per-slice Outcome。
  • 生产变化会改变旧 Score 含义时,及时建立新 Evaluation Slice。

关键结论

  1. 01Distribution 变化会让过去的 Quality Estimate 过期。
  2. 02Shift 可以来自 User、Data、Tool、Policy,而不仅是 Model。
  3. 03Slice-aware Monitoring 会把漂移变成可诊断工程事件。

阅读记录

未打开Practice 尚未完成

这里只记录你真实做过的动作,不代表掌握、熟练或认证。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。