核心 GUIDE
Distribution Shift(分布漂移)
Distribution Shift 指 Production Input、User、Tool 或 Environment 与原先 Evaluation 所覆盖的数据显著不同,使过去的 Quality Estimate 不再可靠。
核心心智模型
Evaluation Score 是对某个 Distribution 的声明,不是模型永久属性。输入分布变化后,旧分数只代表过去 Workload,除非关键 Slice 仍然匹配。
为什么重要
AI Product 即使不升级 Model 也会退化:新用户群进入、Document Style 改变、Tool Schema 演进、Fraud Pattern 变化、Policy 更新。识别 Distribution Shift 可以避免团队把固定 Benchmark 当成永远有效的生产保证。
01
比较 Production Slice 与 Evaluation Population
定义 Workload 的关键维度,例如 Intent、Language、Document Type、Consequence、Tool Path、Customer Segment,并同时监控它们的占比与 Error Rate。当某个 Slice 明显变化时,收集或 Replay 代表性 Case,再决定需要更新 Evaluation Data、Context/Retrieval、Routing、Training 还是 Product Boundary。
02
示例:Benchmark 仍然绿色,但新客户群已经改变
Support Assistant 原本主要在短英文 Ticket 与小客户上评估。Enterprise Launch 后出现长、多语言且带 Attachment 的请求。旧 Test Suite 仍然全绿,但 Escalation 与 Citation Error 上升。团队把新 Workload 建成显式 Slice,不再用旧 Average 为 Enterprise Traffic 背书。
常见失败模式
- 把一套 Frozen Benchmark 永久当成 Representative。
- 只看 Aggregate Quality,不看关键 Slice 的占比与错误变化。
- 一发生 Shift 就直接 Retrain,而不先检查 Context、Routing 与产品边界。
工程启发
- 每个 Quality Claim 都标记它对应的 Distribution。
- 同时监控 Workload Composition 与 Per-slice Outcome。
- 生产变化会改变旧 Score 含义时,及时建立新 Evaluation Slice。
关键结论
- 01Distribution 变化会让过去的 Quality Estimate 过期。
- 02Shift 可以来自 User、Data、Tool、Policy,而不仅是 Model。
- 03Slice-aware Monitoring 会把漂移变成可诊断工程事件。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。