核心 GUIDE
Fine-tuning Dataset Design
Fine-tuning Dataset Design 把一个 Measured Behavior Gap 转成具有代表性的 Training Example,并管理 Label、Coverage、Provenance,同时保持 Evaluation Case 足够独立以验证真正 Generalization。
核心心智模型
Training Data 是用 Example 写成的 Behavior Specification。它的 Distribution 决定模型会被强化什么,因此 Dataset 应对应 Target Gap,同时避免把最终 Test 泄漏进 Training。
为什么重要
Adapter/Fine-tuning 很容易开始,但弱 Data 会编码 Noise、Shortcut 或历史错误。一个围绕真实 Failure 精心 Curate 的小 Dataset,通常比大量 Raw Production Log 更有教学价值,也更容易 Audit。
01
从 Target Failure Distribution 反向设计 Dataset
先定义要改变的 Behavior,收集覆盖 Common、Difficult、Boundary Case 的 Example。统一 Label 与 Instruction,去除 Duplicate/Leakage,追踪 Source 与 Consent Constraint;如果 Random Row Split 会让 Near-duplicate 泄漏,就按 User、Document 或 Time 切分。原始 Failure Slice 应保持 Held-out。
02
示例:Support Fine-tune 记住重复 Ticket Template
团队用数千历史 Ticket 训练,并使用 Random Split 得到近乎完美 Validation。很多 Ticket 是 Near-duplicate Template,Train/Test 实际共享相同 Pattern。改为按 Customer 与 Time Split、Deduplicate Template、补充 Hard Escalation Case 后,真实 Gain 变小,但 Training Target 与 Evidence 更可信。
常见失败模式
- 未经 Curation/Provenance 就把 Raw Production Log 当 Training Data。
- Near-duplicate Random Split 造成 Leakage,却被误认为 Generalization。
- 只按平均 Frequency 设计 Dataset,忽略高成本 Boundary Case。
工程启发
- 从 Measured Behavior Gap 出发决定 Example Coverage。
- 按真实世界会产生 Leakage 的 Unit 做 Split。
- Release Evaluation 前保持 Held-out Failure Slice 不进入 Training Loop。
关键结论
- 01Fine-tuning Data 是 Executable Behavior Specification。
- 02Curation 与 Split Design 决定 Evaluation 是否可信。
- 03更多 Example 不能弥补 Leakage 或 Missing Failure Coverage。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。