核心 GUIDE
Synthetic Data 与 Distillation
Synthetic Data 可以扩展 Example 与 Transfer Behavior,但如果缺少 Quality 与 Diversity Control,也会把 Generator 的 Blind Spot 一起放大。
核心心智模型
Synthetic Data 是 Generated Training Evidence,而不是免费的 Ground Truth。Distillation 可以把更强 Teacher 的 Behavior 压缩到 Target Model,但 Dataset 会继承 Teacher、Prompt、Sampling 与 Filtering Policy。
为什么重要
团队会用 Synthetic Example 覆盖 Rare Case、扩展 Instruction Data 并降低 Labeling Cost。风险在于 Feedback Loop:Teacher 系统性漏掉难例、Generated Example 越来越同质化,或者 Automatic Filter 用同一套 Bias 奖励自己生成的数据。更多 Synthetic Row 最后可能让 Target Model 更自信地变窄,而不是真正更强。
01
广泛 Generate,独立 Filter,用 Real Data Validate
先定义希望 Transfer 的 Capability 或 Behavior,再按显式 Difficulty 与 Domain Slice 生成 Example,而不是只从一个 Prompt Distribution Sampling。为每个 Example 附上 Generation Metadata,能用 Deterministic Check 的地方先自动检查,再用 Independent Reviewer 或不同 Model 做 Quality Filter。最重要的是保留 Real / Independently Curated Eval Data,避免 Synthetic Generator 同时当自己的 Judge。
02
例子:Synthetic Tool-call Training Data
Teacher Model 生成数千条 Tool-use Conversation。Pipeline 不会全部直接训练,而是检查 Schema Validity、平衡 Tool 与 Error Category、去除 Near Duplicate,并把 Uncertain Edge Case 交给 Review。最终 Adapter 在从未由 Teacher 生成的 Real Production-like Tool Task 上 Evaluation。
常见失败模式
- 因为 Generated Label 便宜且多,就把它们当作 Ground Truth。
- 同一个 Model 与 Rubric 同时负责 Generate、Filter 与 Evaluate。
- 只扩 Dataset Size,不测 Diversity、Duplication 与 Difficult Slice。
工程启发
- 为 Synthetic Example 记录 Generator、Prompt、Seed 与 Filter Provenance。
- 主动设计 Coverage Balance,而不是只采样 Easy High-confidence Case。
- 保留 Independent Real-data 或 Human-curated Evaluation Set。
关键结论
- 01Synthetic Data 扩展的是 Supervision,不是 Truth。
- 02Distillation 会同时 Transfer Strength 与 Systematic Error。
- 03Independent Evaluation 是防止 Synthetic Feedback Loop 的核心防线。