核心 GUIDE
Adapter Fine-tuning(适配器微调)
Adapter Fine-tuning 只训练较小的 Adapter Component,同时冻结大部分 Base-model Weight。当已经存在可测量 Task Gap 且确实需要 Training 时,它通常比 Full Fine-tuning 更便宜、更容易 Versioning。
核心心智模型
Adapter 会把 Base Capability 与 Task-specific Parameter Change 分开。LoRA 等方法用较小 Trainable Parameter Set 表达更新;Serving 时可以加载或路由 Adapter,而不必为每个 Variant 维护完整独立 Model。
为什么重要
团队经常在证明 Prompt、Context 或 Retrieval 已不足之前,就提出 Fine-tuning。Adapter Method 虽然降低 Training 与 Storage Cost,但仍会增加 Data、Evaluation、Versioning 与 Serving Complexity。关键问题不是 Adapter 是否“高效”,而是它是否比更简单 Alternative 更好地关闭一个稳定、可测量的 Gap。
01
只有 Strong Baseline 暴露 Persistent Gap 后才训练
先建立并评估 Prompt/RAG Baseline,明确仍然错误的 Behavior,围绕这个 Gap Curate Training Data,并保持 Held-out Evaluation 独立。比较 Adapter、Quantized Adapter 与 Full Fine-tune 在 Task Quality、Training Cost、Serving Complexity 与 Rollback 上的差异。Adapter 必须与 Base-model Dependency 和 Evaluation Evidence 一起 Version。
02
示例:Style Classification 仍然不稳定
Domain Classifier 在 Prompt Example 与 Retrieval 后已经改善,但某组 Label 仍持续失败。团队围绕这些 Failure Curate Correction,保留 Held-out Failure Set,并训练 LoRA Adapter。只有当 Adapter 真正关闭 Gap,且没有带来不可接受的 Serving/Regression Cost 时才 Ship;否则继续使用更简单 Baseline。
常见失败模式
- 还没测 Strong Non-training Baseline 就开始 Fine-tuning。
- 直接用 Raw Production Log 训练 Adapter,没有 Curation 与 Held-out Evaluation。
- Version Adapter 时忽略 Base-model Compatibility 与 Serving Lifecycle。
工程启发
- Training 前必须存在 Persistent 且 Measured 的 Behavior Gap。
- Training Data 与 Held-out Evaluation Evidence 保持分离。
- 把 Adapter、Base Model 与 Serving Policy 作为一个 Operational Unit 进行 Versioning。
关键结论
- 01Adapter 降低的是 Parameter Cost,不会消除 Evaluation 需求。
- 02Fine-tuning 应回答 Measured Gap,而不是满足“想训练”的偏好。
- 03Serving 与 Rollback Complexity 都属于 Adaptation Decision。
阅读记录
这里只记录你真实做过的动作,不代表掌握、熟练或认证。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。