核心 GUIDE
Preference Post-training
Preference Post-training 会塑造 Model 在多种 plausible continuation 中更倾向选择什么行为,但 Preference Signal 不会因此变成 Hard Application Guarantee。
核心心智模型
Broad Pretraining 之后,Post-training 可以通过 Demonstration、Ranking、Critique 或 Reward Signal 优化 Model,使其更偏向 Preferred Response。它改变 Behavioral Tendency 与 Interaction Quality,但 Permission、Evidence 与 Irreversible Decision 仍由 Runtime Policy 负责。
为什么重要
用户真正接触的是 Post-trained Model,因此 Helpfulness、Instruction Following、Refusal Behavior 与 Response Style 都会受到这一阶段强烈影响。但 Optimization Target 依旧是 Learned Preference Signal。Model 在常见 Case 表现良好,不代表面对 Distribution Shift、Conflicting Instruction 或 Unusual Tool 时仍可靠,所以 Product Safety 不能完全外包给“对齐行为”。
01
在 Broad Capability 之后优化 Preferred Behavior
Post-training 从 Pretrained Model 出发,使用代表 Preferred Behavior 的 Example 或 Comparison。Training 可以直接模仿 High-quality Demonstration,也可以针对 Learned / Rule-derived Preference Signal 进行优化。最终改变的是相似 Prompt 下哪些 Response 更可能出现,但 Learned Policy 仍然是 Probabilistic,并受到 Preference Data 与 Evaluation Coverage 的边界限制。
02
例子:Helpful Refusal 是 Behavior,不是 Authorization
Post-trained Assistant 通常会拒绝泄露 Private Customer Data,这个倾向很有价值;但 Production Support Agent 仍然应该从根本上没有导出任意 Customer Record 的 Permission。如果异常 Prompt 绕过 Learned Refusal,Runtime Least Privilege 仍然能保护系统。
常见失败模式
- 把 Aligned Conversational Behavior 当作 Security Boundary。
- 假设 Preference Data 已覆盖所有未来 Tool、Language 与 Edge Case。
- 用 Post-training 编码需要即时更新的 Dynamic Business Policy。
工程启发
- 在真实 Product Slice 与重要 Adversarial Boundary 上 Evaluation Post-trained Behavior。
- Authorization、Source-of-truth State 与 Irreversible-action Control 保持在 Model 外。
- Post-training 更适合 Stable Behavioral Tendency,而不是快速变化的 Fact / Policy。
关键结论
- 01Post-training 在 Broad Capability 学习之后塑造 Behavior。
- 02Preference Optimization 改变 Probability,不改变 Runtime Authority。
- 03Product Guarantee 仍需要 Application-layer Evidence 与 Enforcement。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。