核心 GUIDE
Pretraining Objective 与 Learned Behavior
Pretraining 通过大规模数据中的预测任务学习统计规律;很多有用 Capability 会从中形成,但 Product Guarantee 不会自动出现。
核心心智模型
Pretraining 在海量 Sequence 上优化 Statistical Prediction Objective。Model 因此学习广泛 Pattern 与 Reusable Representation,但它并没有直接针对你的 Product Policy、Current Fact 或某个具体 Workflow 的可靠完成接受训练。
为什么重要
理解 Training Objective 可以避免两个极端:把 Model 当成一份可以精确查询的训练语料 Database,或者因为它表现流畅就认为模型明确训练过你的 Task。Pretraining 提供 Broad Capability Prior;Instruction、Retrieval、Tool、Validation 与 Post-training 决定这些能力在 Runtime 如何被使用,而 Hard Guarantee 仍属于 Application Boundary。
01
从 Prediction Pressure 到 Reusable Representation
Pretraining 中,Model 不断根据 Context 预测 Missing / Next Data,并在预测错误时更新 Parameter。足够多样的数据会奖励能够表示 Syntax、Semantics、Code Pattern、Factual Association 等规律的内部结构,因此 Capability 可以迁移到从未以显式 Product Requirement 形式出现的 Task。
02
例子:Base Capability 仍然需要 Application Contract
Pretrained Model 可能能解释 SQL、生成 Query 并理解 Database Concept,但它不知道你的 Production Schema 与 Permission Rule。Application 可以提供 Schema Context 与 Tool 来利用这个能力,但 Authorization、Query Validation 与 Destructive-action Limit 仍必须在 Model 外部执行。
常见失败模式
- 认为 Pretraining 等于模型存储了一份可完美检索的训练语料副本。
- 把 Emergent Capability 当成可靠 Task Completion Guarantee。
- 用更多 Prompt Text 去解决本应由 Runtime Policy Enforcement 的规则。
工程启发
- 把 Broad Model Capability 与 Application-specific Evidence / Guarantee 分开。
- Current / Private Knowledge 使用 Retrieval 或 Tool,而不是期待 Pretraining 永远最新。
- Evaluation 真实 Workload,不从 General Fluency 推断具体可靠性。
关键结论
- 01Pretraining 建立广泛 Statistical Capability Base。
- 02Capability 不等于 Current Knowledge、Permission 或 Correctness Guarantee。
- 03Application Architecture 决定 Pretrained Capability 如何成为可靠 Product Behavior。
用于这些学习路径
这个 Concept 会在多个 canonical 学习路径中复用。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。