核心 GUIDE

CONCEPTFOUNDATION7 分钟阅读

Pretraining Objective 与 Learned Behavior

Pretraining 通过大规模数据中的预测任务学习统计规律;很多有用 Capability 会从中形成,但 Product Guarantee 不会自动出现。

核心心智模型

Pretraining 在海量 Sequence 上优化 Statistical Prediction Objective。Model 因此学习广泛 Pattern 与 Reusable Representation,但它并没有直接针对你的 Product Policy、Current Fact 或某个具体 Workflow 的可靠完成接受训练。

为什么重要

理解 Training Objective 可以避免两个极端:把 Model 当成一份可以精确查询的训练语料 Database,或者因为它表现流畅就认为模型明确训练过你的 Task。Pretraining 提供 Broad Capability Prior;Instruction、Retrieval、Tool、Validation 与 Post-training 决定这些能力在 Runtime 如何被使用,而 Hard Guarantee 仍属于 Application Boundary。

01

从 Prediction Pressure 到 Reusable Representation

Pretraining 中,Model 不断根据 Context 预测 Missing / Next Data,并在预测错误时更新 Parameter。足够多样的数据会奖励能够表示 Syntax、Semantics、Code Pattern、Factual Association 等规律的内部结构,因此 Capability 可以迁移到从未以显式 Product Requirement 形式出现的 Task。

02

例子:Base Capability 仍然需要 Application Contract

Pretrained Model 可能能解释 SQL、生成 Query 并理解 Database Concept,但它不知道你的 Production Schema 与 Permission Rule。Application 可以提供 Schema Context 与 Tool 来利用这个能力,但 Authorization、Query Validation 与 Destructive-action Limit 仍必须在 Model 外部执行。

常见失败模式

  • 认为 Pretraining 等于模型存储了一份可完美检索的训练语料副本。
  • 把 Emergent Capability 当成可靠 Task Completion Guarantee。
  • 用更多 Prompt Text 去解决本应由 Runtime Policy Enforcement 的规则。

工程启发

  • 把 Broad Model Capability 与 Application-specific Evidence / Guarantee 分开。
  • Current / Private Knowledge 使用 Retrieval 或 Tool,而不是期待 Pretraining 永远最新。
  • Evaluation 真实 Workload,不从 General Fluency 推断具体可靠性。

关键结论

  1. 01Pretraining 建立广泛 Statistical Capability Base。
  2. 02Capability 不等于 Current Knowledge、Permission 或 Correctness Guarantee。
  3. 03Application Architecture 决定 Pretrained Capability 如何成为可靠 Product Behavior。

用于这些学习路径

这个 Concept 会在多个 canonical 学习路径中复用。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。