核心 GUIDE

MENTAL_MODELFOUNDATION6 分钟阅读

概率性模型行为

把模型输出理解为一组可能续写的概率分布,而不是从问题到唯一答案的确定性查表。

核心心智模型

LLM 不是检索一个保证正确的答案,而是在 Context 与采样策略的约束下,持续从多个可能的 Next Token 中进行选择。

为什么重要

如果把概率生成器当成确定性软件组件,就会把正常的输出变化误判为 Bug,也会把模型的自信表达误当成正确性。可靠的 AI 系统需要把模型不确定性与应用层真正提供的保证分开:Schema、Validator、Tool、业务规则与人工复核负责建立可执行的边界。

01

这种行为如何产生

在每一个生成步骤中,模型都会为多个可能的 Next Token 计算分数。Prompt、此前 Token 与模型参数共同塑造这个分布,随后 Decoding 决定选择哪一个续写。Context 或采样条件发生很小的变化,就可能让后续路径分叉,因此同一个任务的两次合理运行也可能得到不同表述。

02

例子:同一个客服问题问两次

连续两次让模型总结退款政策,措辞可能不同,但只要关键事实一致,这种变化本身并不是问题。如果某一次突然编造了一个例外条款,真正的问题也不是“表述不稳定”,而是系统没有为事实性主张提供 Grounding 与 Verification。

常见失败模式

  • 把一次成功输出当作模型行为稳定的证明。
  • 把低 Temperature 当作事实正确性的保证。
  • 让模型的自信程度替代外部证据或 Runtime 检查。

工程启发

  • 当输出变化会影响结果时,用多次代表性运行进行评测。
  • 把必须成立的硬约束放到 Schema、Validator、Tool 与业务规则中。
  • 衡量任务是否真正成功以及失败模式,而不是模型说得有多自信。

关键结论

  1. 01概率性不等于随机,而是结果存在一个分布。
  2. 02当失败代价较高时,应用保证必须由模型之外的系统机制提供。
  3. 03只要明确哪些条件必须保持不变,允许一定输出变化并没有问题。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

采样控制PREREQUISITE