核心 GUIDE
MENTAL_MODELFOUNDATION6 分钟阅读
概率性模型行为
把模型输出理解为一组可能续写的概率分布,而不是从问题到唯一答案的确定性查表。
核心心智模型
LLM 不是检索一个保证正确的答案,而是在 Context 与采样策略的约束下,持续从多个可能的 Next Token 中进行选择。
为什么重要
如果把概率生成器当成确定性软件组件,就会把正常的输出变化误判为 Bug,也会把模型的自信表达误当成正确性。可靠的 AI 系统需要把模型不确定性与应用层真正提供的保证分开:Schema、Validator、Tool、业务规则与人工复核负责建立可执行的边界。
01
这种行为如何产生
在每一个生成步骤中,模型都会为多个可能的 Next Token 计算分数。Prompt、此前 Token 与模型参数共同塑造这个分布,随后 Decoding 决定选择哪一个续写。Context 或采样条件发生很小的变化,就可能让后续路径分叉,因此同一个任务的两次合理运行也可能得到不同表述。
02
例子:同一个客服问题问两次
连续两次让模型总结退款政策,措辞可能不同,但只要关键事实一致,这种变化本身并不是问题。如果某一次突然编造了一个例外条款,真正的问题也不是“表述不稳定”,而是系统没有为事实性主张提供 Grounding 与 Verification。
常见失败模式
- 把一次成功输出当作模型行为稳定的证明。
- 把低 Temperature 当作事实正确性的保证。
- 让模型的自信程度替代外部证据或 Runtime 检查。
工程启发
- 当输出变化会影响结果时,用多次代表性运行进行评测。
- 把必须成立的硬约束放到 Schema、Validator、Tool 与业务规则中。
- 衡量任务是否真正成功以及失败模式,而不是模型说得有多自信。
关键结论
- 01概率性不等于随机,而是结果存在一个分布。
- 02当失败代价较高时,应用保证必须由模型之外的系统机制提供。
- 03只要明确哪些条件必须保持不变,允许一定输出变化并没有问题。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。
采样控制PREREQUISITE