Token 是模型处理文本的基本单位
模型真正读写的是 Token,而不是我们看到的自然语言单词。
看见大语言模型如何把文本拆成 Token、计算下一个 Token 的概率,以及 Temperature 如何改变采样结果。
先处理问题,再阅读解释。
把结果整理成可以复用的判断。
模型真正读写的是 Token,而不是我们看到的自然语言单词。
不同候选 Token 会得到不同概率,解码策略再决定如何从中选择。
值越高,低概率候选越容易被选中;它不会给模型增加新知识。
每选出一个 Token,它都会成为下一轮预测的新上下文。
把这次体验连接到概念、参考与迁移。
概念说明
大语言模型每一轮都会针对当前上下文,计算一组候选 Token 的概率分布,再根据解码策略选择一个 Token。这个 Token 被追加到上下文后,模型继续计算下一轮,因此我们看到的长文本其实是一连串局部选择累积出来的。
Token 是模型内部处理文本的单位。它可能是一个完整单词、一个词的一部分、标点、空格,甚至其他字符片段,具体边界取决于 tokenizer。理解这一点很重要,因为模型的上下文长度和生成成本通常也是按 Token 计算,而不是按“字”或“词”计算。
Temperature 会重新塑造采样概率的分布。较低的值会让概率更集中在头部候选,结果更稳定;较高的值会让分布更平,低概率候选获得更多机会,因此输出通常更有变化。它改变的是选择方式,不是模型参数和知识本身。
在真实应用里,采样策略会影响输出稳定性、结构化数据的可解析性、测试可重复性,以及产品在创造性和可控性之间的取舍。一个适合写广告文案的配置,不一定适合生成必须通过 Schema 校验的 JSON。
不会。自回归语言模型通常是逐个 Token 生成,每一步的结果都会影响下一步。
不一定。Tokenizer 可以把一个单词拆成多个 Token,也可能把标点或空格编码成独立 Token。
不会。Temperature 只改变采样行为,不会修改模型权重,也不会补充缺失的知识。
不是。这个实验使用稳定的教学模拟值,让你可以重复观察同一种因果关系,而不是把它误认为某个真实模型的基准测试。
页面中的概率是教学模拟值;真正需要带走的是 Token、概率分布和采样之间的因果关系。
LEARNING CONTEXT
模型行为是概率性的;应用层保证必须在系统中显式设计,不能从流畅输出里默认获得。
Mental Model
建议补充前置
进入这起事故前,没有必须完成的已发布前置内容。
迁移这个模型
模型返回了一个看起来合理、但不符合枚举约束的值。哪些保证属于模型,哪些必须由应用代码承担?
把这个判断带到另一个问题或构建中。
写创意文案和输出严格 JSON 时,你会使用同样的 Temperature 吗?先说明为什么,再继续下一个实验。