基础·入门·6 分钟

Token Playground

看见大语言模型如何把文本拆成 Token、计算下一个 Token 的概率,以及 Temperature 如何改变采样结果。

01

体验

先处理问题,再阅读解释。

学习路径

01
Prompt
读取当前输入
02
Tokenize
拆成 Token
03
Predict
查看候选概率
04
Sample
改变 Temperature
05
Repeat
把结果加入上下文
正在加载确定性实验运行时…
02

反思

把结果整理成可以复用的判断。

关键结论

Token 是模型处理文本的基本单位

模型真正读写的是 Token,而不是我们看到的自然语言单词。

概率决定候选之间的相对机会

不同候选 Token 会得到不同概率,解码策略再决定如何从中选择。

Temperature 改变的是采样分布

值越高,低概率候选越容易被选中;它不会给模型增加新知识。

生成过程是循环发生的

每选出一个 Token,它都会成为下一轮预测的新上下文。

03

深入理解

把这次体验连接到概念、参考与迁移。

概念说明

LLM 到底怎样预测下一个 Token?

大语言模型每一轮都会针对当前上下文,计算一组候选 Token 的概率分布,再根据解码策略选择一个 Token。这个 Token 被追加到上下文后,模型继续计算下一轮,因此我们看到的长文本其实是一连串局部选择累积出来的。

Token 是什么?

Token 是模型内部处理文本的单位。它可能是一个完整单词、一个词的一部分、标点、空格,甚至其他字符片段,具体边界取决于 tokenizer。理解这一点很重要,因为模型的上下文长度和生成成本通常也是按 Token 计算,而不是按“字”或“词”计算。

Temperature 改变了什么?

Temperature 会重新塑造采样概率的分布。较低的值会让概率更集中在头部候选,结果更稳定;较高的值会让分布更平,低概率候选获得更多机会,因此输出通常更有变化。它改变的是选择方式,不是模型参数和知识本身。

为什么这是工程问题?

在真实应用里,采样策略会影响输出稳定性、结构化数据的可解析性、测试可重复性,以及产品在创造性和可控性之间的取舍。一个适合写广告文案的配置,不一定适合生成必须通过 Schema 校验的 JSON。

常见问题

LLM 会一次决定整句话吗?

不会。自回归语言模型通常是逐个 Token 生成,每一步的结果都会影响下一步。

一个 Token 就是一个单词吗?

不一定。Tokenizer 可以把一个单词拆成多个 Token,也可能把标点或空格编码成独立 Token。

提高 Temperature 会让模型知道得更多吗?

不会。Temperature 只改变采样行为,不会修改模型权重,也不会补充缺失的知识。

这里的概率来自真实模型吗?

不是。这个实验使用稳定的教学模拟值,让你可以重复观察同一种因果关系,而不是把它误认为某个真实模型的基准测试。

页面中的概率是教学模拟值;真正需要带走的是 Token、概率分布和采样之间的因果关系。

LEARNING CONTEXT

学习连接

模型行为是概率性的;应用层保证必须在系统中显式设计,不能从流畅输出里默认获得。

未看过

Mental Model

  • S00-M01概率性模型行为 vs 应用系统保证

建议补充前置

进入这起事故前,没有必须完成的已发布前置内容。

迁移这个模型

模型返回了一个看起来合理、但不符合枚举约束的值。哪些保证属于模型,哪些必须由应用代码承担?

查看完整学习路径
04

下一步

把这个判断带到另一个问题或构建中。

动手想一想

为结构化输出选择解码策略

写创意文案和输出严格 JSON 时,你会使用同样的 Temperature 吗?先说明为什么,再继续下一个实验。

现在,你已经能看懂一次 Token 预测。

下一步:看看这些 Token 周围有限的工作空间——上下文窗口。

继续 →