Token Playground
看见大语言模型如何把文本拆成 Token、计算下一个 Token 的概率,以及 Temperature 如何改变采样结果。
LLM 不是一次写完整句话,而是不断计算“下一个 Token 可能是什么”,选出一个结果,把它加入上下文,再继续下一轮。
为结构化输出选择解码策略
写创意文案和输出严格 JSON 时,你会使用同样的 Temperature 吗?先说明为什么,再继续下一个实验。
LLM 到底怎样预测下一个 Token?
大语言模型每一轮都会针对当前上下文,计算一组候选 Token 的概率分布,再根据解码策略选择一个 Token。这个 Token 被追加到上下文后,模型继续计算下一轮,因此我们看到的长文本其实是一连串局部选择累积出来的。
Token 是什么?
Token 是模型内部处理文本的单位。它可能是一个完整单词、一个词的一部分、标点、空格,甚至其他字符片段,具体边界取决于 tokenizer。理解这一点很重要,因为模型的上下文长度和生成成本通常也是按 Token 计算,而不是按“字”或“词”计算。
Temperature 改变了什么?
Temperature 会重新塑造采样概率的分布。较低的值会让概率更集中在头部候选,结果更稳定;较高的值会让分布更平,低概率候选获得更多机会,因此输出通常更有变化。它改变的是选择方式,不是模型参数和知识本身。
为什么这是工程问题?
在真实应用里,采样策略会影响输出稳定性、结构化数据的可解析性、测试可重复性,以及产品在创造性和可控性之间的取舍。一个适合写广告文案的配置,不一定适合生成必须通过 Schema 校验的 JSON。
常见问题
不会。自回归语言模型通常是逐个 Token 生成,每一步的结果都会影响下一步。
不一定。Tokenizer 可以把一个单词拆成多个 Token,也可能把标点或空格编码成独立 Token。
不会。Temperature 只改变采样行为,不会修改模型权重,也不会补充缺失的知识。
不是。这个实验使用稳定的教学模拟值,让你可以重复观察同一种因果关系,而不是把它误认为某个真实模型的基准测试。