核心 GUIDE

CONCEPTFOUNDATION5 分钟阅读

Tokenization

模型处理的是 Token 序列,而不是人眼看到的字符或单词,因此成本、限制和行为都会受到文本切分方式影响。

核心心智模型

文本进入模型之前会被转换成 Token ID;模型在这个序列上计算,而 Context Limit 也是按 Token 而不是按页数或字符数衡量。

为什么重要

Tokenization 会影响 Context Budget、Latency、价格,某些情况下也会影响模型行为。代码、不常见的人名、多语言文本与空白符,即使视觉长度相近,也可能占用完全不同数量的 Token。

01

从文本到模型输入

Tokenizer 会把常见文本片段映射成整数 ID。高频片段通常可以用更少的 Token 表示,而少见字符串可能被拆成多个碎片。这些 Token ID 构成模型实际处理的序列;生成阶段产生新的 Token ID,再被 Decode 回文本。

02

例子:字符数相近,成本却不同

一个短标识符、一段 JSON 和一句中文可能拥有相近的字符数,却产生不同的 Token 数量。如果系统只按字符预算,就可能意外截断关键指令,或者在接入模型时超过 Provider 的 Context Limit。

常见失败模式

  • 只根据单词数或字符数估算 Context 容量。
  • 忽略日志、代码和序列化 Tool Result 的高 Token 消耗。
  • 假设 Token Boundary 与真正的语义概念边界一致。

工程启发

  • 当限制重要时,使用目标模型对应的 Tokenizer 实际测量。
  • 分别为指令、检索证据、Tool Output 与生成结果预留预算。
  • 在删除高价值证据之前,先裁剪低价值序列化数据。

关键结论

  1. 01字符是 UI 层概念,Token 才是模型输入的计量单位。
  2. 02Token 数量取决于内容类型,并不与视觉长度成固定比例。
  3. 03Tokenization 应用于预算与容量管理,而不应被误用成语义检索策略。

来自 Knowledge Graph 的相关知识点

这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。

Next-token 生成PREREQUISITE