核心 GUIDE
CONCEPTFOUNDATION5 分钟阅读
Tokenization
模型处理的是 Token 序列,而不是人眼看到的字符或单词,因此成本、限制和行为都会受到文本切分方式影响。
核心心智模型
文本进入模型之前会被转换成 Token ID;模型在这个序列上计算,而 Context Limit 也是按 Token 而不是按页数或字符数衡量。
为什么重要
Tokenization 会影响 Context Budget、Latency、价格,某些情况下也会影响模型行为。代码、不常见的人名、多语言文本与空白符,即使视觉长度相近,也可能占用完全不同数量的 Token。
01
从文本到模型输入
Tokenizer 会把常见文本片段映射成整数 ID。高频片段通常可以用更少的 Token 表示,而少见字符串可能被拆成多个碎片。这些 Token ID 构成模型实际处理的序列;生成阶段产生新的 Token ID,再被 Decode 回文本。
02
例子:字符数相近,成本却不同
一个短标识符、一段 JSON 和一句中文可能拥有相近的字符数,却产生不同的 Token 数量。如果系统只按字符预算,就可能意外截断关键指令,或者在接入模型时超过 Provider 的 Context Limit。
常见失败模式
- 只根据单词数或字符数估算 Context 容量。
- 忽略日志、代码和序列化 Tool Result 的高 Token 消耗。
- 假设 Token Boundary 与真正的语义概念边界一致。
工程启发
- 当限制重要时,使用目标模型对应的 Tokenizer 实际测量。
- 分别为指令、检索证据、Tool Output 与生成结果预留预算。
- 在删除高价值证据之前,先裁剪低价值序列化数据。
关键结论
- 01字符是 UI 层概念,Token 才是模型输入的计量单位。
- 02Token 数量取决于内容类型,并不与视觉长度成固定比例。
- 03Tokenization 应用于预算与容量管理,而不应被误用成语义检索策略。
来自 Knowledge Graph 的相关知识点
这些关系直接来自 canonical graph,不维护第二套 Guide 分类体系。
Next-token 生成PREREQUISITE