内容摘要
这段内容的核心判断是:分词不是无聊的预处理,而是大模型能力、成本、稳定性与怪异行为的底层约束。很多看似“模型不聪明”的问题,实际先来自 tokenization 的表示方式。
关键观点
Token 不是字符,而是模型真正看到的原子单位
作者反复强调,大模型内部并不直接处理“字符串”,而是处理 token 序列。即便最简单的字符级方案,本质上也要先建立词表,把每个字符映射成整数,再通过 embedding table 取出对应向量送入 Transformer。也因此,模型感知世界的最小单位不是人类直觉里的字母、单词或句子,而是 tokenizer 划出的片段。只要切分方式改变,模型对上下文长度、相似性、拼写和结构的理解都会一起改变。
为什么重要: 如果你把问题只归因于网络结构或训练不足,会错过更底层的表示问题。调模型前先看 token 边界,通常更有效。
支撑证据
tokens are this like fundamental unit um the atom of uh large language models if you will and everything is in units of tokens everything is about tokens and tokenization is the process for translating strings or text into sequences of tokens
工业分词的核心不是字符级,而是基于 UTF-8 字节流的 BPE 压缩
作者先否定了直接使用 Unicode code point 的方案:词表太大,而且标准仍在变化。随后说明工业界更常见的是先把文本编码成 UTF-8 字节流,再从 256 个原始字节出发,用 BPE 反复合并高频相邻对,逐步长出更大的 token。这样做的目标不是语义优雅,而是压缩序列长度,提高上下文利用率,同时把词表大小控制在可计算的范围。换句话说,BPE 是一种面向 Transformer 约束的压缩策略。