Token 与分词

为什么 AI 按 Token 收费?一个汉字算几个 Token?

自然语言处理 分词 BPE
阅读时间约 8 分钟
Chapter 01

什么是 Token?

当我们和 AI 对话时,AI 并不像人类一样逐字阅读。它也不是按照"词"来理解文字的。AI 的基本阅读单位叫做 Token——一种介于字符和单词之间的子词片段(subword)。

一个 Token 可能是一个完整的英文单词(如 the),也可能是单词的一部分(如 un + happi + ness),还可能是一个中文字或几个字节。具体怎么切分,取决于模型使用的分词器(Tokenizer)。

// 互动演示:实时分词

在下方输入任意文字,观察它如何被拆分为 Token:

Token 就像乐高积木——AI 不认识完整的句子,它把文字拆成一块块"积木"来理解。

Chapter 02

BPE 算法

大多数现代大语言模型使用 Byte Pair Encoding(BPE,字节对编码) 算法来构建它们的分词器。BPE 的核心思想非常简单:反复合并最常出现的相邻符号对

BPE 的训练过程如下:

1. 将所有文本拆成最小单元(字符或字节)
2. 统计所有相邻符号对出现的频率
3. 将最高频的一对合并为一个新符号
4. 重复步骤 2-3,直到词表达到预设大小

// 互动演示:BPE 合并过程

观察单词 lowest 如何通过 BPE 逐步合并(基于频率统计):

BPE 就像找规律缩写——如果你发现 "th" 总是一起出现,就把它合成一个新符号。

Chapter 03

中文 vs 英文

不同语言的 Token 效率差异很大。英文单词由 26 个字母组成,常见词(如 theis)往往是单个 Token。而中文有数千个常用汉字,每个汉字的信息密度远高于一个英文字母——但分词器需要更多的 Token 来编码它们。

简单来说:中文表达同样的语义,往往需要更多的 Token,即使中文的字数更少。

示例一

English
The cat sat on the mat
6
Tokens
中文
猫坐在垫子上
6
Tokens

示例二

English
Artificial intelligence is transforming our daily lives
7
Tokens
中文
人工智能正在改变我们的日常生活
11
Tokens

中文就像压缩包——信息密度高,但 AI 需要更多"解码步骤"。

Chapter 04

Token 与价格

AI 模型的调用成本直接与 Token 数量挂钩。无论是发送给模型的 Prompt(输入),还是模型生成的 Completion(输出),都按 Token 计费。输出通常比输入更贵,因为生成文字需要更多的计算。

以下是主流模型每 100 万 Token 的定价参考(USD):

模型 输入价格 输出价格 缓存输入
GPT-5.4 $2.50 $15.00 $1.25
Claude Opus 4.6 $5.00 $25.00 $0.50
Claude Sonnet 4.6 $3.00 $15.00 $0.30
Gemini 2.5 Pro $1.25 $10.00 -
DeepSeek V3.2 $0.28 $0.42 $0.028
Qwen3.5 Plus $0.26 $1.56 -

* 价格为 2026 年 3 月公开定价(USD / 1M tokens),可能随时间变化。缓存输入指 Prompt Caching,可显著降低重复上下文的成本。端侧推理(如 AtomGradient Runtime)Token 费用为零。

可以看到,不同模型之间的价格差异巨大。DeepSeek V3.2Qwen3.5 提供了极具竞争力的价格(输出仅 $0.42-1.56/M),而 Claude Opus 4.6GPT-5.4 在能力上有各自的优势。选择模型时,需要在成本能力之间做权衡。

Token 就是 AI 的"字数"——就像手机话费按分钟计,AI 按 Token 计费。

Chapter 05

总结

🧩

Token 是子词片段

AI 不按字、不按词阅读,而是按分词器切出的子词单元(Token)来处理文本。

🔗

BPE 逐步合并

Byte Pair Encoding 从最小单元开始,反复合并高频相邻对,构建出高效的词表。

🌏

语言影响效率

中文信息密度高但 Token 开销大,同样语义的中文通常比英文消耗更多 Token。

💰

Token = 计费单位

理解 Token 就能估算 AI 调用成本,选择合适的模型和优化策略。

理解 Token,就理解了 AI 的"语言单位"和"计费单位"。

下一篇:注意力机制