为什么 AI 按 Token 收费?一个汉字算几个 Token?
阅读时间约 8 分钟当我们和 AI 对话时,AI 并不像人类一样逐字阅读。它也不是按照"词"来理解文字的。AI 的基本阅读单位叫做 Token——一种介于字符和单词之间的子词片段(subword)。
一个 Token 可能是一个完整的英文单词(如 the),也可能是单词的一部分(如 un + happi + ness),还可能是一个中文字或几个字节。具体怎么切分,取决于模型使用的分词器(Tokenizer)。
在下方输入任意文字,观察它如何被拆分为 Token:
Token 就像乐高积木——AI 不认识完整的句子,它把文字拆成一块块"积木"来理解。
大多数现代大语言模型使用 Byte Pair Encoding(BPE,字节对编码) 算法来构建它们的分词器。BPE 的核心思想非常简单:反复合并最常出现的相邻符号对。
BPE 的训练过程如下:
1. 将所有文本拆成最小单元(字符或字节)
2. 统计所有相邻符号对出现的频率
3. 将最高频的一对合并为一个新符号
4. 重复步骤 2-3,直到词表达到预设大小
观察单词 lowest 如何通过 BPE 逐步合并(基于频率统计):
BPE 就像找规律缩写——如果你发现 "th" 总是一起出现,就把它合成一个新符号。
不同语言的 Token 效率差异很大。英文单词由 26 个字母组成,常见词(如 the、is)往往是单个 Token。而中文有数千个常用汉字,每个汉字的信息密度远高于一个英文字母——但分词器需要更多的 Token 来编码它们。
简单来说:中文表达同样的语义,往往需要更多的 Token,即使中文的字数更少。
中文就像压缩包——信息密度高,但 AI 需要更多"解码步骤"。
AI 模型的调用成本直接与 Token 数量挂钩。无论是发送给模型的 Prompt(输入),还是模型生成的 Completion(输出),都按 Token 计费。输出通常比输入更贵,因为生成文字需要更多的计算。
以下是主流模型每 100 万 Token 的定价参考(USD):
| 模型 | 输入价格 | 输出价格 | 缓存输入 |
|---|---|---|---|
| GPT-5.4 | $2.50 | $15.00 | $1.25 |
| Claude Opus 4.6 | $5.00 | $25.00 | $0.50 |
| Claude Sonnet 4.6 | $3.00 | $15.00 | $0.30 |
| Gemini 2.5 Pro | $1.25 | $10.00 | - |
| DeepSeek V3.2 | $0.28 | $0.42 | $0.028 |
| Qwen3.5 Plus | $0.26 | $1.56 | - |
* 价格为 2026 年 3 月公开定价(USD / 1M tokens),可能随时间变化。缓存输入指 Prompt Caching,可显著降低重复上下文的成本。端侧推理(如 AtomGradient Runtime)Token 费用为零。
可以看到,不同模型之间的价格差异巨大。DeepSeek V3.2 和 Qwen3.5 提供了极具竞争力的价格(输出仅 $0.42-1.56/M),而 Claude Opus 4.6 和 GPT-5.4 在能力上有各自的优势。选择模型时,需要在成本和能力之间做权衡。
Token 就是 AI 的"字数"——就像手机话费按分钟计,AI 按 Token 计费。
AI 不按字、不按词阅读,而是按分词器切出的子词单元(Token)来处理文本。
Byte Pair Encoding 从最小单元开始,反复合并高频相邻对,构建出高效的词表。
中文信息密度高但 Token 开销大,同样语义的中文通常比英文消耗更多 Token。
理解 Token 就能估算 AI 调用成本,选择合适的模型和优化策略。
理解 Token,就理解了 AI 的"语言单位"和"计费单位"。