术语表

Token

最后更新:2026-07-02

TokenLLM 实际读写的文本单位。模型看到的不是字母也不是完整单词——分词器(tokenizer)先把文本切成固定词表里的块:常见词是一个 token,生僻词拆成几个,标点通常独占一个。英文平均一个 token 约 ¾ 个单词(约 4 个字符),1,000 个 token 大致 750 词;中文更贵,约每个汉字 1–2 个 token。

为什么 token 是那个要紧的单位

有两样东西按 token 计量,而且都花你的钱:

  • API 价格按每百万 token 算,输入(你的 prompt)和输出(模型的回复)费率不同——输出通常贵 3–5 倍。比如 Claude Sonnet 5 尝鲜价是每百万输入 token $2、每百万输出 $10。
  • 上下文窗口——模型一次能看多少内容——是一份 token 预算,不是字数预算。

值得知道的坑

分词效果因语言和内容而异:代码、非英语文本与特殊格式,单位信息量消耗的 token 都更多。而且不同模型的分词器互不相同——同一段文本在 A 模型可能比 B 模型多数出 10–35% 的 token,成本对比会被悄悄改写。Anthropic 的 Sonnet 5 换分词器就是现成的例子:相同文本映射为前代的 1.0–1.35 倍 token,单价没变,按任务算的经济账却变了。

数数你的 token

把真实文本粘进我们的 Token 计算器,即可查看 GPT、Claude、Gemini、DeepSeek 等模型的 token 数与预估 API 费用——纯浏览器运行,不上传任何内容。

来源

← 全部术语