什么是 Token

在前面的学习中,我们已经对大模型有了整体的认识。从这一章开始,我们将深入到大模型的内部世界,去搞懂那些 AI 专家天天挂在嘴边的 “专业术语”。

如果小伙伴们有关注 AI 资讯,或者看过一些官媒新闻,一定会被 “Token” 这个词频繁刷屏。比如:

  • 某某给大学捐赠了 20 亿 Token。
  • 国家超算中心开始送 Token了。
  • 该模型支持 128k 的 Token 上下文。
  • 调用 API 每 100 万个 Token 收费多少元。
  • ……

那么,这个 “Token” 到底是什么?大模型又为什么要拿它当计量单位呢?这一节咱们就来好好聊聊。

什么是大模型 Token:图解人工智能(AI)的文本处理单元与 API 计费基本标准

提示: 国内官媒已经将 Token 的翻译定为 “词元”,不过大多数情况下,我们还是会使用 “Token” 这种叫法。

大模型中的 Token 是什么?

大模型虽然很聪明,但它的底层说到底,是个只能处理数学计算的计算机。它没法像人类一样,直接把 “大模型” 这 3 个字塞进大脑里去理解。

为了读懂人类的语言,大模型拿到我们输入的文本后,做的第一件事就是把这一整段话 “拆分”,切成一个个小小的文字碎片。这些被切出来的 “文字碎块”,在 AI 世界里就叫作 Token。

我们可以把 Token 想象成大模型世界的 “乐高积木”。任何一篇文章、一段代码、一句话,在大模型眼里,都是由大大小小的乐高积木拼接而成的。它读的时候是一块一块地读,回答的时候,也是一块一块往外蹦。

大模型 Token 原理通俗图解:像乐高积木一样,将文章与代码拆分成文字碎块

此 Token,非彼 Token

如果小伙伴们做过 Web 开发,对 Token 这个词一定不陌生。在前后端交互中(比如用户登录鉴权时),我们经常会用到 “JWT(JSON Web Token)”。在这种场景下,Token 是一张 “身份凭证”。

但要注意:大模型中的 Token,与 Web 开发中的 Token,是两个完全不同的东西。大模型的 Token 和身份验证毫无关系,它纯粹是一个 “文本计量的基本单位”。

为什么不使用 “字” 或 “词” 作为计量单位呢?

小伙伴可能会犯嘀咕:既然是要拆分文本,那直接按中文的 “字”、英文的 “单词” 来拆不就好了吗?为什么非要生造一个 “Token” 出来呢?

这主要是为了同时兼顾 “全球语言的通用性” 和 “计算效率”。

  • 如果按 “单词” 切:英文具有天然优势,它可以使用空格来切分单词,但中文不行。比如中文的 “大模型” 是一个词,却是由 3 个汉字组成的。要是把世界上每种语言的每个词都单独做成积木,那大模型的积木库就会膨胀到天文数字。
  • 如果按 “单字” 切:比如把英文单词 “beautiful” 拆成 b-e-a-u-t-i-f-u-l 这 9 个字母,那 AI 读一本书就需要处理海量的字母,效率极其低下,并且单个字母本身是没有任何实际意义的。

为什么大模型不用字或词作为计量单位?中英文拆分效率与通用性对比

所以,研究人员发明了一种折中方案:按 “子词” 来切。比如英文单词 “helpful”,大模型可能会把它切成 “help” 和 “ful” 两个 Token。这样既保留了主要意思,又大大减少了积木的种类。

大模型 Token 拆分的折中方案:英文子词(Subword)切分原理示例

此外,数字也是被切成 Token 来处理的,而且切法有时并不直观。比如 “9.11” 可能被切成 “9”、“.”、“11” 这 3块。这也是为什么某些模型会在 “9.11 和 9.9 谁更大” 这种问题上翻车的原因之一。这一点,我们已经在前面 “大模型的能力边界” 一节中提过了。

“中文的 Token” vs “英文的 Token”

搞清楚 “中文的 Token” 和 “英文的 Token” 之间的区别非常重要,因为这直接关系到你日后调用大模型时的 “钱包” 问题。

1. 在早期的大模型时代(比如几年前)

由于大模型最初都是由国外巨头研发的,它们的积木库主要是针对英文设计的。这就导致早期的模型在处理英文时,1 个 Token 大约等于 0.75 个英文单词。

可处理中文时就尴尬了:由于词表里没收录完整的中文词汇,它只能把 1 个汉字硬拆成好几个底层字节来存,结果 1 个汉字往往要占掉 2 到 3 个 Token。

所以在那会儿,用大模型处理中文,比处理英文要贵上好几倍——就是因为 Token 消耗量多了好几倍。

早期大模型中英文 Token 消耗对比:汉字占用 Token 较多导致计费昂贵

2. 现在的国产大模型时代

大人,时代变了!随着国内 AI 技术的爆发,像 DeepSeek、Qwen(通义千问)等主流国产大模型,为了让咱们中国人用得更爽、更便宜,专门在底层大幅扩充了 “中文词表”。

在现在的国产大模型中,1 个汉字只占 1 个 Token,甚至很多常见的中文词组(比如 “大模型”、“人工智能”)也被直接做成了一整块 “乐高积木”。这么一来,处理同样一段中文,消耗的 Token 比早期少了一大截。在国内用大模型处理中文,计费效率已经实现了反超,性价比更高了!

国产大模型中文 Token 优化原理图解:展示了现代大模型如何将常见中文词组打包,从而大幅降低 Token 消耗并提升性价比。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号