Token 计算与计费

Token 就像是大模型世界里的 “乐高积木”。搞懂了它的概念之后,很多准备做开发、或者接入大模型 API 的小伙伴,最关心的就是:“这玩意儿到底是怎么算账的?我发一篇文章过去,或者让它敲一段代码出来,到底会扣我多少钱啊?”

提示: 这一节内容偏向于开发者,对于非开发的小伙伴来说,简单过一遍即可。

如何查看和计算 Token 数量?

对于大模型来说,它只认 “积木”,不认 “字数”。为了准确算出一段话包含多少个 Token,各大 AI 厂商都提供了专门的 “分词器” 工具——把文本粘贴进去,它就会自动帮你切碎、数出积木的数量。

其中,目前主流大模型在线 Token 计算工具有以下几种:

  • TikTokenizer:这是全球开发者最常用的开源分词可视化网站,网址:https://tiktokenizer.vercel.app/。
  • ChatGPT:https://platform.openai.com/tokenizer
  • Claude AI:https://huggingface.co/spaces/Xenova/the-claude-3-tokenizer
  • Gemini:https://aistudio.google.com/
  • DeepSeek:https://huggingface.co/spaces/Xenova/deepseek-llm-7b-tokenizer

比如,小伙伴们可以把一段文本粘贴进 TikTokenizer 的计算器中,然后可以非常直观地看出 Token 是如何计算的,如下图所示。

大模型 Token 在线计算与分词器工具:TikTokenizer 界面演示

需要注意的是:由于切分算法的不同,同样一段 1000 字的中文小说,在不同的模型里切出来的 Token 数量是不一样的。如果是早期的海外模型,可能需要消耗 1500 个 Token。但如果是现在的国产顶尖大模型(词表经过高度优化),往往只需要 500 到 800 个 Token。

大模型的双轨计费:输入与输出

当我们去翻阅各种大模型的 Token 价格表时,会发现它们清一色都用了两种价格来计算:

  1. 输入价格(Prompt Tokens):指的是你发给大模型的提示词、上下文、历史对话所消耗的 Token 数量。
  2. 输出价格(Completion Tokens):指的是大模型听懂你的话之后,自己思考、“接龙” 生成出来的回答所消耗的 Token 数量。

大模型双轨计费机制:输入价格(Prompt) vs 输出价格(Completion)

注意: 在绝大多数情况下,输出价格都会比输入价格 “贵上好几倍”。以 Gemini Pro 为例,输入 100 万 Token 大约只需 2 美元,但输出 100 万 Token 则可能高达 10~15 美元——具体数字各家不一样、也会随时调整。

为什么输出会比输入贵这么多呢?咱们可以用一个生动的例子来理解。

这就好比你去请教一位资深的 “行业专家”。你递给他一份 5000 字的需求说明书(相当于 “输入”),他凭借着渊博的经验,扫几眼就读懂了。这个 “读题” 的过程对他来说很轻松,所以收费比较便宜。

可读完之后,他得绞尽脑汁、耗费大量精力,才能帮你设计出一套完善的 500 字方案(这相当于 “输出”)。创造新内容、写出答案是很费脑子的,所以这部分收费自然就贵得多。

大模型也是同样的道理,“输入” 本身耗费的算力不大,但是 “输出” 耗费的算力非常大。这就是输出价格比输入贵很多的根本原因。

实战算账:调用一次到底花多少钱?

为了让小伙伴们更好地理解,我们到一个接近真实的场景里算一笔账。假设我们接入了某款主流大模型(比如 DeepSeek 最新版),它的官方公开价格为:

  • 输入价格:1元/百万 Token(即 0.000001元 / Token)。
  • 输出价格:2元/百万 Token(即 0.000002元 / Token)。

注意: 本文里出现的所有价格,都只是为了讲清算法而举的例子。各家大模型的价格变动非常频繁(经常降价、也常有促销),所以真要算预算时,大家务必要以官方价格页上的最新数字为准。

1. 单次简单对话

假设你写了一段 500 字的提示词,大模型给你生成了一份 1000 字的回答。经分词器折算,这次请求的积木消耗大致是:

  • 输入:500个 Token。
  • 输出:1000个 Token。

因此,大模型厂商扣除的费用计算如下:

总费用 = 500 * 0.000001 + 1000 * 0.000002 = 0.0005 + 0.0020 = 0.0025元(即四分之一分钱)

看起来是不是便宜到不行?一次调用连一分钱都不到。但小伙伴们别高兴得太早——真正的 “Token 吞噬怪” 马上就要登场了。

调用大模型 API 一次花多少钱?单次对话 Token 消耗费用计算示例

2. 多轮长对话的 “滚雪球效应”

大模型在后台是没有任何短期记忆的。为了让你感觉它是在跟你 “连续聊天”,每次你发一条新消息过去,大模型都会把你和它 “之前所有的历史聊天记录” 合并在一起,重新当成输入来处理。

连续多轮长对话,是会产生恐怖的 “滚雪球效应” 的,比如:

  • 第 1 轮:你输入 500 Token,AI 回复 1000 Token。
  • 第 2 轮:你输入 500 Token。此时发送给 AI 的实际输入是:第一轮输入 + 第一轮回复 + 第二轮输入 = 500 + 1000 + 500 = 2000个 Token!
  • 第 3 轮:你再输入 500 Token。这次发过去的,是前两轮的全部对话加上这次的输入——假设 AI 每轮也回复 1000 Token,那就是 500 + 1000 + 500 + 1000 + 500 = 3500 个 Token!

多轮长对话的 Token 计费:合并历史记录导致的滚雪球效应成本暴涨

随着聊天越来越深入,每轮消耗的输入 Token 会像滚雪球一样越滚越大。要是你的网站访问量很大,哪怕单次再便宜,一万个用户天天这么聊,一个月的账单也足够让你肉疼。

这里肯定有小伙伴会一脸懵逼:“平常我用网页版的 DeepSeek,好像也没见它跟我计费啊?” 大家别搞混了——大模型的 Token 计费,一般是在你调用它的 API 接口时才会发生。普通人日常用网页版,通常是用不上的,只有开发者才会用到。

当然了,如果想要上手试一下 API,也别怕花钱。很多平台都会给新注册的账号送一笔免费额度(比如几百万 Token),足够我们学习、练手很久了。

要不要对 AI 说 “谢谢”?

当 AI 帮了大忙的时候,很多小伙伴心怀感激,总忍不住在对话框里敲下一句感谢的话:“太感谢了,真是帮了我大忙!”

实际上,“谢谢” 其实是一次非常奢侈的礼貌。为什么这样说呢?

首先,你发出去的这句 “谢谢”,会作为提示词消耗掉一部分 “输入 Token”。紧接着,大模型为了展现它的服务精神,通常也会礼貌地回复你:“不客气!很高兴能帮到你。如果还有其他问题,随时欢迎提问哦!” 这样又消耗了 “输出 Token”。如果是 “滚雪球效应”,消耗的 Token 更多。

就连 OpenAI CEO 也曾打趣说:“人们在 ChatGPT 里输入的这些礼貌用语,已经让我们花掉了数千万美元。”

如果小伙伴们使用的是免费网页版大模型,随意散发你的善意即可。

但如果你是在调用付费的 API 接口做开发,那就直接做一个 “没有感情的机器”——用完即走,绝不寒暄,这才是对钱包最大的尊重。AI 是没有感情的机器,它不会因为你礼貌就给你更好的答案。

保护钱包:节省 Token 的四大黄金法则

顶级大模型的 Token 都不便宜,所以咱们得学会怎么省着用。下面是我们总结的 4 条非常有效的省钱技巧:

1. 裁剪历史记录

我们不要一上来就把长达几天的聊天记录全部发过去。比如在写后端代码时,应该在逻辑中动态裁剪,通常只保留最近 5 到 10 轮有效对话就够了,更早的 “记忆” 可以直接丢掉。

裁剪大模型历史对话记录:丢弃早期历史聊天以节省 API 输入 Token 费用

2. 善用 “上下文缓存”

这是目前最前沿的省钱 “黑科技”!现在主流的大厂 API 都支持缓存功能。

比如我们发给 AI 一本 10 万字的小说,只要第一轮它读过一遍,就会自动把这 10 万字 “缓存” 起来。在后续的几百轮对话里,这部分输入的价格往往会打 1 折、甚至直接免费。

大模型上下文缓存(Context Caching)机制图解:通过首轮读取缓存大幅降低后续多轮对话的 API 费用

如果小伙伴们使用过 Cursor、Claude Code、Codex 这类工具,在终端或后台日志中看到的 “缓存命中率”,说的就是这里讲的 “上下文缓存” 技术。

节省 Token 费用的前沿技术:大模型 API 上下文缓存(Context Caching)命中率演示

3. 控制最大输出

在调用大模型 API 时,我们应该严格限制 max_tokens 参数。比如明确规定这次回答最多只能吐 500 个 Token,免得它一开 “话痨模式”,就疯狂消耗你的额度。

控制大模型 API 最大输出:设置 max_tokens 参数限制生成长度以防止 Token 额度浪费

4. 使用外挂知识库

不要一上来就把几万字的公司规章制度,整段塞进 “系统提示词(System Prompt)”里。我们可以用后面会学到的 “外挂知识库(RAG)” 技术,只把最相关的那几百字捞出来发给大模型——这样往往能帮你省下高达 90% 的输入费用。

使用外挂知识库(RAG)节省 Token 成本:精准检索相关内容,减少大模型海量输入开销

说到底,省 Token 就一个核心思路:输入只喂真正有用的,输出只要真正需要的。把这一进一出两头都管住,账单自然就降下来了。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号