Token 就像是大模型世界里的 “乐高积木”。搞懂了它的概念之后,很多准备做开发、或者接入大模型 API 的小伙伴,最关心的就是:“这玩意儿到底是怎么算账的?我发一篇文章过去,或者让它敲一段代码出来,到底会扣我多少钱啊?”
提示: 这一节内容偏向于开发者,对于非开发的小伙伴来说,简单过一遍即可。
如何查看和计算 Token 数量?
对于大模型来说,它只认 “积木”,不认 “字数”。为了准确算出一段话包含多少个 Token,各大 AI 厂商都提供了专门的 “分词器” 工具——把文本粘贴进去,它就会自动帮你切碎、数出积木的数量。
其中,目前主流大模型在线 Token 计算工具有以下几种:
- TikTokenizer:这是全球开发者最常用的开源分词可视化网站,网址:https://tiktokenizer.vercel.app/。
- ChatGPT:https://platform.openai.com/tokenizer
- Claude AI:https://huggingface.co/spaces/Xenova/the-claude-3-tokenizer
- Gemini:https://aistudio.google.com/
- DeepSeek:https://huggingface.co/spaces/Xenova/deepseek-llm-7b-tokenizer
比如,小伙伴们可以把一段文本粘贴进 TikTokenizer 的计算器中,然后可以非常直观地看出 Token 是如何计算的,如下图所示。

需要注意的是:由于切分算法的不同,同样一段 1000 字的中文小说,在不同的模型里切出来的 Token 数量是不一样的。如果是早期的海外模型,可能需要消耗 1500 个 Token。但如果是现在的国产顶尖大模型(词表经过高度优化),往往只需要 500 到 800 个 Token。
大模型的双轨计费:输入与输出
当我们去翻阅各种大模型的 Token 价格表时,会发现它们清一色都用了两种价格来计算:
- 输入价格(Prompt Tokens):指的是你发给大模型的提示词、上下文、历史对话所消耗的 Token 数量。
- 输出价格(Completion Tokens):指的是大模型听懂你的话之后,自己思考、“接龙” 生成出来的回答所消耗的 Token 数量。

注意: 在绝大多数情况下,输出价格都会比输入价格 “贵上好几倍”。以 Gemini Pro 为例,输入 100 万 Token 大约只需 2 美元,但输出 100 万 Token 则可能高达 10~15 美元——具体数字各家不一样、也会随时调整。
为什么输出会比输入贵这么多呢?咱们可以用一个生动的例子来理解。
这就好比你去请教一位资深的 “行业专家”。你递给他一份 5000 字的需求说明书(相当于 “输入”),他凭借着渊博的经验,扫几眼就读懂了。这个 “读题” 的过程对他来说很轻松,所以收费比较便宜。
可读完之后,他得绞尽脑汁、耗费大量精力,才能帮你设计出一套完善的 500 字方案(这相当于 “输出”)。创造新内容、写出答案是很费脑子的,所以这部分收费自然就贵得多。
大模型也是同样的道理,“输入” 本身耗费的算力不大,但是 “输出” 耗费的算力非常大。这就是输出价格比输入贵很多的根本原因。
实战算账:调用一次到底花多少钱?
为了让小伙伴们更好地理解,我们到一个接近真实的场景里算一笔账。假设我们接入了某款主流大模型(比如 DeepSeek 最新版),它的官方公开价格为:
- 输入价格:1元/百万 Token(即 0.000001元 / Token)。
- 输出价格:2元/百万 Token(即 0.000002元 / Token)。
注意: 本文里出现的所有价格,都只是为了讲清算法而举的例子。各家大模型的价格变动非常频繁(经常降价、也常有促销),所以真要算预算时,大家务必要以官方价格页上的最新数字为准。
1. 单次简单对话
假设你写了一段 500 字的提示词,大模型给你生成了一份 1000 字的回答。经分词器折算,这次请求的积木消耗大致是:
- 输入:500个 Token。
- 输出:1000个 Token。
因此,大模型厂商扣除的费用计算如下:
总费用 = 500 * 0.000001 + 1000 * 0.000002 = 0.0005 + 0.0020 = 0.0025元(即四分之一分钱)看起来是不是便宜到不行?一次调用连一分钱都不到。但小伙伴们别高兴得太早——真正的 “Token 吞噬怪” 马上就要登场了。

2. 多轮长对话的 “滚雪球效应”
大模型在后台是没有任何短期记忆的。为了让你感觉它是在跟你 “连续聊天”,每次你发一条新消息过去,大模型都会把你和它 “之前所有的历史聊天记录” 合并在一起,重新当成输入来处理。
连续多轮长对话,是会产生恐怖的 “滚雪球效应” 的,比如:
- 第 1 轮:你输入 500 Token,AI 回复 1000 Token。
- 第 2 轮:你输入 500 Token。此时发送给 AI 的实际输入是:第一轮输入 + 第一轮回复 + 第二轮输入 = 500 + 1000 + 500 = 2000个 Token!
- 第 3 轮:你再输入 500 Token。这次发过去的,是前两轮的全部对话加上这次的输入——假设 AI 每轮也回复 1000 Token,那就是 500 + 1000 + 500 + 1000 + 500 = 3500 个 Token!

随着聊天越来越深入,每轮消耗的输入 Token 会像滚雪球一样越滚越大。要是你的网站访问量很大,哪怕单次再便宜,一万个用户天天这么聊,一个月的账单也足够让你肉疼。
这里肯定有小伙伴会一脸懵逼:“平常我用网页版的 DeepSeek,好像也没见它跟我计费啊?” 大家别搞混了——大模型的 Token 计费,一般是在你调用它的 API 接口时才会发生。普通人日常用网页版,通常是用不上的,只有开发者才会用到。
当然了,如果想要上手试一下 API,也别怕花钱。很多平台都会给新注册的账号送一笔免费额度(比如几百万 Token),足够我们学习、练手很久了。
要不要对 AI 说 “谢谢”?
当 AI 帮了大忙的时候,很多小伙伴心怀感激,总忍不住在对话框里敲下一句感谢的话:“太感谢了,真是帮了我大忙!”
实际上,“谢谢” 其实是一次非常奢侈的礼貌。为什么这样说呢?
首先,你发出去的这句 “谢谢”,会作为提示词消耗掉一部分 “输入 Token”。紧接着,大模型为了展现它的服务精神,通常也会礼貌地回复你:“不客气!很高兴能帮到你。如果还有其他问题,随时欢迎提问哦!” 这样又消耗了 “输出 Token”。如果是 “滚雪球效应”,消耗的 Token 更多。
就连 OpenAI CEO 也曾打趣说:“人们在 ChatGPT 里输入的这些礼貌用语,已经让我们花掉了数千万美元。”
如果小伙伴们使用的是免费网页版大模型,随意散发你的善意即可。
但如果你是在调用付费的 API 接口做开发,那就直接做一个 “没有感情的机器”——用完即走,绝不寒暄,这才是对钱包最大的尊重。AI 是没有感情的机器,它不会因为你礼貌就给你更好的答案。
保护钱包:节省 Token 的四大黄金法则
顶级大模型的 Token 都不便宜,所以咱们得学会怎么省着用。下面是我们总结的 4 条非常有效的省钱技巧:
1. 裁剪历史记录
我们不要一上来就把长达几天的聊天记录全部发过去。比如在写后端代码时,应该在逻辑中动态裁剪,通常只保留最近 5 到 10 轮有效对话就够了,更早的 “记忆” 可以直接丢掉。

2. 善用 “上下文缓存”
这是目前最前沿的省钱 “黑科技”!现在主流的大厂 API 都支持缓存功能。
比如我们发给 AI 一本 10 万字的小说,只要第一轮它读过一遍,就会自动把这 10 万字 “缓存” 起来。在后续的几百轮对话里,这部分输入的价格往往会打 1 折、甚至直接免费。

如果小伙伴们使用过 Cursor、Claude Code、Codex 这类工具,在终端或后台日志中看到的 “缓存命中率”,说的就是这里讲的 “上下文缓存” 技术。

3. 控制最大输出
在调用大模型 API 时,我们应该严格限制 max_tokens 参数。比如明确规定这次回答最多只能吐 500 个 Token,免得它一开 “话痨模式”,就疯狂消耗你的额度。

4. 使用外挂知识库
不要一上来就把几万字的公司规章制度,整段塞进 “系统提示词(System Prompt)”里。我们可以用后面会学到的 “外挂知识库(RAG)” 技术,只把最相关的那几百字捞出来发给大模型——这样往往能帮你省下高达 90% 的输入费用。

说到底,省 Token 就一个核心思路:输入只喂真正有用的,输出只要真正需要的。把这一进一出两头都管住,账单自然就降下来了。
