BotLearn LogoBotLearn
返回洞见列表

Token 是什么?为什么 AI 不按字收费,而按它收费

2026-08-28BotLearn编辑部
添加到 GoogleAI 总结

价格表上写的是每一百万 token 多少钱,上下文窗口的大小标的也是 token 数,新闻里比谁家模型能读进更多内容,比的还是 token。这个词几乎无处不在,却很少有人讲清楚它到底是什么。一句话说透:你看到的是字,AI 处理和收费的单位,是 token——文本会先被切成一段一段的 token 再处理,AI 读的、写的、想的、看的图,全都按 token 计量,钱也是按它算的。

一个 token,到底是多长的一段?

先看一个直观的例子。下面三句话意思完全一样,只是措辞不同:

  • "这家店的东西好吃,价格也不贵。"——切出 13 段
  • "这家店的菜肴馥郁鲜腴,价格亦低廉。"——切出 20 段
  • "这家店做的菜味道很不错,价钱也容易接受。"——切出 17 段

三句话字数相差不大,切出来的段数却差了近一半。这说明决定 token 数的从来不是字数,而是用词:常见的词会被整块处理,不常见的词会被拆碎。

这背后就是"分词"(Tokenization)——把文本切成 token 的那道工序。OpenAI、Anthropic、Google 三家的官方文档对 token 的定义高度一致:模型按"块"处理文本,这些块代表最常出现的字符组合;token 可能是一个完整的词,也可能是半个词、一个字符,甚至一段字节。切完之后,模型看到的已经不是你打的那些字,而是一串切好的 token。

规律很简单:常见词(比如"价格")整段不拆;生僻词(比如"馥郁")会被拆成好几段;标点符号(逗号、句号、空格)虽然不承载内容,同样要占一个 token 的位置。

更关键的是,这套切法不是查字典或按空格分词得来的,而是从海量文本里统计出哪些字符组合最常一起出现,再把这些组合定成一段。正因为是统计出来的,不同模型的切法可以完全不同——Anthropic 官方文档就提到过,它较新型号换用的分词器,对同一段文字大约会多切出三成 token。所以问"一句话有多少 token"这个问题本身是不完整的,必须同时说明是哪个模型,否则没有唯一答案。

中文和英文,切出来的 token 数一样吗?

答案是:不一定,得实际切一遍才知道。

拿一句意思相同的话对比:中文"人工智能正在改变我们的工作方式。"切成了 8 段;英文"Artificial intelligence is changing the way we work."切成了 9 段。段数会随模型变化,但差异本身是真实存在的。

三家厂商给出的公开经验值也印证了这一点:

  • 英文:大约 4 个英文字符算一个 token,这个口径在 OpenAI、Google、Anthropic 三家的官方页面上是一致的(都注明是"大约")。
  • 中文:目前只有 Kimi 官方文档给出过换算比例——通常情况下,1 个 token 大约相当于 1.5 到 2 个汉字。其余厂商都没有在官方页面上公布中文的换算比例。

需要提醒的是,中文和英文这两条经验值不能直接拿来比谁更省 token,因为一个汉字承载的信息量本来就比一个英文字母大得多,两边的"分母"根本不是一回事,目前也没有哪家厂商正面给出过中英文效率的对比数字。想知道自己这句话到底占多少 token,靠经验值估算不准,最可靠的办法是用官方的分词工具(比如 OpenAI 的 Tokenizer 网页)或计算 token 的接口,把这句话实际切一遍。

一轮对话里,哪些地方在悄悄花 token?

很多人以为,一轮对话消耗的 token,就是自己在输入框里打的那些字。实际上,一次完整的问答里,通常有五笔账在同时计量,其中只有两笔是你能在界面上看到的。

看得见的两笔:

  • 输入(Input Token):你发给 AI 的内容,模型要先整体读一遍才能作答。
  • 输出(Output Token):AI 写回来的内容,是它一个 token 一个 token 生成出来的。

各家官方价格页都是把输入和输出分成两栏列价的,这两笔要相加,才是一轮对话的真实消耗——不是只数你打了多少字。

看不见的三笔,同样计量:

第一笔是推理 token(Reasoning Tokens)。如果你开启了深度思考,AI 会先在内部推演一遍,再动笔写正式回答。这段推演过程在多数产品里是折叠甚至完全不显示的,但 OpenAI 在开发者文档里写得很明确:这部分内容在接口上不呈现,但它照样占着上下文窗口,并且按输出 token 计费。Anthropic 的文档给出的是同一个结论。更值得注意的是,部分较新型号还会把这一轮的思考内容留进对话历史,下一轮当作输入再计量一次——也就是说,思考多的那一轮,不只这一轮贵。

第二笔是你贴的图和文件。图片不是以"图片"的形态进入模型的,它同样要先折算成 token。Anthropic 官方文档给出过一条明确公式:把图片按 28×28 像素切成小方块,有多少块就算多少个视觉 token。按这条公式换算,一张 1000×1000 像素的截图大约折合 1296 个 token——比很多人一次打的字还多。文件走的是另一条路:OpenAI 开发者文档说明,上传的文件会先提取里面的文字,再照常按 token 计量,页数越多这笔消耗越大。

第三笔是每一轮重发的全部历史。这一点最容易被忽略,却影响最大。模型本身是"无状态"的,它不会自己保存对话记忆。所以你每问一次,之前的全部对话历史都要重新递交一遍,模型重新读一遍,这一遍照样计量。聊到第十轮的时候,账上算的不只是你新打的那句话,还有前九轮的全部内容。这就是为什么越聊越长的对话,越往后每一轮的实际消耗越大,而不是每轮都差不多——有点像滚雪球。

把这五笔放在一起看:你发的和它回的是明面上的两笔,深度思考的过程、你传的图片文件、以及每轮重发的历史,是看不见的三笔。看不见,不等于不计量。

AI 的钱到底是怎么算出来的?

打开任何一家的官方价格页,同一个模型后面通常跟着两个价,而不是一个价——这是因为计价的第一件事,就是把输入和输出分开算,各有各的单价。

真正的差别在倍数上。把同一个模型价格表里的两个数直接相除会发现:OpenAI 的 GPT-5.6 全系,输出价是输入价的 6 倍;Anthropic 的 Claude 全系是 5 倍;DeepSeek 的 V4 全系是 3 倍(以上为 2026 年 8 月 21 日访问三家官方价格页所得,倍数只在各家内部成立,不能跨厂商套用,各家会随时调价)。

这个结构落到实际使用上就是:同样是一千个 token,AI 写出来的那一千个,比你打进去的那一千个贵好几倍。所以让 AI 写一篇长文,和你自己多打几百字去问,代价完全不是一回事。前面提到的"看不见的消耗"里,深度思考的过程按输出 token 计费,走的正是这两列价格里更贵的那一列。

同样的 token 数,也可能不是同样的钱。 由于模型每一轮都要把之前的对话历史整个重发一遍,而重发内容的开头部分往往和上一轮一模一样,有些产品会把这段重复的开头缓存下来,下一轮命中同一段时按缓存价结算。Anthropic 官方价格页显示,缓存命中价是基础输入价的十分之一,便宜九成;DeepSeek 官方价格页则显示,缓存命中价约是未命中价的三十分之一。需要注意的是,写进缓存的那一次本身并不打折,Anthropic 的 5 分钟缓存档反而是基础输入价的 1.25 倍,之后命中的轮次才便宜。

这里有一个容易混淆的地方需要单独说清楚:缓存省的是钱,不是地方。Anthropic 官方明确说过,被缓存的内容照样占着上下文窗口,缓存改变的只是这些 token 要付多少钱,不改变它算不算数。所以开了缓存,并不会让 AI"多记住"一句话,窗口该顶到上限还是会顶到。

为什么手机上的免费 AI 应用感觉不按 token 算钱?

因为计量方式本身分成两套。开发者通过接口调用模型时,用的是前面说的那一套精确计费——输入、输出、缓存分开记账,用多少算多少。但普通人在手机上打开的免费 AI 应用,大多不是这么算的,常见的是按对话次数限、图片语音文件各自单独限额这类粗一些的方式。具体到几次、几张、哪个时段,各家规则不一样也经常调整,官方很少把它写成一张明码表。

把前面清点过的几笔账放在一起看,免费额度为什么消耗得快就不难理解了:每一轮都要把全部历史重发一遍,越往后单轮的量越大;开了深度思考,那部分推演过程按更贵的输出价计费;随手发一张普通截图,按官方公式折算下来就是上千个 token。这几笔本来就存在,叠加起来自然走得快——不是平台在"坑"你,而是计量的方式和大多数人的直觉不一样:你数的是自己打了几句话,系统数的是这一轮实际处理了多少 token。

常见问题

一个 token 就是一个汉字或一个英文单词吗? 不是。三家官方定义一致:token 是文本被切开后的一小段,长短并不固定,可能是一个完整的词,也可能是半个词、一个词缀或一个标点。常见词往往整块切下来,生僻词会被拆成好几段,中文英文都遵循同一套规则,没有哪一边天然按字数算。

同一段文字切成几个 token,由什么决定? 由模型的分词方式决定,而不是由字数决定。切法来自对海量文本的统计,最常一起出现的字符组合会被定成一整段,其余的靠更小的片段拼出来。同样字数的两句话,用词常见的那句段数少,用词生僻的那句段数多;换一个模型,切法也会跟着变。

为什么开启深度思考会比不开更费 token? 因为思考产生的内容也记在输出这一笔账上。OpenAI 开发者文档写明,思考过程产生的 token 在接口上不会显示给用户,但它照样占用上下文窗口,并且按输出 token 计费,Anthropic 的文档给出的是同一个结论。看不见不等于不计量,部分较新型号还会把这一轮的思考内容留进对话历史,下一轮当输入再算一次。

聊到第十轮,这一轮消耗的 token 会比第一轮多吗? 会更多,因为之前的历史每一轮都要重新计算一遍。模型本身不保存对话,是无状态的,所以每问一次,之前全部的对话历史都要重新递交、重新读一遍,这部分照样计量。第十轮账上算的,是你新打的那句话,再加上前九轮的全部内容——越聊越长的对话,越往后每一轮的消耗越大。

开了上下文缓存,AI 能记住的内容会变多吗? 不会,缓存改变的只是价格,不是容量。Anthropic 官方明确说过,被缓存的内容照样占着上下文窗口,缓存只影响这部分 token 要付多少钱,不影响它算不算进窗口容量。所以缓存既不会腾出更多空间,也不会让长对话晚一点才顶到上限,省下的只有钱。

这些内容出自哪里?要付费吗?

不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 4 讲《Token 是什么?AI 怎么收费》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。

要点总结

  • Token 是 AI 处理文字的基本计量单位:文本会先被切成一段一段的 token 再处理,常见词整段不拆,生僻词会被拆成好几段,切法来自对海量文本的统计,因此不同模型的切法可以不同。
  • 中文和英文切出来的 token 数不一样,官方经验值仅供参考(英文约 4 字符一个 token,中文约 1.5-2 个汉字一个 token),精确数值需要用分词工具实际切一遍。
  • 一轮对话通常有五笔账在计量:你发的内容(输入)、AI 写的内容(输出)、深度思考的推演过程、你传的图片和文件、以及每一轮都要重新递交的全部历史——后三笔在界面上大多看不见。
  • 官方价格表里输出价通常显著高于输入价(不同厂商倍数不同,常见在 3-6 倍区间),重复递交的历史内容可以通过缓存机制打折,但缓存只省钱、不会让上下文窗口变大。
  • 手机端的免费 AI 应用大多不按 token 精确计费,而是按对话次数或功能项限额,这类粗粒度限额和接口调用的精确计费是两套完全不同的计量体系。

出品方:BotLearn免费AI公开课 | 对应课程:第 4 讲《Token 是什么?AI 怎么收费》,免费 | 更新日期:2026-08-28