价格表上写的是每一百万 token 多少钱,上下文窗口的大小标的也是 token 数,新闻里比谁家模型能读进更多内容,比的还是 token。这个词几乎无处不在,却很少有人讲清楚它到底是什么。一句话说透:你看到的是字,AI 处理和收费的单位,是 token——文本会先被切成一段一段的 token 再处理,AI 读的、写的、想的、看的图,全都按 token 计量,钱也是按它算的。
先看一个直观的例子。下面三句话意思完全一样,只是措辞不同:
三句话字数相差不大,切出来的段数却差了近一半。这说明决定 token 数的从来不是字数,而是用词:常见的词会被整块处理,不常见的词会被拆碎。
这背后就是"分词"(Tokenization)——把文本切成 token 的那道工序。OpenAI、Anthropic、Google 三家的官方文档对 token 的定义高度一致:模型按"块"处理文本,这些块代表最常出现的字符组合;token 可能是一个完整的词,也可能是半个词、一个字符,甚至一段字节。切完之后,模型看到的已经不是你打的那些字,而是一串切好的 token。
规律很简单:常见词(比如"价格")整段不拆;生僻词(比如"馥郁")会被拆成好几段;标点符号(逗号、句号、空格)虽然不承载内容,同样要占一个 token 的位置。
更关键的是,这套切法不是查字典或按空格分词得来的,而是从海量文本里统计出哪些字符组合最常一起出现,再把这些组合定成一段。正因为是统计出来的,不同模型的切法可以完全不同——Anthropic 官方文档就提到过,它较新型号换用的分词器,对同一段文字大约会多切出三成 token。所以问"一句话有多少 token"这个问题本身是不完整的,必须同时说明是哪个模型,否则没有唯一答案。
答案是:不一定,得实际切一遍才知道。
拿一句意思相同的话对比:中文"人工智能正在改变我们的工作方式。"切成了 8 段;英文"Artificial intelligence is changing the way we work."切成了 9 段。段数会随模型变化,但差异本身是真实存在的。
三家厂商给出的公开经验值也印证了这一点:
需要提醒的是,中文和英文这两条经验值不能直接拿来比谁更省 token,因为一个汉字承载的信息量本来就比一个英文字母大得多,两边的"分母"根本不是一回事,目前也没有哪家厂商正面给出过中英文效率的对比数字。想知道自己这句话到底占多少 token,靠经验值估算不准,最可靠的办法是用官方的分词工具(比如 OpenAI 的 Tokenizer 网页)或计算 token 的接口,把这句话实际切一遍。
很多人以为,一轮对话消耗的 token,就是自己在输入框里打的那些字。实际上,一次完整的问答里,通常有五笔账在同时计量,其中只有两笔是你能在界面上看到的。
看得见的两笔:
各家官方价格页都是把输入和输出分成两栏列价的,这两笔要相加,才是一轮对话的真实消耗——不是只数你打了多少字。
看不见的三笔,同样计量:
第一笔是推理 token(Reasoning Tokens)。如果你开启了深度思考,AI 会先在内部推演一遍,再动笔写正式回答。这段推演过程在多数产品里是折叠甚至完全不显示的,但 OpenAI 在开发者文档里写得很明确:这部分内容在接口上不呈现,但它照样占着上下文窗口,并且按输出 token 计费。Anthropic 的文档给出的是同一个结论。更值得注意的是,部分较新型号还会把这一轮的思考内容留进对话历史,下一轮当作输入再计量一次——也就是说,思考多的那一轮,不只这一轮贵。
第二笔是你贴的图和文件。图片不是以"图片"的形态进入模型的,它同样要先折算成 token。Anthropic 官方文档给出过一条明确公式:把图片按 28×28 像素切成小方块,有多少块就算多少个视觉 token。按这条公式换算,一张 1000×1000 像素的截图大约折合 1296 个 token——比很多人一次打的字还多。文件走的是另一条路:OpenAI 开发者文档说明,上传的文件会先提取里面的文字,再照常按 token 计量,页数越多这笔消耗越大。
第三笔是每一轮重发的全部历史。这一点最容易被忽略,却影响最大。模型本身是"无状态"的,它不会自己保存对话记忆。所以你每问一次,之前的全部对话历史都要重新递交一遍,模型重新读一遍,这一遍照样计量。聊到第十轮的时候,账上算的不只是你新打的那句话,还有前九轮的全部内容。这就是为什么越聊越长的对话,越往后每一轮的实际消耗越大,而不是每轮都差不多——有点像滚雪球。
把这五笔放在一起看:你发的和它回的是明面上的两笔,深度思考的过程、你传的图片文件、以及每轮重发的历史,是看不见的三笔。看不见,不等于不计量。
打开任何一家的官方价格页,同一个模型后面通常跟着两个价,而不是一个价——这是因为计价的第一件事,就是把输入和输出分开算,各有各的单价。
真正的差别在倍数上。把同一个模型价格表里的两个数直接相除会发现:OpenAI 的 GPT-5.6 全系,输出价是输入价的 6 倍;Anthropic 的 Claude 全系是 5 倍;DeepSeek 的 V4 全系是 3 倍(以上为 2026 年 8 月 21 日访问三家官方价格页所得,倍数只在各家内部成立,不能跨厂商套用,各家会随时调价)。
这个结构落到实际使用上就是:同样是一千个 token,AI 写出来的那一千个,比你打进去的那一千个贵好几倍。所以让 AI 写一篇长文,和你自己多打几百字去问,代价完全不是一回事。前面提到的"看不见的消耗"里,深度思考的过程按输出 token 计费,走的正是这两列价格里更贵的那一列。
同样的 token 数,也可能不是同样的钱。 由于模型每一轮都要把之前的对话历史整个重发一遍,而重发内容的开头部分往往和上一轮一模一样,有些产品会把这段重复的开头缓存下来,下一轮命中同一段时按缓存价结算。Anthropic 官方价格页显示,缓存命中价是基础输入价的十分之一,便宜九成;DeepSeek 官方价格页则显示,缓存命中价约是未命中价的三十分之一。需要注意的是,写进缓存的那一次本身并不打折,Anthropic 的 5 分钟缓存档反而是基础输入价的 1.25 倍,之后命中的轮次才便宜。
这里有一个容易混淆的地方需要单独说清楚:缓存省的是钱,不是地方。Anthropic 官方明确说过,被缓存的内容照样占着上下文窗口,缓存改变的只是这些 token 要付多少钱,不改变它算不算数。所以开了缓存,并不会让 AI"多记住"一句话,窗口该顶到上限还是会顶到。
因为计量方式本身分成两套。开发者通过接口调用模型时,用的是前面说的那一套精确计费——输入、输出、缓存分开记账,用多少算多少。但普通人在手机上打开的免费 AI 应用,大多不是这么算的,常见的是按对话次数限、图片语音文件各自单独限额这类粗一些的方式。具体到几次、几张、哪个时段,各家规则不一样也经常调整,官方很少把它写成一张明码表。
把前面清点过的几笔账放在一起看,免费额度为什么消耗得快就不难理解了:每一轮都要把全部历史重发一遍,越往后单轮的量越大;开了深度思考,那部分推演过程按更贵的输出价计费;随手发一张普通截图,按官方公式折算下来就是上千个 token。这几笔本来就存在,叠加起来自然走得快——不是平台在"坑"你,而是计量的方式和大多数人的直觉不一样:你数的是自己打了几句话,系统数的是这一轮实际处理了多少 token。
一个 token 就是一个汉字或一个英文单词吗? 不是。三家官方定义一致:token 是文本被切开后的一小段,长短并不固定,可能是一个完整的词,也可能是半个词、一个词缀或一个标点。常见词往往整块切下来,生僻词会被拆成好几段,中文英文都遵循同一套规则,没有哪一边天然按字数算。
同一段文字切成几个 token,由什么决定? 由模型的分词方式决定,而不是由字数决定。切法来自对海量文本的统计,最常一起出现的字符组合会被定成一整段,其余的靠更小的片段拼出来。同样字数的两句话,用词常见的那句段数少,用词生僻的那句段数多;换一个模型,切法也会跟着变。
为什么开启深度思考会比不开更费 token? 因为思考产生的内容也记在输出这一笔账上。OpenAI 开发者文档写明,思考过程产生的 token 在接口上不会显示给用户,但它照样占用上下文窗口,并且按输出 token 计费,Anthropic 的文档给出的是同一个结论。看不见不等于不计量,部分较新型号还会把这一轮的思考内容留进对话历史,下一轮当输入再算一次。
聊到第十轮,这一轮消耗的 token 会比第一轮多吗? 会更多,因为之前的历史每一轮都要重新计算一遍。模型本身不保存对话,是无状态的,所以每问一次,之前全部的对话历史都要重新递交、重新读一遍,这部分照样计量。第十轮账上算的,是你新打的那句话,再加上前九轮的全部内容——越聊越长的对话,越往后每一轮的消耗越大。
开了上下文缓存,AI 能记住的内容会变多吗? 不会,缓存改变的只是价格,不是容量。Anthropic 官方明确说过,被缓存的内容照样占着上下文窗口,缓存只影响这部分 token 要付多少钱,不影响它算不算进窗口容量。所以缓存既不会腾出更多空间,也不会让长对话晚一点才顶到上限,省下的只有钱。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 4 讲《Token 是什么?AI 怎么收费》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 4 讲《Token 是什么?AI 怎么收费》,免费 | 更新日期:2026-08-28