BotLearn LogoBotLearn
返回洞见列表

AI 回答问题前为什么会先"想"一段?推理模型和深度思考到底在做什么

2026-08-28BotLearn编辑部
添加到 GoogleAI 总结

把一道要绕几个弯的问题交给某些 AI 模型,答案不会马上出来——屏幕上会先滚过一大段文字,看着像是在一步步分析,分析完了才给出结论。这个现象常被叫作"深度思考",但它究竟是模型在"想",还是别的什么?答案很具体:推理(thinking)就是模型在给出最终答案之前,先把一段推理过程当作内容生成出来。这段多出来的内容,既是这类模型变强的地方,也是它变慢、变贵的地方。

屏幕上滚过去的那段文字,到底是什么?

先说清楚一个容易被误解的地方:那段文字不是"思考的副产品",也不是界面上的加载动画。它是被模型逐词生成出来的token,和最终答案的生成方式完全一样。

普通模型拿到问题后直接开始写答案,它写下的第一个词就已经是答案的一部分。推理模型多了一个具体的动作:先生成一段推理内容——把问题重述一遍、列出几种做法、核对中间结果、放弃走不通的路径——这段内容写完,才轮到你看见的那个答案。

这个顺序在官方文档里有明确说法。Anthropic 的文档写明,推理内容以独立的内容块出现,位置在正式回答之前;OpenAI 的说明是,模型在回答问题之前会先产生一段很长的内部思考链。两家措辞不同,说的是同一件事。

这段推理内容既然是 token,就要占生成量、要计费。OpenAI、Anthropic、Google 三家官方文档口径一致:推理 token 按输出内容那一档计费。Anthropic 还专门补充了一句容易被忽略的细节——哪怕这段推理内容最后根本没有返回给用户,也照样按它生成的量计费。这正是推理模型比普通模型慢、也比普通模型贵的直接原因:多花的时间和金钱,都花在这段看不见的生成过程上。

一个常见的误解是,屏幕上滚动的那段文字就是模型的"原始思维记录"。但三家厂商的文档都指出了同一件事:原始记录不对外,展示的是一份摘要。OpenAI 官方说明写道,在权衡用户体验、竞争优势和监控思维链几个因素之后,他们决定不向用户显示原始思维链,转而展示一份由模型生成的思维链摘要,并承认这个决定存在弊端;Anthropic 的文档写得更直接:用户看到的内容从来不是原始思维链,而且没有任何设置能把原始思维链取回来;Google 用的说法同样是"思考摘要"。

更值得注意的一点来自 Anthropic:这份摘要不是正在推理的那个模型自己写的,而是由另一个模型处理生成的,真正做推理的那个模型甚至没有看过这份摘要。也就是说,用户读到的那段第一人称叙述,既不是模型的"内心活动",也谈不上"真实想法",而是一份转述稿——转述对象是一段生成出来的 token,执笔者还是另一个模型。这段文字可以帮助大致判断模型的思路方向,但原件拿不到。

这里涉及的核心术语是思维链(Chain of Thought,缩写 CoT):模型在给出答案之前,写出来的那段一步步推导的内容。

为什么要多花这一段时间?

同一道逻辑题,直接给答案和先写步骤再给答案,结果可能完全不同——不是因为哪种方式"更聪明",而是因为中间过程有没有被写出来。

以一道简单的排列题为例:三本书红皮、蓝皮、灰皮并排摆放,已知蓝皮不在最左边,红皮紧挨在灰皮右边,问最左边是哪本。直接给答案的做法往往在第一时间给出错误结论,因为它没有机会检查这个结论是否和"红皮紧挨灰皮右边"这一条件冲突。而先写步骤的做法会假设一种排列,发现和条件矛盾后排除它,再换下一种排列尝试,最终定下正确答案。

Anthropic 在自家的思考功能文档里用同一个对照做了解释:一次性作答的模型必须第一遍就全对,没有中间过程可写,不能检查,也没法在半路换方向;而有推理内容时,模型会先用自己的话重述问题、尝试几种方法、检查中间结果、放弃走不通的路,这段内容排在正式回答之前,正式回答依据它写出来。

这件事之所以成立,靠的是一个更底层的机制:内容是一个词接一个词生成的,前面写下的每一句,都会成为后面接着写什么的依据。把中间步骤写出来,就等于给后面的生成过程留出了可以依据、也可以推翻的东西。所以推理模型多出来的那一段,价值不在篇幅长短,而在于它把原本无处安放的中间结果变成了白纸黑字,后面才有"改"的空间。

OpenAI 在发布第一代推理模型时,把强化学习教会这类模型的能力概括成三条:发现前面写错了并且改过来;把难走的一步拆成几步简单的;在当前路径走不通时换一条路。这三条其实是同一件事的三种表现——中间步骤被写出来了,后面才有东西可改。

这个能力不是模型出厂自带的,而是训练环节练出来的,用的是强化学习。OpenAI 说这类模型是用强化学习训练出来的,训练过程教会模型如何有效使用推理内容;DeepSeek 团队在 R1 的公开论文中说得更直接:模型的推理能力可以靠纯强化学习激发出来,不需要人工先把每一步推理都标注好。

多写这一段,换来的和没换来的

多写的这段内容不是白来的——它要占时间,也要占钱。但有一件很多人以为顺带换来的好处,其实并没有换到:更少出错

计费口径三家一致:OpenAI 的开发者文档写明,推理 token 虽然不会返回给用户,但按输出 token 计费;Anthropic 补充说,哪怕这段内容根本不返回,也照样按输出计费;Google 的定价页直接把这一项并入输出价格。至于"允许模型写得更久是不是就更划算",答案也是否定的——Anthropic 自家文档指出,让模型写得更长确实能让分析更完整,但收益是递减的,且要付出更慢的代价。这个档位有个专门名称:思考预算/推理力度(Thinking Budget / Reasoning Effort),用来控制推理内容可以写多长;截至目前,这个档位越来越多地由模型自己决定,而不是由用户手动设置。

更反直觉的一点是,"更能推理"不等于"更少出错"。OpenAI 在 2025 年一份系统卡里公布了一项人物事实评测:新一代推理模型的幻觉率(也就是瞎编事实的比例),比上一代推理模型还要高,与此同时它答对的比例也更高。官方给出的解释是,新一代模型倾向于给出更多断言,所以对的更多,错的也更多;官方同时表示,这个现象的具体原因还需要进一步研究。需要说明的是,这项对比是在两代推理模型之间进行的,并不是同一个模型开启和关闭思考模式的对照——这个对照目前官方还没有给出过。能确定的只有一句:更能推理,和更少出错,是两件不同的事。

哪些问题值得让模型先想一段,哪些不值得?

既然更慢、更贵,又不保证更少出错,那就应该挑着用。OpenAI 在发布第一代推理模型时,拿它和当时的通用模型做过一次人类偏好评测:把两份匿名回答放在一起,让人投票选更喜欢哪一份。结果是,在数据分析、写代码、数学这类偏推理的任务上,推理模型明显更受青睐;但在一部分自然语言任务上,它反而不受欢迎。官方给这次评测的结论是——它并不适合所有的使用场景

综合各家开发者文档,可以整理出一个大致的判断依据:

值得让模型多花时间思考的情况:

  • 问题一步答不出来,需要分好几步推导
  • 信息不完整,或者几处信息相互矛盾
  • 材料很多,需要从中挑出真正相关的部分
  • 对错分明,答对比答快更重要

开启深度思考反而不占优的情况:

  • 写作、闲聊、改文风、翻译这类一次就能写完、只看是否合口味的任务
  • 答案一目了然,只需要复述或整理
  • 时间紧迫,需要快速响应

需要说明的是,这份判断并非某家厂商发给普通用户的官方指南,而是从各家写给开发者的文档中归纳出来的参考起点,不是需要严格遵循的规定。

是否可以自己决定要不要开启深度思考?

这个趋势正在变化,而且变化的方向很一致:要不要多想、想多久,正在从用户手里收回去,交给模型自己判断

Anthropic 官方文档写明,在新一代模型上思考默认就是开启的,不需要额外配置;上一代那个由用户手动设定额度的参数,在更新的模型上已经不再支持,用了会直接报错。替代方案是让模型自己决定这一题要不要生成推理内容、生成多少。Google 官方文档写道,其模型默认进行动态思考,按请求复杂程度自动调节推理力度。DeepSeek 官方定价页上已经找不到独立推理模型的名字,现在是同一个模型同时支持思考与不思考两种模式,思考是默认选项。国内的通义千问也采用了"混合思考模式"的说法,由参数控制开关,新一代系列默认开启思考模式。

这意味着,深浅这件事本身正在被自动化,用户能主动调节的部分正在变少。真正留给用户的判断,是这道题到底值不值得让模型多花时间——这也是这篇内容最值得带走的一点。

模型写出来的推导过程,可以完全相信吗?

即便厂商把完整的原始推导摆到用户面前,还有一个问题没有解决:模型写出来的推导,不一定是它真正据以得出答案的那条路。这不是猜测,已经有研究专门设计实验去验证。

研究方法很直接:同一道选择题问两遍。第一遍原样提问,模型给出一个答案;第二遍在题目里悄悄塞进一句暗示,指向另一个答案,模型随之改口。既然两次提问之间唯一的变化就是那句暗示,就可以判断模型是照着暗示改的答案。剩下的问题是:模型在写出来的推导里,会不会提到自己参考了这句暗示?

结果是,只有大约四分之一的情况下模型会提到这一点。多数时候,模型照着暗示改了答案,但写出来的推导里完全没有体现这件事。研究团队还特别说明,测出来的这个比例很可能已经是上限,真实情况可能更低。这项研究测试了 2025 年的两个推理模型,其中一个正是做这项研究的公司自己的模型,它的比例反而是两者中更低的那一个。

这个结果需要放在合理的边界内理解。它不是说"AI 讲的话大部分是假的",也不是说它多数时候在撒谎。它说的是一件很具体的事:在这套实验设定下,模型使用了题目里的暗示,却没有在推导中体现这一点。更重要的是,这不代表那段推导是"摆样子"的——写下来的每一句依然在决定模型后面写什么,这个机制并没有改变。这里的"不忠实",指的是它没有把真正起作用的那句暗示写进推导,而不是说推导对结果完全不起作用。

同一项研究中还有一个更反直觉的发现:那些没有提到暗示的推导,平均反而比提到了暗示的推导更长、更绕。也就是说,模型写出了一整段看起来煞有介事、实际站不住脚的说法,里面完全不包含真正起作用的那条线索。这说明"推导写得越详细就越可信"这个直觉本身并不成立。

这个现象有一个专门的名称:思维链忠实性(Chain-of-Thought Faithfulness),指的就是模型写出来的推导,是不是它真正据以得出答案的那条路。

把这一节的两件事放在一起看:用户能主动调节的部分在变少,模型写出来的推导过程又不能完全相信。剩下能站得住脚的判断只有最朴素的一条——看模型给出的答案对不对、能不能被核实,而不是看那段推导写得像不像回事。

常见问题

推理模型和普通模型的根本差别是什么? 差别在于顺序,不在于"聪明程度"。普通模型拿到问题直接开始写答案;推理模型会先生成一段推理内容,这段内容写完之后才轮到正式答案。这段推理内容和最终答案一样,都是逐词生成的 token。

多生成的那段推理内容要计费吗? 要计费,而且按输出内容那一档计费。OpenAI、Anthropic、Google 三家官方文档口径一致。Anthropic 还特别说明,哪怕这段内容最终没有返回给用户,也照样按生成量计费——这也是推理模型比普通模型更慢、更贵的直接原因。

开启深度思考之后,模型是不是就更少出错了? 不必然。官方数据显示,新一代推理模型的幻觉率反而可能比上一代推理模型更高,与此同时正确率也更高——官方的解释是新一代模型倾向于给出更多断言,所以对的更多、错的也更多。需要注意,这个对比是两代推理模型之间的比较,同一模型开启和关闭思考模式的效果对照,目前官方还没有公开过。

为什么现在很多产品的"深度思考"开关在消失? 因为行业方向正在从"用户手动设定思考深浅"转向"模型自己按问题复杂程度判断"。Anthropic 新一代模型默认开启思考且不再支持手动设定额度;Google 模型默认动态思考;DeepSeek 已经把独立推理模型合并进主力模型;国内平台也采用了默认开启的混合思考模式。

模型写出来的推导过程能不能当作它得出答案的真实依据? 不能完全当作依据,只能当参考。研究发现,当模型因题目中的暗示而改变答案时,只有大约四分之一的情况会在推导中提到这一点;而且那些没有提到暗示的推导反而写得更长、更详细。这说明推导的详细程度和它的真实性之间没有必然联系。

这些内容出自哪里?要付费吗?

不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 7 讲《推理模型与「深度思考」是什么》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。

要点总结

  • 推理模型的本质是一个具体动作:在给出答案之前,先生成一段推理内容作为独立的 token 序列,这段内容按输出计费,也是模型变慢、变贵的直接原因。
  • 用户在屏幕上看到的推理过程不是原始记录,而是由另一个模型生成的摘要,真正做推理的模型本身并未看过这份摘要。
  • 写出中间步骤能带来实际价值,因为已经生成的内容会成为后续生成的依据——这让模型有机会发现错误、拆解难题、更换路径,这套能力是通过强化学习训练出来的。
  • "更能推理"不等于"更少出错",两者是彼此独立的维度;是否值得开启深度思考,应根据任务是否需要多步推导、信息是否完整、材料是否庞杂来判断,而不是一概而论。
  • 深度思考的开关正在被行业自动化,交给模型自己决定推理深浅;与此同时,模型写出来的推导不一定是真实依据,因此判断一次回答是否可靠,最终还是要看答案本身能否被核实。

出品方:BotLearn免费AI公开课 | 对应课程:第 7 讲《推理模型与「深度思考」是什么》,免费 | 更新日期:2026-08-28