很多人还在提示词末尾加一句"请一步步思考",以为这是让 AI 变准的万能咒语。但这句话的效果早已被主流产品的默认行为取代——AI 现在大多会自己先推理、再作答,用不用加这句话,结果差别不大。真正决定你能不能信任答案的,是它写在答案前面的那段推理过程有没有被你看到、有没有被你拿去核对。答案读起来多笃定,跟它对不对是两码事;能拿去查的,只有过程本身。
这句话在网上流传了很多年,几乎每一份提示词教程都会提到它,加在问题后面,据说能让 AI 变准。它确实有确切来历:一篇公开发表的研究提出了这个做法,测试对象是有标准答案的推理题。
早期的模型,问一句就直接吐出一个答案,中间什么都不写。答案对不对,你没有别的东西可以判断;一道要绕几个弯的题,模型经常在半路走岔,你也看不见它是在哪一步岔的。
加上这句话之后,模型的动作变了一个:先把中间的判断一行一行写出来,写完再落到答案上。这个改变同时影响了两边。对模型自己,写出来的每一步都成了下一步的落脚点,绕弯的题才有机会一步步走到底,中途走岔了也有机会自己拐回来。对使用者,模型每一步的说法都留在了回答里,可以逐句拿去对照。
这段在答案前写出来的推导内容,有一个正式名字:思维链(Chain of Thought,缩写 CoT)。它可以很短,也可以很长——简单的题两三行就完了,绕得多的题能写上一整屏,长短由题目本身决定,但出现的位置固定:永远在答案之前。
这里还有一个概念常被混淆。给几个例子再问,叫少样本提示;一个例子都不给,直接问,叫零样本提示。在零样本提示的基础上多加一句"请一步步思考",让模型把推导写出来,就是零样本 CoT(Zero-shot Chain of Thought)。它和普通零样本提示的差别,就在那一句话。网上流传最广的正是这一路做法,因为它最省事;另一条路是给模型几个带完整推导的示范例子,让它照着写,属于少样本那一路。
那句话当年之所以有效,前提是模型默认不写推导,得用户开口去要。这个前提今天已经不成立了。
主流的对话产品,现在默认就在做"先想后答"这件事:碰到一道要绕几个弯的题,模型会先自己推理一遍,把过程走完,再把答案交出来,用户一个字都不用加。这个决定权,这一两年被从用户手里收走了,收走的方式大致有三种:变成一个可调的力度档位,由用户选择想多深、花多久;交给模型自己判断,简单的直接答、难的多想一会儿;或者干脆取消开关,想关也关不掉。这种由模型自己决定是否深入推理、推理多久的机制,叫自适应思考(Adaptive Thinking)。它省掉的是用户的判断成本——题目难不难由模型自己估,用户只管问。
更直接的证据来自模型提供方自己:同一件事,两家给出的建议是相反的。OpenAI 的开发者文档在给推理模型的建议清单里明确提到,不要再加思维链提示,理由是这类模型本来就会先把推导走完,多要一句纯属多余,甚至可能拖后腿。而 Google 的提示词指南则认为,笼统来一句"想仔细点再回答",仍然能带来提升,代价是模型要多想一些、也多花一些。两家说的是各自的模型,面对的是同一个问题:这句话今天还要不要加。行业内部至今没有统一口径。唯一能确定的是:在这些默认已经在推理的产品里,这句话已经不再是必须写进每个问题的固定动作。
回答变长之后,很多人会习惯性地在问题后面加一句"直接说结论""别废话""简短点"。这么说的时候,省下的是阅读时间,但代价可能不止那点长度。
用一道有例外条款的报销题做对比就能看清楚。规则是:单张发票 500 元以上需部门经理审批;餐饮类发票无论金额都需要审批;团建餐饮由行政统一走流程,个人不用报;出差期间的餐饮按差旅报,不适用餐饮类规则。小李出差三天,回来报两张票:一张 320 元的餐饮发票(出差期间宴请客户),一张 680 元的高铁票。
原样问一次,模型会逐条对照规则:320 元那张属于出差期间餐饮,触发的是差旅规则,餐饮类审批规则对它不适用,金额也没到 500 元,所以不需要审批;680 元高铁票金额超过 500 元,需要审批。结论是只有高铁票要审批。加上"直接说结论,别解释"之后再问一次,回来的只有一句话:680 元的高铁票需要部门经理审批。两次答案一致,都对。
问题出在能不能核对上。这道题的坑恰好在两条规则打架——一条说餐饮类发票无论金额都要审批,另一条说出差期间的餐饮按差旅报、不适用餐饮类规则。那张 320 元的发票正好卡在两条规则中间:它既是餐饮,又是出差期间发生的。原样问的那次回答里,模型怎么处理这个冲突、走的是哪一条路,全部写在眼前,当场就能判断这条路成不成立。只要结论的那次,答案同样对,但至少有两种不同的推理路径都能落到"不用审批"这个结论上——一种是认出这张发票属于出差期间餐饮、按差旅规则处理;另一种是压根没看到餐饮类那条规则,只看到金额没到 500 元就直接放过。两条路通向同一个答案,但只有结论的那一栏,没有任何一句话能拿去分辨走的是哪一条。
掐掉推理过程,模型今天多半还是能答对。但回答里只剩一行结论,能拿去核对的东西一句不剩。过程是给你查的,不是给它变聪明的——这道题里用户自己手握规则,还能自己核;换成一件不熟悉的事,能拿来对照的就只剩模型写在回答里的那几步。
嫌啰嗦是真实存在的体验:想要一句话,模型有时要绕一大圈才回来。这种情况有个专门的名字,叫过度思考(Overthinking):一道本来一句话能答的题,模型绕了一大圈才回来,等得久、话还多,越是用户觉得简单的题,越容易碰上。
关键在于,要求简短和要求跳过过程,是两个完全不同的要求:前者动的是篇幅长短,后者动的是那段推导还在不在回答里。三种更精确的说法可以在压缩篇幅的同时保住能核对的部分。第一种是"把每一步写短,一步一句话,别展开"——步数不变,位置不动,推导仍然排在答案之前,需要核对时依然翻得到,只是版面变短了。第二种是"把明摆着的那几步跳过,别的照写"——被砍掉的是那些不需要判断的步骤,模型真正在做判断的那几步依然留在回答里。第三种是把问题本身问得更具体,范围划小、条件说全,模型要走的岔路自然变少,绕远的情况也会减少。而"别废话""简短点"这类笼统的说法没有指名要压掉哪一段,具体砍掉哪一块由模型自己定,效果并不稳定。把要求说到位,比含糊地要短更可靠。
一段推导写得再长,真正撑住结论的往往只有一步。找到它的办法是逐步设想:换掉这一步的判断,结论会不会跟着翻转。
举个例子:部门聚餐按人均 80 元批预算,这次到场 12 位,其中 2 位是外部客人,看中的这家店人均 75 元。模型的推理分了四步:第一步,75 元没超过 80 元的标准;第二步,到场 12 位,外部客人也占预算名额,按 12 位算;第三步,12 位乘 75 元合计 900 元;第四步,12 位对应的预算上限是 960 元,900 元没超,可以定。这四步里,换掉第二步——外部客人算不算预算名额——结论就会翻过来,这一步就是真正的关键步骤。
找到关键步骤之后,只需要核一件事:模型在这一步凭的那条规则或那个前提,在不在用户给出的条件里,管不管这一步。站得住的情况是,模型凭的那句话能在自己给的条件里明确指出来,而且这句话正好管这一步——比如例子里第一步用的"人均 80 元"标准,就是用户自己写进条件里的,用在比较单价上正好对应。站不住的情况是,模型凭的那句话在条件里根本找不到,或者找得到但管的是另一件事——比如第二步"外部客人占不占预算名额",条件里一个字都没提,这是模型自己补上的判断。分了步、编了号、算术全对,这些只能说明它写得整齐,跟对不对没有必然关系。真正要核的,是那一步写出来的那句话,通常一句话就能看完。
还有一个动作可以让模型替用户先走一遍:交差之前,让它拿着一组标准把自己的答案重新核一遍再定稿。这个做法在两家模型提供方的公开建议里都能查到,一句可以直接使用的话是——"交给我之前,你自己拿这三条过一遍:条件有没有用反、哪一步换个说法结论就变、有没有超出我给的上限。对不上的地方,改完再给我。"这个动作有专门的名字,叫自查(Self-check):让模型在交差前,拿着给定的标准把自己的答案再过一遍。需要留意的是,部分较新的模型已经会自己核对一次,再叮嘱一遍反而会让它多花时间反复验证。标准由用户给出,模型核的就是用户在意的那几条——标准写得越具体,这一遍核对越有着落。
"请一步步思考"这句话现在还要不要加? 不用刻意加了。主流对话产品大多已经默认在做"先推理、再作答"这件事,模型问一道要绕弯的题时会自己先想一遍,用户不用额外要求。加不加这句话对结果影响不大——甚至有模型提供方明确建议不要加,理由是推理模型本来就会先把推导走完,多加一句纯属多余,有时还会拖后腿。
为什么答案是对的,但我还是不放心? 因为笃定和正确是两码事。一段回答读起来顺不顺、快不快、语气有多确定,跟它对不对没有必然关系——答错的时候句子照样干净、节奏照样快。真正能判断对错的,不是回答的语气,而是那段推理过程里每一步凭的规则或前提站不站得住。
要求"直接说结论"会不会让答案变得不准? 答案本身通常不会因此变得不准,但会让你没法核对。掐掉推理过程后,模型多半照样能给出正确答案,但回答里只剩一行结论,原本可以逐句核对的说法全部消失了。如果这件事你自己就能判断对错,问题不大;但换成不熟悉的领域,能拿来对照的就只剩下模型写在回答里的那几步,一旦没有了,就无从核实。
推理过程那么长,到底该看哪一步? 不用逐字读完整段推导。一段推导里通常只有一步真正决定最终结论,找到它的办法是设想"换掉这一步的判断,结论会不会翻转"。找到之后只核一件事:这一步凭的规则或前提,在不在你给出的条件里、管不管这一步。条理是否清晰、篇幅是否够长,跟这一步站不站得住没有关系。
除了自己核对,还有别的办法吗? 可以在交代任务时加一句自查要求,让模型在交差前拿着你给的标准把答案自己核一遍,例如"条件有没有用反、哪一步换个说法结论就变、有没有超出我给的上限"。这个做法在多家模型提供方的公开建议里都出现过,效果取决于标准写得够不够具体——标准越具体,模型自查这一遍才越有着落。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 16 讲《思维链今天还灵吗》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 16 讲《思维链今天还灵吗》,免费 | 更新日期:2026-08-28