ChatGPT、DeepSeek、豆包每天都有人在用,但很少有人说得清它到底是个什么东西。答案其实很简单:大语言模型不是一个能查到答案的"超级资料库",而是一台预测机器——它的每一句话,都是根据上文一个词一个词现算出来的,不是从什么地方"查"出来的。理解了这一点,你就能看懂它为什么每次回答都不一样,也能看懂它为什么有时会一本正经地说错话。
很多人对大模型的第一印象,是一个装满了知识、随时能调出正确答案的数据库。两个小实验就能打破这个直觉。
第一个现象:同一个问题问两次,答案往往不完全一样。比如让它"用一句话介绍一下猫",第一次和第二次的措辞几乎不会完全重合。如果它真的是从一个固定的知识库里"查"答案,同一个问题查一百次也应该得到同一个答案——但事实并非如此。
第二个现象更直接:把它回答里的任何一句话,原样复制去搜索引擎搜,多半找不到一模一样的出处。如果它的每句话都对应着一份真实存在的原文,那这句话应该能被搜到;但它搜不到,因为这句话本来就不是从哪篇文章里"抄"来的。
这两个现象指向同一个结论:大模型的回答不是查出来的,而是即时预测出来的。这也是"生成式 AI"这个说法的由来——"生成"指的正是内容由模型当场预测生成,而不是从现成资料里原样取出。行业里把这类 AI 统称为大语言模型(Large Language Model,缩写 LLM),后面看到 LLM 这三个字母,说的都是同一类东西。
理解它的工作原理,其实可以从一个很生活化的游戏说起:文字接龙。
想象一句话:"今天外面下好大的____"。大多数人会脱口而出"雨",少数人会说"雪",几乎没人会接"象棋"。你的大脑其实在潜意识里给每一种接法都打了一个"合不合理"的分——这正是大模型每生成一个词时都在做的事。
大模型读过海量的人类文字,从中学到的不是一堆现成答案,而是语言的规律:什么词后面常跟什么词。回答你的问题时,它就是在不停地重复这个动作——看着已经生成的内容,给所有候选词打分,挑一个接上去,再把新的上文重新算一遍,接着预测下一个词。整段回答,就是这样一个词一个词"转"出来的。它开口的那一刻,其实并不知道这句话最后会在哪里结束。
举个更具体的例子:接到"昨晚睡得真__"这一步,模型算出的候选词大概会是"香"最顺、"好"也说得通、"惨"偶尔有人这么用、"砖"基本不会有人接。它不是想好整句话再说出来的,而是边想边说——这里的"想",就是每接一个词之前,把所有候选词都评估一遍。这个机制有个专门的名字,叫预测下一个词(Next Token Prediction),是大模型生成一切内容的基本机制。
答案就藏在候选词的概率分布里。有些句子几乎没有悬念:比如"床前明月__",几乎所有概率都压在"光"这个字上,"圆""亮"的可能性微乎其微。但绝大多数时候,情况完全不同——比如"周末我打算去__",后面接"爬山""逛街""睡懒觉"哪一个都说得通,几个候选词的概率不相上下。
面对这种情况,大模型并不总是死板地挑概率最高的那个词,而是在概率靠前的几个候选里抽签,每预测一个词就抽一次。一段回答有几十个词,抽上几十次签,整段话的走向自然次次不同——这就是为什么同一个问题问两遍,答案往往不完全一样。
这种"抽签的胆量"是可以调节的,专业名词叫温度(Temperature):温度越低,模型越倾向于选概率最高的词,输出越稳定、越接近"标准答案";温度越高,概率较低的词也有机会被选中,输出越多样、越有变化。不少产品把这个参数包装成"创造力"滑块给用户调节。
为什么要故意加入这种随机性,而不是每次都选最优解?实践证明,如果每次都挑概率最高的词,说出来的话会显得死板、重复;只有偶尔冒险选一个没那么"标准"的词,语言才会显得自然、有变化。这也解释了一个常见现象:问题越开放,大模型能给出的答案花样就越多——因为开放式问题本身就意味着候选词的概率更加分散。
搞懂了预测机制之后,更重要的问题是:该怎么看待它给出的答案?
关键的一点是:大模型从头到尾只做一件事——把下一个词预测得合理。合理的话,恰好也是正确的答案的情况确实很多,但"正确"从来不是它验证过的结果,而是"合理"的副产品。你觉得它"懂了",很多时候是你自己在替它把话讲通。
由此推出一个必须正视的结论:当大模型不知道正确答案时,它会不会停下来说"我不知道"?大概率不会——它只会继续把话说得合理、流畅、自信,这就是常说的幻觉(Hallucination):模型生成了流畅但与事实不符的内容。幻觉不是系统故障,而是"预测下一个词"这套机制的必然副产品,因为合理和正确本来就不是一回事。
理解了这一层,就能看清大模型的三个边界:
大模型体内是不是存着一个巨大的答案库,回答只是从里面挑一条? 不是。它存储的是从海量文本里学到的语言规律,而不是一条条现成答案。每一次回答都要从上文重新开始,为候选词逐个计算概率,一个词一个词生成出来。所以既不存在"答案库",也不存在"查"和"算"的分工。
同一个问题问了两遍,答案不一样,是出问题了吗? 不是问题,是抽签机制的正常结果。每预测一个词都要抽一次签,一段回答有几十个词,走向自然次次不同。答案不一样不代表哪次是错的。
让它写标题,第一次不满意,该怎么办? 最省事的办法是同一个要求再问几遍,挑最好的一个。既然每一步生成都在抽签,多问几次相当于免费拿到多个版本,大模型本身也没有所谓的"标准答案"。
问它今天几月几号,它答错了,为什么? 最可能的原因是它默认并不知道当前日期——它的知识停在训练结束那天,之后的信息(包括今天的日期)本来就不在其中。很多产品会把当前日期作为额外信息随问题一起发给它,这也是为什么有时候它又能答对。
它说出的信息来源,可信吗? 不能完全相信。它回答"这是从哪查来的"时,用的仍然是同一套预测机制——它可能确实见过类似出处,也可能是编出来的。连它对自己的解释都不能全信,核实这件事没有人能替你完成。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 1 讲《一次性搞懂什么是大模型?》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 1 讲《一次性搞懂什么是大模型?》,免费 | 更新日期:2026-08-28