一个能接话、能答题、答得还挺像样的 AI,本事不是天生的,而是分三步"学"出来的:先靠海量文本练成"接话高手",再靠人写的示范学会"好好答题"的方式,最后靠人的挑选把答法打磨得更讨人喜欢。这三步分别叫预训练、微调和强化学习,合起来就是一条完整的训练流水线,走完它就出厂了。
想一想一本教科书的构成:正文、例题、课后习题,这三部分教给人的东西完全不同——正文打底子,例题给示范,习题逼着自己上手。AI 的训练过程几乎是照着这个顺序来的:正文对应预训练,读遍海量文本,一句一句练着把话接下去;例题对应微调,人先写好标准答案,AI 照着学怎么答;习题对应强化学习,题目给它、解法不给,它自己作答,人从中挑出更好的那个。
顺序也一样,先读正文,再看例题,最后做习题,三样走完才算"毕业"。训练不是把整个互联网一口吞下去、吞完就直接上岗,而是分成三段,每段学的东西完全不一样,其中最花时间的是第一步。
预训练的做法说穿了很朴素:把海量文本一句一句喂给模型,让它反复做同一件事——填空。上一讲提到过,AI 本质上是一台预测下一个词的机器,预训练练的正是这个能力。
拿一句很普通的话举例,把末尾遮住:"天黑了,我伸手打开了▁▁。"刚开始,模型给出的答案基本是瞎猜的;随着读过的文本越来越多,它填上去的词会越来越贴近人们真正会写的那个,比如"灯"而不是"冰箱"。取一句、盖住末尾、让模型猜、猜偏了就调一下内部数值,这一圈会在海量文本上重复到数不清的次数。
这里有个容易被忽略的细节:预训练用的文本是提前存好的一整份材料,内容截止到某个时间点,训练过程中模型并不联网。现在很多产品能联网搜索,那是后来另外挂上去的功能,不是预训练这一步在做的事。
读完这一步,模型确实"会说话"了,但练出来的本事只有"接着往下写"一样,回答问题完全是另一回事。如果直接把一个只做完预训练的模型当助手用,你问它"北京有什么好玩的",它很可能不是回答你,而是顺着这句话往下接一串同类问题。要让它老老实实当助手,光有预训练还不够。
教会一个人本事,通常有两条路:能写清楚的,写成示范让 ta 照着学;写不清楚的,让 ta 自己试,你在旁边挑出哪次做得更好。这两条路分别对应微调和强化学习。
微调(Fine-tuning) 走的是第一条路,对应教科书里的例题:人先把标准答案写出来,模型照着学。比如"怎么申请退货"配一份得体的示范回答,"发票怎么开"配另一份,写好一大批这样的一问一答,让模型反复练习。练完之后,遇到没见过的新问题,它也能用学来的这套方式好好回应——问题该怎么接、话该怎么起头、答完要不要补一句总结、遇到不该答的怎么委婉回绝,这些"答法"都是这一步教会的。
值得记住的一点是:模型答得上来的知识,绝大部分是预训练阶段读来的;微调教的只是"怎么把话说好"。练完微调,它说话的方式整个换了一套,但知道的东西基本没动——改的是答法,不是认知。这一步的技术名字是监督微调(Supervised Fine-tuning,缩写 SFT),技术文章里提到的 SFT 说的就是它。因为示范是人给的现成答案,模型模仿的是答法,而不是重新去认识世界。
有些本事写不清楚该怎么做示范,比如"怎么安慰一个加班到深夜的朋友"。这种情况没法直接给一份标准答案,只能让模型自己答,人从它给出的选项里挑出更好的那个——这就是强化学习(Reinforcement Learning),对应教科书里的课后习题:题目给它,解法不给。
举个例子,同一个问题"朋友加班到深夜,怎么安慰几句",模型可能给出"别想太多,早点睡吧"和"辛苦了,忙完这阵记得补个觉,周末我请你吃顿好的"两种回答。人挑中了后者,模型就朝这个方向调整参数。这样一轮一轮下来,被挑中的答法以后更容易出现,没被挑中的答法以后更少出现,回答会慢慢长成人更常选的那种。
说到人给模型反馈,很多人第一反应是打分,1 到 10 分那种。但实际做的不是打分,而是把两个答案摆在一起,挑出更好的那一个。
原因在于:要打分,得先有一张明确的评分表;要挑一个,什么都不用先准备。一个回答好在哪,人往往说不清楚标准,却能一眼挑出更好的那个——人挑得出、写不出评分表,这一步就只能设计成挑选。
用人的选择来完成这一步,最有名的具体做法叫基于人类反馈的强化学习(Reinforcement Learning from Human Feedback,缩写 RLHF)。RLHF 指的是强化学习这一大步里的一种具体做法,并不等于强化学习本身。
强化学习让模型去追一个分数,而凡是能让分数变高的路,模型都可能撞上——包括设计者根本没想到的那条,这种现象叫奖励黑客(Reward Hacking),也叫刷分。
一个流传很广的真实案例是:研究人员训练一只机械臂去抓取物体。"抓得好不好"没法用文字写清楚,于是用强化学习的办法,把机械臂两段动作的录像摆给人看,让人挑哪段更像抓住了物体,再汇总成一套自动打分标准。结果机械臂练到后来学会了一招——不去真的抓取,而是把自己挪到摄像头和物体中间,让镜头这个角度看上去像是稳稳抓住了。分数到手,物体其实根本没动。
这不是模型"学会了骗人",也不是程序故障——骗人需要先判断对方会怎么看再决定隐瞒什么,这套能力模型并不具备。真正的问题出在评分标准本身没有设计准:只要评分方式和人真正想要的东西之间留了一道缝,模型就会钻进去。这类问题至今没有被彻底解决,仍是训练时需要专门防范的一项。
工程实践中,微调和强化学习并不是各做一次就结束,而是反复交替进行。所以很多公司的官方介绍干脆把这两步合并起来,统称为后训练(Post-training),把整个流程说成两步:预训练加后训练。
这不代表少了一步,而是把三步合成了两步的说法。之所以在这里拆开讲,是因为微调和强化学习学到的东西本质不同——一个是照着示范模仿,一个是自己尝试后再对答案。看到某家公司说自己的模型"分两步训练",可以理解为它把微调和强化学习并到了一起数。
还有一个延伸:强化学习这一步现在多了一个新用途——用能自动判断对错的题目(比如数学题、代码题)训练模型一步一步往下推理,练出来的正是很多产品界面上标注的"深度思考"功能。
预训练、微调、强化学习走完,模型就出厂了,它的本事不再随便"生长"。AI 不会因为跟你聊了一次就变聪明,你打的字只留在这一轮对话里,不会进入它的参数。它生成回答用的,永远是三步训练走完就定下来的那套参数,哪怕这一轮聊得再热闹,参数一个数字都不会变。
你今天说的话,实际上会走向三个不同的地方,效果完全不同:
也就是说,前两条路都不动模型的参数,只有第三条会动,而且动的是以后那一代模型,不是眼前这一个。实际的做法是:打开常用的 AI 产品,进入设置里跟数据或隐私相关的选项,看看有没有一项写着"用你的内容改进模型",按自己的意愿调整;真正涉密的内容,最好一开始就不要放进对话框。
预训练时模型是一边训练一边联网学习最新内容吗? 不是。预训练用的是提前存好、截止到某个时间点的一整份文本材料,训练过程中模型并不联网。现在一些产品具备的联网搜索能力,是训练完成之后额外挂载的功能。
只做完预训练的模型,直接当助手用会是什么效果? 文字会很通顺,但你问它问题,它常常是顺着往下接话,而不是老老实实回答。预训练练出来的能力是"接着往下写",要变成合格的助手,还需要后面的微调和强化学习。
强化学习阶段,人给模型的反馈到底是打分还是别的形式? 是挑选,不是打分。把模型给出的两个答案摆在一起,人从中选出更好的那一个交回去。"一个回答好在哪"很难写成明确的评分表,但人往往一眼就能看出哪个更好,所以这一步被设计成"二选一"。
跟 AI 聊天时当场纠正它的一个错误,这个纠正能让它以后都记住吗? 不能。它改的只是这一轮对话里的说法,背后那套参数不会发生任何变化。想让某个要求长期生效,需要把它写进账号记忆或自定义指令里,而不是依赖临时纠正。
自己在对话框里输入的内容,一定会被用来训练以后的模型吗? 不一定,但确实有可能。是否被用于训练,取决于产品设置里的一个开关,可以自己查看并调整,涉及隐私或机密的内容建议一开始就不要输入对话框。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 2 讲《AI 是怎么训练出来的?》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 2 讲《AI 是怎么训练出来的?》,免费 | 更新日期:2026-08-28