把数据备好、程序跑起来,一个大模型就自动出来了吗?并不是。造一个大模型其实是三种完全不同的活接力干出来的——训练基础设施(Infra)、预训练、后训练,而且每一步都有人在替它做具体的选择:机器怎么连起来、资料读哪些、回答好不好用,没有一步是自动完成的。这篇文章按 DeepSeek-V3、Llama 3、OLMo 2 等公开技术报告的说法,把这三种活和背后的人一次讲清楚。
这个三段分法不是随手编的,而是几份公开的大模型技术报告自己划出来的章节结构。
DeepSeek-V3 的技术报告里,第 3 章标题就是 Infrastructures(基础设施),第 4 章是 Pre-Training(预训练),第 5 章是 Post-Training(后训练)。Llama 3 的报告把基础设施放进预训练那一章里单独成节,后面再接后训练。OLMo 2 则给基础设施单开了一整章,标题叫 Infrastructure as a Research Catalyst——基础设施是研究的催化剂。
三份报告的切法不完全一样,但这三块内容在每一份里都找得到。最容易被外界忽略的恰恰是第一块:OLMo 2 那一章里有一句观察,说很多预训练论文根本不谈自己用的那套训练系统。连论文都很少提,公众自然更少听说。
这三种活各自在做什么:
一个大模型从来不是在一台机器上训出来的。DeepSeek-V3 的报告写自己用了 2048 张显卡,Llama 3 的报告写最多用到 1.6 万张——不同模型用的机器规模差很多,这些数字都是各家自己写在报告里的。机房、网络、存储,再加上跑训练用的那套软件,得先全部到位,才能让这几千张卡像一台机器一样,连续运转几十天。
规模有多大可以从一个数字体会:2048 张卡不停跑 3.7 天,也只够读完一万亿个 token,而 DeepSeek-V3 这个模型总共要读 14.8 万亿个 token。
训练途中真的会出事,而且频率不低。Llama 3 的技术报告记录了一次预训练里连续 54 天的情况:这 54 天里训练一共被打断了 466 次,其中 47 次是计划内的维护,剩下 419 次是意外——按这个数字折算,平均每天要断 8 次以上。这 419 次意外中,约 78% 被归到硬件问题,单是显卡这一类,就占了全部意外中断的 58.7%。所以这一层的日常工作离不开值班、故障响应和事后复盘,这三件事甚至写在相关公司自己的招聘页上。
出事之后怎么办?答案是存档点(Checkpoint)——训练途中定期保存的存档。中途断了,或者训练走偏了,就退回最近一次存档接着训,这个循环在几十天的训练里会走很多遍。OLMo 2 的报告写的正是这句话:从出问题的那个点重新训。相比之下,DeepSeek-V3 的报告专门写下了一件没发生的事——这次训练从头到尾一次都没有回滚过。一次没回滚也值得单独写进技术报告,恰恰说明中途退回才是常态。
显存管理也归这一层管,而且不只是省钱的问题。显卡上能装东西的空间有限,一个模型被拆开放到很多张卡上算,每张卡都得把分给自己的那份装下,训练一开跑,这点空间立刻成了最紧张的资源之一。DeepSeek-V3 的报告写过,团队反复琢磨怎么把显存占用压下来,省出来的空间让这次训练不必再上另一套更贵的方案。这说明训练基础设施这一层不是单纯的后勤保障,它直接决定这次训练能不能以更低的代价跑起来。
预训练开始之前,有人要先决定模型读什么、每一类读多少——这不是一件自动生成答案的事,而是有一支团队坐下来,把通识、数学与推理、代码、多语言各占多少一条一条定出来,再照着这个比例去准备数据。
数据也不是"把互联网倒进去"这么简单。Llama 3 那份公开的技术报告把预训练数据的处理流程一步一步写了出来:从网上抓回来的原始网页,到真正能喂进训练的数据,中间隔着两道由人拍板的工序——先洗,再配比。
清洗这一步具体做了什么?报告写明:先整站剔除含大量个人身份信息的网站,以及已知的成人内容网站;再做三层去重——按网址去一遍、按整篇文档去一遍、按行再去一遍。最具体的是按行这一层:每 3000 万篇文档算一批,同一行在一批里出现超过 6 次,直接删掉。
洗干净了还不能开跑,还得决定各类内容各占多少,这就是数据配比(Data Mix)——决定喂进去的资料里,通识、数学与推理、代码、多语言各占多少比例。Llama 3 报告里专门讲这件事的那一节,标题直译过来就是"决定数据配比"。报告把自己的最终比例写了出来(原文用的是"大致"这样的说法,这是这一份报告的数字,不是通用标准):
| 内容类别 | 占比 |
|---|---|
| 通识 | 50% |
| 数学与推理 | 25% |
| 代码 | 17% |
| 多语言 | 8% |
通识指不限定专业领域的一般知识,是模型的底子;数学与推理装的是数学内容以及带推演过程、讲道理的内容;代码是各种软件的源码;多语言是用不同语言写成的内容。
这几个百分点决定的事情不小。Llama 3 报告里最大的那个模型,是在 15.6 万亿个 token 上完成预训练的,每一类内容在这十几万亿个 token 里各读进去多少,就是靠这组比例定的。这么一遍要跑多久,各家不一样:DeepSeek-V3 的报告写的是,它的预训练阶段在不到两个月内跑完。换句话说,数据配比这几个数字一旦定下来,后面就是几十天和一整笔算力的投入,几乎没有回头重来的余地。
预训练决定的是模型的底子,而模型答得好不好、用起来顺不顺手,是在后训练这一步被人一条一条比出来的。
Llama 3 的技术报告把后训练的做法写了出来:它接在预训练的存档点上,一轮接一轮地做,不是一遍就完。每一轮里先拿挑好的例子做一次微调,再拿人比出来的好坏把模型接着训一次。具体分三个环节:
比较的时候不是简单判个高下。报告里写明,更好的那条比另一条好多少也要说清楚,一共分四档:明显更好、更好、稍好、略好。模型用起来顺不顺手,正是在这一步被一条一条比出来的。
模型准备上线之前,还有一批人专门来找它的毛病,这就是红队测试(Red Teaming)——有组织地去找一个 AI 系统的缺陷和漏洞,通常在受控环境里、和开发方一起做,这是一份公开白皮书引用的官方定义。同一份白皮书还写过一个真实结果:一次红队测试试出了某个语音功能会不自觉地模仿用户本人的声音。
这份白皮书把请外部人员来做红队测试的流程写成了四步:
上线前被攻出来的问题,最后会被汇总成日后考核这个模型的题目。
值得注意的是,这三种活不是排好队各交各的班,而是前一步的结果直接决定后一步能怎么干。把显存占用压下来,这次训练才可以不用另一套更贵的方案;后训练又是接着预训练留下的存档点往下做的。每一环都有人在拍板:路怎么铺、断了从哪一次存档接着训、各类资料各占多少、两条回答哪条更好。
也有一件事需要老实说清楚:某份年度报告观察到,训练代码、参数量、数据集规模和训练时长,在几个最耗资源的系统上已经不再公布。所以这里能讲到的这些细节,来自愿意公开技术报告的那几家,不代表所有团队都是这么做的,更不代表这是行业统一标准。
训练途中一张显卡坏了,会发生什么? 训练会先停下来,因为几千张卡是在一起算同一个模型,硬件一出问题这次训练就会被打断。但不用从头再来——训练途中会定期保存存档点,退回最近一个存档点接着训就行。坏卡自动跳过不影响训练、或者训练作废要从头再来,这两种说法都不成立。
洗数据和定数据配比是同一件事吗? 不是。Llama 3 报告把这两件事分成两节写:先把从网上抓回来的原始网页做一遍清洗(剔除隐私和成人内容站点、做三层去重),洗完之后才在留下来的资料上决定通识、数学与推理、代码、多语言各占多少比例。清洗判断的是哪些内容不能用,配比决定的是能用的资料里每一类各读多少,顺序也是先洗再配比,不是反过来先定比例再去网上定向抓取。
为什么要把显存省下来,不就是省钱吗? 不只是省钱。DeepSeek-V3 的报告写过,把显存占用一点点压下来,省出来的空间让这次训练不必再上另一套更贵的方案,这直接影响了这次训练能不能以现有条件跑起来。模型回答质量的提升来自数据和后训练调教,不是省显存带来的;硬件故障也不会因为省显存而减少,那要靠存档点和值班兜底。
红队测试和数据清洗阶段剔除敏感内容是一回事吗? 不是同一件事,但容易被混淆。剔除隐私和成人内容发生在预训练的数据清洗阶段,针对的是喂给模型的训练资料;红队测试发生在模型准备上线前,针对的是已经训练好的模型本身,专门组织人员测试模型会不会说出不该说的话、做出不该做的事。两者时间点和对象都不一样。
大模型的哪一步最直接决定我用起来顺不顺手? 是后训练。训练基础设施决定这次训练要花多大代价才能跑起来,预训练决定模型的知识底子,而后训练直接调的就是模型开口回答时的样子——它是接在预训练存档点之后、由人一轮一轮比较打磨出来的,日常感受到的顺手或不顺手,最直接来自这一步。
这些内容出自哪里?要付费吗?
不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 8 讲《造一个大模型的人在做什么》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。
出品方:BotLearn免费AI公开课 | 对应课程:第 8 讲《造一个大模型的人在做什么》,免费 | 更新日期:2026-08-28