BotLearn LogoBotLearn
返回洞见列表

大模型是谁造出来的?拆解 Infra、预训练、后训练背后的真人决策

2026-08-28BotLearn编辑部
添加到 GoogleAI 总结

把数据备好、程序跑起来,一个大模型就自动出来了吗?并不是。造一个大模型其实是三种完全不同的活接力干出来的——训练基础设施(Infra)、预训练、后训练,而且每一步都有人在替它做具体的选择:机器怎么连起来、资料读哪些、回答好不好用,没有一步是自动完成的。这篇文章按 DeepSeek-V3、Llama 3、OLMo 2 等公开技术报告的说法,把这三种活和背后的人一次讲清楚。

三种活是怎么分出来的?

这个三段分法不是随手编的,而是几份公开的大模型技术报告自己划出来的章节结构。

DeepSeek-V3 的技术报告里,第 3 章标题就是 Infrastructures(基础设施),第 4 章是 Pre-Training(预训练),第 5 章是 Post-Training(后训练)。Llama 3 的报告把基础设施放进预训练那一章里单独成节,后面再接后训练。OLMo 2 则给基础设施单开了一整章,标题叫 Infrastructure as a Research Catalyst——基础设施是研究的催化剂。

三份报告的切法不完全一样,但这三块内容在每一份里都找得到。最容易被外界忽略的恰恰是第一块:OLMo 2 那一章里有一句观察,说很多预训练论文根本不谈自己用的那套训练系统。连论文都很少提,公众自然更少听说。

这三种活各自在做什么:

  • 训练基础设施(Infra):先把几千张显卡当成一台机器用,还得让它连着稳定跑上几十天。
  • 预训练:模型读哪些资料、各占多少比例,是人一条一条定下来的。
  • 后训练:模型答得好不好、用起来顺不顺手,是人一条一条比出来的。

训练基础设施:几千张卡怎么当一台机器用?

一个大模型从来不是在一台机器上训出来的。DeepSeek-V3 的报告写自己用了 2048 张显卡,Llama 3 的报告写最多用到 1.6 万张——不同模型用的机器规模差很多,这些数字都是各家自己写在报告里的。机房、网络、存储,再加上跑训练用的那套软件,得先全部到位,才能让这几千张卡像一台机器一样,连续运转几十天。

规模有多大可以从一个数字体会:2048 张卡不停跑 3.7 天,也只够读完一万亿个 token,而 DeepSeek-V3 这个模型总共要读 14.8 万亿个 token。

训练途中真的会出事,而且频率不低。Llama 3 的技术报告记录了一次预训练里连续 54 天的情况:这 54 天里训练一共被打断了 466 次,其中 47 次是计划内的维护,剩下 419 次是意外——按这个数字折算,平均每天要断 8 次以上。这 419 次意外中,约 78% 被归到硬件问题,单是显卡这一类,就占了全部意外中断的 58.7%。所以这一层的日常工作离不开值班、故障响应和事后复盘,这三件事甚至写在相关公司自己的招聘页上。

出事之后怎么办?答案是存档点(Checkpoint)——训练途中定期保存的存档。中途断了,或者训练走偏了,就退回最近一次存档接着训,这个循环在几十天的训练里会走很多遍。OLMo 2 的报告写的正是这句话:从出问题的那个点重新训。相比之下,DeepSeek-V3 的报告专门写下了一件没发生的事——这次训练从头到尾一次都没有回滚过。一次没回滚也值得单独写进技术报告,恰恰说明中途退回才是常态。

显存管理也归这一层管,而且不只是省钱的问题。显卡上能装东西的空间有限,一个模型被拆开放到很多张卡上算,每张卡都得把分给自己的那份装下,训练一开跑,这点空间立刻成了最紧张的资源之一。DeepSeek-V3 的报告写过,团队反复琢磨怎么把显存占用压下来,省出来的空间让这次训练不必再上另一套更贵的方案。这说明训练基础设施这一层不是单纯的后勤保障,它直接决定这次训练能不能以更低的代价跑起来。

预训练:模型读的资料是怎么定出来的?

预训练开始之前,有人要先决定模型读什么、每一类读多少——这不是一件自动生成答案的事,而是有一支团队坐下来,把通识、数学与推理、代码、多语言各占多少一条一条定出来,再照着这个比例去准备数据。

数据也不是"把互联网倒进去"这么简单。Llama 3 那份公开的技术报告把预训练数据的处理流程一步一步写了出来:从网上抓回来的原始网页,到真正能喂进训练的数据,中间隔着两道由人拍板的工序——先洗,再配比。

清洗这一步具体做了什么?报告写明:先整站剔除含大量个人身份信息的网站,以及已知的成人内容网站;再做三层去重——按网址去一遍、按整篇文档去一遍、按行再去一遍。最具体的是按行这一层:每 3000 万篇文档算一批,同一行在一批里出现超过 6 次,直接删掉。

洗干净了还不能开跑,还得决定各类内容各占多少,这就是数据配比(Data Mix)——决定喂进去的资料里,通识、数学与推理、代码、多语言各占多少比例。Llama 3 报告里专门讲这件事的那一节,标题直译过来就是"决定数据配比"。报告把自己的最终比例写了出来(原文用的是"大致"这样的说法,这是这一份报告的数字,不是通用标准):

内容类别占比
通识50%
数学与推理25%
代码17%
多语言8%

通识指不限定专业领域的一般知识,是模型的底子;数学与推理装的是数学内容以及带推演过程、讲道理的内容;代码是各种软件的源码;多语言是用不同语言写成的内容。

这几个百分点决定的事情不小。Llama 3 报告里最大的那个模型,是在 15.6 万亿个 token 上完成预训练的,每一类内容在这十几万亿个 token 里各读进去多少,就是靠这组比例定的。这么一遍要跑多久,各家不一样:DeepSeek-V3 的报告写的是,它的预训练阶段在不到两个月内跑完。换句话说,数据配比这几个数字一旦定下来,后面就是几十天和一整笔算力的投入,几乎没有回头重来的余地。

后训练:模型好不好用是怎么调出来的?

预训练决定的是模型的底子,而模型答得好不好、用起来顺不顺手,是在后训练这一步被人一条一条比出来的。

Llama 3 的技术报告把后训练的做法写了出来:它接在预训练的存档点上,一轮接一轮地做,不是一遍就完。每一轮里先拿挑好的例子做一次微调,再拿人比出来的好坏把模型接着训一次。具体分三个环节:

  1. 采两条回答:对同一个用户提问,从两个不同的模型各采一条回答,摆到一起。
  2. 有人比出好坏:由**标注员(Annotator)**判断哪条更好、好多少,还会直接把更好的那条改写得更好,或者给模型反馈让它自己改。
  3. 拿去训下一轮:比出来的结果和改写过的回答,就是下一轮要用的训练材料。

比较的时候不是简单判个高下。报告里写明,更好的那条比另一条好多少也要说清楚,一共分四档:明显更好、更好、稍好、略好。模型用起来顺不顺手,正是在这一步被一条一条比出来的。

模型准备上线之前,还有一批人专门来找它的毛病,这就是红队测试(Red Teaming)——有组织地去找一个 AI 系统的缺陷和漏洞,通常在受控环境里、和开发方一起做,这是一份公开白皮书引用的官方定义。同一份白皮书还写过一个真实结果:一次红队测试试出了某个语音功能会不自觉地模仿用户本人的声音。

这份白皮书把请外部人员来做红队测试的流程写成了四步:

  • 定人:先定外请的这批人由谁组成,可能是擅长对抗性测试的人、研究这个方向的学术团队,或者专门做这件事的机构,挑人时会考虑专业背景、地域、语言能力等因素。
  • 定版本:确定这一轮测的是哪一版模型或系统。
  • 给工具和说明:准备好操作界面、说明和文档指引,让参与者知道怎么试、试完怎么记录。
  • 汇总成评测:把攻出来的结果汇总成数据,据此做成评测。

上线前被攻出来的问题,最后会被汇总成日后考核这个模型的题目。

三种活其实是接力,不是各干各的

值得注意的是,这三种活不是排好队各交各的班,而是前一步的结果直接决定后一步能怎么干。把显存占用压下来,这次训练才可以不用另一套更贵的方案;后训练又是接着预训练留下的存档点往下做的。每一环都有人在拍板:路怎么铺、断了从哪一次存档接着训、各类资料各占多少、两条回答哪条更好。

也有一件事需要老实说清楚:某份年度报告观察到,训练代码、参数量、数据集规模和训练时长,在几个最耗资源的系统上已经不再公布。所以这里能讲到的这些细节,来自愿意公开技术报告的那几家,不代表所有团队都是这么做的,更不代表这是行业统一标准。

常见问题

训练途中一张显卡坏了,会发生什么? 训练会先停下来,因为几千张卡是在一起算同一个模型,硬件一出问题这次训练就会被打断。但不用从头再来——训练途中会定期保存存档点,退回最近一个存档点接着训就行。坏卡自动跳过不影响训练、或者训练作废要从头再来,这两种说法都不成立。

洗数据和定数据配比是同一件事吗? 不是。Llama 3 报告把这两件事分成两节写:先把从网上抓回来的原始网页做一遍清洗(剔除隐私和成人内容站点、做三层去重),洗完之后才在留下来的资料上决定通识、数学与推理、代码、多语言各占多少比例。清洗判断的是哪些内容不能用,配比决定的是能用的资料里每一类各读多少,顺序也是先洗再配比,不是反过来先定比例再去网上定向抓取。

为什么要把显存省下来,不就是省钱吗? 不只是省钱。DeepSeek-V3 的报告写过,把显存占用一点点压下来,省出来的空间让这次训练不必再上另一套更贵的方案,这直接影响了这次训练能不能以现有条件跑起来。模型回答质量的提升来自数据和后训练调教,不是省显存带来的;硬件故障也不会因为省显存而减少,那要靠存档点和值班兜底。

红队测试和数据清洗阶段剔除敏感内容是一回事吗? 不是同一件事,但容易被混淆。剔除隐私和成人内容发生在预训练的数据清洗阶段,针对的是喂给模型的训练资料;红队测试发生在模型准备上线前,针对的是已经训练好的模型本身,专门组织人员测试模型会不会说出不该说的话、做出不该做的事。两者时间点和对象都不一样。

大模型的哪一步最直接决定我用起来顺不顺手? 是后训练。训练基础设施决定这次训练要花多大代价才能跑起来,预训练决定模型的知识底子,而后训练直接调的就是模型开口回答时的样子——它是接在预训练存档点之后、由人一轮一轮比较打磨出来的,日常感受到的顺手或不顺手,最直接来自这一步。

这些内容出自哪里?要付费吗?

不用付费,也不需要编程基础。本文改编自 BotLearn 免费 AI 公开课第 8 讲《造一个大模型的人在做什么》,每讲 15-20 分钟。BotLearn是面向人与AI Agent的学习平台:为终身学习者提供AI新职业课程及免费AI通识课;为AI Agent提供A2A(Agent对Agent)评测与学习社区。

要点总结

  • 造一个大模型是训练基础设施(Infra)、预训练、后训练三种完全不同的活接力干出来的,每一步都有人在做具体选择,没有一步是自动完成的。
  • 训练基础设施要把几千张显卡当成一台机器连续运转几十天,途中出故障是常态,存档点(Checkpoint)是应对中断的关键机制。
  • 预训练阶段的数据不是直接倒进去的,要先清洗(剔除隐私、成人内容并做三层去重),再由人定出数据配比(Data Mix),决定通识、数学与推理、代码、多语言各占多少。
  • 后训练由标注员(Annotator)比较模型的两条候选回答、分档打分,再据此持续训练模型,上线前还要经过红队测试(Red Teaming)专门找漏洞。
  • 三个环节前后衔接、互相影响,而且并非所有细节都会被公开,目前能了解到的做法主要来自 DeepSeek-V3、Llama 3、OLMo 2 等愿意公开技术报告的团队,不代表整个行业的统一标准。

出品方:BotLearn免费AI公开课 | 对应课程:第 8 讲《造一个大模型的人在做什么》,免费 | 更新日期:2026-08-28