大模型预训练

从上一节我们知道,大模型的训练过程分为 3 个阶段。这一节,咱们先来介绍大模型成长中最残酷、也是最烧钱的第一阶段—— 预训练(Pre-training)

如果把训练大模型的过程比作一场长征,那么光预训练这一步,就吃掉了其中 95% 以上的算力、时间和资金!

大模型预训练资源消耗图解:解析为什么预训练吞噬了 AI 训练中 95% 以上的算力与资金

我们在新闻里经常看到:各大科技巨头一掷千金,疯抢上万张顶级显卡(比如 A100),甚至专门盖起巨大的数据中心。这些天价设备连续运转好几个月、烧着惊人的电费,其实绝大部分时间,都只在干一件事——预训练。

大模型的预训练是什么?

大模型在训练前就像是刚出生的婴儿:它的大脑里虽然有几千亿个空白的 “神经突触”(参数),但此刻它什么都不认识。

为了给它开智,研究者们干脆把它扔进了一座人类有史以来最庞大的数字图书馆。这里面装着人类在互联网上几乎所有的公开资料,比如:

  • 维基百科的权威百科。
  • 几千万本开源电子书。
  • 各大新闻网站的历史报道。
  • GitHub 成千上万的源码。
  • 各类论坛里的水贴和聊天记录。
  • ……

所谓预训练,就是让大模型在没有任何人类指导的情况下,自己没日没夜地把这些数据全部吸收完。

大模型预训练(Pre-training)语料:吸收维基百科、新闻与代码的海量数字图书馆

预训练到底 “吃” 了多少数据?

早几年,一个模型能 “吃” 下几十亿个 Token,就已经很了不起了。可到了今天,这个数字膨胀到了一个恐怖的量级——比如全球最强的开源模型之一 Meta Llama 3,它的预训练数据量足足有 15 万亿个 Token!

15 万亿个 Token 是什么概念?如果把这些文字完全打印在 A4 纸上,叠起来的高度可以直接从地球铺到月球。大模型就是通过把这 15 万亿个积木反反复复地拼接、咀嚼,才最终 “涌现” 出了不可思议的智慧(即 “涌现能力”)。

预训练在干什么?没有老师的 “自监督学习”

我们平时在教孩子认字或者认动物时,一般都是拿着卡片指给他看:“宝贝你看,这个是牛,这个是马……牛,马,牛马……”然后多说几次,孩子就能记住了。

早期 AI 人工打标签训练方式:类似教人类小孩认动物卡片,效率极其低下

在早期的 AI 发展阶段,研究者要想让 AI 认识 “牛”,就得雇人手动给成千上万张图片标上 “这是牛” 的记号。这种做法,叫做 “人工打标签”。

可问题来了,大模型在预训练时面对的是几万亿字的海量数据。这要是全靠人工一字一句地打标签,就算把全世界的人都拉来当标注工,干上一百年也干不完。

为了解决这个问题,研究者们利用 Transformer 架构之上,想出了一种绝妙的玩法——自监督学习(Self-Supervised Learning)。这个词听着高大上,但它的底层逻辑其实非常简单,就是咱们第一章反复强调的那套:盲盒文字接龙

大模型在读书时,算法会故意把句子后面的词给 “遮住”,逼着它去盲猜。

  • 开始出题:中国的首都是 [???]
  • 第 1 次盲猜:大模型根据体内一开始乱设的参数,瞎蒙了一个词——“上海”。
  • 后台挨打:算法立刻翻开原书对答案,发现正确答案是 “北京”,判定它猜错了!于是狠狠 “抽” 它一下,强行修正它脑子里刚才参与计算的那些参数的权重。
  • 第 10000 次盲猜:当大模型疯狂读完成百上千本中国地理书后,当它再次看到 “中国的首都是” 这几个字时,它脑子里 “北京” 这个词的得分概率,就会直接飙升到 99%。

自监督学习(Self-Supervised Learning)机制:盲猜下一个词,并纠正参数的文字接龙过程

就这样,在经历了亿万次的 “猜错、挨打、长记性” 之后,大模型不仅摸透了人类怎么说话造句,还在不知不觉中,把书本里的物理常识、历史事件,全都化成了一个个具体的数值,牢牢 “焊” 在了它大脑里那几百亿个参数旋钮上。

大模型预训练参数调整:通过反复猜错与纠正,将物理历史知识固定在几十亿个旋钮参数上

这一招的精妙之处在于:“正确答案” 根本不用人来标注,它就明明白白藏在文章的下一个词里——相当于数据自己给自己当了老师。也正是靠着这一点,大模型才挣脱了 “人工标注” 的枷锁,得以一口气吞下几万亿个 Token。

可以说,没有 “自监督学习”,就没有今天这么大的模型。

喂料的艺术:垃圾进,垃圾出(Data Cleaning)

俗话说得好:“吃什么补什么。” 在预训练中,大模型吃进去的是什么,几乎直接决定了它将来吐出来的是什么。

要是我们不加分辨,把互联网上的原始垃圾数据一股脑直接喂给它,那就完蛋了——大模型学出来的,全是键盘侠的对喷、网页小广告、满屏的错别字。

“垃圾进,垃圾出”(Garbage in, Garbage out)。所以在真正开始预训练之前,数据工程师们得像淘金一样,用一套严谨的算法把数据反复筛选、提纯:

  1. 去重过滤:互联网上有大量复制粘贴的重复网页。如果让 AI 反复读一模一样的废话,它就会变成一个呆板的复读机。因此,我们必须使用 “去重算法” 把重复文本过滤才行。
  2. 毒性过滤:用过滤词表和分类器,把涉及暴力、歧视、垃圾广告等会污染大模型的内容全部剔除,保证它吸收的都是干净的语料。
  3. 代码提纯:对于编程代码,工程师们会专门挑出 GitHub 上高 Star、带有严谨单元测试的优质代码库,把那些质量差、或者机器自动生成的 “垃圾代码” 筛掉,只把最高质量的代码喂给大模型。

大模型预训练数据清洗(Data Cleaning)流程:过滤重复数据与毒性内容,来提纯出高质量语料

为什么现在同样参数量的开源模型(比如 DeepSeek-V4),能够把几年前同样规模的老模型直接按在地上摩擦呢?很大一个原因就在于:如今喂给大模型的数据,比前几年的更优质、也更纯净。

预训练的最终产物:底座模型

当大模型看完几万亿个词、烧掉几千万美元电费、又熬过几个月的预训练之后,就会得到一个基础模型。这时候的它,行业里叫作 “底座模型(Base Model)”。

预训练的最终产物:通过海量文本数据训练得出的底座模型(Base Model)

底座模型虽然吸收完了人类几乎所有的文本资料,懂得特别多,但此刻它绝对不能直接拿去做成产品给用户使用的。

为什么呢?因为底座模型现在只学会了一件事,那就是 “续写接龙”(即顺着你的话往下接字)。现在的它根本不知道什么是 “提问”,什么是 “回答”。

如果我们直接向才刚经过预训练的底座模型提问:“感冒了应该吃什么药?” 它并不会回答你,而是会顺着这个问题继续往下接:

“发烧了应该吃什么药?”

“肚子痛应该吃什么药?”

底座模型(Base Model)的缺陷:只会顺着提问继续续写文字接龙,还不会听懂指令和回答问题

底座模型只会顺着你的文本往下凑字数,因为它压根没学过如何听懂人的指令、并回答问题。因此,为了让底座模型变成我们平常使用的那种能听懂指令、能正常聊天的 AI,就必须进入下一阶段的训练——SFT 微调。

最后提醒一个很实用的点:预训练一旦完成,大模型的 “大脑” 基本就定型了。这会带来两个直接结果:

  1. 它的知识有一个 “截止日期”(还记得 “大模型的能力边界” 里讲的吗)——预训练数据收集到什么时候,它就只知道到什么时候,之后发生的新鲜事它并不知晓。
  2. 是你平时和它聊天,并不会 “训练” 到它——它的参数早就固定了,不会因为你说了几句话就偷偷记住、或者变聪明。

Anthropic “焚书” 事件

对于大模型的预训练来说,数据的质量是远大于数量的。可能有小伙伴了解过这样一个新闻:为了获取最干净、无版权争议的高质量语料,Claude 的母公司 Anthropic 甚至采取了令人震惊的手段,引发了备受争议的 “焚书” 事件。

Anthropic 花费数百万美元购买了数百万本正版实体二手书。为了追求极致的机器扫描速度和文本提取纯净度,他们采用无情的工业流水线——直接切掉书籍的装订书脊,将书本彻底拆碎成散页,然后进行飞速的高清扫描。扫描一旦完成,原稿纸张就被当即送进碎纸机销毁。

买进、切散、扫描、销毁。数百万本实体纸质书(甚至包括部分绝版书)就这样从物理世界永远消失,化作了 AI 神经网络里冰冷的 Token 参数。

这场 “数字焚书” 事件在文化界引发了巨大的争议,但也直观地揭示了预训练的底层法则:为了给大模型喂上一口高质量的 “干净粮食”,科技巨头们不惜痛下血本。优质的纯净数据,已经成为大模型最深不可测的护城河。

感兴趣的小伙伴可以自行搜索一下相关新闻,整个事件里面的细节,绝对会让你大跌眼镜。

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号