大模型发展史

很多小伙伴在看到 ChatGPT、DeepSeek 震撼全球时,会以为它们是一夜之间冒出来的。其实,大模型的发展是一个循序渐进的漫长过程。

如果把大模型的进化比作一个人的成长,它也大致经历了 “婴儿期、童年期、青春期、壮年期”,然后到了现在的 “社会人阶段”。

大模型发展历程图解:将人工智能的演进比作人类从婴儿到社会人的五个成长阶段

婴儿期:规则与统计(1950s - 2010s)

在婴儿期阶段,人工智能还相当 “笨”。这一大阶段,又可以细分成下面几个小阶段。

1. 规则时代

科学家们试图把人类的语法规则全部写成代码,喂给计算机。比如告诉它:“主语 + 谓语 + 宾语” 是一句话。结果却发现,人类语言太复杂了,规则怎么写也写不完。

人工智能早期的规则时代:试图将语法规则写进代码

2. 统计时代

后来,人们发现可以使用数学统计的方法。比如在英文中,“How” 后面出现 “are” 的概率很高,那就让计算机去查表。这时的 AI 就像个只会查字典的复读机,碰到稍微复杂点的逻辑就容易卡壳。

这种基于规则和简单统计的早期 AI,是非常笨的。这里有一个流传很广的经典例子:据说当年人们让早期的翻译软件,把英语谚语 “The spirit is willing, but the flesh is weak”(心有余而力不足)先翻译成俄语,再翻回英语,结果意思却变成了:“The vodka is good, but the meat is rotten”(伏特加是好酒,但这肉烂了)。

之所以闹出这种笑话,是因为早期的 AI 根本不懂 “语境”,只会死板地查字典、做字面替换。

AI 婴儿期的统计模型:基于概率查表的死板翻译器

3. AI 的两次 “寒冬”

在大模型出现前,AI 其实经历过两次 "寒冬"。每次大家都满怀期待、以为 AI 要起飞了,结果却都因为技术不成熟而跌入低谷:

  • 第一次寒冬(1970s):因为规则式 AI 始终无法处理真实世界的复杂性,研究经费被大量削减。
  • 第二次寒冬(1980s 末 - 1990s):所谓的 “专家系统” 商业化失败,AI 再次被冷落。

这也是为什么后来 ChatGPT 横空出世时,整个行业都被震撼了——因为它真正圆了过去几十年里,无数 AI 研究者的梦。

人工智能发展史上的两次 AI 寒冬:经费削减与商业化失败

童年期:深度学习与神经网络(2010s - 2017)

随着计算机性能的提升,“深度学习” 和 “神经网络” 技术开始大放异彩。在这个时期,AI 学会了 2 项非常重要的本领。

1. 词向量:把文字变成数字

计算机本质上只认识 “0” 和 “1” 这两个数字,那它到底是怎么理解人类语言的呢?

2013 年,科学家提出了 “词向量” 技术,成功地把每一个人类文字,变成了一串长长的数字坐标(也就是 “向量”)。从此,AI 在数学层面上,真正理解了词与词之间的关联!

比如它会发现 “苹果” 和 “香蕉” 这两个对应的数字坐标离得非常近,而离 “飞机” 对应的数字坐标却很远。靠着这种数学上的关联,AI 第一次 “看懂” 了人嘴里说的同类词。

深度学习词向量(Word Embedding)技术:把文字变成数字

2. 循环神经网络(RNN):开始拥有记忆

认识了单词之后,AI 开始尝试读懂完整的句子。此时主流的技术叫 “RNN(循环神经网络)”。

有了 RNN,AI 开始具备初步的记忆能力,能够联系上下文来理解句子。但此时的它还有一个致命弱点——忘性大。如果一个句子太长,它读到结尾时,往往就忘了开头讲的是啥了。

具备初步记忆能力的循环神经网络(RNN)图解

青春期:Transformer 的诞生(2017 - 2018)

2017 年是人工智能史上最重要的转折点。这一年,谷歌发表了一篇划时代的论文《Attention Is All You Need》,并提出了那个大名鼎鼎的——Transformer 模型

Transformer 通过把 “自注意力机制” 作为核心,大幅缓解了早期 AI 处理长文本时 “忘性大” 的问题。它能在处理一句话时为每个词分配不同的权重,从而更关注其中最相关的部分。

Transformer 架构核心:让 AI 抓重点的注意力机制(Attention)

可以说,Transformer 是所有现代大模型的 “亲生父亲”。不管是后来的 GPT、Gemini,还是现在的各种国产大模型,底层用的都是 Transformer 这套框架。

壮年期:预训练与参数量大爆发(2018 - 2022)

有了 Transformer 框架之后,各大科技巨头开始走上了 “大力出奇迹” 的道路:

  • BERT(谷歌):2018 年发布,它让 AI 对语言含义的理解更深了一层,一举刷新了当时一大批 NLP 任务的纪录。
  • GPT 系列(OpenAI):OpenAI 则走了另一条路——他们坚持不断地往上堆模型的“参数量”(可以理解成大脑里神经元的数量)。
    • GPT-1:证明了这条路可行。
    • GPT-2:展现出了惊人的续写能力。
    • GPT-3:这是一道分水岭,参数量一举冲到了 1750 亿。人们惊讶地发现:当模型大到一定程度,它会突然 “涌现” 出新本事,变得异常聪明。
    • InstructGPT:在 ChatGPT 爆发前,OpenAI 先用它验证了 RLHF(基于人类反馈的强化学习)的威力。这就好比在正式推出智能手机前,先做出了一个极其成功的内部测试原型机。

大模型壮年期:从 GPT-1、GPT-3 到 InstructGPT 的参数量演进

社会人阶段:对话、对齐与应用落地(2022 至今)

2022 年底,ChatGPT 横空出世,彻底引爆了全球 AI 浪潮。它不仅继承了庞大的参数量,还将 “人类反馈强化学习(RLHF)” 这项技术发扬光大。

具体来说,ChatGPT 在 2022 年 11 月 30 日正式发布,仅用 5 天,用户数就突破了百万。大约 2 个月,月活就冲破 1 亿,一举成为当时史上增长最快的消费级应用。

所谓的 “人类反馈强化学习” 技术,简单来说就是:让人类给 AI 的回答打分,一点点教它怎么像人一样说话,怎么变得礼貌、安全又有用。这个过程,也被称为 “对齐”(Alignment)。

让大模型更像人的 RLHF(人类反馈强化学习)与对齐技术图解

除了 “对齐” 之外,现阶段的大模型还迎来了以下 3 大突破:

  • 多模态爆发:如今的 AI 已经不再局限于纯文本,它不仅能看懂图片、听懂语音,还能直接生成高质量的图片和视频。这种大模型也叫做 “多模态模型”。
  • 开源生态崛起:玩家不再只有科技巨头,越来越多强大的 “开源模型” 被免费公开出来,比如 DeepSeek、LLama(Meta 开源)。靠着它们,普通开发者、甚至普通人,也能在自己的电脑上跑大模型。
  • 深度推理模型:这是当前最前沿的趋势。以前的模型是 “快思考”(直接吐出答案),而现在的模型学会了 “慢思考”——在给出最终答案前,会先在后台生成大量 “思维链”,反复自我验证、逻辑推导。这让 AI 在解决复杂的数学和编程问题上,能力实现了质的飞跃。

大模型下半场的较量

现在的竞争已经不再仅仅是比谁的参数更大,而是比谁更 “懂用户”(对齐更好)、谁的 “幻觉” 更少、谁的 “性价比” 更高(比如最近大火的 DeepSeek,就是用极低的成本实现了极高的性能)。

最后,我们把上面这些关键节点串成一条时间线,方便大家了解和记忆,如下图所示。

大模型(LLM)与人工智能发展的关键时间线

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号