Transformer 模型

相信不少小伙伴们都好奇过:“大模型的底层到底是个什么东西?它是怎么做到一瞬间读完几十页文档,还能精准挑出里面的问题,或者帮我们总结概要的?”

这,就不得不提到所有主流大模型共同的 “亲生父亲”—— Transformer 模型

2017 年,谷歌(Google)的几位研究人员发表了一篇名为《Attention Is All You Need》(你需要的,仅仅是注意力)的划时代论文。在这篇论文中,正式提出了 Transformer 架构。它的出现,直接打破了旧 AI 的技术瓶颈,也由此拉开了生成式 AI 时代的大幕。

Transformer 模型概览:ChatGPT 等大模型,基于注意力架构的共同底层基础

提示: 现在市面上我们听过的所有主流大模型(包括 GPT、DeepSeek、Gemini 等),其底层都是基于谷歌的 Transformer 架构开发出来的。

说个能帮大家 “秒记” 的冷知识:我们天天挂在嘴边的 GPT,全称是 “Generative Pre-trained Transformer”(生成式预训练 Transformer)——没错,最后那个 “T”,指的就是这一节要讲的 Transformer。可以说,没有 Transformer,就没有今天的 GPT。

在 Transformer 诞生之前,旧 AI 遇到了什么瓶颈?

为了理解 Transformer 到底牛在哪,我们得先看看它的前辈们当年过得有多憋屈。

在 2017 年之前,AI 处理文字主要靠一种叫 “RNN(循环神经网络)” 的架构。RNN 读书的方式和人类很像,是排着队、一个字一个字往前读。

这种方式听起来挺合理,但放到计算机的世界里,它有两个很要命的毛病。

1. 健忘严重(长距离依赖灾难)

由于 RNN 是按顺序读的,等它读到第 1000 个字时,前面那 999 个字的记忆,得一棒接一棒地传递过来。这么一路传下去,越往后读,前面的内容就忘得越厉害。

传统 RNN 模型的瓶颈:排队读字,导致 “长距离依赖灾难”

2. 无法 “多核并行计算”

由于第 2 个字的计算必须等第 1 个字的结果出来,第 3 个字又得等第 2 个字算完……这么一来,哪怕你的电脑有几十核的 CPU、再配上强劲的 GPU 显卡,它也只能像老太太过马路一样,慢吞吞地一步一步单线程地算,训练速度慢到让人崩溃。

传统 RNN 模型的效率瓶颈:无法多核并行计算,只能单线程排队

Transformer 核心机制之一:自注意力机制

为了彻底打破旧架构的技术瓶颈,Transformer 带来了解放生产力的第一大机制:自注意力机制(Self-Attention)

它直接废除了 “排队读字” 这条老规矩,让 AI 拥有了 “全景鸟瞰” 的能力。大模型在读一句话时,会把所有的字同时摊在桌面上,一眼看全,然后瞬间算出每个字、每个词之间的 “远近亲疏关系”。

Transformer 自注意力机制(Self-Attention):废除排队读字,实现全景鸟瞰

为了让小伙伴们更好地理解,咱们来看一个经典的多义词场景:

  • 句子 A:苹果公司的库克今天发布了新手机。
  • 句子 B:我刚刚在路边吃了一个大苹果

同样是 “苹果” 这两个字,我们人类一眼就能分辨:一个是公司,一个是水果。可旧的 AI 由于是挨个读字,很难把隔得老远的词联系到一起。

那拥有了自注意力机制的 Transformer 又是怎么做的呢?它会给句子里的每一个词,都拉起无数条无形的 “连线”。

  • 处理句子 A 中的 “苹果” 时,它发现这个 “苹果” 与后面的 “公司”、“库克”、“手机” 之间的几条连线权重更高。于是它立马反应过来:“哎哟,这不就是造手机的那家公司嘛!”
  • 当它处理句子 B 中的 “苹果” 时,它发现这个 “苹果” 和前面的 “吃了”、“大” 几条连线权重最高。于是它就明白了:“哦,这个是能啃的水果!”

自注意力机制连线权重:根据上下文,精准区分苹果公司与水果苹果

简单来说,自注意力机制就是给大模型装了一个 “全景雷达”。它不再孤立地去看某一个字,而是让每个字都结合周围所有的上下文,来综合判断自己的真实含义。这,正是大模型能听懂人类各种复杂语境的原因。

自注意力机制核心作用:抓远关系与看上下文字词联系,来理解语境

Transformer 核心机制之二:并行计算

Transformer 带来的第二大核心机制,正好能把显卡 GPU 的强大算力彻底压榨出来,那就是——并行计算

由于自注意力机制允许大模型同时 “鸟瞰” 所有的词,因此它的后台就不用再像以前那样,苦哈哈地单核排队等了。

大模型在训练时,会把十本长篇小说、几百万行代码这些东西,一股脑拆成无数个 Token,同时塞进 GPU,让 GPU 里成千上万个计算核心一起开工。

我们可以把这个处理过程,比作盖一栋楼:

  • 以前的架构(RNN):就像只雇了 1 个工人盖楼。必须等第一层全部盖完,才能接着盖第二层,效率低得感人。
  • 现在的架构(Transformer):就像一口气雇了 10000 个工人同时开工,每人只负责一小块,几天工夫就能把一栋大楼盖起来。

Transformer 并行计算机制:与 RNN 对比,实现多 Token 同时塞进 GPU 计算

并行计算这一机制,彻底打破了速度的枷锁,我们这才有可能把整个互联网的数据,全都喂给大模型去处理。也正因为喂进去的数据足够多,大模型的参数量才能突破临界点,从而获得我们前面讲过的 “涌现能力”。

这里也顺带解答一个疑问:为什么训练顶级大模型那么“烧钱”、那么吃显卡?正是因为 Transformer 能并行,厂商才值得动用成千上万张昂贵的 GPU 显卡同时开练。关于算力这块,我们会在后面 “大模型算力基础” 一节中详细介绍。

Transformer 核心机制之三:位置编码

读到这儿,有些机灵的小伙伴可能会冒出一个疑问:“既然 Transformer 不排队、把所有词一股脑全扔进 GPU 去算,那它怎么知道词的先后顺序呢?比如 ‘我打你’ 和 ‘你打我’,用的字一模一样,要是同时扔进去,大模型怎么分得清谁打谁、谁挨打?”

并行计算带来的顺序混淆问题:无法分辨 “我打你” 与 “你打我” 的词语顺序

这确实是并行计算带来的一个大麻烦:丧失了顺序感。

为了解决这个致命问题,Transformer 引入了一项巧妙的技术——位置编码(Positional Encoding)

简单来说,位置编码指的是:在把一句话拆成 Token、扔进计算核心之前,系统会给每一个 Token 贴上一个 “座位号” (即位置信息),比如:

  • 我(1号座位)
  • 打(2号座位)
  • 你(3号座位)

这样一来,哪怕 GPU 是同时处理这 3 个字的,大模型在计算自注意力连线时,也能通过它们身上贴着的 “座位号”,清清楚楚地知道它们在原句里的真实位置。

Transformer 位置编码(Positional Encoding):给 Token 贴上座位号

讲到这儿,Transformer 的三大核心机制就凑齐了。我们再把它们串起来回顾一遍:

  • 自注意力机制:让大模型读一句话时能一眼看全,瞬间抓住词与词之间的远近关系。
  • 并行计算:让成千上万个字能同时进 GPU 计算,训练速度一下子就提了上来。
  • 位置编码:给每个字贴上 “座位号”,解决并行之后 “分不清前后顺序” 的难题。

正是这三招互相配合,才让 Transformer 又快又准。

Transformer 三大核心机制:自注意力机制、并行计算与位置编码

最后补充一个进阶小知识(小伙伴们看不懂可以先跳过,完全不影响理解):完整的 Transformer 其实由 “编码器(Encoder)” 和 “解码器(Decoder)” 两部分组成——前者擅长 “读懂、理解”,后者擅长 “生成、续写”。

我们天天用的 ChatGPT、DeepSeek 这类会聊天、会写东西的大模型,主要用的就是其中的 “解码器” 部分(所以也叫 Decoder-only 模型);而像 BERT 这种偏 “理解、分类” 的模型,用的则是 “编码器” 部分。但不管怎么搭配,它们脚下的地基,都是同一个 Transformer。

为什么说 Transformer 改变了整个时代?

在日常生活中,相信小伙伴们都体验过:现在所有的手机、电脑、小家电等都已经统一用上了 “Type-C 充电接口”。现在出门在外,再也不用像以前那样,揣一兜子乱七八糟的转接线了。

Transformer 架构对于整个 AI 界来说,就是那个一统江湖的 “万能标准接口” 。

在它出现之前,AI 圈子是相当割裂的:搞图像的、搞语音的、搞文本的……不同领域的工程师各自为战,底层模型和技术代码也互不通用,彼此隔着一道墙。

而在 Transformer 诞生之后,研究者们发现:这套架构什么都可以做!它不仅可以用来处理文本,还可以用来处理图片、音频、视频等。所有这些东西,都可以先变成 “Token”,然后丢进Transformer 架构中处理!

Transformer 改变 AI 时代:统一文本、图片、音频处理的多模态万能接口

这也是为什么 “多模态模型” 能够爆发的原因——因为不管是图像处理、语音识别、还是写代码等,大模型的底层全都是使用同一套架构。可以说,Transformer 真正实现了全人类各种信息格式的 “大一统”。

“前谷歌黑手党”

很多小伙伴肯定好奇:如今把整个 AI 圈搅得天翻地覆的 Transformer 架构,到底是哪位天才发明出来的?这背后,其实藏着一段相当传奇的硅谷往事。2017 年,谷歌的 8 位顶尖研究员联手,发表了一篇堪称 “神作” 的论文——《Attention Is All You Need》。正是这篇价值万亿的论文,直接为今天所有的大模型(不管是 ChatGPT 还是 DeepSeek)打下了底层地基。

按理说,谷歌手里攥着这么一张王炸级别的技术底牌,早该一统江湖了吧?可戏剧性的一幕来了:这 8 位大佬在论文发表后,嫌弃谷歌 “大厂病” 太重、推产品太磨叽,竟在随后几年里接二连三地全都辞职走人了!出走之后,他们各自疯狂创业,拉起了 Cohere、Character.AI、Essential AI 等一大批 AI 公司——其中像 Cohere、Character.AI,更是摇身一变,成了估值高达几十亿美元的行业独角兽。

这 8 位前谷歌研究员,后来被业界戏称为 “前谷歌黑手党”,又或者 “AI 界的叛逆八仙”。这段有趣的八卦,不仅给原本枯燥的 Transformer 架构平添了几分江湖传奇色彩,也让我们看清了一个现实:在这个飞速狂奔的大模型时代,谁的动作一慢,哪怕是谷歌这样的科技霸主,也只能眼睁睁看着自己亲手种下的这棵神树,最后把果子全结到了别人家的院子里。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号