大模型算力基础(GPU、NPU、TPU)

小伙伴们肯定经常听到 “算力” 这个词,但它到底是什么呢?说白了,算力就是计算机做数学运算的能力。而大模型的训练和运行,本质上就是在做海量的数学计算(主要是矩阵乘法)。

所以,算力就是大模型的 “发动机”——模型越大,需要的算力就越猛。而提供这份算力的,主要是 3 种专门的芯片:GPU、NPU、TPU。这一节,我们来带大家把它们彻底搞清楚。

大模型算力基础的三大核心芯片图解:提供海量算力的通用并行主力 GPU、为 AI 量身定制的专用机 TPU 以及端侧设备本地运行的省电小助手 NPU

为什么传统的 CPU 不够用了?

提到芯片,我们最熟悉肯定是 CPU(中央处理器),它是计算机的 “大脑”。CPU 很聪明、也很全能,但它有个特点:核心数量少,更擅长一件一件、按顺序地处理复杂任务。

打个比方,CPU 就像几位博学的大学教授:单兵作战能力极强,再难的题都能解,但人数就那么几个。

而大模型要做的,是另一种活儿——把海量又简单又重复的数学题(成千上万个数字相乘、相加),同时一起算出来。这种 “人海战术” 的活儿,几位教授反而忙不过来。

于是,专门擅长 “并行计算”(一大堆运算同时进行)的芯片就登场了,那就是——GPU。

CPU 与 GPU 的算力逻辑对比:CPU 少量强核心顺序处理 vs GPU 大量简单核心并行计算

GPU:从打游戏 “转行” 的算力主力

GPU,也就是 “Graphics Processing Unit(图形处理器)”,它最早是为了打游戏、渲染画面而生的。因此,很多喜欢玩游戏的小伙伴会对它比较了解(比如什么 5090、4090 等)。

为什么 GPU 能够跑大模型呢?这是因为渲染游戏画面,本身就是在同时计算屏幕上成千上万个像素点,它天生就是个 “并行计算” 的活儿。所以 GPU 里塞了成百上千个小核心,特别擅长 “一大堆运算同时开工”。

接着上面的比方:如果说 CPU 是几位大学教授,那么 GPU 就像几千个小学生——每人只做简单的加减乘除,但人多力量大。而大模型要的,恰恰就是这种海量又简单的重复计算。于是,原本用来打游戏的 GPU,一不留神成了 AI 时代的 “算力主力”。

GPU 适合大模型的原因图解:大量简单核心(如小学生)并行计算海量重复数学题

目前,无论是训练大模型,还是跑大模型推理,GPU 都是绝对的主流选择。其中,英伟达(NVIDIA)的 GPU 几乎处于统治地位,我们经常听到的 H100、H200 等 “明星芯片”,都出自它家。

AI 时代的 “卖铲人”

我们可能都听过这样一个故事:当年美国西部淘金热,真正赚大钱的往往不是那些苦逼挖金子的人,而是那些在路边卖铲子的人。

大模型时代的 “铲子”,就是算力。而英伟达(NVIDIA)的 GPU 几乎处于统治地位,它毫无悬念地成了最赚钱的 “卖铲人”。更有趣的是,英伟达的创始人黄仁勋,无论春夏秋冬,每次开产品发布会都雷打不动地穿着一件标志性的黑色皮衣,因此被网友们戏称为 “皮衣刀客”。

现在搞 AI 的公司基本赚不了什么钱,而英伟达却赚得盆满钵满,一跃成为全球市值最高的公司。果然还是卖铲子的赚钱啊!

英伟达在 AI 淘金热中的卖铲人角色:GPU 成为大模型算力主力

TPU:谷歌为 AI 量身定做的 “专用机”

TPU,也就是 “Tensor Processing Unit(张量处理器)”,它是谷歌(Google)专门为 AI 计算定制的一款芯片。

TPU 名字中的 “Tensor(张量)”,是深度学习里最基础的数据形式(你可以粗略理解成 “一大堆排好队的数字”)。TPU 干的,就是专门加速这种张量运算。

和 “什么都能干一点” 的 GPU 不同,TPU 是个 “专才”——它把电路设计得只为 AI 计算服务。

  • 好处是:在它擅长的活儿上,往往跑得更快、更省电。
  • 代价是:通用性不如 GPU 灵活。

谷歌自家的大模型(比如 Gemini),主要就是用 TPU 训练出来的,它也通过谷歌云对外开放使用。我们可以把 TPU 理解成:一条为 AI 计算专门搭建的 “流水线”,只做这一种活儿,但做得又快又省。

谷歌 TPU (张量处理器) 概念图解:为 AI 计算量身定做更快更省电的专用流水线

NPU:装进你手机里的 “AI 小助手”

NPU,也就是 “Neural Processing Unit(神经网络处理器)”,它同样是为 AI 计算而生,但它主打的是另一个战场——你的手机、电脑等终端设备。

现在的智能手机芯片里,基本上都集成了 NPU(比如苹果的 “神经网络引擎”、华为麒麟的 NPU、高通的 NPU)。这两年火起来的 “AI PC”,靠的也是芯片里的 NPU。

NPU 的核心使命是:在设备本地,又快又省电地处理日常的 AI 任务——比如人脸解锁、照片的智能美化、语音助手、实时字幕,以及在手机上跑一些小模型。

为什么要使用它呢?因为这些活儿如果全传到云端去算,既慢又费流量、还涉及隐私。NPU 就像一个嵌在你设备里的 “AI 小助手”,省电、贴身、随叫随到。

NPU (神经网络处理器) 概念图解:智能手机与 AI PC 中处理本地 AI 任务的省电小助手

GPU、TPU、NPU 之间的区别

大模型计算,主要用的就是 “GPU、TPU、NPU”(注意不包括 CPU,因为 CPU 不适合),它们之间的区别如下:

  • GPU:最全能的 “算力主力”,是数据中心里训练、运行大模型的主角,以英伟达为代表。
  • TPU:谷歌为 AI 定制的 “专用机”,同样在数据中心干活,胜在专一、高效。
  • NPU:装在手机、电脑里的 “省电小能手”,负责在你身边、本地处理日常的 AI 任务。

GPU、TPU 与 NPU 核心区别总结

再粗略一点记:GPU 和 TPU 主要待在 “云端”(数据中心)干重活;NPU 则待在你的“手边”(终端设备)干轻活。(当然了,现实中它们的界限没这么绝对,但这么记,足够让你先建立起一个清晰的全局印象了。)

算力,是整个大模型世界的地基。也正因为它这么关键,高端 AI 芯片(尤其是英伟达的 GPU)才成了眼下最紧俏、最具战略意义的资源——这也是 “算力” 会三天两头登上新闻的原因。

显存

还有一个经常和 “算力” 一起出现的词,那就是——“显存”。算力决定的是 “计算得快不快”,而显存决定的是 “一次能装下多大的模型”。

它们两个就像一辆卡车的 “马力” 和 “车厢大小”,跑大模型时缺一不可。在后续《大模型本地部署》这门课程中,我们也会详细介绍。

大模型算力与显存的核心区别通俗比喻:算力就像卡车的马力决定模型跑得快不快,而显存就像卡车的车厢大小决定一次能装下多大的模型参数,两者缺一不可

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号