小伙伴们肯定经常听到 “算力” 这个词,但它到底是什么呢?说白了,算力就是计算机做数学运算的能力。而大模型的训练和运行,本质上就是在做海量的数学计算(主要是矩阵乘法)。
所以,算力就是大模型的 “发动机”——模型越大,需要的算力就越猛。而提供这份算力的,主要是 3 种专门的芯片:GPU、NPU、TPU。这一节,我们来带大家把它们彻底搞清楚。

为什么传统的 CPU 不够用了?
提到芯片,我们最熟悉肯定是 CPU(中央处理器),它是计算机的 “大脑”。CPU 很聪明、也很全能,但它有个特点:核心数量少,更擅长一件一件、按顺序地处理复杂任务。
打个比方,CPU 就像几位博学的大学教授:单兵作战能力极强,再难的题都能解,但人数就那么几个。
而大模型要做的,是另一种活儿——把海量又简单又重复的数学题(成千上万个数字相乘、相加),同时一起算出来。这种 “人海战术” 的活儿,几位教授反而忙不过来。
于是,专门擅长 “并行计算”(一大堆运算同时进行)的芯片就登场了,那就是——GPU。

GPU:从打游戏 “转行” 的算力主力
GPU,也就是 “Graphics Processing Unit(图形处理器)”,它最早是为了打游戏、渲染画面而生的。因此,很多喜欢玩游戏的小伙伴会对它比较了解(比如什么 5090、4090 等)。
为什么 GPU 能够跑大模型呢?这是因为渲染游戏画面,本身就是在同时计算屏幕上成千上万个像素点,它天生就是个 “并行计算” 的活儿。所以 GPU 里塞了成百上千个小核心,特别擅长 “一大堆运算同时开工”。
接着上面的比方:如果说 CPU 是几位大学教授,那么 GPU 就像几千个小学生——每人只做简单的加减乘除,但人多力量大。而大模型要的,恰恰就是这种海量又简单的重复计算。于是,原本用来打游戏的 GPU,一不留神成了 AI 时代的 “算力主力”。

目前,无论是训练大模型,还是跑大模型推理,GPU 都是绝对的主流选择。其中,英伟达(NVIDIA)的 GPU 几乎处于统治地位,我们经常听到的 H100、H200 等 “明星芯片”,都出自它家。
AI 时代的 “卖铲人”
我们可能都听过这样一个故事:当年美国西部淘金热,真正赚大钱的往往不是那些苦逼挖金子的人,而是那些在路边卖铲子的人。
大模型时代的 “铲子”,就是算力。而英伟达(NVIDIA)的 GPU 几乎处于统治地位,它毫无悬念地成了最赚钱的 “卖铲人”。更有趣的是,英伟达的创始人黄仁勋,无论春夏秋冬,每次开产品发布会都雷打不动地穿着一件标志性的黑色皮衣,因此被网友们戏称为 “皮衣刀客”。
现在搞 AI 的公司基本赚不了什么钱,而英伟达却赚得盆满钵满,一跃成为全球市值最高的公司。果然还是卖铲子的赚钱啊!

TPU:谷歌为 AI 量身定做的 “专用机”
TPU,也就是 “Tensor Processing Unit(张量处理器)”,它是谷歌(Google)专门为 AI 计算定制的一款芯片。
TPU 名字中的 “Tensor(张量)”,是深度学习里最基础的数据形式(你可以粗略理解成 “一大堆排好队的数字”)。TPU 干的,就是专门加速这种张量运算。
和 “什么都能干一点” 的 GPU 不同,TPU 是个 “专才”——它把电路设计得只为 AI 计算服务。
- 好处是:在它擅长的活儿上,往往跑得更快、更省电。
- 代价是:通用性不如 GPU 灵活。
谷歌自家的大模型(比如 Gemini),主要就是用 TPU 训练出来的,它也通过谷歌云对外开放使用。我们可以把 TPU 理解成:一条为 AI 计算专门搭建的 “流水线”,只做这一种活儿,但做得又快又省。

NPU:装进你手机里的 “AI 小助手”
NPU,也就是 “Neural Processing Unit(神经网络处理器)”,它同样是为 AI 计算而生,但它主打的是另一个战场——你的手机、电脑等终端设备。
现在的智能手机芯片里,基本上都集成了 NPU(比如苹果的 “神经网络引擎”、华为麒麟的 NPU、高通的 NPU)。这两年火起来的 “AI PC”,靠的也是芯片里的 NPU。
NPU 的核心使命是:在设备本地,又快又省电地处理日常的 AI 任务——比如人脸解锁、照片的智能美化、语音助手、实时字幕,以及在手机上跑一些小模型。
为什么要使用它呢?因为这些活儿如果全传到云端去算,既慢又费流量、还涉及隐私。NPU 就像一个嵌在你设备里的 “AI 小助手”,省电、贴身、随叫随到。

GPU、TPU、NPU 之间的区别
大模型计算,主要用的就是 “GPU、TPU、NPU”(注意不包括 CPU,因为 CPU 不适合),它们之间的区别如下:
- GPU:最全能的 “算力主力”,是数据中心里训练、运行大模型的主角,以英伟达为代表。
- TPU:谷歌为 AI 定制的 “专用机”,同样在数据中心干活,胜在专一、高效。
- NPU:装在手机、电脑里的 “省电小能手”,负责在你身边、本地处理日常的 AI 任务。

再粗略一点记:GPU 和 TPU 主要待在 “云端”(数据中心)干重活;NPU 则待在你的“手边”(终端设备)干轻活。(当然了,现实中它们的界限没这么绝对,但这么记,足够让你先建立起一个清晰的全局印象了。)
算力,是整个大模型世界的地基。也正因为它这么关键,高端 AI 芯片(尤其是英伟达的 GPU)才成了眼下最紧俏、最具战略意义的资源——这也是 “算力” 会三天两头登上新闻的原因。
显存
还有一个经常和 “算力” 一起出现的词,那就是——“显存”。算力决定的是 “计算得快不快”,而显存决定的是 “一次能装下多大的模型”。
它们两个就像一辆卡车的 “马力” 和 “车厢大小”,跑大模型时缺一不可。在后续《大模型本地部署》这门课程中,我们也会详细介绍。

