大模型参数量

如果小伙伴们接触过开源大模型,一定会发现一个规律:几乎所有大模型的名字后面,都跟着一个带有字母 “B” 的小尾巴。比如:

DeepSeek-671B、Qwen-72B、Llama-8B

那么,这个频繁出现的 “B” 究竟代表什么?前面的数字又是什么意思呢?今天我们就来聊一聊大模型世界里最核心的指标——参数量

大模型的参数是什么?

如果我们把大模型比作人类的大脑,那么 “参数” 就相当于大脑里的 “神经突触”。而大模型的参数量,直接代表了它的 “脑容量”。

上一节我们讲过,大模型底层全是在做复杂的矩阵计算。当它在 “预训练” 阶段疯狂吸收全人类的知识时,其实只在干一件事:不断微调内部那些密密麻麻的数学权重和偏差值。而这些能够被调节的权重和偏差,就统称为 “参数”。

大模型参数通俗比喻:像调音台一样,在预训练中被调节的数学权重与偏差旋钮

我们可以把大模型想象成一个拥有无数个 “音量旋钮” 的超级调音台。每学一点新知识,它就会把某些旋钮拧大一点、把另一些拧小一点。

大模型学习过程图解:通过调大或调小参数旋钮,来记忆数学定律与代码逻辑

经过几个月、烧掉几千万美元的训练后,这无数个旋钮最终被固定在一个最合适的角度。大模型学到的所有数学定律、唐诗宋词、代码逻辑等,最终都会变成数字,存进这海量的旋钮(参数)里。

这里需要厘清一个容易搞混的概念:参数量好比大脑的 “容量”,而训练数据则好比它“读过多少书”——这是两码事。

一个模型要想真聪明,光有大容量还不够,还得喂给它足够多、足够优质的数据。只堆参数、却没喂够好数据,照样是个 “绣花枕头”。

名字里的 7B、72B 到底有多大?

大模型名字后缀里的这个字母 “B”,其实是英文 “Billion(十亿)” 的缩写。比如:

  • 7B:代表这个模型拥有 70 亿个参数。
  • 72B:代表这个模型拥有 720 亿个参数。
  • 千亿大模型:比如 400B 或者更大,代表它拥有几千亿个参数。

大模型名字后缀 7B 与 72B 的含义:B 代表 Billion (十亿) 参数量

为了让小伙伴们对这个规模有个直观的感受,我们可以拿人类的大脑来做个对比。

科学界普遍认为,一个成年人的大脑大约拥有 100 万亿个神经突触。而目前最顶级的超大规模 AI(如 GPT),其参数量据业界估计在 1.8 万亿(也就是万亿级)这个量级(各家官方一般并不公开确切数字)。虽然离人脑还有不小差距,但在某些特定领域,它的能力已经逼近、甚至超过了人类专家。

参数量越大越好吗?

对于不懂技术的普通人来说,第一反应多半是:“既然参数量越大,大模型就越聪明,那我直接无脑选最大的不就完了?”

实际上,天下没有免费的午餐。参数量的大小,其实是一场残酷的博弈:智商天花板 vs 硬件燃烧速度

1. 参数越大的好处

我们在前面 “涌现能力” 一节讲过,当参数量跨过某个临界点时,大模型就会突然觉醒某些高级推理能力。

一个小参数模型(比如 1B 或 3B),顶多帮你坐坐简单的中英文翻译,或者写几句干巴巴的营销文案。但当参数量飙到 72B、甚至几千亿时,它就能轻松推导复杂的数学题、读懂深奥的医学论文,甚至帮你重构几千行的复杂代码。

不过要特别提醒一句:参数量并不是衡量大模型聪不聪明的唯一标准。同样是 7B 模型,用的训练数据和训练方法不同,水平也能差出十万八千里。

事实上,靠着更优质的数据和更先进的训练,如今不少新出的小模型,实力反而能反超过去那些更老、更大的模型。所以千万别一看参数大,就觉得它一定更强。

大模型参数越大的好处:涌现出复杂逻辑推理与重构代码能力

2. 参数越大的代价

大模型在干活(也就是 “推理”)的时候,必须把所有的参数加载到显卡(GPU)的显存(VRAM)里。业界有一个简单粗暴的计算公式:

10 亿个参数(1B)大约需要占用 2GB 的显存

也就是说,如果我们想要在本地(即自己电脑)运行一个 7B 的模型,至少得有16GB 的显存才行——目前市面上的高端游戏本,勉强能扛得动。我看了一眼自己那台 “老破小”,只能默默叹了一口气。

而要是想跑一个 72B 的中大型模型,那就得用上大约 150GB 的显存了,至少需要两张顶级显卡(比如 A100)才行。而一张 A100 就要 5 到 10 万块——这显然不是普通人能负担得起的了。

运行大模型的显存代价:1B 参数约占用 2GB 显存,72B 需双卡 A100 运行

拯救普通人的 “量化” 黑科技

看到这里,很多小伙伴可能要绝望了:“那我这台普通电脑,岂不是连最小的 7B 模型都跑不起来?” 别担心。为了让大模型走进千家万户,研究人员发明了一种强大的空间压缩技术——量化(Quantization)

量化技术的原理很简单,就像是把体积巨大的无损 WAV 音乐,压缩成了听不出太大差别的 MP3 格式。通过 4-bit 量化技术,原本需要 16GB 显存的 7B 模型,现在只需要 6GB~8GB 显存就能完美流畅运行!也就是说,只要我们有一台主流的普通游戏本,就能在本地跑起属于自己的大模型。

关于怎么利用量化技术在本地部署大模型,我们将在后续上线的 《大模型本地部署》 这个教程中再详细介绍。

大模型如何选型?

如果你是一名开发工程师,在将 AI 接入商业项目时,应该怎么选参数量呢?我们可以直接套用下面 “大杯、中杯、小杯” 选型策略:

  • 端侧微型模型(0.5B - 3B)
    • 运行环境:智能手机、网页前端浏览器、树莓派。
    • 业务场景:手机上的离线语音助手、极其简单的文本分类。它非常轻量,但不具备复杂的逻辑思考能力。
  • 轻量级主力模型(7B - 14B)
    • 运行环境:普通家用电脑、单张高性价比显卡服务器。
    • 业务场景:这是目前普通开发者玩得最多、性价比也最高的区间,适合用来做知识库问答、客服聊天机器人、文章摘要等。它能听懂人话,但碰上复杂的数学题或长篇代码,依然容易翻车。
  • 企业级中坚力量(32B - 72B)
    • 运行环境:多卡企业级服务器集群。
    • 业务场景:这是中大型公司做私有化部署的 “甜点区间”。在这个规模下,模型已经具备相当不错的逻辑推理和写代码能力,能胜任绝大多数复杂的商业任务(比如合同审计、金融数据分析)。
  • 云端超大模型(千亿至万亿级别)
    • 运行环境:大厂的超级智算中心。
    • 业务场景:直接调用大厂的闭源 API(比如 GPT 系列、Claude 系列)。当你要处理变态级的深层逻辑、或者搭建全自动的 AI Agent 智能体 时,直接花钱买顶级算力,往往是最稳妥的选择。

总而言之,参数量(B)可不是一个冷冰冰的数字,它直接代表了 AI 大模型实力的 “段位”。选大模型就像选车,千亿大模型是重型卡车,力大无穷但极其耗油;7B 模型是灵巧小轿车,省油且便宜。

大模型选型比喻:如耗油重卡的千亿级超大模型 vs如省油轿车的7B 轻量级模型

如果想要成为一名真正优秀的开发者,我们不应该一味追求最大的参数,而是懂得根据业务场景和预算,选择性价比最高的大模型。

最后说一句:咱们这篇文章聊的这些显存、选型,主要是针对要 “自己部署” 模型的开发者。如果小伙伴们平时只是用用 ChatGPT、或者调用各家的在线 API,那这些完全不用操心——对于参数多大、要几张显卡,大厂在后台早就替你搞定了。

上一篇:

下一篇:

给站长反馈

绿叶网正在不断完善中,小伙伴们如果发现任何问题,还望多多给站长反馈,谢谢!

邮箱:lvyenet@vip.qq.com

「绿叶网」服务号
绿叶网服务号放大
关注服务号,微信也能看教程。
绿叶网服务号