量化、精度、MoE,显卡参数和大模型的那点事

量化、精度、MoE,显卡参数和大模型的那点事

今天没别的内容,就是给弄不清楚的新手玩家梳理一下显卡的技术参数,诸如显存、位宽、带宽、计算精度,和大模型的技术名词有什么关联。



算力不等于存力,这是最容易被忽视的起点

刚接触大模型本地部署的玩家,最容易陷入一个思维定式:盯着显卡的算力,觉得TFLOPS越高推理速度就越快。但真正上手后才发现,模型加载阶段直接报错"Out of Memory",连跑起来的机会都没有。这是因为大模型部署的第一道门槛,从来不是算得快不快,而是装不装得下。显存容量决定了你能不能把模型加载进显卡,算力只决定了加载之后生成Token有多快,两者的优先级必须分清楚。很多人把精力花在对比CU核心数量上,却连自己的显存能不能装下模型都没算过,这是新手最常走的弯路。



总参数量才是显存容量的硬锚点

一个模型的总参数量,直接决定了它需要占多大显存。这个关系非常线性:参数数量乘以每个参数占用的字节数,就是模型加载时的基础显存需求。比如一个700亿参数的模型,如果每个参数用FP16精度存储(占用2字节),那光是模型权重就需要大约140GB显存。这还没算推理过程中需要的KV Cache和中间激活值。



精度就是显存需求最直接的调节旋钮

既然显存装不装得下取决于总参数乘以每个参数的字节数,那字节数就成了唯一可以灵活调节的变量。这也就是量化的本质:用更少的比特数来表示原本的浮点数。FP32占4字节,FP16占2字节,INT8占1字节,INT4只占0.5字节。同样一个700亿参数的模型,FP16需要140GB显存,INT8只需要70GB,INT4更是只需要35GB。

精度降低带来的好处立竿见影,但代价同样明显:模型输出的质量会下降,尤其是数学推理和多步逻辑任务上表现最敏感。所以量化不是无脑压缩,而是在显存容量和模型智商之间做权衡。很多时候,与其花大价钱买多卡跑高精度,不如接受少量质量损失换取单卡部署的便利。新手常见的错误,是把量化后显存占用的下降误解为"模型变小了",实际上模型的参数量完全没有变化,只是每个参数的存储密度变高了。



位宽和带宽决定了参数能被喂得多快

模型加载进显存之后,推理速度的瓶颈就从显存容量转移到了显存带宽。显存带宽由位宽和频率共同决定,它直接影响了显卡每秒钟能从显存中读取多少数据参与计算。大模型推理属于典型的"带宽敏感型"任务,因为在生成每个Token时,大量参数需要从显存搬运到计算单元。搬运速度越快,生成速度就越快。

而位宽相当于道路的车道数,频率相当于车速,两者的乘积就是总吞吐量。高端显卡和入门显卡的核心算力差距可能只有几倍,但显存带宽的差距往往超过十倍,这直接反映在大模型生成Token的速度上。经常有人买了显存容量够大的卡,却发现推理速度慢得离谱,根本原因就在于位宽和带宽被严重缩水,数据喂不到计算单元里去。


常见本地AI部署设备显存带宽


MoE改变了计算负担,但没有改变存储负担

MoE(混合专家模型)架构的精妙之处,在于它用"稀疏激活"打破了密集模型"参数越多推理越慢"的魔咒。传统密集模型的每个参数在每次推理中都要参与计算,所以参数量翻倍,推理速度就减半。

而MoE模型的总参数量虽然可以膨胀到很大,但每个Token只激活少数几个“专家”,实际参与计算的参数量远小于总数。这就是MoE模型能把推理价格打下来的根本原因。但这个优势只体现在计算层面,不体现在存储层面。

部署MoE模型时,显存容量依然要按总参数量准备,只有推理速度可以按激活参数量来估算。很多人把这两者混为一谈,以为MoE能用更少的显存跑更大的模型,这是对架构的根本误解。更准确的理解是:MoE让你为庞大的知识储备支付一次性显存成本,但每次使用时的电费和时间成本都被大幅压低。


图片来自网络


理解了这几层关系,选卡就不会再被带偏

把显存容量、精度、总参数量、激活参数量、位宽和带宽这几件事串起来看,选显卡的逻辑就清晰了:第一步看显存容量够不够装下目标模型在某个精度下的权重,这是能不能跑的底线;第二步看带宽够不够支撑可接受的推理速度,这是跑得快不快的保证;最后才看算力峰值,因为大模型推理对算力的敏感度远低于带宽。

很多显卡的营销话术喜欢强调TFLOPS多高,但真正懂行的人第一眼看的是显存规格。参数表里的位宽是192bit还是384bit,带宽是几百GB/s还是超过1.5TB/s,这些东西比CU核心数量更直接地决定了你在本地跑大模型的体验。



多卡互联要留意

当单张显卡装不下模型(比如120B参数)时,就需要多张显卡并行工作。张量并行时会把模型参数切分到多张显卡上,每张显卡负责存储和计算一部分参数,这样多张显卡的显存容量可以累加,但显卡之间的通信开销也会随之增加,此时性能瓶颈就从单张显卡的显存带宽,变成了多张显卡之间的互联带宽。NVLink桥接的显卡本质上也是插在主板PCIe插槽上的显卡,只是额外多了一条绕过主板和CPU、专用于显卡间直接数据交换的高速通道,而普通显卡仅靠PCIe通道经CPU中转通信,这种差异在多显卡并行场景下对推理速度的影响极大。不过需要特别留意的是,并非所有显卡都支持NVLink,许多消费级显卡(如RTX 40系列)已经从硬件层面移除了NVLink接口,即使主板和驱动支持也无法启用这条高速通道。所以如果打算组建多卡系统,不仅要看单张显卡的显存和算力规格,还要关注主板和显卡之间的互联方案。



另外对喜欢捡垃圾的小伙伴说一下,很多服务器淘汰的商业级计算卡,乍看参数不错,比如HBM显存+庞大的CU单元,但由于设计年代久远(例如NVIDIA Tesla V100、AMD Radeon Instinct MI50等等),可能完全不支持FP16、INT8等对深度学习至关重要的低精度计算,量化大模型根本无从谈起,实用性大打折扣,可不要贪小便宜哦!


编辑于 2026-07-15 · 著作权归作者所有