大模型显卡需求速查表:推理、训练、微调显存公式与选型指南

大模型显卡需求速查表:推理、训练、微调显存公式与选型指南

大模型显卡需求速查表:推理、训练、微调显存公式与选型指南

选型最怕拍脑袋。一张卡到底能不能跑下某个模型,核心看显存算力两个维度。本文给出可落地的估算公式和主流显卡对照,采购/部署前花 5 分钟算一遍,少踩坑。

一、显存需求估算

1.1 推理(inference)

推理只需存模型权重 + 少量激活值。显存 ≈ 参数量 × 每参数字节数:

| 精度 | 每参数字节 | 7B 模型显存 | 70B 模型显存 | | --- | --- | --- | --- | | FP16/BF16 | 2 B | ≈ 14 GB | ≈ 140 GB | | FP8 | 1 B | ≈ 7 GB | ≈ 70 GB | | INT4(量化) | 0.5 B | ≈ 3.5 GB | ≈ 35 GB |

经验公式:每 10 亿参数(1B)约需 1~4 GB 显存,取决于量化程度。INT4 量化后 7B 只要 3.5~4 GB,消费级 8GB 卡都能跑。

1.2 训练 / 微调(training / fine-tuning)

训练时显存 = 参数 + 梯度 + 优化器状态 + 激活值,远大于推理:

  • 全精度(FP32)训练:约 12~16 倍参数量(7B ≈ 84~112 GB)
  • 混合精度(FP16/BF16)训练:约 6~10 倍参数量(7B ≈ 42~70 GB)
  • LoRA 等参数高效微调(PEFT):只训练少量适配器,显存可压到 2~3 倍参数量(7B LoRA ≈ 15~20 GB)
经验公式:混合精度训练每 1B 参数约需 6~10 GB;LoRA 微调可降一个数量级。

1.3 一个常用近似公式

显存 ≈ 1.2 × (模型参数 × 2) + (batch_size × seq_len × d_model × 8)

前半段是权重+常量的基准开销,后半段是激活值随 batch/序列长度线性增长的部分。公式用于快速估算上限,精确值以实测为准。

二、算力需求

  • 训练:涉及前向 + 反向 + 优化器更新,算力需求远高于推理。通常需要 A100/H100 级卡,且多卡并行(数据并行 / 张量并行 / 流水线并行)。
  • 7B 全参训练:单卡 A100 80GB(混合精度 + 梯度累积)勉强可行;
  • 100B+:需 8~32 张 A100/H100 配合模型并行。
  • 推理:仅前向,对算力要求低。中端卡(3090/4090)或推理卡(T4/L4)即可,重点看显存和吞吐/延迟。

三、训练 vs 推理的显存比例

以显存为基准,训练与推理需求比例约 5:1 ~ 10:1(训练需要 5~10 倍显存)。例如:

  • 训练 7B:1 张 A100 80GB 或 2 张 4090 48GB;
  • 推理 7B:单张 3090 24GB(FP16)甚至 8GB 卡(INT4 量化)。

四、主流显卡速查

| 显卡 | 显存 | 定位 | 可跑典型模型(推理) | | --- | --- | --- | --- | | RTX 3090/4090 | 24 GB | 消费级旗舰 | 7B~13B FP16 / 7B~34B INT4 | | RTX 6000 Ada | 48 GB | 专业级 | 13B~34B FP16 / 70B INT4 | | A100 | 40/80 GB | 数据中心 | 70B FP16 / 多卡训练 | | H100 | 80 GB | 数据中心旗舰 | 大模型训练首选 | | T4 / L4 | 16/24 GB | 推理专用 | 7B~13B 推理 |

五、降低显存的关键手段

  1. 量化:GPTQ / AWQ / GGUF 把权重压到 INT4/INT8,显存直接砍半到 1/4;
  2. 模型并行:张量并行 + 流水线并行分摊单卡压力,代价是通信开销;
  3. 参数高效微调:LoRA / QLoRA 只训适配器,Q-LoRA 还能在 4-bit 量化上微调,24GB 卡也能微调 7B;
  4. 梯度检查点 / 激活重计算:用时间换空间,降低激活值显存。

六、选型一句话建议

  • 只做推理:先看显存够不够放权重(量化后),4090/3090 性价比最高;
  • 做微调:LoRA 优先,24GB 卡可玩 7B,70B 需 80GB+;
  • 做预训练:直接上 A100/H100 多卡集群,别指望消费级卡。

参考资料

  • 微信公众号《大模型微调显存优化》系列
  • 知乎「不同精度下算力/显存对比」讨论
  • 个人部署实践整理
编辑于 2026-08-16 · 著作权归作者所有