
5060Ti 16G、V100 32G 本地推理 Gemma4 12B 实测对比
接上期《5060Ti 16G、V100 32G 本地推理 Qwen3.6-27B Q4量化谁更胜一筹?》,Qwen3.6-27B 因为模型超过显存容量,5060Ti 不得不进行 CPU+GPU 混合推理,最终被 V100 拉开了接近 9 倍的差距。

这一期我们换一个思路,选择能够完整装入显存的模型,看看当两张卡都能实现纯 GPU 推理时,结果又会如何。
测试环境
本次推理框架依然采用 Ollama,测试模型为 Gemma4 12B Q4_K_M 量化版,模型大小 8.4GB,上下文统一设置为 32K,测试硬件和环境信息之前已经详细介绍过了。

测试结果
首先来看 5060Ti 16G,由于模型大小仅 8.4GB,可以完整驻留在显存中,全程 GPU 100% 运行,显存占用约 9GB,内存最高占用 11.2GB,最终推理速度达到 34.05 Token/s。

再来看 V100 SXM2 32G,同样实现纯 GPU 推理,GPU 利用率 100%,显存占用 9.36GB,内存最高占用 4.7GB,最终推理速度达到 48.85 Token/s。

这一次两张卡都没有出现显存溢出,也没有发生 PCIe 回传,因此测试结果更能体现显卡本身的推理能力。
最终 V100 依然领先,大约比 5060Ti 快了 43%。

测试总结
很多人可能会觉得意外,毕竟 5060Ti 属于更新的 Blackwell 架构,而 V100 已经是 2018 年发布的数据中心显卡,但对于大语言模型推理来说,当模型能够完全装入显存后,瓶颈往往不再是 PCIe,而是显存带宽。
5060Ti 虽然拥有更新的 Tensor Core 和更先进的低精度计算能力,但其显存带宽为 448GB/s,而 V100 SXM2 32G 配备 HBM2 高带宽显存,带宽高达 900GB/s,几乎是 5060Ti 的两倍。
大语言模型本质上需要不断从显存中读取海量权重进行计算,因此显存带宽往往直接决定了推理速度,这也是为什么在模型能够完整驻留显存的情况下,V100 依然能够保持明显领先。不过从另一个角度来看,5060Ti 的表现其实已经相当不错。
毕竟它只是一张定位中端的消费级显卡,在显存带宽只有 V100 一半的情况下,依然能够达到 V100 约 70% 的推理性能,相比上一期 Qwen3.6-27B 的 3.52 Token/s,这次提升到了 34.05 Token/s,性能直接提升接近 10 倍。
这也再次验证了一个结论:对于本地大模型推理来说,模型能否完整装入显存,往往比显卡架构本身更重要,当模型放不进显存时,再强的 GPU 也会被 PCIe 和内存拖垮;而当模型能够完整驻留显存后,显卡之间的差距才会真正回到算力和显存带宽本身,下期开始我决定将 5060Ti 放到 PCIE 5.0 + DDR5 的配置中重新测试,看看推理速度是否有质的飞跃!