5060Ti 16G 换平台后本地推理 27B 大模型性能暴涨 164%

5060Ti 16G 换平台后本地推理 27B 大模型性能暴涨 164%

接上期《5060Ti 16G、V100 32G 本地推理 Gemma4 12B 实测对比》,前两期我们分别测试了 Qwen3.6-27BGemma4 12B 两个模型,也得出了一个比较明确的结论:

当模型能够完整装入显存时,决定推理性能的主要是显卡本身,因此虽然 RTX 5060 Ti 的显存带宽只有 V100 的一半,但依然能够发挥出约 70% 的推理性能。

而当模型超过显存容量时,情况就完全不同了。

在上一期的 Qwen3.6-27B 测试中,5060Ti 不得不采用 CPU + GPU 混合推理,推理速度只有 3.52 Token/s,最终被 V100 拉开了接近 9 倍的差距。

这一期,我们保持 RTX 5060 Ti 16GB 不变,仅升级整个平台进行复测,将它从之前的 PCIe 3.0 + DDR4 平台,更换到了 PCIe 5.0 + DDR5 的新平台,并确认显卡运行在 PCIe 5.0 x8 模式下。

同样的显卡、同样的模型、同样的推理框架,仅更换平台,看看性能究竟会发生多大的变化。

测试平台

之前测试 RTX 5060 Ti 时,它一直安装在一台比较老的平台上:

旧平台

  • PCIe 3.0
  • DDR4 内存
  • RTX 5060 Ti 16GB

这套机器主要是为了兼容老硬件,所以一直作为测试平台使用。

这次,我把 5060 Ti 换到了游戏主机:

新平台

  • Intel Core i5-14600KF
  • Z790 主板
  • DDR5 6400 32GB
  • PCIe 5.0 x8(GPU-Z 实测确认)

显卡保持完全一致,只更换平台,其余测试环境保持一致。

测试模型

本次继续测试之前使用过的两个模型:

  • Qwen3.6-27B(Q4_K_M)
  • Gemma4 12B(Q4_K_M)

这样可以直接和之前的数据进行对比。

测试结果

Qwen3.6-27B

平台推理速度
PCIe 3.0 + DDR43.52 tokens/s
PCIe 5.0 + DDR59.28 tokens/s

性能提升:164%

这也是最让我惊讶的一组数据。

以前问一句问题,经常要等三秒左右才开始输出第一个字。

换平台之后,几乎能够做到刚说完问题,模型就开始生成回复

虽然 9 tokens/s 算不上特别快,但已经从”体验很差”进入了真正可以日常使用的区间。

Gemma4 12B

平台推理速度
PCIe 3.0 + DDR434.05 tokens/s
PCIe 5.0 + DDR540.05 tokens/s

性能提升:18%

看到这里,很多人可能会觉得:

“怎么才提升 18%?”

其实不能只看百分比。

原本 34 tokens/s 已经属于比较高的速度,在这个基础上还能继续提升近两成,说明平台依然会对推理效率产生一定影响。

为什么一个提升 164%,另一个只有 18%?

因为:

12B 可以完整放进显存,而 27B 放不下。

对于能够完整驻留在显存中的模型来说,整个推理过程几乎都发生在 GPU 内部。因此决定速度的主要因素就是:

  • GPU 算力
  • 显存带宽
  • Kernel 优化

CPU、内存和 PCIe 的影响相对有限。

所以 Gemma4 12B 的提升只有 18%,这是符合预期的。

而对于 Qwen3.6-27B 这种超过显存容量的模型来说,就完全不同了,由于模型无法全部放入显存,推理过程中会不断在 GPU 显存系统内存 之间交换数据,这时候,影响性能的不再只有显卡,还包括整个主机平台:

  • PCIe 带宽
  • 系统内存带宽
  • CPU 内存控制器
  • 平台整体架构

这些因素都会直接影响数据传输效率,也正因为如此,当我把平台升级到 PCIe 5.0 + DDR5 后,27B 模型的推理速度直接提升了 164%。

为什么 DDR5 和 PCIe 会带来这么大的变化?

很多人会认为:

PCIe 3.0 到 PCIe 5.0,带宽翻倍,速度自然翻倍。

实际上并没有这么简单。

真正发挥作用的是多个因素共同叠加:

  • 更高的 PCIe 带宽,降低了 GPU 与内存之间的数据传输瓶颈;
  • DDR5 相比 DDR4 拥有更高的内存带宽,可以更快地向 GPU 提供数据;
  • 新平台的 CPU、缓存和内存控制器效率更高,整体数据通路更加顺畅。

对于需要频繁访问系统内存的大模型来说,这些提升最终都会体现在推理速度上。

总结

对于超过显存容量的大模型而言,平台的重要性并不亚于显卡。

如果模型能够完整放进显存,升级平台带来的收益通常比较有限,但一旦模型需要频繁访问系统内存,PCIe、DDR5、CPU 以及整个平台架构都会成为影响推理速度的重要因素,所以,如果你觉得自己的大模型跑得慢,不妨先别急着换显卡。真正限制性能的,或许并不是 GPU,而是整个平台。

编辑于 2026-08-11 · 著作权归作者所有