
5060Ti 16G 换平台后本地推理 27B 大模型性能暴涨 164%
接上期《5060Ti 16G、V100 32G 本地推理 Gemma4 12B 实测对比》,前两期我们分别测试了 Qwen3.6-27B 和 Gemma4 12B 两个模型,也得出了一个比较明确的结论:
当模型能够完整装入显存时,决定推理性能的主要是显卡本身,因此虽然 RTX 5060 Ti 的显存带宽只有 V100 的一半,但依然能够发挥出约 70% 的推理性能。
而当模型超过显存容量时,情况就完全不同了。
在上一期的 Qwen3.6-27B 测试中,5060Ti 不得不采用 CPU + GPU 混合推理,推理速度只有 3.52 Token/s,最终被 V100 拉开了接近 9 倍的差距。
这一期,我们保持 RTX 5060 Ti 16GB 不变,仅升级整个平台进行复测,将它从之前的 PCIe 3.0 + DDR4 平台,更换到了 PCIe 5.0 + DDR5 的新平台,并确认显卡运行在 PCIe 5.0 x8 模式下。

同样的显卡、同样的模型、同样的推理框架,仅更换平台,看看性能究竟会发生多大的变化。
测试平台
之前测试 RTX 5060 Ti 时,它一直安装在一台比较老的平台上:

旧平台
- PCIe 3.0
- DDR4 内存
- RTX 5060 Ti 16GB
这套机器主要是为了兼容老硬件,所以一直作为测试平台使用。
这次,我把 5060 Ti 换到了游戏主机:

新平台
- Intel Core i5-14600KF
- Z790 主板
- DDR5 6400 32GB
- PCIe 5.0 x8(GPU-Z 实测确认)
显卡保持完全一致,只更换平台,其余测试环境保持一致。
测试模型
本次继续测试之前使用过的两个模型:
- Qwen3.6-27B(Q4_K_M)
- Gemma4 12B(Q4_K_M)
这样可以直接和之前的数据进行对比。
测试结果
Qwen3.6-27B

| 平台 | 推理速度 |
|---|---|
| PCIe 3.0 + DDR4 | 3.52 tokens/s |
| PCIe 5.0 + DDR5 | 9.28 tokens/s |
性能提升:164%
这也是最让我惊讶的一组数据。
以前问一句问题,经常要等三秒左右才开始输出第一个字。
换平台之后,几乎能够做到刚说完问题,模型就开始生成回复。
虽然 9 tokens/s 算不上特别快,但已经从”体验很差”进入了真正可以日常使用的区间。
Gemma4 12B

| 平台 | 推理速度 |
|---|---|
| PCIe 3.0 + DDR4 | 34.05 tokens/s |
| PCIe 5.0 + DDR5 | 40.05 tokens/s |
性能提升:18%
看到这里,很多人可能会觉得:
“怎么才提升 18%?”
其实不能只看百分比。
原本 34 tokens/s 已经属于比较高的速度,在这个基础上还能继续提升近两成,说明平台依然会对推理效率产生一定影响。
为什么一个提升 164%,另一个只有 18%?
因为:
12B 可以完整放进显存,而 27B 放不下。

对于能够完整驻留在显存中的模型来说,整个推理过程几乎都发生在 GPU 内部。因此决定速度的主要因素就是:
- GPU 算力
- 显存带宽
- Kernel 优化
CPU、内存和 PCIe 的影响相对有限。
所以 Gemma4 12B 的提升只有 18%,这是符合预期的。
而对于 Qwen3.6-27B 这种超过显存容量的模型来说,就完全不同了,由于模型无法全部放入显存,推理过程中会不断在 GPU 显存 与 系统内存 之间交换数据,这时候,影响性能的不再只有显卡,还包括整个主机平台:
- PCIe 带宽
- 系统内存带宽
- CPU 内存控制器
- 平台整体架构
这些因素都会直接影响数据传输效率,也正因为如此,当我把平台升级到 PCIe 5.0 + DDR5 后,27B 模型的推理速度直接提升了 164%。
为什么 DDR5 和 PCIe 会带来这么大的变化?
很多人会认为:
PCIe 3.0 到 PCIe 5.0,带宽翻倍,速度自然翻倍。
实际上并没有这么简单。
真正发挥作用的是多个因素共同叠加:
- 更高的 PCIe 带宽,降低了 GPU 与内存之间的数据传输瓶颈;
- DDR5 相比 DDR4 拥有更高的内存带宽,可以更快地向 GPU 提供数据;
- 新平台的 CPU、缓存和内存控制器效率更高,整体数据通路更加顺畅。
对于需要频繁访问系统内存的大模型来说,这些提升最终都会体现在推理速度上。
总结
对于超过显存容量的大模型而言,平台的重要性并不亚于显卡。
如果模型能够完整放进显存,升级平台带来的收益通常比较有限,但一旦模型需要频繁访问系统内存,PCIe、DDR5、CPU 以及整个平台架构都会成为影响推理速度的重要因素,所以,如果你觉得自己的大模型跑得慢,不妨先别急着换显卡。真正限制性能的,或许并不是 GPU,而是整个平台。