
5060Ti 16G、V100 32G 本地推理 Qwen3.6-27B Q4 量化谁更胜一筹?
接上期《5060Ti 16G、V100 32G 跑 LTX-2.3 文生视频谁更胜一筹?》 5060Ti 跑文生视频把 V100 按在地上摩擦,速度翻倍显存减半,今天评测另一个方向:本地大模型推理。
测试硬件和环境信息上期已经详细介绍过了。

测试 Ollama+Q4_K_M
本次推理框架采用 Ollama,毕竟显存就那么点大,跑个 Q4_K_M 的量化版差不多了。
第一组测试 Qwen3.6-27B Q4_K_M,模型大小:18GB,上下文:32K。
5060Ti 模型大小已经超过显存容量,可以看到 Ollama 采用了 CPU + GPU 混合推理,CPU 使用 21%,GPU 使用 79%,显存使用 15G,内存最高占用 15.4G,最后的推理速度可想而知:3.52 Token/s。

V100 整个模型可以完全放入显存,是完全使用 GPU,显存使用 19.17GB,内存最高占用 5.8G,推理速度:30.74 Token/s。

这里出现了接近8.7倍性能差距,原因并不是 5060Ti 算力不够,而是模型已经超过了 16G 显存容量,大量权重需要通过 PCIe 在系统内存和显存之间来回搬运,加上 X99 的测试环境 PCIe 只有 3.0,不能以 PCIe 5.0 x8 速度传输,只能获得约 1/4 速度 ≈ 7.88 GB/s,此时推理性能瓶颈已经从 GPU 算力变成了 PCIe 带宽 和 内存延迟。
测试 vLLM+NVFP4
最后不死心,想看看能不能通过 Blackwell 架构的 NVFP4 扳回优势,上了 vLLM 框架进行推理,结局很残酷,虽然模型已经加载成功了,但没有更多的显存分配给 KV Cache,差个 2.06G 才能跑起来。

测试总结

所以对于 16G 显存的 5060Ti 来说,想要获得比较理想的本地推理体验,模型最好能够完整装入显存。以目前主流 GGUF Q4_K_M 量化为例,13B 左右的模型是相对稳的选择。