笔记本能否同时使用独显和外接显卡进行AI计算?

可以的,llama.cpp支持多卡联合推理,相关参数如下:

  • --device
  • --tensor-split
  • --split-mode

我在AMD轻薄本上通过USB4外接一张A卡9070,这个eGPU作为主力,不够的显存用笔记本上的iGPU(核显880M+128bit双通道内存)来补:

  • 跑Qwen3.6-27B-Q4_K_XL,开MTP,生成速度有20tps。
  • 跑Qwen3.6-35B-A3B-Q4_K_XL,生成速度有40tps。

速度虽然不快,好在eGPU(58W)和iGPU(27W)的功率都很温和,风扇噪音小,硬件寿命友好。

iGPU(880M)+eGPU(9070)双卡推理

我用的几个参数如下:

--device Vulkan0,Vulkan1 # 我用的是Vulkan后端,ROCm和CUDA后端写法不同
--tensor-split 70,30     # 结合模型占用显存大小,根据显卡显存分配负载
--split-mode layer       # 分割模式默认是layer,使用ROCm和CUDA后端可以尝试使用tensor并行计算

结合模型占用显存大小,根据显卡显存分配负载:

--tensor-split 70,30 的算法:
70%=16/23*100 (9070显存16GB,模型Qwen3.6-35B-Q4_K_XL所需显存总量为23GB)
30%=100%-70% (剩下部分由第2块显卡880M存放)

编辑于 2026-07-31 · 著作权归作者所有