笔记本能否同时使用独显和外接显卡进行AI计算?
可以的,llama.cpp支持多卡联合推理,相关参数如下:
- --device
- --tensor-split
- --split-mode
我在AMD轻薄本上通过USB4外接一张A卡9070,这个eGPU作为主力,不够的显存用笔记本上的iGPU(核显880M+128bit双通道内存)来补:
- 跑Qwen3.6-27B-Q4_K_XL,开MTP,生成速度有20tps。
- 跑Qwen3.6-35B-A3B-Q4_K_XL,生成速度有40tps。
速度虽然不快,好在eGPU(58W)和iGPU(27W)的功率都很温和,风扇噪音小,硬件寿命友好。

我用的几个参数如下:
--device Vulkan0,Vulkan1 # 我用的是Vulkan后端,ROCm和CUDA后端写法不同
--tensor-split 70,30 # 结合模型占用显存大小,根据显卡显存分配负载
--split-mode layer # 分割模式默认是layer,使用ROCm和CUDA后端可以尝试使用tensor并行计算结合模型占用显存大小,根据显卡显存分配负载:
--tensor-split 70,30 的算法:
70%=16/23*100 (9070显存16GB,模型Qwen3.6-35B-Q4_K_XL所需显存总量为23GB)
30%=100%-70% (剩下部分由第2块显卡880M存放)
编辑于 2026-07-31 · 著作权归作者所有