AMD Strix Halo VS DGX Spark对比AI 工作站测评

AMD Strix Halo VS DGX Spark对比AI 工作站测评

www.theregister.com/on-prem/2025/12/25/tested-amds-strix-halo-vs-nvidias-dgx-spark/2098514

本地构建、测试和原型化AI系统的能力如今依然重要。

直到最近,这还需要高端、多GPU工作站,价格常常高达数万美元。随着基于GB10的DGX Spark于十月发布,英伟达着手改变这一现状。虽然性能远不及它强大,但配备了128GB的显存,这台系统本质上是一个装在盒子里的AI实验室,几乎可以运行你交付的任何AI工作负载。

正如我们在最初试用时提到的,Spark既不是首选,也不是最便宜的选择。AMD和苹果还提供大量统一内存的系统,这些内存在CPU和GPU之间共享,这使它们在AI开发者和爱好者中极受欢迎。

Z2 Mini G1a明显更大,一定程度上归功于集成电源和更大的散热方案

AMD 的 Ryzen AI Max+ 395 APU,为了简洁起见,我们接下来就简称为“Strix Halo”,尤其有趣。除了售价为Spark的四分之三到一半外,Strix Halo还基于与公司数据中心产品大致相同的ROCm和HIP软件栈。这提供了更清晰但不一定无缝的从桌面到数据中心的迁移路径。

为了看看Strix Halo与Spark的表现,惠普送来了Z2 Mini G1a工作站,让我们了解这些小盒子TOPS在多种AI工作负载中的表现,从单用户推断、批量推断到微调和图像生成。

系统概述

你首先会注意到的是它的马力明显比Spark大得多。部分原因是英伟达选择了通过USB-C连接的外接电源适配器,而惠普则选择了稍大且集成电源的机箱。

我们通常更倾向于惠普的设计,尤其是因为更大的底盘带来了更坚固的散热方案,尽管Spark的做工和外观明显更为高端。

Spark采用全金属底盘兼作散热片,而G1a更像是惠普产品,外壳虽干净但塑料,外壳覆盖坚硬的金属底盘。这种设计理念的好处是可维修性。进入G1a只需按下机器背面的按钮,滑开顶盖即可。

不过,由于机器使用焊接的LPDDR5x内存,实际上两套系统都没什么可做的。惠普配备了两颗标准的2280 PCIe 4.0 x4 M.2固态硬盘,这些SSD可由用户自行维护。

作为对比,Spark更像家电,不过SSD也可以通过拆除系统底部的磁性板和四颗螺丝来更换。

机器内部装有一对风扇,从前面吸入冷空气,从后面排出。如果你感兴趣,G1a的双M.2固态硬盘就在风扇正下方,这样可以防止风扇在高负载下过热。

在机器的后方,我们看到惠普在I/O方面采取了与英伟达截然不同的策略。

从左到右,我们看到一个2.5 GbE RJ45端口,四个标准USB端口(2个10 Gbps,2个USB 2.0端口),两个40 Gbps的Thunderbolt端口,以及两个迷你DisplayPort。机身侧面有一个3.5毫米耳机-麦克风组合插孔,以及两个额外的10 Gbps USB 3.0接口,标准和USB-C两种形态。

你还会注意到两个空白空间,可以配置任意数量的惠普Flex IO模块,包括串口、USB和千兆端口,2.5 GbE或10 GbE端口。

与此同时,Spark优先考虑多节点AI计算环境的高速网络。电源键旁边有四个USB-C接口,最左边的用于供电。显示输出方面,有一个HDMI端口,还有一个10 GbE RJ45网络端口,以及一对QSFP笼,通过系统内置的ConnectX-7网卡提供200 Gbps的网络带宽。

这些端口旨在实现多个Spark或其他GB10系统集群,使用数据中心中相同的硬件和软件。

据我们了解,你还可以利用G1a的Thunderbolt端口作为高速网络接口,实现多个系统之间的互联,尽管我们未能测试这一用例。

速度与进给

这两种系统都不是各自硅片最便宜的战车。DGX Spark的零售价为3999美元,而HP的Z2 Mini G1a按规格售价约为2950美元。

你可以找到配置类似的GB10和Strix Halo盒子,如果你愿意在存储、连接或I/O上妥协,价格会便宜得多。

惠普、华硕以及其他几家厂商都有原厂版Spark,起价大约3000美元,1TB存储容量。我们还见过配备128GB的Strix Halo系统,售价略高于2000美元,尽管内存短缺似乎推高了价格,而且你将错过“Pro”版本芯片提供的企业级远程管理或内存加密等功能。

DGX 火花HP Z2 Mini G1a(测试中)
平台格蕾丝·布莱克韦尔(GB10)AMD 锐龙 AI Max+ Pro 395
GPU布莱克韦尔Radeon 8060S
中央处理器20核ARM(10x X925 + 10x A725)16颗Zen 5核心,最高5.1GHz
CUDA 核心/流处理器6,1442,560
张量核心 / 计算单元192 第五代40
RT核心48 第四代40
张量(GPU)1 petaFLOPS 稀疏的FP456 teraFLOPS 密度 BF16/FP16(估计)
NPUXDNA 2 50 最高
内存条128 GB LPDDR5x 8533 MT/s128 GB LPDDR5x 8000 MT/s
内存总线256位256位
内存带宽273 GB/s256 GB/s
存储4TB NVMe2x 1TB M.2 TLC NVMe
USB4x USB 3.2 Type-C(20 Gbps)3个USB 3.2型A型(10 Gbps)2个USB 2.0型A型
雷霆1 RJ-45 (10 GbE)2 Thunderbolt 4(40 Gbps)
以太网1RJ-45(10 GbE)1台RJ-45(2.5 Gbps)
NICConnectX-7 200 Gbps瑞昱RTL8125BPH-CG
WiFiWiFi 7联发科WiFi 7
蓝牙蓝牙5.4蓝牙5.4
音频输出HDMI多通道3.5毫米耳机麦克风组合端口
峰值功率适配器功率:240 W电源额定 300 瓦
展示1个HDMI 2.1A2个Mini DisplayPort 2.1 2个Thunderbolt 1个USB Type C(侧面)
操作系统DGX 操作系统Windows 11 Pro / Ubuntu 24.04
尺寸150毫米 x 150毫米 x 50.5毫米85毫米 x 168毫米 x 200毫米
重量1.2公斤2.3公斤
价格3,999美元(建议)零售价2,949美元

所以,如果你对这两套系统感兴趣,但对价格不满意,或许能从其他OEM厂商那里找到更优惠的价格。以GB10系统为例,除了外观,选择原厂重新贴牌而不是创始人版,基本上没什么损失。

CPU 性能

在深入探讨生成式AI性能之前,我们预计大多数人都会关心它,先花点时间谈谈这两台机器各自的CPU。

Strix Halo 是一款相当有趣的处理器。与桌面机类似,它配备了16个全功能Zen 5核心,分布在两个核心复合芯片(CCD)上,主频最高可达5.1 GHz。这些CCD通过先进的封装与处理内存、PCIe和图形处理的I/O芯片结合。

Z2 Mini G1a实际上采用了该芯片的Pro版本,增加了多项硬件安全和管理功能,这对大规模或敏感环境中部署这些系统的企业来说可能具有吸引力。

Spark 的 GB10 Grace Blackwell 超级芯片则配备了与联发科合作开发的 Arm CPU 芯片,包含 10 个 X925 性能核心和 10 个 Cortex A725 效率核心,总共 20 个。

虽然这些核心并不慢,但在我们有限的测试中,Zen 5在Sysbench、7zip压缩/解压和HandBrake转码工作负载中实现了10%到15%的性能提升。

然而,在代表许多高性能计算工作负载的高性能Linpack基准测试中,G1a在1.6 teraFLOPS的双精度表现上是Spark的708 gigaFLOPS的两倍多。我们需要注意的是,这个分数是仅使用X925核心实现的,因为启用A725测试实际上削弱了性能,这表明仍有提升空间。

虽然生成式AI的性能高度依赖于低精度GPU的FLOPS,但Strix Halo更强大的CPU可能使其成为那些寻求运行生成式AI模型的PC而非AI设备的用户更灵活的选择。

生成式AI性能

接下来谈谈GenAI,我们应该稍微谈谈这两种系统的一些性能宣传。

虽然NV声称拥有一千万亿次浮点运算(PETAFLOPS)的AI计算能力,但现实是大多数用户永远无法接近这个数字。原因很简单:要达到这种性能水平,需要结构化稀疏性,而这一特性对推理工作负载几乎没有任何好处

因此,Spark的峰值性能实际上更接近密集的500 teraFLOPS,且仅适用于能够利用FP4数据类型的工作负载。通常这意味着Spark实际上会以8位或16位精度运行,峰值性能分别限制在250和125 teraFLOPS。

持续的表现通常略低于理论水平。在最大可实现MatMul FLOPS(MAMF)基准测试中,我们在BF16实现了101 teraFLOPS,在FP8实现了207 teraFLOPS。

那驱动G1a的Strix Halo部件呢?这里我们看到了AMD最大的弱点之一。虽然 House of Zen 声称其顶级 Strix Halo SKU 拥有 126 个平台 TOPS,但你很难找到任何应用能充分利用这一点。其中50个TOPS由NPU提供,需要专门的软件来加以利用——后面会详细说明。其余的 TOPS 则通过 CPU 和 GPU 实现。

Strix Halo的GPU也不差。据我们估计——AMD实际上并没有给芯片提供峰值浮点性能——GPU能输出约56 teraFLOPS的峰值BF16性能。在MAMF中,我们在46 teraFLOPS下实现了约82%的成功率,这同样不错。

但由于GPU基于AMD较旧的RDNA 3.5架构,它缺乏Spark提供的低精度数据类型支持。

从技术上讲,架构支持 INT8,但性能基本与 BF16 相同。理论上,它应该能提供大约112 TOPS(INT4),但关键是找到真正能以这种精度计算的软件。十六个不同的数值根本无法提供太多细致的细分。

从理论上看,这使Spark在原始AI计算能力上比Strix Halo高出2.2倍到9倍的性能优势。

虽然在我们的测试中多次验证了这一点,但计算只是生成式人工智能的一面。另一个是内存带宽。根据你的使用场景,这甚至可能让AMD和Nvidia系统之间的性能差距不再是问题。

LLM推理

我们将从LLM推理开始,因为它说明了为什么更多的TOPS和FLOPS并不总能转化为更好的AI性能。

为了保持一致,我们大部分测试都在Linux上运行:惠普上的Ubuntu 24.04 LTS和英伟达轻度定制的发行版DGX OS。

仅从Llama.cpp的单批次性能来看——这是消费级CPU和GPU上运行LLM最流行的框架之一——我们可以看到GB10和Strix Halo的token输出速度相近,而AMD机在使用Vulkan后端时则略占领先。

在单用户场景中,令牌生成通常受限于内存带宽。GB10声称约273 GB/s的内存带宽,而AMD的Strix Halo则支持约256 GB/s。

这很可能是许多AI爱好者在Spark首次亮相时感到失望的原因之一。价格在三分之二到一半之间,你就能买到一个同样快速产出代币的Strix Halo盒子。

不过,如果你把注意力转向第一个令牌的时间栏,你会发现GB10的GPU大约比Strix Halo盒子里的快2-3倍,而这还是在处理一个相对较短的256令牌提示时。序列长度越长,这一间隙越明显。这是因为即时处理往往很快会被计算束缚。

对于较短的提示或多回合对话,Llama.cpp的提示缓存大大缓解了性能上的不足。在这种情况下,我们只谈到在AMD平台上多等待一两秒,考虑到Strix Halo较低的平均售价,客户可能愿意忽略这一点。

X轴完成批处理的秒数,Y轴每个批次大小下的整体吞吐量token/s

编者注:我们在测试 G1a 时遇到了一些 Ubuntu GPU 卡顿的问题。不过,通过添加几个内核参数,我们成功解决了这个问题。 可以通过编辑Grub启动配置来完成调整:然后更新GRUB_CMDLINE_LINUX=“”条目,使其看起来像这样:完成后保存并按Ctrl X退出编辑器。最后,更新引导加载程序并运行重启机器:如果你仍然遇到GPU卡顿,建议查看Framework论坛上的这个帖子。sudo nano /etc/default/grub
GRUB_CMDLINE_LINUX_DEFAULT="quiet splash amdgpu.cwsr_enable=0 amd_iommu=offwq! amdgpu.gttsize=131072 ttm.pages_limit=33554432"
sudo update-grub sudo reboot

对于需要将大型文档输入模型环境的玩家来说,Spark更强大的GPU在这方面带来了明显优势,只是客户需要权衡其较高的价格。

多批次性能

除了单批次性能外,我们还在更大批量下测试了这两台机器。用户经常会批量处理像从一堆文件或邮件中提取信息,而不是逐一处理。

在这种情况下,我们使用的是vLLM,根据我们的经验,它比Llama.cpp更能优雅地处理大批量和并发,更适合单用户应用。我们还使用Qwen3-30B-A3B-Instruct-2507的原生BF16精度,以避免量化开销。

为了观察机器的性能,我们让它们处理一个1024令牌的输入,并生成一个1024令牌的响应,批处理规模从1到64不等。

Spark更快的图形处理器再次让它比G1a更强。虽然这显然是Spark的优势,但除非你经常执行批处理作业,否则性能优势很可能不会被察觉,尤其是当你能安排批处理在夜间时。批量推理并不完全是互动式的,所以你可以随时离开,完成后再回来。

微调

当我们用微调技术通过接触新信息来教授模型新技能时,情况也类似。

微调需要大量内存,像Mistral 7B这样的型号可能高达100GB。正如我们之前讨论的,像LoRA或QLoRA这样的技术可以大幅减少训练模型所需的内存。

Spark和G1a在任一平台上均可支持最高128GB内存,非常适合这种工作负载,尽管速度并不特别快。

不同批处理大小(从1到64)下整体吞吐量(tok/s)与端到端延迟的关系

运行了Meta的Llama 3.2 3B的全微调,我们看到Spark完成任务的时间大约是G1a的三分之二。然而,与Radeon Pro W7900或RTX 6000 Ada等工作站显卡相比,这些显卡不仅提供更高的浮点性能,还拥有更快的GDDR6内存,Spark和G1a明显被超越。

真正有趣的地方是我们开始考虑在大型模型上使用QLoRA时。要在家微调像Llama 3.1 70B这样的型号,通常需要多张工作站显卡。但由于它们占用大量内存,这项工作完全可以用AMD或Nvidia的主机完成。

对于相对较小的数据集——我们之前已经证明,这足以调整模型风格——性能更符合我们的预期。G1a完成任务仅用了50多分钟,而Spark大约20分钟。

对于使用更大数据库或LoRA等级的大型微调工作,这很容易延长到数小时甚至数天,使Spark的性能优势更加显著。

但正如我们在多批次推理测试中讨论的,除非你经常微调模型,否则Spark更高的性能可能并不值得相比HP、Minisforum、Framework或其他任何迷你PC厂商的同类配置Strix Halo系统。

图像生成

Spark高性能的一个明显优势是图像和视频生成工作负载。像微调一样,图像生成是一项特别耗费计算和内存的工作量,但通常不会受限于带宽。

部分原因是图像模型不像大型语言模型那样容易压缩,除非对输出质量做出重大妥协。因此,许多人更喜欢以这些模型的原生精度运行,无论是FP32、BF16还是FP8。

通过在ComfyUI中运行Black Forest Lab的FLUX.1开发,我们的测试系统相对于其16位浮点性能,几乎完全符合预期的扩展性。

Bf16的120和125 teraFLOPS动力,Spark大致与AMD Radeon Pro W7900相当,同时比基于Strix Halo的G1a领先约2.5倍,后者在我们的测试中实际性能约为46 teraFLOPS。

升级到更大的70B参数,加上GB10的更快显卡,在QLoRA微调方面更具优势

可以说,图像生成显然不是Strix盒子的强项。

那NPU呢?

AMD 的 Strix Halo APU 还配备了相当专业的神经处理单元(NPU),这得益于公司收购 Xilinx。XDNA 2 NPU 能够额外输出 50 TOPS 的 AI 性能。关键当然是找到能够利用它的软件。大多数NPU的应用场景侧重于最小化诸如音频和视频降噪、背景模糊和光学字符识别等功耗。

然而,AMD等公司已开始将NPU应用于生成式人工智能应用,结果参差不齐。多亏了像Lemonade Server这样的应用,你现在可以完全在NPU上运行LLM。除非你想省电,否则你现在可能还不想这么做。

截至本文撰写时,型号支持较为有限,且NPU似乎无法访问GPU全部250 GB/s的内存带宽。在Windows的NPU上运行Mistral 7B时,我们观察到解码性能仅为4-5 tok/s,而我们预期的解码速度会接近40 tok/s。

然而,AMD显然在推动分解推理的理念,即将计算量大的提示处理卸载给NPU,而内存带宽密集的解码阶段由GPU处理。性能更好,但仍然不如直接在GPU上运行模型。

这种拆分的方法对于性能受限的笔记本非常合理,但对于像G1a这样的台式机系统则不太适用。话虽如此,我们很期待看到AMD将此方向发展成何方。

我们还成功让NPU在Amuse中工作,Amuse是一款适合初学者的图像生成套件。AMD最近新增了直接在NPU上运行Stable Diffusion 3的支持,在这种情况下,性能实际上比在GPU上运行同型号要好得多。

在NPU上运行时,Amuse能在一分钟多一点的时间内通过20步生成1,024 x 1,024的图像,而在GPU上运行同样测试大约需要两倍时间。

有一些值得指出的注意事项。目前整合功能相当有限,仅在初学者模式下,性能滑块设置为平衡时才可用。切换到“专家模式”会禁用NPU,迫使模型在图形处理器上运行。

整合也仅限于Stable Diffusion 3,该版本自一年多前首次亮相以来,已经相当老旧。不过,看到越来越多的应用利用NPU不仅仅是视频通话中的背景模糊,还是令人欣慰的。

CUDA护城河变得越来越浅

在AMD和Nvidia的比较中,一个经常被提到的卖点是软件兼容性,也就是CUDA护城河。

虽然几乎所有运行在CUDA上的软件都能在Spark上顺利运行,但基于Strix Halo的G1a并不保证这一点。

CUDA 近二十年的开发经验不容忽视,尽管 AMD 在软件支持方面历来落后于其 ROCm 和 HIP 库,但近几个月公司取得了显著进展。

一年前,我们遇到了许多头疼的问题,这些库要么不可用,要么依赖于专门为AMD基于CDNA的数据中心芯片构建的分支,导致它们无法在消费级平台上运行。如今,这个问题已经没那么严重了。事实上,我们的大多数PyTorch测试脚本在AMD平台上无需修改即可运行。不过,如果说体验和Spark一样无缝,那就是在说谎。

很多软件可以在AMD的消费级硬件上运行,但并不总是像运行pip install xyz-package那样简单。我们仍然需要从源代码构建库,或者多次使用专门为 Radeon GPU 制作的分支——例如 vLLM、BitsandBytes 和 Flash Attention 2 只是其中几个例子。

在许多情况下,尤其是使用靠近硬件编写的软件时,软件需要专门为该代Radeon图形编译。Llama.cpp只是一个例子,我们需要对 gfx1151 目标进行编译才能让软件运行。

无论你用什么平台,处理这些依赖都不容易,所以看到AMD和Nvidia提供预配置好的Docker容器,这些容器已经预配置好,帮助你入门,令人欣慰。在我们的vLLM测试中,我们同时使用了Team Red和Green的vLLM Docker容器,以确保获得最佳性能。

也许我们最大的软件挑战其实并不完全是软件本身。Strix Halo基于AMD较早的RDNA 3.5架构,这意味着它不支持Spark旗下Blackwell GPU提供的许多低精度数据类型。因此,我们经常被迫以16位精度运行模型,即使FP8或FP4更合适。

AMD的RDNA 4架构应通过增加稀疏性和FP8支持来解决部分问题。然而,现在行业大部分人正转向微缩放数据类型,如MXFP4,因其内存占地更小且有效范围更广。

尽管AMD正在迅速缩小差距,英伟达在硬件和软件领域依然保持显著领先。

你们一直等待的答案

我们知道你们都会问。是的。这两个盒子都能运行《孤岛危机》。

在1440p、中等画质下,《孤岛危机重制版》在G1a上运行时达到了相当不错的90-100帧。这并不令人意外,因为惠普使用的是来自一家拥有悠久图形历史的公司提供的x86 CPU和GPU。

在DGX Spark上运行游戏更复杂,因为GB10使用的Arm CPU,无论好坏,它都不支持32位指令。幸运的是,我们用一个叫FEX的工具让它运行起来。如果你感兴趣,可以在这里找到我们使用的安装脚本。

不幸的是,我们没能让Steam性能覆盖在Spark上正常工作,这意味着我们无法获得具体的性能指标。在中等设置下,游戏完全可玩,即使不使用英伟达的AI升频技术,而这技术在游戏中确实有效。

更多背景


虽然你可以让游戏在Spark或其他GB10系统上运行,但我们不确定会推荐它胜过Strix Halo盒子或其他许多更便宜的游戏电脑。

总结

哪种系统适合你,实际上取决于你是想要一台专门为人工智能设计的机器,还是一台恰好能运行大多数AI工作负载的电脑。

我们怀疑许多能走到这一步的人很可能属于后者。如果你要花2000到4000美元买一台新电脑,我们认为期待它能做好多项工作并不算过分。

在这方面,惠普的Z2 Mini G1a是较好的选择之一,尤其是如果你主要想运行单批次LLM推理,而不是微调或镜像生成。AMD的Strix Halo SoC虽然没有英伟达GB10主机的计算能力,但它能胜任运行Windows和Linux,也不需要为了玩喜欢的游戏而费尽心思。

尽管存在性能差距,对于为不断增长的AI PC细分市场开发应用的软件工程师来说,基于AMD的系统或许仍可能是更好的开发平台,哪怕仅仅因为Microsoft的NPU要求。

但对于那些真正想要AI设备来原型制作代理、微调模型或生成文本、图片和视频内容的人来说,Spark或其GB10兄弟机可能是更好的选择,前提是你能接受这个要价。

在我们的测试中,该机器稳定地提供了基于AMD的惠普系统2-3倍的性能,同时还受益于更成熟且活跃的软件生态系统。正如我们展示的,紧急情况下你也可以让非AI工作负载在Spark上运行,但这并不是它的设计目的。火花的核心是盒装AI实验室,最好以此形式使用。®

编辑于 2026-08-10 · 著作权归作者所有