NVIDIARTXSpark 将 CPU 与 GPU 直接焊在一起,这项技术有哪些颠覆性突破?
这东西不受美国现行法律约束,加上使用的制程为 TSMC 3nm,是目前国内无法实现的工艺水平,可以放在一个巴掌大的盒子里,换做是国产技术的话可能体积、散热要高不少,所以国产目前在这方面基本没法和 DGX SPARK/RTX Spark 竞争。
拥有 6 倍于 AMD Ryzen AI 395+ Max 的 AI 推理预填充性能,能更快输出推理结果,支持硬件 FP8、FP4,现在很多新的模型直接塞进去就能跑。
内存带宽是它的相对弱点,但是 300GB/s 其实也算可以了,例如跑 Diffusion 模型,瓶颈完全在算力上而非带宽上,现在的 MTP、DSpark、DiffusionGemma 等技术也正越来越让 LLM decode 性能偏向于算力、降低了内存带宽的压力。
Mac Studio M3 Ultra 跑 DiffusionGemma 是每秒 43 token。
I tested Google's new "fast" model on my Mac Studio. It's slower than the old one. : r/MacStudio
DGX SPARK 是每秒 150+ Tokens:
https://forums.developer.nvidia.com/t/community-docker-adds-support-for-diffusiongemma/372831/16?u=cho
它的原版 DGX SPARK 拥有目前所有小主机都不具备的互连能力,单口模式 400Gbps、双口模式 200Gbps,跑多机互连的时候完爆所有同类小主机。
DGX Spark/RTX Spark 是目前办公室、家庭本地化部署的最佳解决方案,体积小、低噪音、性能够用、所有软件都已经部署好即插即用、具备 CUDA 全栈生态(cuda toolkit、DLSS、光线追踪)、内存容量远大于 RTX 3090/4090/5090、跑算力约束的 AI 推理同阶无敌、跑 LLM 有 MTP、DSpark、DiffusionGemma 等越来越多需要算力的加速方案。作为对比,AMD Ryzen AI 395+ Max 和 Mac 连 FP8、FP4 都不具备。
RTX SPARK 号称全天续航,而 AMD Ryzen AI 395+ Max 我记得好像是 6-10 小时吧。
'Expect all-day battery life' — Nvidia is confident RTX Spark laptops will go the distance | TechRadar

