怎么看苹果发布全新 Mac mini/Mac Studio ,M6 芯片下 AI 性能暴涨4倍?

我觉得这次 M6 和新 Mac Studio 都不错,但真正值得关注的其实是 M7,尤其是 M7 Ultra Mac Studio

因为苹果这次的产品节奏本身就很反常。

据 Bloomberg 的 Mark Gurman,苹果没有继续完整推进 M6 Pro、M6 Max、M6 Ultra,而是把高端产品线更快切到 M7。原因不是普通的工艺升级,而是 M7 会有比较大的 neural-processing / AI 架构改动。Gurman 甚至提到,M7 Ultra 的 AI 性能目标已经开始往 Nvidia Blackwell 这类专用 AI 加速器靠。

所以我觉得,M6 更像过渡,M7 才是苹果真正按照现在的大模型推理需求重新设计的一代。

最值得看的几个方向其实很明确。

首先是内存带宽。

现在 Mac 跑大模型,很多时候真正卡住的不是理论算力,而是模型每生成一个 token 都要不断读取权重。算力涨得再快,内存喂不上去也没用。

目前关于基础 M7 已经有大约 240GB/s 带宽目标的消息。如果这一方向成立,Max 和 Ultra 的带宽继续往上堆,对本地大模型的实际意义会非常大。

另一个重点是 FP4 / MXFP4。

现在越来越多的新模型已经明显往 FP4 走。真正重要的不是“能不能加载 4bit 模型”,这个今天就能做到,而是 GPU 里的矩阵计算单元能不能直接原生执行 FP4。

如果 M7 真把 FP4 做成主要计算格式,同样面积和功耗下,AI 矩阵吞吐会比现在明显提高。

再加上针对 Attention、MoE、grouped GEMM、routing、gather/scatter 这些实际大模型工作负载做优化,M7 的提升就不会只是传统意义上的“GPU 快了百分之几十”。

这里我觉得很像现在 Nvidia 从 Blackwell 往 Rubin 走的思路。

当然,目前没有消息说苹果“照着 Rubin 做 M7”,这属于推断。

但方向其实很接近:不再把重点放在传统 FP32 跑分,而是把越来越多的晶体管、带宽和计算资源直接服务于 Transformer、MoE 和低精度推理。

苹果自己现在其实已经在往这边走。

新 Mac Studio 已经做到非常大的统一内存和 TB/s 级带宽。它最大的优势本来就不是单纯和 5090 比 GPU 峰值算力,而是 GPU 可以直接访问几百 GB 内存

这件事对大模型太重要了。

5090 很快,但显存容量有限。

想在传统 GPU 平台上获得 128GB、256GB、512GB 这种 GPU 可直接访问的内存,很快就进入专业卡和服务器的价格范围。

Mac Studio 走的是另一条路线。

它先解决“模型装不下”的问题,然后再慢慢补算力和带宽。

现在的问题其实已经变成:

模型能装进去,但能不能跑得足够快。

一个几百 B 参数的模型,3、5 token/s 当然也叫能跑,但实际使用还是比较难受。

真正发生变化,是这类模型开始能稳定跑到四五十多个 token/s。

到了那个时候,它才不只是实验,而是真正能每天拿来工作的东西。

这也是为什么我真正期待的是 M7 Ultra Mac Studio。

如果未来它真的能把几百 GB、甚至更大的统一内存,TB/s 级别的内存带宽,更强的 GPU AI 计算,以及原生 FP4 放到一起,那么两三百 B、甚至更大的 MoE 就会开始进入个人桌面设备真正可用的范围。

Gurman 甚至提到过 M7 Ultra 最高可能支持 1.5TB 统一内存,并且未来这套芯片还有进入 Apple Intelligence 服务器的可能。

如果这个方向最后真的落地,那 Mac Studio 的意义会变得很不一样。

所谓“把 Opus 搬回家”,当然不是说未来能直接下载 Claude Opus。

而是如果以后出现真正达到 Opus 级能力的开源 MoE,以前这种模型基本只能放在数据中心里;到了 M7 Ultra 这一代,它第一次可能变成个人可以买一台机器放在桌子下面,本地长期运行的东西。

所以我对 M6 的看法是:它本身不错,但更像是在铺路。

真正值得看的,是 M7 能不能把 内存带宽、原生 FP4、GPU AI 算力和 MoE 推理优化 这几件事一起做出来。

如果做到了,下一代 Mac Studio 才可能真正从一台高性能 Mac,变成一台很特别的本地 AI 工作站。

编辑于 2026-08-29 · 著作权归作者所有