怎么看苹果发布全新 Mac mini/Mac Studio ,M6 芯片下 AI 性能暴涨4倍?

利益非常相关,mac mini/studio双持,其中年初买的studio可以说是利润率超过50%的投资了。

所以这次 M6 / M5 Ultra 发布以后,我专门去苹果官网翻了一遍它的测试数据。一个很明显的变化是:苹果这次开始非常认真地测试“本地跑 AI”了。

它测试的基本都不是云端,而是在 Mac 本机运行模型。

简单总结一下:

  • M6 Mac mini 跑 14B、4 位量化模型,处理 8K 长提示词时,首个词元响应速度最高达到 M4 的 4.8 倍
  • M5 Pro 对 M4 Pro,在同样 20 核 GPU、64GB 内存的情况下,最高达到 4 倍
  • M5 Ultra 对 M3 Ultra,在同样 80 核 GPU、512GB 内存的情况下,最高达到 4.1 倍
  • 用 MLX 跑 12B 文生图模型,M5 Ultra 比 M3 Ultra 快约 4.3 倍
  • 4 台 M5 Ultra Mac Studio 联机运行 72B 模型,最高比单台快 3 倍

测试条件来自苹果 Mac miniMac Studio 页面底部的脚注。苹果没有公布 14B、12B 模型的具体名字,也没有公开文生图模型的精度、分辨率和采样步数。

我去 Hugging Face 上找了一下 14B 的模型,选择非常之多。14B 就是约140亿参数。按4位量化粗算,模型权重本身约占7GB;再加上量化元数据、运行时、KV Cache、系统和其他应用,32GB的M6 Mac mini仍有比较充足的余量。

所以他让 M6 和 M4 都选择 32GB 内存,就可以保证大家都能够完整地装得下,并且有余量。

但这里有一个特别容易被误解的地方。

苹果公布的 4.8 倍,并不是“模型每秒吐字快了 4.8 倍”

它测试的是 TTFT,也就是 Time To First Token,可以简单理解成:你把一大段材料扔给 AI,到它真正开始回答之前,需要等多久。

比如你扔进去一份很长的 PDF,模型首先要把前面的内容全部“读一遍”,然后才开始输出答案。

M6 提升最大的,主要就是这个“读完材料然后开口”的过程。至于开口以后,每秒究竟能够生成多少 token,也就是大家平时更熟悉的 tokens/s,苹果目前并没有公布。

所以可以简单理解成:说得更早,不一定等于说得更快。

为什么 M6 能这么快?

M6 的 GPU 从测试中的 M4 10 核增加到了 12 核,但只多了 20%,显然解释不了 4.8 倍的差距。

真正重要的变化,是苹果开始在每个 GPU 核心里面加入专门针对 AI 计算的神经网络加速器。

大模型在“阅读”长提示词时,需要做大量重复的数学计算。以前主要靠 GPU 自己算,现在相当于 GPU 里面又增加了一套专门负责 AI 计算的小型加速单元。

这一点其实从另外两组测试更容易看出来。

M5 Pro 和 M4 Pro 都是 20 核 GPU、64GB 内存,但速度差了 4 倍。

M5 Ultra 和 M3 Ultra 更夸张,两边都是 80 核 GPU、512GB 内存,结果依然相差约 4.1 倍。

也就是说,核心数量没有增加、内存也没有增加,但 AI 速度还是大幅提高。

这基本说明,真正发生变化的是 GPU 内部专门针对 AI 的计算能力。

所以以后看 Mac 的 AI 性能,可能已经不能单纯看“CPU 快了多少”“GPU 多了几个核心”。

普通跑分可能只提升 20%~50%,但碰到专门优化过的 AI 任务,可能突然就是三四倍。

文生图也出现了类似变化

苹果还用 MLX 测试了一个 12B 文生图模型。M5 Ultra 和 M3 Ultra 都是 80 核 GPU、512GB 内存,但 M5 Ultra 完成图片生成的速度快了约 4.3 倍

这个测试其实比前面的“首词速度”更有意思,因为它测的是完整的图片生成过程,而不是单纯测试模型多久开始回答。

以前大家说 Mac 适合跑本地 AI,最容易想到的其实是一个优势:

统一内存特别大。

比如很多消费级显卡只有 16GB、24GB 显存,而 Mac Studio 可以直接做到 128GB、256GB,甚至 512GB。

所以以前 Mac 的优势更多是:

别人装不下的模型,我能装进去。

现在苹果明显开始补第二块:

不但能装进去,还要跑得更快。

当然,苹果并没有公布这个 12B 文生图模型具体叫什么、生成分辨率多少、用了多少步,所以这个 4.3 倍只能代表苹果自己的这一组测试,不能直接理解成所有 AI 绘图软件都会快 4 倍。

4 台 Mac Studio 也开始真正“组队”了

还有一个我觉得很有意思的测试。

苹果把 4 台 M5 Ultra Mac Studio 连在一起,每台都是 512GB 统一内存,然后运行一个 72B 的大模型,并输入 32K 长上下文生成摘要。

结果最高比单台快 3 倍。为什么不是理论上的 4 倍?

因为四台电脑一起工作以后,还需要互相传数据、同步计算,这些都会产生额外开销。

但这至少证明了一件事:Mac Studio 的多机互联已经不只是参数表上的功能,苹果真的开始拿它跑大模型了。

这也让 Mac mini 和 Mac Studio 的定位越来越清楚。

32GB 的 M6 Mac mini,跑十几 B 的量化模型已经非常舒服,用来本地聊天、写代码、总结文档、跑一些轻量 Agent 都没有太大问题。

但当模型继续变大、上下文继续拉长,或者你同时跑多个模型以后,真正限制你的往往就不再是速度,而是内存够不够大

这时候 64GB、128GB,甚至 512GB 的 Mac Studio 才开始体现价值。

所以 Mac mini 和 Mac Studio 并不冲突

对我来说也是一样。

看到新款在部分 AI 测试里面快了三四倍,我并不会觉得年初买的 Studio 突然就过时了。

本地 AI 其实有两个完全不同的问题:速度决定你要等多久,内存决定你到底能不能跑。

M6 可以让一个 14B 模型更快开始回答,但它替代不了 512GB 统一内存。

所以我反而觉得两台机器的分工越来越明显:

Mac mini 更像一台体积小、功耗低、可以长期在线的本地 AI 节点;Mac Studio 则负责更大的模型、更长的上下文和更重的任务。

从这次测试来看,苹果的路线其实已经很清楚了:

入门机型靠新的 GPU AI 加速能力,让十几 B 的模型越来越快;高端 Studio 则继续堆统一内存、带宽和多机互联,把更大的模型留在本地。

至于 M6 到底值不值得升级,我现在还在等最后一个数据:

同一个模型、同样的量化和上下文,真正持续生成时到底能达到多少 tokens/s。

首词快 4.8 倍当然很好。

但如果你每天真正花时间等待的是几千字的长回答,那么模型“开口以后到底说得多快”,可能比“多久开始说第一句话”更加重要。

编辑于 2026-08-26 · 著作权归作者所有