怎么看苹果发布全新 Mac mini/Mac Studio ,M6 芯片下 AI 性能暴涨4倍?

苹果这次破天荒把台积电2nm工艺首发给了Mac mini,而不是销量更大的iPhone。

我们先看这次两款新品的发售与定价矩阵。

产品型号搭载芯片核心规格配置起始统一内存/存储国行起售价美版起售价预购与发售时间
Mac mini(基础版)M6(首发2nm)12核CPU(2超+4性+6效)+12核GPU16GB+256GB¥6,999$8998月27日预购
9月22日发售
Mac mini(高配版)M5 Pro最高18核CPU+20核GPU24GB/32GB+¥12,999$1,6998月27日预购
9月22日发售
Mac Studio(Max版)M5 Max18-24核CPU+最高40核GPU36GB/64GB+¥19,999$2,4998月27日预购
9月22日发售
Mac Studio(Ultra版)M5 Ultra最高36核CPU+80核GPU96GB-512GB(1.2TB/s)¥46,999$5,4998月27日预购
9月22日发售(512GB版10月下旬)

产品定位很清晰,Mac mini是个人AI工作流入口,而Mac Studio是给团队做本地部署用的。

苹果对M6芯片的本地大模型推理性能做了极致优化。

宣传最多的一个点,是LLM提示词处理速度最高提速至13.5倍。

懂大模型底层原理的人都知道,LLM推理有两个阶段。

第一个阶段是prefill,这里决定了你按下回车后多久能看到第一个字,也就是首字响应延迟TTFT。这个阶段是纯粹的计算密集型任务。

第二个阶段是decode,每吐出一个token都要把整个模型的全部权重重新读一遍。这个阶段的瓶颈在内存带宽。

而prefill现在耗时越来越长,因为各种Agent的系统提示词、工具表述越来越复杂,往往第一句话就要带出好几万token的输入。

尤其对算力贫乏的本地小机器来说。

M6就是冲着这个痛点来的,它做了两个专门针对大模型推理的优化。

第一是GPU与NPU协同计算。

以往Apple Silicon的NPU主要用来跑人脸识别、相册抠图这种轻量端侧任务,重度矩阵乘法依然要扔给GPU。而M6执行通用矩阵乘法时,GPU能直接与NPU核心的双16核Neural Engine协同并发。

第二是芯片原生支持FP8计算精度。

以往本地跑FP16精度,内存带宽与算力开销巨大。M6在硬件底层原生支持FP8,在模型精度几乎零损失的前提下,直接把显存传输数据量降低一半,让提示词矩阵乘法的吞吐量瞬间翻倍。

两套优化下来,长提示词处理速度暴涨,本地跑14B到32B的大模型,几乎可以做到瞬时响应。

编辑于 2026-08-26 · 著作权归作者所有