怎么看苹果发布全新 Mac mini/Mac Studio ,M6 芯片下 AI 性能暴涨4倍?
苹果这次破天荒把台积电2nm工艺首发给了Mac mini,而不是销量更大的iPhone。
我们先看这次两款新品的发售与定价矩阵。
| 产品型号 | 搭载芯片 | 核心规格配置 | 起始统一内存/存储 | 国行起售价 | 美版起售价 | 预购与发售时间 |
|---|---|---|---|---|---|---|
| Mac mini(基础版) | M6(首发2nm) | 12核CPU(2超+4性+6效)+12核GPU | 16GB+256GB | ¥6,999 | $899 | 8月27日预购 9月22日发售 |
| Mac mini(高配版) | M5 Pro | 最高18核CPU+20核GPU | 24GB/32GB+ | ¥12,999 | $1,699 | 8月27日预购 9月22日发售 |
| Mac Studio(Max版) | M5 Max | 18-24核CPU+最高40核GPU | 36GB/64GB+ | ¥19,999 | $2,499 | 8月27日预购 9月22日发售 |
| Mac Studio(Ultra版) | M5 Ultra | 最高36核CPU+80核GPU | 96GB-512GB(1.2TB/s) | ¥46,999 | $5,499 | 8月27日预购 9月22日发售(512GB版10月下旬) |
产品定位很清晰,Mac mini是个人AI工作流入口,而Mac Studio是给团队做本地部署用的。

苹果对M6芯片的本地大模型推理性能做了极致优化。
宣传最多的一个点,是LLM提示词处理速度最高提速至13.5倍。
懂大模型底层原理的人都知道,LLM推理有两个阶段。

第一个阶段是prefill,这里决定了你按下回车后多久能看到第一个字,也就是首字响应延迟TTFT。这个阶段是纯粹的计算密集型任务。
第二个阶段是decode,每吐出一个token都要把整个模型的全部权重重新读一遍。这个阶段的瓶颈在内存带宽。
而prefill现在耗时越来越长,因为各种Agent的系统提示词、工具表述越来越复杂,往往第一句话就要带出好几万token的输入。
尤其对算力贫乏的本地小机器来说。
M6就是冲着这个痛点来的,它做了两个专门针对大模型推理的优化。
第一是GPU与NPU协同计算。
以往Apple Silicon的NPU主要用来跑人脸识别、相册抠图这种轻量端侧任务,重度矩阵乘法依然要扔给GPU。而M6执行通用矩阵乘法时,GPU能直接与NPU核心的双16核Neural Engine协同并发。
第二是芯片原生支持FP8计算精度。
以往本地跑FP16精度,内存带宽与算力开销巨大。M6在硬件底层原生支持FP8,在模型精度几乎零损失的前提下,直接把显存传输数据量降低一半,让提示词矩阵乘法的吞吐量瞬间翻倍。
两套优化下来,长提示词处理速度暴涨,本地跑14B到32B的大模型,几乎可以做到瞬时响应。
编辑于 2026-08-26 · 著作权归作者所有