如何评价小米6月9日发布的MiMo-V2.5-Pro-UltraSpeed模式?
小米在ai领域的动作还是非常多的。今年以来可以说是喜报频传。
3月份首先内测了Mimo-v2系列,推出了万亿参数级别的大模型和1m长上下文。随着后训练更进一步,到了4月又推出了Mimo-v2.5系列。其中的v2.5是一个全模态的模型,试着用它赏析音乐,效果也挺好。
4月底,小米推出了百万亿orbit计划,给开发者免费赠送tokenplan,申请了一个,后来额度重置了,现在还没用完。
5月,小米基于swa的体系建设,把推理端的价格全部打下来了。定价直接对标deepseek,infra建设更进一步。
在应用端,小米一直在内测miclaw,在手机端做一个agent应用,迭代速度非常快,体验也很好。
现在又推出了“mimo极速版”,也就是今天的speedultra版本
2026 年 6 月 9 日,小米 MiMo 团队联合 TileRT,推出了MiMo-V2.5-Pro-UltraSpeed。它在一台标准 8 卡通用 GPU 节点上,将万亿参数大模型的文本生成速度,硬生生推到了 1000 TPS(tokens per second),峰值可达 1200 TPS。
这是一个什么概念?你读完上面这段话的时间里,它已经生成了几百个 token——相当于一篇千字短文,眨三次眼就写完了。
这么恐怖的速度是怎么实现的?小米官方博客给出的答案是三管齐下:首先引入 FP4 量化,针对 MoE 架构仅对专家层做无损压缩;其次,也是最关键的一步,引入基于块级 Masked 并行预测的高效推测解码方案——DFlash,大幅提升单次验证的 Token 接受长度,平均单轮可确认 6-7 个 token;最后,依靠 TileRT 推理系统重构 GPU 执行架构,消除算子切换延迟。
三招下来,一台 8 卡 GPU 节点,跑出了千 token 每秒的惊人成绩。全程无需定制专用芯片。
DFlash 是 2026 年 2 月由 UC San Diego Z Lab 在 arXiv 上发表的一篇论文(arxiv: 2602.06036),从发表到工业级部署只用了不到四个月。这篇文章,我们就来把它拆开揉碎,看看它为什么能让大模型推理加速 6 倍,以及小米是如何把它变成 1000 TPS 的现实的。
···
一、自回归的诅咒:GPU 利用率为什么这么低
大语言模型的核心是 Transformer 架构。在生成文本时,模型每步只能生成一个 token,而生成下一个 token 必须依赖上一个 token 的计算结果。这就是自回归解码(Autoregressive Decoding)的根本困境。
想象一条流水线,每个工位必须等上一个工位完成才能动手。以 NVIDIA A100 为例,其 6912 个 CUDA 核心拥有每秒 312 TFLOPS 的浮点算力,但在逐 token 生成时,GPU 的大部分计算单元处于空闲等待状态。推理 1000 个 token 的回答,意味着 GPU 要执行 1000 次独立的前向传播——每次前向传播中,矩阵乘法确实很快,但算完之后 GPU 就必须停下来,等待"下一个 token 到底该是什么"这个决策完成。
本质矛盾:Transformer 推理的计算量并不大,但"必须等上一个结果"的串行依赖,使得 GPU 的并行计算能力被严重浪费。
这个问题不是新问题。业界很早就意识到,要突破瓶颈,必须让大模型"一次生成多个 token"。这就引出了两个技术方向:多 Token 预测(MTP)和投机解码(Speculative Decoding)。
···
二、投机解码:用小模型"猜",让大模型"批"
投机解码的核心思路简洁而巧妙:
第 1 步(Draft):一个小型"草稿模型"快速生成 k 个候选 token。 第 2 步(Verify):大型"目标模型"一次前向传播,并行验证这 k 个 token 的正确性。 第 3 步(Accept/Reject):被验证正确的 token 直接输出;从第一个错误 token 开始,大模型接管生成。
这个方案的妙处在于:验证阶段是完全可并行的。目标模型一次前向传播可以同时验证所有候选 token。如果草稿质量够高,大部分 token 被接受,那么一次前向传播就相当于生成了 k 个 token,加速效果接近 k 倍。
DeepSeek、小米 MiMo 等最新模型都引入了类似的多 Token 预测机制,本质上都是这个逻辑:用小模型的"量"换大模型的"质",降低大模型前向传播的次数。
···
三、草稿模型的天花板:自回归的"实习生"还是太慢
但问题并没有完全解决。
以当前投机解码的最先进方案 EAGLE-3 为例,它的草稿模型依然采用自回归方式生成候选 token——一个 token 一个 token 地猜。生成 8 个候选 token,就需要跑 8 次草稿前向传播。
这带来了三个连锁问题:
第一,草稿成本随 token 数线性增长。每多猜一个 token,就多一次完整的前向传播,草稿阶段的延迟随 k 线性增长。加速比的提升很快就撞到天花板。
第二,草稿模型被迫极度轻量化。为了控制延迟,EAGLE-3 的草稿模型只能使用 1 层 Transformer。容量不足意味着草稿质量有限——生成的候选 token 和目标模型的真实分布偏差越来越大,接受率很快饱和。
第三,接受长度受限于模型容量。当草稿模型容量不够时,增加候选 token 数量并不能线性提升接受长度。花更多时间生成,却得不到更多被接受的 token。
核心矛盾:传统的自回归草稿模型陷入了"快则不准、准则不快"的两难——想要快就得轻量化,轻量化就不准;想要准就得加容量,加容量就慢。
能否设计一种草稿模型,做到一次前向传播就生成一整块 token,同时保证极高的接受率?
···
四、扩散语言模型:全并行生成的"另一种可能"
要回答这个问题,需要先把目光投向另一个研究领域——扩散语言模型(Diffusion Language Model,DLLM)。
扩散模型在图像生成领域的统治地位无需赘言——Stable Diffusion、DALL-E、Midjourney,都是从一张噪声图逐步"去噪"成清晰图像。这个过程的独特之处在于:扩散模型是全并行生成的。它不是从左到右逐像素画,而是对整个画面整体去噪、逐步精细化。每一步去噪,所有位置同时更新。
业界很自然地想到:能不能把扩散模型的范式搬到文本生成上来?
这就是 DLLM 的由来。它的核心思路是:在一个固定长度的文本块内,所有位置的 token 同时被遮罩(mask),然后模型通过多次去噪步骤,逐步把遮罩位置"还原"为正确的 token。因为所有位置同时解码,生成速度极快。
但 DLLM 有两个致命短板:
第一,去噪步数太多。为了达到自回归模型的生成质量,DLLM 通常需要几十甚至上百步去噪。每一步都是一次完整的前向传播,累积延迟反而可能超过自回归。
第二,生成长度固定。全并行扩散要求预先确定序列长度,这在实际对话场景中极不灵活——你无法预知一个回答到底需要多少 token。
于是,块扩散模型(Block Diffusion)的设想应运而生:块内并行生成,块间自回归衔接。每个块固定长度(比如 16 个 token),块内所有 token 同时解码;一个块完成后,基于它的结果再生成下一个块。这样兼顾了并行效率与灵活的长度控制。
···
五、DFlash:让扩散模型给自回归模型当"实习生"
DFlash 的核心洞察就在这里:把块扩散模型用作投机解码的草稿模型。
这一定位转变极其关键。扩散语言模型作为独立生成器时,面临"去噪步数多、质量不如 AR"的困境。但作为草稿模型时,它不需要独立生成高质量文本——只需要成为目标模型的高质量"影子",在目标模型的强引导下快速生成候选块。至于文本质量的最终把关,完全交给自回归的大模型。

图:传统自回归 vs EAGLE-3 vs DFlash 三种解码方案对比
5.1 特征融合:从目标模型"偷师"
DFlash 的第一个关键技术是特征融合(Feature Fusion)。它从目标模型的一次完整前向传播中,均匀采样 5 层的隐藏状态(从第 2 层到倒数第 3 层),通过线性投影和 RMSNorm 融合成一个紧凑的上下文特征向量。
这个特征向量包含了关于多个未来 token的语义信息——目标模型的深层隐藏状态里,实际上"埋藏"了接下来十几个 token 的语义倾向。DFlash 的草稿模型就是基于这个融合特征来并行预测整个块。
5.2 KV 注入:每层都"看得见"目标
这是 DFlash 与 EAGLE-3 最本质的区别。
EAGLE-3 将目标特征与 token embedding 拼接后,仅送入草稿模型的第一层。随着层数增加,目标信号逐层衰减——后面的层越来越"看不见"目标的引导,草稿质量随深度递减。
DFlash 的做法截然不同:将目标特征注入草稿模型每一层的 Key/Value 投影中,并通过 KV Cache 持久存储。这意味着草稿模型的每一层都能持续获得完整的目标上下文信号,接受长度随层数增加而有效扩展。

图:EAGLE-3 仅首层注入(上)vs DFlash 每层 KV 注入(下)
5.3 块扩散训练:随机锚点 + 位置加权
DFlash 的块大小默认设为 16(对应 LLaMA 3.1 设为 10)。训练时,随机选择 2 个位置作为"锚点"——这两个位置不被遮罩,保持可见;其余 14 个位置全部遮罩。草稿模型基于锚点 token 和目标模型注入的特征,并行预测所有遮罩位置。这种随机锚点策略迫使模型学会从任意已知 token 出发推理整块内容,泛化能力更强。

图:DFlash 块扩散的训练与推理策略
5.4 极致的轻量化
DFlash 草稿模型仅 5 到 8 层 Transformer,参数规模被严格控制。对比早期扩散草稿方案 DiffuSpec 曾使用 7B 参数的庞大草稿模型——内存占用巨大,推理延迟甚至超过了目标模型本身,完全不具备实际部署价值。DFlash 用实践证明:在投机解码场景下,轻量 + 强引导远胜重量 + 弱引导。
···
六、效果如何:全面领先,加速天花板被重写
DFlash 在多个主流模型上进行了全面评测:

图:DFlash 在多个模型和场景下的加速比
在 Qwen3-8B 上,DFlash 实现了超过 6 倍的无损加速——也就是说,输出质量与自回归基线完全一致,但速度快了 6 倍。对比 EAGLE-3,DFlash 的加速效果是其 2.4 倍。
尤为关键的是,这种加速是无损的——不是用质量换速度。DFlash 的草稿 token 一旦被目标模型接受,与被目标模型自己生成的结果完全等价。这是投机解码理论保证的性质。
在代码生成和数学推理等结构化场景,DFlash 平均单轮可确认 6-7 个 token,远超 EAGLE-3 的 2-3 个。这意味着目标模型跑一次前向传播,就能验证并接受近半块的结果——效率极高。
关键数据: - Qwen3-8B 代码生成:6.0x 加速(EAGLE-3 为 2.5x) - Qwen3-8B 数学推理:5.5x 加速(EAGLE-3 为 2.2x) - LLaMA 3.1-8B 文本生成:4.5x 加速(EAGLE-3 为 2.0x) - 平均接受长度:6-7 tokens/轮(EAGLE-3 为 2-3 tokens/轮)
···
七、小米 MiMo 的实战落地:从论文到百万用户
DFlash 从论文发表到工业级部署,只用了不到 4 个月。
2026 年 6 月 9 日,小米 MiMo 官方宣布与 TileRT 联合发布 MiMo-V2.5-Pro UltraSpeed 模式。这套方案整合了三大核心技术:
其一,FP4 无损量化。针对 MiMo 的 MoE(混合专家)架构特点,仅对占绝大多数参数的专家层执行 FP4 量化,其余模块保留原始精度。在压缩显存占用、缓解带宽压力的同时,模型综合能力基本不降。
其二,DFlash 块并行推测解码。单次前向预测一整段文本区块,在代码、数理推理等场景平均单轮确认 6-7 个 token,大幅提升解码效率。
其三,TileRT 推理系统。重构 GPU 执行架构,采用持久化内核与异构流水线,消除算子切换带来的延迟间隙,让硬件算力持续满负荷运转。
最终效果:基于万亿参数大模型,在单台标准 8 卡通用 GPU 节点上,文本生成速度突破 1000 tokens/s,峰值可达 1200 tokens/s。全程无需定制专用芯片,大幅降低了极速 AI 推理的落地门槛。
按定价计算,UltraSpeed 模式的价格是原版的 3 倍,但生成速度提升了约 10 倍。这在高频量化交易、实时反欺诈、医疗影像分析等毫秒级实时决策场景中,将彻底改变 AI 的可用性边界。
···
八、技术启示:扩散 + 自回归的融合时代已经到来
DFlash 的意义不仅仅是一个加速方案。它揭示了一条更宏大的技术路线:扩散模型和自回归模型不必是对立的两条路,而可以是互补的两个组件。
长期以来,NLP 社区和 CV 社区各自在自己的范式里深耕——自回归统治文本,扩散统治图像。DFlash 打破了这堵墙,证明了扩散模型的并行生成能力可以被精确地嫁接到自回归框架中,作为"加速器"而非"替代者"。
这背后的哲学意味值得深思:不是要推翻自回归,而是要超越自回归的局限。大模型作为最终的"真理检验器"依然不可或缺,但让扩散模型在更前端的环节承担"快速假设生成"的角色,可以使整个系统的效率发生质变。
可以预见,在 DeepSeek、Qwen、MiMo 等下一代模型的设计中,类似的块扩散投机解码技术极有可能成为标配。而随着扩散草稿模型的进一步优化——更好的锚点策略、更高效的 KV 注入方式、乃至与目标模型的联合训练——加速比的天花板还会被继续推高。
那个"大模型说话不再一字一顿"的未来,比我们想象的要近得多。
···
参考文献: [1] Chen, J., Liang, Y., & Liu, Z. (2026). DFlash: Block Diffusion for Flash Speculative Decoding. arXiv:2602.06036v2. [2] Xiaomi MiMo Team. (2026). MiMo x TileRT: 突破 1000 tokens/s 的 UltraSpeed 模式. [3] Z Lab, UC San Diego. DFlash GitHub Repository. [4] Li, Y. et al. (2024). EAGLE-3: Scaling Up Speculative Decoding.