如何评价6月9日小米MiMo-V2.5-Pro的UltraSpeed模式?1000tps是怎么实现的?
今年2月份有个公司,叫Taalas,推出的产品最大的亮点就是快,16960的TPS,举世无双的快。
那个时候同期的推理卡大多在几百TPS,快的也不到2000。

这家公司的做法比较极端,是把模型“焊”在芯片上的,当然了,模型也比较小是Llama 3.1 8B的模型。

聪明嘛肯定一般,复杂任务肯定是指望不上的。
但问题是现实有很多场景根本用不到复杂的推理,特别是端侧、近端、设备控制类的任务。
这些任务最重要的不是“它能不能写论文”,而是“它能不能立刻响应”。
比如车机里一句“打开副驾窗户”,智能家居里一句“把客厅灯调暗一点”,工厂设备里一句“把三号机械臂停下来”,这些东西对模型智力的要求并不高,但对延迟的要求极高。
你不能等它想半天。
它慢一秒,用户就觉得这玩意儿不智能;它慢三秒,在某些设备控制场景里甚至就已经失去意义了。
所以Taalas这条路很有意思,它本质上不是在跟云端大模型拼“聪明”,而是在重新定义另一类AI产品的价值:不求全能,但求极快、极稳、极便宜、极低功耗。
小米 MiMo-V2.5-Pro 的 UltraSpeed 模式,又把这个问题往前推了一步。
因为 Taalas 快,是可以理解的。
它是把一个相对小的模型,几乎直接“焊”进芯片里。你可以把它理解成一个非常专用、非常极端、非常为速度而生的方案。
但小米这次不一样。
MiMo-V2.5-Pro 不是一个 8B 小模型,而是一个万亿参数级别的大模型。它跑的也不是某块神秘定制芯片,而是通用 GPU。
结果它在 UltraSpeed 模式下,生成速度也冲到了 1000 tokens/s 这个级别。
过去我们对大模型的理解很简单。越大的模型越聪明,越聪明就越慢。要速度,就得牺牲能力;要能力,就得忍受等待。
但 MiMo-V2.5-Pro UltraSpeed 想打破的,正是这个默认取舍。
它的做法当然也有很多工程细节,比如模型结构、量化、推理框架、GPU 调度这些东西一起配合。
其实我觉得这个工作可以展望两个点:
1. 端侧 AI 的真正意义,外界的大模型也可以跑得非常快,也可以支持端侧。那么,端侧 AI 的真正意义到底在哪里?
现在的端侧 AI 智力确实不太够,像冰箱、电视、大沙发之类的家电装个 AI,可能不需要很复杂的功能,但如果是在复杂的场景,端侧 AI 的智力瓶颈就会显现出来。
2. 芯片级的大模型集成能否在未来某个时间节点,当某个大模型的能力达到巅峰,或者处于一个短时间内无法突破的高位时,直接把这个万亿级的大模型“焊”在芯片上?
这样的话,它既能跑出极速的速度,同时又能拥有超强的智能。