如何评价 DeepSeek 刚刚上线的多模态「识图模式」?
这算是对我最不友好的消息之一了。
因为我前段时间刚刚出版了一本书,名字叫《AI效率革命》,主要内容就是根据DeepSeek来基础AI能力来源构思的,原谅我这个名字可能太宏大了,但是编辑建议这样可能会更有受众一些。
这本书在前段时间出版我觉得还挺幸运的,正好赶在DS V4发布,同时它还恰好没有多模态能力。
同时,它还提到了在未来会把多模态能力融到模型里面,我想着怎么也得几个月吧。

没想到,不到一个星期,DS就把识图模式上线了。
实体书的出版周期太长了,去年写的,那个时候就是基于DS短时间内不会上多模态为大基础的,然后差不多一年才出版,但是这本书的内核本身就不太依赖于模型,AI的使用方法论跟模型是隔离的,所以我觉得它的价值还在。(有实力的朋友可以支持下,过几天我会抽奖送一批出去)
至于这个识图模式,我觉得最值得讨论的有三件事:
一:5天的时间差
DeepSeek V4,4月24日上线。 识图模式,4月29日开始灰度测试。 时间差:5天。
如果识图是V4原生能力的一部分,这两件事应该同时发布,或者在同一个公告里出现。
它没有。
V4的技术报告里,多模态能力被明确列为"未来方向"。也就是说,V4在发布时就不是多模态模型—它是纯文本,视觉理解能力不在其中。
识图模式是另外一件事,5天后单独上线。
二:底层模型是否公开
识图模式用的是哪个模型?暂时没有消息公布。
从时间线和公开的论文推断,识图模式最可能的基础是DeepSeek-VL2—2024年12月发布的视觉语言模型,专门做图像理解,和V4是完全不同的产品线。
如果这个推断是对的,用户现在在识图模式里用的,是一个升级版的模型。
这没有问题,VL2是专门的视觉模型,做这件事没什么不合适。
三:是否是原生多模态
多模态基本上是现在大模型的标配。
单纯的实现它并不再是复杂的问题,而大家在等的是native multimodal:从预训练阶段就整合了视觉信息的架构,类似Gemini 3.1那种,视觉和语言能力在模型底层就是融合的。
原生多模态才比较有噱头。
DeepSeek V4大概率不是。
现有的资料说明V4是纯文本模型,识图是5天后上线的单独模块,底层模型还可能是VL2而不是V4。这更接近GPT-4V的方式,视觉是附加能力,不是原生能力。
接下来看什么
识图模式的上线意味着基础设施已经稳定,V4能跑起来,周边功能可以开始积累。
真正的变量是两个:native multimodal什么时候来(V4技术报告把它列为"未来方向",可能是下一代模型的目标),以及昇腾芯片上的推理优化能到什么水平(决定DeepSeek能以什么成本扩展服务规模)。
我的判断:识图现在值得尝试(如果被灰度到的话),文档/OCR场景是真实的强项。

