6月18日这天,不少用户打开DeepSeek网页端或APP时,突然发现——在熟悉的快速模式和专家模式旁边,多了一个识图模式。这意味着,那些一直没被灰度测试覆盖到的用户,终于可以拿DeepSeek处理图片了。

目前DeepSeek官方还没有发布公开介绍,模型界面上显示的仍然是“图片理解功能内测中”。有猜测说,这次可能是面向所有用户的全量推送。不过,DeepSeek多模态团队的负责人陈小康当天在社交媒体上,口吻已经变成了“视觉模式已在网页和应用上正式上线”,还加了一句:“试试这双新眼睛”。

有意思的是,就在5天前,陈小康还紧跟热点,把“鹅腿阿姨”的绿色鸭腿图丢给了DeepSeek。从回复来看,它不仅能辨认出那不是鹅腿,还提醒说这个绿色有可能是食品安全隐患。他在评论区调侃:“如果当年有DeepSeek,今年是不是就没有‘鸭骗战争’了。”

当时就有用户追问为什么自己还用不上视觉功能,陈小康的回复是:“灰度(测试)只有少量用户能用到”。今年4月底,DeepSeek识图模式启动灰度测试,5月曾进行过一次大范围开放,但依然有不少用户没拿到资格。直到这次,才像是终于面向所有用户开放了。
那么,DeepSeek的识图效果到底怎么样?实测下来,不同场景差别还挺大。
尝试了一张上海外滩的建筑图,问这是哪里。DeepSeek用了16秒给出答案,不仅准确识别出四个主要建筑,还指出白色拱桥“大概率是乍浦路桥”,是经典摄影角度。表现相当不错。

但换成这几天很火的佛得角守门员沃齐尼亚,情况就不一样了。DeepSeek花了一分多钟进行深度思考,思考过程里几次提到佛得角,却始终对应不上具体球员,最后给了一个完全错误的答案。

这个结果倒也不意外。沃齐尼亚之前并不出名,大模型训练数据里很可能没有涉及;而且DeepSeek的识图模式没有联网搜索功能,自然无法识别当下的热点人物。
在社交平台上,有早就被灰度测试覆盖到的用户反馈说,DeepSeek的识图能力已经超过了国产模型的平均水平,但和海外顶级模型相比,在复杂图片理解、细节推理方面还有差距。如果是日常截图、报错信息、表格、论文、网页内容这些场景,基本够用,速度也快;可换成多层逻辑流程图、复杂的数据图表,准确率就会开始下降。不过,考虑到价格和开放程度,不少用户认为它仍然值得一用。
一个值得注意的插曲是:就在4月30日,DeepSeek曾发布过一篇多模态技术报告,标题叫《Thinking with Visual Primitives》(《用视觉原语思考》),详细阐释了背后的技术细节。但很快大家发现,这篇论文连同多模态仓库都被连夜删除了——打开GitHub界面已经是“404”。当时外界猜测很多,有的说DeepSeek还没准备好,有的说论文透露的信息太多了。有意思的是,论文里提出了一个核心判断:目前多模态模型在复杂任务上崩溃,并不是因为“看不见”(感知鸿沟),而是因为“指不准”(引用鸿沟)。多模态智能的未来,不只是“看见更多像素”,而是构建语言与视觉之间精准、无歧义的指代桥梁。
截止目前,DeepSeek官方还没有公开宣布识图模式正式上线,关于这一模式的技术细节以及更多消息,还需要等待后续的官方介绍。