惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Google DeepMind News
Google DeepMind News
I
InfoQ
Engineering at Meta
Engineering at Meta
D
DataBreaches.Net
L
LangChain Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Recent Announcements
Recent Announcements
GbyAI
GbyAI
爱范儿
爱范儿
Microsoft Security Blog
Microsoft Security Blog
腾讯CDC
美团技术团队
罗磊的独立博客
Microsoft Azure Blog
Microsoft Azure Blog
WordPress大学
WordPress大学
T
The Blog of Author Tim Ferriss
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
雷峰网
雷峰网
M
MIT News - Artificial intelligence
D
Docker
MongoDB | Blog
MongoDB | Blog
F
Fortinet All Blogs
博客园 - 叶小钗

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
DeepSeek「开眼」了,但你可能想多了 – 人人都是产品经理
沃垠AI · 2026-05-06 · via 人人都是产品经理

DeepSeek 识图模式的灰度测试悄然上线,虽非外界期待的原生多模态,却在基础视觉理解上展现了不俗实力。从 OCR 提取到文化背景推理,这款产品的视觉模块正试图在巨头林立的 AI 战场突围。当字节、阿里、Kimi 纷纷亮出多模态王牌时,DeepSeek 能否凭借性价比优势后发制人?

先给结论:DeepSeek识图模式来了,能用,但跟你们期待的多模态不是一回事。

4月29日下午,陈小康在X上发了这么一条:”Now, we see you.” 配图是两只鲸鱼logo,一只还戴着海盗眼罩,一只已经睁开了眼睛。

我看到那一刻,第一反应:这营销做得有点秀。

(这句话是AI说的,别骂我…)

但有意思的是,这是他24小时内第二次发类似内容。前一天他发过”Soon, we see you.”发完很快就删掉了。一删一发,很明显在等一个时机。果然,和这条推文几乎同步,已经有部分用户在DeepSeek官方App的输入栏上方,发现了第三个按钮:”识图模式”,标注”图片理解功能内测中”。

灰度测试,正式开始了。

1. 到底发了什么

这件事的时间节点很值得注意。

DeepSeek V4正式发布是4月24日,V4-Pro(1.6T参数)和V4-Flash(284B参数),都支持1M token上下文,都是纯文本模型。识图模式在V4发布的第5天就上了灰度,快得有点出乎意料。

但问题是,V4技术报告在”局限与未来方向”这节,白纸黑字写着:下一步工作之一是”将多模态能力融入模型体系”。

所以,识图模式跟V4是什么关系?从灰度体验的输出风格来判断,更接近是一个挂在V4主干上的视觉理解模块,而不是外界过去半年疯传的”原生多模态V4″。

说白了:视觉理解 ≠ 原生多模态生成。

那识图模式到底能用到什么程度?从已经被灰度到的用户实测来看,基础识图准确率挺高。

场景描述、OCR、文字提取,不开思考模式也能给出相当结构化的回答;开了思考模式,甚至能推断博物馆展品的文化背景,比如把一件玉器判断为”清代痕都斯坦风格”,也就是莫卧儿王国的工艺风格,这一步推理其实已经超出”看图说话”的范畴了。

但知识库的局限很明显。最新的产品、游戏、品牌,识不出来。让它看一张FM24战术图,认出来了;让它看一款2025年底发布的手机,判断错了;但居然通过副屏推断出了旧型号,这逻辑链还挺能打的。

复杂图形逻辑题,比较拉。让它数图里的老虎,数了三遍,每次数字不一样,最后给了个错的。

这类基于反色、碎块化的视觉推理,还是视觉模型的硬伤,DeepSeek也没逃过。

2. 带伤上阵的多模态团队

这次识图模式发布背后,有一个很多人没注意到的背景。

DeepSeek的多模态团队,过去大半年走了不少人。多模态核心贡献者阮翀,去了自动驾驶公司元戎启行,出任首席科学家;OCR系列核心作者魏浩然,春节前后离职;R1推理负责人郭达雅,以年薪亿元的价码去了字节跳动Seed团队;初代大模型核心作者王炳宣,也去了腾讯。

这四个人,刚好覆盖了DeepSeek最核心的四条技术主线:基座模型、推理、OCR、多模态。

V4技术报告近300人名单里,有10个名字被标注了”已离职”。

DeepSeek做了一件让很多人觉得有风骨的事:把离职的人也放进了致谢名单,注明贡献。有人说这是”AI界黄埔军校”,这个评价我不觉得过誉,但它背后也是一个真实的留人困境,大厂拿着2到3倍薪资和八位数总包,确实很难顶。

也正因为如此,陈小康这次连续两条推文才显得有点不寻常。这是DeepSeek多模态团队近三个月来,第一次以产品形式对外释放进展。

某种程度上,这是一次”我们还在”的宣示。

带伤打仗,我觉得,这才是DeepSeek现在的真实状态。

3. 行业没有等你

再说说外部压力。DeepSeek识图模式上灰度这一天,身边的竞争对手没有一个在歇着。

字节跳动的Doubao-Seed-2.0-Pro,在SuperCLUE-VLM最新评测里拿下总榜第一,90.66分,超过谷歌Gemini-3.1 Pro的89.35分。这是中文场景多模态评测的目前最高水位。

阿里在3月下旬发布了Qwen3.5-Omni,原生全模态架构,基于超过1亿小时音视频数据预训练,215项SOTA,官方说通用音频理解全面超越Gemini-3.1 Pro,而且宣称文本和视觉能力没有因为多模态而降智。

Kimi在4月底发布K2.6,多模态和Agent方向同时推进。

商汤的SenseNova U1也在同一周开源,单一框架整合多模态理解、推理和生成。

这个赛道,现在基本上是”王不见王,全都在同一周发”的状态。国产多模态,已经进入肉搏期。

有一个细节值得记住:豆包在2025年底的月活已经超过了DeepSeek。这说明纯文本能力再强,产品化落地和用户覆盖才是这一阶段真正拉开差距的事。识图模式的到来,是DeepSeek在补这块短板。

4. 性价比,才是真正的牌

DeepSeek在纯文本上能打赢,核心还是两件事:性能够用,价格足够低。V4-Pro的API价格已经是历史低点,这条逻辑有没有可能在多模态上复制?

如果能,它的影响可能比前几轮价格战来得更猛烈。现在多模态API的调用成本,对绝大多数开发者来说还是一道真实的门槛。如果DeepSeek能把视觉理解的API打到地板价,甚至再来一次那种”99%降价”的打法,这个市场格局就真的会变。

说实话,这才是我最想看到的那张牌。

Qwen3.5-Omni的能力很强,但如果DeepSeek的多模态API比它便宜十倍,开发者会怎么选?

写在最后

识图模式目前是灰度内测,还没有全量,很多人还看不到。

从现有能力判断,基础视觉理解已经可用,这是DeepSeek多模态路线产品化的第一步。但离”原生多模态”还有距离,V4技术报告里那句”下一步工作”,说的大概就是这件事。

陈小康那句”Now, we see you.”,我觉得是个双关。

一方面跟用户说:DeepSeek的眼睛,睁开了。另一方面,大概也是跟整个行业说:我们看到你们了,别以为我们不在。

但问题是,对手可没等你。

字节在追,阿里在赶,Kimi在超,个个都不是省油的灯。

DeepSeek这次补多模态,来得有点晚,人才也走了不少,但有一点没变:它还是那个最有可能把成本打穿的选手。

这对吗?说实话,我不知道。

但我知道,接下来几个月,一定会很好看。

本文由人人都是产品经理作者【沃垠AI】,微信公众号:【沃垠AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。