惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
Visual Studio Blog
Y
Y Combinator Blog
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
The Cloudflare Blog
L
LangChain Blog
美团技术团队
N
Netflix TechBlog - Medium
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
B
Blog
博客园 - 司徒正美
爱范儿
爱范儿
D
DataBreaches.Net
月光博客
月光博客
U
Unit 42
B
Blog RSS Feed
Engineering at Meta
Engineering at Meta
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
MongoDB | Blog
MongoDB | Blog
腾讯CDC

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
Deepseek-OCR凭啥惊艳海内外,用小学生都能理解的大白话告诉...
灵山下的小妖怪 · 2025-10-25 · via 人人都是产品经理

你知道AI看图比看字还省力吗?Deepseek-OCR火出圈,就是因为它能“看图说话”,还说得又快又准。这篇文章用小学生都能懂的大白话,告诉你它为啥这么强——读完你会发现,AI也需要“学会遗忘”,才能更聪明。

在大型语言模型(LLM)的世界里,一直存在一条近乎铁律的成本法则——“令牌经济学”(Tokenomics)。传统上,文本被认为是“令牌高效”的,处理起来相对经济;而图像则是“令牌低效”的,转换成令牌后会消耗海量的计算资源。因此,行业内的普遍共识是,尽可能在文本层面解决问题。

但如果说,让AI处理一篇长文最经济的方式,不是去“阅读”它,而是先把它“看”成一张图片,你会怎么想?这个彻底违背直觉的想法,正是DeepSeek-OCR模型的核心。本文将为你揭示它带来的4个足以颠覆我们对AI认知的革命性启示。

1. 启示一:AI“读”文本的最佳方式,是先把它变成图像

核心概念解释

DeepSeek-OCR的核心范式转移在于“上下文光学压缩”(Contexts Optical Compression)。它不再将文本视为需要通过分词器(tokenizer)处理的字符序列,而是将其渲染成图像,再作为一种可被高效压缩的视觉信息来处理。模型将整个文档页面视为一幅图像,通过先进的视觉编码器,将其压缩成数量极少但信息密度极高的视觉令牌。

引用权威观点

这一思想的颠覆性得到了业界领袖的认可。如OpenAI联合创始人Andrej Karpathy所指出的,DeepSeek-OCR代表的可能是一种更优越的LLM输入模态。他认为,未来AI应将图像作为主要输入,以此绕开传统分词器的弊端,并将所有信息统一到像素这一通用格式,从而简化和泛化整个输入管道。

分析与反思

这一思想的革命性之处在于,它不仅仅是技术上的改良,更是对LLM处理信息方式的一次根本性重构。它将解决问题的重心从传统的自然语言处理(NLP)转向了以计算机视觉(CV)为核心的解决方案,为突破长文本处理瓶颈开辟了一条全新的道路。

2. 启示二:十五倍压缩,近乎无损——令牌经济学的彻底颠覆

展示惊人数据

DeepSeek-OCR的压缩效率是其最引人注目的特点。具体数据显示,一篇包含1000个单词(在传统分词器下约等于1500个文本令牌)的文章,可以被光学压缩为仅仅100个视觉令牌。这意味着高达 15倍 的效率提升,从根本上降低了处理长文本的计算成本。

强调高保真度

高压缩率并没有以牺牲准确性为代价。在Fox基准测试中的数据证明了其卓越的保真度:

  • 在低于10倍的压缩比下,OCR解码精准度高达97%。
  • 在9.7倍的有效压缩下(处理包含900-1000个文本令牌的页面),精准度达到了96.8%。

提炼核心价值

DeepSeek-OCR的真正突破,不在于高压缩率或高准确率本身,而在于 同时实现 二者。它在将计算成本降低15倍的同时,信息保真度的损失却不足4%(仍保持96.8%的准确率)——这一全新的性价比,从根本上重塑了处理长文档的经济学。它引入了“每令牌准确率”(accuracy-per-token)这一衡量计算效率的新维度,并在此维度上建立了显著的领先地位。

3. 启示三:绕过RAG,实现“无限”上下文的全新可能

点明行业痛点

当前处理长文档的主流技术是检索增强生成(Retrieval-Augmented Generation, RAG)。但RAG系统实现复杂,且其工作方式是检索并处理离散的文本片段,而非对整个知识库进行整体理解。

提出全新方案

光学压缩技术为解决“长上下文难题”提供了一条全新的、可能更优越的路径。一个具体的应用场景是:企业可以将公司所有的内部文档一次性压缩并输入到模型的上下文中,然后对整个知识库进行整体性推理。这与RAG只能检索几个相关片段的方式形成了鲜明对比,光学压缩允许模型对整个数据集的压缩表征进行全面理解。

分析其深远影响

这一变革对企业工作流具有深远的潜在影响。它可能催生出全新的AI应用,从根本上改变企业与海量内部知识库的交互方式,使得真正意义上的“全局知识问答”和深度洞察成为可能。

4. 启示四:模拟人类记忆,AI也能“选择性遗忘”

引入前瞻概念

该技术还为构建更先进的AI记忆系统提供了一个极具前瞻性的理论基础。其可动态调整的压缩比,可以被用来模拟人类的记忆机制。

阐述工作原理

这个“可控的遗忘机制”可以用一个生动的比喻来解释:近期发生的重要信息,可以像高清照片一样,以低压缩率、高保真地存储在AI的“记忆”中;而久远或次要的信息,则被逐渐压缩成一个“模糊”的概要,就像我们对往事的回忆一样,只保留关键轮廓。通过调整压缩率,AI可以在有限的计算资源下,实现理论上无限长的上下文记忆。

探讨未来意义

这一概念的重要性在于,它是迈向更具生物学合理性的AI记忆架构的一步。对于开发能够进行长期持续学习、并与环境进行持久交互的智能体而言,这种动态调整记忆精度的能力具有非凡的意义。

当AI学会“看”世界

DeepSeek-OCR的意义远超一个OCR工具。它是一次成功的技术验证,证明了“上下文光学压缩”是解决AI领域长期挑战的一条潜力巨大的新路径。它不仅在性能和效率上取得了突破,更重要的是,它为我们展示了一种全新的AI信息处理范式。

我们正在见证一个以视觉为中心的AI未来的到来。在这个未来里,计算机视觉和自然语言处理的界限将变得模糊,AI将以一种更统一、更高效的方式处理一切信息。

当AI开始以“看”作为接收所有信息的主要方式时,一个真正统一的人工智能架构离我们还有多远?

本文由 @灵山下的小妖怪 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Deepseek官网截图