惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

G
Google Developers Blog
WordPress大学
WordPress大学
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
小众软件
小众软件
人人都是产品经理
人人都是产品经理
美团技术团队
Blog — PlanetScale
Blog — PlanetScale
S
SegmentFault 最新的问题
博客园 - 【当耐特】
V
V2EX
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - 叶小钗
Google DeepMind News
Google DeepMind News
量子位
罗磊的独立博客
月光博客
月光博客
N
Netflix TechBlog - Medium
大猫的无限游戏
大猫的无限游戏
博客园_首页
P
Proofpoint News Feed
Jina AI
Jina AI
云风的 BLOG
云风的 BLOG
博客园 - 司徒正美
腾讯CDC

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理,
视觉记忆革命:DeepSeek-OCR如何重塑AI的记忆方式
一葉 · 2025-10-27 · via 人人都是产品经理

当主流技术仍在扩展上下文窗口时,DeepSeek-OCR另辟蹊径,以“看图记忆”重塑AI的信息处理方式。本文将从上下文工程、RAG系统到视觉压缩机制,解析这一技术如何突破“内存墙”,并为AI构建更接近人类认知的记忆体系。

AI的长期记忆问题,一直以来是一直想要去解决的难题。我们一直面临一个核心矛盾:模型需要更多的上下文才能做出准确响应,但计算资源却随着文本长度指数级增长。这就是著名的“内存墙”困境。

当各大厂商致力于扩展上下文窗口(从数万到数百万tokens)时,DeepSeek-OCR却走上了一条截然不同的道路——它让AI学会“看图记忆”。

一段长文本可以压缩成一张图像,AI的记忆瓶颈正被重新定义

为解决长期记忆问题我们做过的努力

RAG和上下文工程

RAG 技术,本质是给 AI 配了个 “实时图书馆”。我们通过给模型搭建相应的记忆宫殿,帮助AI能够实时检索,以求降低幻觉,提高准确性

但是这套方法短板也非常明显:

  • 知识库向量化成本巨大
  • 文档结构和多模态信息在提取过程中缺失
  • 检索结果受限于片段化的信息

传统的上下文工程面临着艰难的权衡:提供足够的背景信息与避免上下文窗口过载

DeepSeek-OCR不是要取代,而是互补

想象一个增强型的RAG系统:

  • 在检索阶段,只需将知识库文档的元数据向量化,而完整文档内容被压缩成视觉快照
  • 在增强阶段,直接加载这几篇完整文档的视觉快照
  • 模型转态:这种方式让AI像是在一目十行地快速翻阅几份完整的原始报告,对所有内容和结构了如指掌,而不仅仅是阅读被割裂的文本片段。

在上下文工程中:

它通过视觉压缩,实现了质的信息密度提升。就像人类速读文档一样,大脑会并行地、整体地处理信息,而不再是逐字逐句线性阅读。

这种方法特别符合上下文工程中“记忆细胞”的概念——通过合理的记忆管理策略,在保持用户体验连贯性的同时,避免上下文窗口被填满。

DeepSeek-OCR的优势

DeepSeek-OCR的突破在于,它将千字长文压缩成单张图像,再通过视觉模型转化为极简的“视觉标记”,最后由语言模型解码还原。

这种机制带来了惊人的效率提升,在10倍压缩率下,模型仍能保持97%的文本还原精度。这意味着处理一本300页的技术手册,传统方法可能需要数万token,而DeepSeek-OCR可能仅用几千视觉标记就能搞定。

AI的“遗忘曲线”

DeepSeek-OCR最引人入胜的可能是它对人类记忆机制的模拟。研究团队将这种技术类比为人类的“遗忘曲线”

在实际应用中,它可以实现分层级的记忆管理

  • 高保真区:最近10页文档存为高清图像,相当于短期记忆
  • 低密度区:超过30天的对话压缩为模糊影像,相当于长期记忆

而这样的遗忘曲线,会更加贴合模拟人类的行为,结合部分的上下文工程,以及RAG的能力,再搭建部分的记忆机制,那么AI的长期记忆能力会更加完善,进而服务于人的日常生活、工作之中。

这种设计不仅节省计算资源,更让AI的记忆处理更接近人类认知模式。正如认知心理学家所言:“当AI开始理解‘记忆需要管理’时,它才真正向人类智能迈进。”

DeepSeek-OCR不是一个简单的截图工具,而是一个为AI的视觉系统量身定制的、信息密度极高的文档渲染引擎。它的创新包括:

  • 创造了一种“AI友好”的特殊字体/字符集,用最紧凑的字符表示方法
  • 智能化的版面压缩与重建,在渲染时会智能地分析原始PDF的布局,丢弃掉所有不必要的空白。
  • 这种处理对表格、图形等具备二维结构的信息具有天然优势,预计将在金融报表、科研文献等大版面、多元素文档处理场景中率先实现规模化落地。

对于产品经理而言,这项技术意味着我们可以构建出回答质量、处理效率和成本效益都远超当前所有系统的下一代知识管理和分析工具。

本文由 @一葉 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议