惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
雷峰网
雷峰网
有赞技术团队
有赞技术团队
罗磊的独立博客
博客园 - 叶小钗
Jina AI
Jina AI
博客园 - 司徒正美
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
T
Tailwind CSS Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
人人都是产品经理
人人都是产品经理
Apple Machine Learning Research
Apple Machine Learning Research
阮一峰的网络日志
阮一峰的网络日志
Microsoft Security Blog
Microsoft Security Blog
大猫的无限游戏
大猫的无限游戏
量子位
MyScale Blog
MyScale Blog
V
Visual Studio Blog
博客园 - 聂微东
The Cloudflare Blog
Engineering at Meta
Engineering at Meta
小众软件
小众软件
宝玉的分享
宝玉的分享

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
DeepSeek联合北大推出Engram:突破GPU显存限制的LLM记忆革命...
站外新闻 · 2026-06-14 · via Prompt 语宙

💡 站外导读:随着大语言模型参数规模持续膨胀,GPU显存已成为制约模型扩展的关键瓶颈。同时,LLM在处理知识密集型任务时,常面临推理效率低下、长上下文理解困难等挑战。如何在不增加计算成本的前提下,突破硬件限制并提升模型性能,成为业界焦点。DeepSeek联合北京大学提出的Engram条件记忆模块,正是瞄准这一核心痛点,通过创新的计算与存储解耦架构,为LLM的效率与能力带来双重突破。

Engram 是DeepSeek团队联合北京大学推出的条件记忆模块,能提升大语言模型(LLM)的性能。Engram通过引入现代化的 -gram 嵌入表,将静态知识存储在独立的内存中,用稀疏检索和上下文感知门控技术实现高效的知识查找。Engram 与混合专家模型(MoE)互补,能显著提升模型在知识密集型任务、长上下文处理和推理能力上的表现,不增加计算量,还能突破 GPU 显存限制,支持大规模参数扩展。

  • Engram是什么
  • Engram的主要功能
  • Engram的技术原理
  • Engram的项目地址
  • Engram的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Engram

Engram的主要功能

  • 知识检索:通过静态嵌入表快速查找固定知识,减少对计算资源的依赖。

  • 长上下文处理:释放注意力机制的容量,使其专注于全局上下文,提升长文本推理能力。

  • 计算与存储解耦:支持从主机内存异步预取数据,突破 GPU 显存限制,实现大规模参数扩展。

  • 性能提升:在不增加计算量的情况下,显著提升模型在知识密集型任务、通用推理、代码和数学任务上的表现。

Engram的技术原理

  • 分词器压缩:通过预计算的满射函数将原始 Token ID 映射为规范化 ID,减少词表冗余,提高 -gram 的覆盖效率。

  • 多头哈希检索:用哈希方法和多头机制将局部上下文映射到嵌入表中,解决直接参数化 -gram 组合的难题。

  • 上下文感知门控:用当前隐藏状态作为动态 Query,检索到的嵌入作为 Key 和 Value,通过门控机制抑制噪声,确保语义一致性。

  • 稀疏性分配:在给定的参数预算下,重新分配 MoE 专家参数给 Engram 内存,发现计算与记忆之间的 U 型权衡曲线,找到最优分配比例。

  • 系统实现:用 Engram 的确定性检索特性,实现计算与存储的解耦,通过预取和重叠机制掩盖数据传输延迟,突破 GPU 显存限制。

Engram的项目地址

  • 技术论文:https://github.com/deepseek-ai/Engram/blob/main/Engram_paper.pdf

Engram的应用场景

  • 知识问答:Engram 可快速检索知识库中的事实信息,提升问答系统的响应速度和准确性。

  • 文本生成:通过高效的知识检索,Engram 能在文本生成中快速匹配固定短语和模式,提高生成效率。

  • 长文本处理:Engram 能优化长上下文建模,增强模型对长文本的推理能力,适用于法律、学术等长文本分析。

  • 代码辅助:Engram 能快速检索代码中的常见模式和结构,提升代码生成、补全和理解的效率。

  • 数学推理:Engram 能快速检索数学公式和定理,辅助解决数学问题,提升推理效率。

📝 站长洞察 (Editor’s Insight)

Engram的推出标志着LLM架构设计正从‘暴力堆算力’转向‘精细化资源管理’。其核心价值在于将‘记忆’从‘计算’中剥离,这与当前混合专家模型(MoE)的发展脉络高度契合——MoE优化了计算分配,而Engram则优化了知识存储与检索。两者互补,共同勾勒出下一代高效LLM的蓝图。从更宏观的视角看,Engram代表了一种趋势:通过软件和算法创新,来突破硬件物理限制。它不像追求更大显存那样‘奢侈’,而是用智能的内存管理(如异步预取、确定性检索)来‘四两拨千斤’。这对降低AI部署成本、推动大模型在更多场景落地具有深远意义。未来,类似Engram的‘外挂式’智能记忆模块,或将成为LLM标配,使模型在知识更新、长期记忆管理等方面更加灵活高效。