惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

MongoDB | Blog
MongoDB | Blog
V
V2EX
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
有赞技术团队
有赞技术团队
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
罗磊的独立博客
月光博客
月光博客
爱范儿
爱范儿
D
Docker
U
Unit 42
P
Proofpoint News Feed
I
InfoQ
腾讯CDC
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
L
LangChain Blog
V
Visual Studio Blog
IT之家
IT之家
Vercel News
Vercel News
G
Google Developers Blog
M
MIT News - Artificial intelligence
美团技术团队
The GitHub Blog
The GitHub Blog
阮一峰的网络日志
阮一峰的网络日志
MyScale Blog
MyScale Blog

博客园 - gogoy

LangChain的Deep Agents学习 Java 开发中 一篇文章讲清楚VO,BO,PO,DO,DTO的区别 云原生:Mesh化架构模式(sidecar模式)、容器vsPod Serverless 介绍 Spring单例Bean并发安全问题分析和解决 图解直接映射(Direct mapped)、全相联(Fully-associative)和组相联(Set-associative)cache缓存基本原理 【台大机器学习系列1】机器学习2021 人工智能交互中的角色与提示词:System、User与Assistant 台大李宏毅 2025 AI Agent 新课来了!(即李宏毅机器学习2025) 一文搞懂Passkey(转) RISC-V、x86、ARM技术对比解析 各种函数依赖及规范化解决 SSE协议与HTTP协议 操作日志 “二清”详解:支付产品必须知道的“清结算规矩” 金融通识:国内支付清算体系CNAPS2 Mockito教程(单测mock) zookeeper TCP相关经典 Java常见的超时及设计
为什么大语言模型推理要分成 Prefill 和 Decode?
gogoy · 2025-09-18 · via 博客园 - gogoy

一句话解释:Prefill 和 Decode 的分工

大语言模型生成文本的过程本质上是给定上下文,逐词预测下一个词。
但在实现上,这个过程被明确地分成两个阶段:

image

为什么不能用一个阶段做完?

因为输入和输出的计算特性完全不同:

  • 输入 prompt 是完整的、一次性提供的,适合并行计算。
  • 输出 token 是未知的,只能一个一个推理,必须串行。

这种“数据形态差异”导致我们不得不把它们拆成两个阶段,并用不同方式处理。

原文链接:https://blog.csdn.net/keeppractice/article/details/147012874

大模型系列:深度解析 Prefill-Decode 分离式部署架构  https://zhuanlan.zhihu.com/p/1918334902492963669

为什么LLM推理要分成Prefill和Decode两个阶段?  https://zhuanlan.zhihu.com/p/1925514980343677032