










我们可以从数学建模的角度,对比自回归语言模型(AR)与扩散语言模型(DLM)在文本生成任务中的核心机制和损失函数设计。
| 模型类型 | 数学建模方式 | 损失函数 | 生成方式 | 上下文建模 |
|---|---|---|---|---|
| AR 模型 | 条件概率链式分解: \(P(x_1, x_2, ..., x_T) = \prod_{t=1}^{T} P(x_t | x_{<t})\) |
交叉熵损失: \(\mathcal{L}_{AR} = -\sum_{t=1}^{T} \log P(x_t | x_{<t})\) |
串行生成(逐 token) | 单向(因果) |
| DLM 模型 | 掩码预测 + 去噪建模: \(P(x) = \mathbb{E}_{M} \left[ \prod_{t \in M} P(x_t | x_{\setminus M}) \right]\) 或基于扩散过程: \(x_T \sim \mathcal{N}(0, I),\quad x_0 = \text{目标文本}\) \(\mathcal{L}_{DLM} = \mathbb{E}_{t, x_0, \epsilon} \left[ | \epsilon - \epsilon_\theta(x_t, t) |^2 \right]\) |
并行生成(整体优化) | 双向(非因果) |
根据最新研究:
如果你希望我用 numpy 或 pseudocode 模拟 DLM 的掩码训练过程,或构建一个模块化框架来比较两者在 Context Engineering 中的表现,我可以继续深入。你更想从优化角度分析它们,还是从推理效率出发?
此内容由惯性聚合(RSS阅读器)自动聚合整理,仅供阅读参考。 原文来自 — 版权归原作者所有。