惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Recent Announcements
Recent Announcements
J
Java Code Geeks
U
Unit 42
GbyAI
GbyAI
大猫的无限游戏
大猫的无限游戏
L
LangChain Blog
D
Docker
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
罗磊的独立博客
I
InfoQ
The Cloudflare Blog
小众软件
小众软件
V
Visual Studio Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Engineering at Meta
Engineering at Meta
S
SegmentFault 最新的问题
爱范儿
爱范儿
Hugging Face - Blog
Hugging Face - Blog
P
Proofpoint News Feed
V
V2EX
月光博客
月光博客
Martin Fowler
Martin Fowler

运维开发绿皮书

OBS虚拟摄像头重命名 Ubuntu备份为LiveOS 使用Powershell卸载windows默认程序 Cisco路由器OSPF配置 汽车的分类和特点 Windows11跳过TPM2.0 HTTPS 双向认证与 USB 加密锁配置实战 SSL 证书工具 字数统计 BMI 计算 颜色转换 Hash 生成器 JSON 格式化 JWT 解码 房贷计算 时间戳转换 URL 编码 UUID 生成 牛马时钟 二维码批量生成器 CKS Simulator Kubernetes 1.25 FRP TOTP验证码生成器 direct-ssh-passthrough-nat 脚本使用说明 Python软件授权 Linux命令行百度网盘 为 Containerd 配置 Harbor 无证书镜像站 Docker一键部署Meta和MetacubexD面板 必应搜索屏蔽垃圾网站 VMware的ubuntu完整安装vm-tools支持粘贴板
模型详解配置
Paper-Dragon · 2025-07-09 · via 运维开发绿皮书

模型详解配置


模型详解配置

构建大模型需要考虑的因素归一化方法、位置编码、激活函数、注意力计算

image-20250709173129303

层数L、注意力头数N、特征维度N

归一化方法

为什么要做归一化?

  • 不同特征在空间中的尺度不同,对损失优化的影响不一致
    特征尺度差异会导致损失函数各方向的梯度下降速度不同。尺度大的特征梯度更新剧烈,迫使模型花费更多迭代次数调整其他特征权重,降低优化效率。

  • 提升训练稳定性,加速模型收敛
    归一化使所有特征处于相近的数值范围(如[0,1]或[-1,1])。这使优化路径更平滑,梯度更新方向更稳定,减少震荡风险,从而加快模型收敛速度。

image-20250709173320576

方法

image-20250709173524409

归一化模块位置

image-20250709173703607

层后归一化(Post-Layer Normalization, Post-Norm)

定义 (归一化模块放置于残差计算之后)

优点

  • 加快训练收敛速度
  • 防止梯度爆炸或梯度消失
  • 降低神经网络对于超参数的敏感性

缺点

  • 可能导致训练不稳定
  • 目前较少单独使用

层前归一化(Pre-Layer Normalization, Pre-Norm)

定义 (归一化模块应用在每个子层之前)

优点

  • 训练更加稳定
  • 主流模型采用较多

缺点

  • 性能略有逊色

夹心归一化(Sandwich-Norm)

定义 (通过双重归一化叠加:在子层和子层各加一次归一化)

核心特性

  • Pre-Norm与Post-Norm的复合结构
  • 归一化逻辑:输入 → 首次归一化 → Sublayer计算 → 二次归一化 → 残差连接

优势

  • 理论上融合Pre-Norm的稳定性与Post-Norm的性能增益
  • 梯度调节能力更强(双重归一化约束)

局限性

  • 计算开销显著增加(额外归一化层)
  • 仍存在训练震荡风险
  • 实际应用较少,多见于理论研究

位置编码

image-20250709174313357

绝对位置编码代表性的是旋转位置编码

绝对位置编码:旋转位置编码

image-20250709174411105

image-20250709174458173

相对位置编码:ALiBi位置编码

image-20250709174645134

激活函数

image-20250709174245261

注意力计算

image-20250709174655763

对硬件优化

image-20250709174843648

MOE模型

举例: deepseek、Mixtral

目的是在不显著提升计算成本的同时实现对于模型参数的扩展。

image-20250709175101374

混合专家架构(Mixture-of-Experts, MoE)

核心定义
$$ \text{MoELayer}(x_t) = \sum_{i=1}^{K} G(x_t)_i \cdot E_i(x_t)
$$ 其中路由函数:
$$ G(x_t) = \text{softmax}(\text{topk}(x_t \cdot W_G))
$$

基本组成

  1. 专家组件

    • $K$个独立的前馈神经网络 ${E_1, E_2, ..., E_K}$
    • 每个专家具备相同网络结构,参数不同
  2. 路由网络

    • $W_G$:权重矩阵(将输入词元$x_t$映射为$K$维得分向量)
    • $\text{topk}$:选择得分最高的$k$个专家(通常$k \ll K$)
    • $\text{softmax}$:归一化获得激活权重(未选中专家权重置$0$)

运行流程
输入词元 → 路由计算→ 筛选topk专家→ 专家并行计算→ 加权输出求和

核心优势

  • 稀疏激活:仅计算部分专家输出(节省计算资源)
  • 超参扩容:通过增加专家数$K$提升模型容量(计算量仅由$k$决定)
  • 动态适配:根据输入特性自动分配处理专家

显著局限

  • 路由决策不可导(需直通估计器技巧)
  • 专家负载不均衡风险(需引入辅助损失)
  • 通信开销大(分布式训练时专家间数据交换)

常用

模型混合专家归一化位置编码激活函数注意力机制层数隐藏层维度注意力头个数头维度
LLaMA-3.1 (405B)N/APre RMSNorm旋转位置编码SwiGLU多头隐式注意力12616,384128128
DeepSeek (67B)N/APre RMSNorm旋转位置编码SwiGLU多头隐式注意力958,19264128
DeepSeek-V2 (236B)162 ExpertsPre RMSNorm旋转位置编码SwiGLU分组查询注意力605,12040128
DeepSeek-V3 (671B)257 ExpertsPre RMSNorm旋转位置编码SwiGLU分组查询注意力617,16856128

更新日志

  • 9389a-04模型详解配置.md