惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Blog — PlanetScale
Blog — PlanetScale
博客园_首页
WordPress大学
WordPress大学
博客园 - 聂微东
P
Privacy International News Feed
Forbes - Security
Forbes - Security
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Last Week in AI
Last Week in AI
C
CERT Recently Published Vulnerability Notes
月光博客
月光博客
NISL@THU
NISL@THU
美团技术团队
T
Tailwind CSS Blog
Jina AI
Jina AI
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Apple Machine Learning Research
Apple Machine Learning Research
C
Cisco Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
The Hacker News
The Hacker News
B
Blog
P
Palo Alto Networks Blog
L
Lohrmann on Cybersecurity
有赞技术团队
有赞技术团队
The Register - Security
The Register - Security
S
Securelist
A
Arctic Wolf
MyScale Blog
MyScale Blog
H
Help Net Security
N
Netflix TechBlog - Medium
CTFtime.org: upcoming CTF events
CTFtime.org: upcoming CTF events
T
Threatpost
Recent Commits to openclaw:main
Recent Commits to openclaw:main
Security Latest
Security Latest
T
Tor Project blog
V
Vulnerabilities – Threatpost
V
V2EX
AI
AI
Hugging Face - Blog
Hugging Face - Blog
大猫的无限游戏
大猫的无限游戏
博客园 - Franky
Simon Willison's Weblog
Simon Willison's Weblog
小众软件
小众软件
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
H
Hackread – Cybersecurity News, Data Breaches, AI and More
T
Troy Hunt's Blog
Schneier on Security
Schneier on Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
H
Heimdal Security Blog
Google Online Security Blog
Google Online Security Blog
Know Your Adversary
Know Your Adversary

运维开发绿皮书

OBS虚拟摄像头重命名 Ubuntu备份为LiveOS 使用Powershell卸载windows默认程序 Cisco路由器OSPF配置 汽车的分类和特点 Windows11跳过TPM2.0 HTTPS 双向认证与 USB 加密锁配置实战 SSL 证书工具 字数统计 BMI 计算 颜色转换 Hash 生成器 JSON 格式化 JWT 解码 房贷计算 时间戳转换 URL 编码 UUID 生成 牛马时钟 二维码批量生成器 CKS Simulator Kubernetes 1.25 FRP TOTP验证码生成器 direct-ssh-passthrough-nat 脚本使用说明 Python软件授权 Linux命令行百度网盘 为 Containerd 配置 Harbor 无证书镜像站 Docker一键部署Meta和MetacubexD面板 必应搜索屏蔽垃圾网站 VMware的ubuntu完整安装vm-tools支持粘贴板 Docker Desktop 安装到其他位置 Dell EMC PowerEdge R740服务器内存插槽使用说明及正确安装方法 tc常用命令总结 OpenStack排错 稳定币监管与投资指南 VMware ESXi 密码恢复指南 VMware 加密 state.tgz 文件解密教程 六百万数据 MySQL count(*) 优化 使用iptables禁止特定子网访问指定端口 解决 iptables DNAT 无法转发到 127.0.0.1 的问题及安全风险分析 Linux 一键测试脚本 Gitlab配置详解 Gitlab批量创建用户 Ubuntu安装VNC教程 Windows11跳过微软账号登录 vue配置Nginx伪静态 Linux下Ollama开放端口 修改Git提交历史中的作者信息 在PowerShell中启动Git Bash的方法 一键安装OpenVPN 大语言模型 模型架构-Transformer模型 训练相关资料 GPT&DeepSeek模型 大模型技术基础 Git Bash 中一键安装 pacman Gitlab-Runner的一些问题 Docker运行kwaivgi-liveportrait Firefox密码提取 在x86-64上构建和运行多种架构的Docker容器 flutter配置镜像站 VMware最新下载地址(纪念碑) 一键安装Conda Docker老版本runc报错无法启动 清理Rancher节点 aapanel 7.x 中文语言配置指南 Ubuntu 22 安装 Kubernetes 1.29 集群指南 Ubuntu修复CNVD-2024-4920726 GRUB锁定密码 Grub2手动引导Linux Cron在线表达式生成器 GitLab一键设置镜像源 文本字符串倒序 Windows禁用任务管理器 UOS(1070a)服务器版本部署Kubernetes1.28 Windows11恢复Windows10右键菜单 Ubuntu一键设置镜像源 CentOS 7 一键设置Vault镜像 Base64在线编码解码 代码差异对比 为Docker分配物理网卡 解密CFSSL生成的CRL数据 已经在谷底了 怎么走都是向上 GitLab统计提交代码行数Python代码 Windows11的24H2出现扩展错误 Windows绕过MicroSoft Store直接下载应用 Fossy平台离线部署分析 在WSL中移除Windows环境变量 重装MicroSoft Store Sony Xperia 10 IV(pdx225)AOSP14编译和刷机方法 pnpm在DevContainer中存储出错解决方法 从SVN迁移仓库到Git Ubuntu中移除Snap软件包 使用Netcat检测UDP端口连通性 rke2集群命令行调试方法 Ubuntu隐私优化-关闭公共门户连接检查 Cisco路由器配置ipv4和ipv6的VTY账户密码 Python实现九九乘法表 Windows10中用多网卡链路聚合来解决网卡网速瓶颈 CentOS7 安装 OpenResty
模型详解配置
Paper-Dragon · 2025-07-09 · via 运维开发绿皮书

模型详解配置


模型详解配置

构建大模型需要考虑的因素归一化方法、位置编码、激活函数、注意力计算

image-20250709173129303

层数L、注意力头数N、特征维度N

归一化方法

为什么要做归一化?

  • 不同特征在空间中的尺度不同,对损失优化的影响不一致
    特征尺度差异会导致损失函数各方向的梯度下降速度不同。尺度大的特征梯度更新剧烈,迫使模型花费更多迭代次数调整其他特征权重,降低优化效率。

  • 提升训练稳定性,加速模型收敛
    归一化使所有特征处于相近的数值范围(如[0,1]或[-1,1])。这使优化路径更平滑,梯度更新方向更稳定,减少震荡风险,从而加快模型收敛速度。

image-20250709173320576

方法

image-20250709173524409

归一化模块位置

image-20250709173703607

层后归一化(Post-Layer Normalization, Post-Norm)

定义 (归一化模块放置于残差计算之后)

优点

  • 加快训练收敛速度
  • 防止梯度爆炸或梯度消失
  • 降低神经网络对于超参数的敏感性

缺点

  • 可能导致训练不稳定
  • 目前较少单独使用

层前归一化(Pre-Layer Normalization, Pre-Norm)

定义 (归一化模块应用在每个子层之前)

优点

  • 训练更加稳定
  • 主流模型采用较多

缺点

  • 性能略有逊色

夹心归一化(Sandwich-Norm)

定义 (通过双重归一化叠加:在子层和子层各加一次归一化)

核心特性

  • Pre-Norm与Post-Norm的复合结构
  • 归一化逻辑:输入 → 首次归一化 → Sublayer计算 → 二次归一化 → 残差连接

优势

  • 理论上融合Pre-Norm的稳定性与Post-Norm的性能增益
  • 梯度调节能力更强(双重归一化约束)

局限性

  • 计算开销显著增加(额外归一化层)
  • 仍存在训练震荡风险
  • 实际应用较少,多见于理论研究

位置编码

image-20250709174313357

绝对位置编码代表性的是旋转位置编码

绝对位置编码:旋转位置编码

image-20250709174411105

image-20250709174458173

相对位置编码:ALiBi位置编码

image-20250709174645134

激活函数

image-20250709174245261

注意力计算

image-20250709174655763

对硬件优化

image-20250709174843648

MOE模型

举例: deepseek、Mixtral

目的是在不显著提升计算成本的同时实现对于模型参数的扩展。

image-20250709175101374

混合专家架构(Mixture-of-Experts, MoE)

核心定义
$$ \text{MoELayer}(x_t) = \sum_{i=1}^{K} G(x_t)_i \cdot E_i(x_t)
$$ 其中路由函数:
$$ G(x_t) = \text{softmax}(\text{topk}(x_t \cdot W_G))
$$

基本组成

  1. 专家组件

    • $K$个独立的前馈神经网络 ${E_1, E_2, ..., E_K}$
    • 每个专家具备相同网络结构,参数不同
  2. 路由网络

    • $W_G$:权重矩阵(将输入词元$x_t$映射为$K$维得分向量)
    • $\text{topk}$:选择得分最高的$k$个专家(通常$k \ll K$)
    • $\text{softmax}$:归一化获得激活权重(未选中专家权重置$0$)

运行流程
输入词元 → 路由计算→ 筛选topk专家→ 专家并行计算→ 加权输出求和

核心优势

  • 稀疏激活:仅计算部分专家输出(节省计算资源)
  • 超参扩容:通过增加专家数$K$提升模型容量(计算量仅由$k$决定)
  • 动态适配:根据输入特性自动分配处理专家

显著局限

  • 路由决策不可导(需直通估计器技巧)
  • 专家负载不均衡风险(需引入辅助损失)
  • 通信开销大(分布式训练时专家间数据交换)

常用

模型混合专家归一化位置编码激活函数注意力机制层数隐藏层维度注意力头个数头维度
LLaMA-3.1 (405B)N/APre RMSNorm旋转位置编码SwiGLU多头隐式注意力12616,384128128
DeepSeek (67B)N/APre RMSNorm旋转位置编码SwiGLU多头隐式注意力958,19264128
DeepSeek-V2 (236B)162 ExpertsPre RMSNorm旋转位置编码SwiGLU分组查询注意力605,12040128
DeepSeek-V3 (671B)257 ExpertsPre RMSNorm旋转位置编码SwiGLU分组查询注意力617,16856128

更新日志

  • 9389a-04模型详解配置.md