惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Microsoft Azure Blog
Microsoft Azure Blog
宝玉的分享
宝玉的分享
博客园 - 【当耐特】
有赞技术团队
有赞技术团队
G
Google Developers Blog
Microsoft Security Blog
Microsoft Security Blog
Apple Machine Learning Research
Apple Machine Learning Research
The Cloudflare Blog
Blog — PlanetScale
Blog — PlanetScale
博客园_首页
L
LangChain Blog
Stack Overflow Blog
Stack Overflow Blog
Last Week in AI
Last Week in AI
Y
Y Combinator Blog
罗磊的独立博客
T
Tailwind CSS Blog
博客园 - 叶小钗
T
The Blog of Author Tim Ferriss
Engineering at Meta
Engineering at Meta
博客园 - 聂微东
博客园 - Franky
B
Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
F
Fortinet All Blogs

运维开发绿皮书

OBS虚拟摄像头重命名 Ubuntu备份为LiveOS 使用Powershell卸载windows默认程序 Cisco路由器OSPF配置 汽车的分类和特点 Windows11跳过TPM2.0 HTTPS 双向认证与 USB 加密锁配置实战 SSL 证书工具 字数统计 BMI 计算 颜色转换 Hash 生成器 JSON 格式化 JWT 解码 房贷计算 时间戳转换 URL 编码 UUID 生成 牛马时钟 二维码批量生成器 CKS Simulator Kubernetes 1.25 FRP TOTP验证码生成器 direct-ssh-passthrough-nat 脚本使用说明 Python软件授权 Linux命令行百度网盘 为 Containerd 配置 Harbor 无证书镜像站 Docker一键部署Meta和MetacubexD面板 必应搜索屏蔽垃圾网站 VMware的ubuntu完整安装vm-tools支持粘贴板
模型架构-Transformer模型
Paper-Dragon · 2025-06-18 · via 运维开发绿皮书

Paper-Dragon2025/6/18...大约 1 分钟


模型架构-Transformer模型

Why Attention?

搜索场景

在搜索场景中,人们的目光往往会更加关注左上角的三角区域(即第一条搜索结果的位置)

image-20250617180226663

阅读中

image-20250617180330064

浏览图文信息

image-20250617180404154

注意力机制

注意力机制,可以视为一致基于相似度的查表

image-20250617180516947

核心模块: 注意力

  • Transformer完全抛弃传统的CNN和RNN,整个网络结构完全由注意力机制组成

编码器-解码器结构

  • 编码器将输入序列变换为隐藏层特征
  • 解码器将隐藏层特征变换为输出序列

image-20250617181405802

编码器:将输入变换为隐藏层特征

  • N个堆叠的编码器层
    • 多头注意力
    • 前馈网络
    • 残差连接和层归一化

image-20250617181958884

解码器:将隐藏层特征变换为自然语言序列

  • N个堆叠的解码器层
    • (掩码)多头注意力
    • 前馈网络
    • 残差链接和层归一化

image-20250617182115104

更新日志

  • 7a639-排序 大语言模型