惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Secure Thoughts
C
Cybersecurity and Infrastructure Security Agency CISA
T
Tenable Blog
Project Zero
Project Zero
T
The Exploit Database - CXSecurity.com
T
Threat Research - Cisco Blogs
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Cyberwarzone
Cyberwarzone
PCI Perspectives
PCI Perspectives
G
GRAHAM CLULEY
H
Hacker News: Front Page
Cloudbric
Cloudbric
Latest news
Latest news
N
News and Events Feed by Topic
C
CERT Recently Published Vulnerability Notes
Attack and Defense Labs
Attack and Defense Labs
SecWiki News
SecWiki News
Security Latest
Security Latest
MyScale Blog
MyScale Blog
阮一峰的网络日志
阮一峰的网络日志
Vercel News
Vercel News
The GitHub Blog
The GitHub Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Security Archives - TechRepublic
Security Archives - TechRepublic
V2EX - 技术
V2EX - 技术
B
Blog RSS Feed
L
LINUX DO - 最新话题
人人都是产品经理
人人都是产品经理
Last Week in AI
Last Week in AI
IT之家
IT之家
Jina AI
Jina AI
Y
Y Combinator Blog
博客园 - 聂微东
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
V
Visual Studio Blog
P
Privacy International News Feed
B
Blog
S
Schneier on Security
Application and Cybersecurity Blog
Application and Cybersecurity Blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Hacker News - Newest:
Hacker News - Newest: "LLM"
Help Net Security
Help Net Security
D
DataBreaches.Net
博客园_首页
G
Google Developers Blog
I
InfoQ
量子位
大猫的无限游戏
大猫的无限游戏
S
Security @ Cisco Blogs

博客园 - PetterLiu

OpenReel开源项目 OpenConnector 技术白皮书 汽车行业高效办公AI实践案例集 微软开源Flint语义驱动的图表项目 - PetterLiu 工业互联网零信任安全应用进展与挑战 - PetterLiu 开发思维导论:从大白话创意到AI全自动执行 - PetterLiu 从微服务到 Agent:我们到底在焦虑什么? Drain3与LogParser-LLM技术优劣势及适用场景对比 人机协作的工程化进化路线与落地案例 长视频如何实现信息压缩与细节 AI 站点可靠性工程 (SRE) Agent 苹果公司"中国+1"布局的逻辑重塑与风险对冲 训练 Agent 最怕什么?不是模型笨,是环境烂。 大语言模型自我验证机制与环境鲁棒性前沿技术研究报告 全球软件产业智能化范式转移与商业价值重构研究报告 基于AJ-Bench智能体自我验证场景案 物业行业 AI 落地避坑指南 AI 驱动的视频内容自动化创作框架ShortGPT 2026年6月份个人回顾 Skill不是长Prompt:如何写出工业级 Skill AI 驱动下的上下文治理与管理范式革命 为什么 FDE 正在成为商业落地的唯一解药 《不懂人性,就别做管理》:软件研发管理的核心洞察解读 四周实现非母语教学APP Agent Mail 产品介绍与 Trae Solo Agent 实测 AI时代团队效能的非线性陷阱与组织重构升级 AI落地三大误区与组织提效路径 AI工程化人才的角色演变与组织冲击 揭秘AI搜索时代的"GEO全链路技能库" AI领域值得关注的人与机构 MAICC 如何让 AI 团队在瞬间学会完美协作 去AI味十大Agent skill 六个视频类Agent Skills 工业级 AI Skill 构建指南 FDE-AI落地时代的“最后公里”解决者 Book to skill 将书籍蒸馏为skill 深度学习论文精读方法论 每个科研新人都该读的经典短文How to Read a Paper 从DeepSeek-Agent Harness研发员岗位看齐 小米XiaoMiTTS-Local-Skill 某大厂AI应用开发面试题 钉钉无招管理风格与企业文化 Antigravity Agent Skills Antigravity 2.0智能体 如何用 Codex 建立行业认知框架 Qwen3.7-Plus新一代多模态智能体核心突破 训练小模型2026 年最被低估的 AI 技能 打工人必装的12个 Skills 儿童古诗词绘本AIGC 豆包-编程优点与缺点 mimo2codex实现 codex+xiaomi mimo模型 研发自动驾驶的冷思考 AI重构媒体行业 Salesforce Headless 360 架构变革--Agent 时代的系统交互范式重构 怎么把一个想法拆给 AI? AI时代的高效研发协同体系:从“即时规划”到“左移验证”的范式转移白皮书 Agency-agents开源项目介绍 Anthropic官方Claude for Financial Services介绍 FeedSpot上订阅英语口语Podcast 如何成为任何领域的前 1% OpenAI 与Anthropic 开放公共学习平台 AI时代的学习策略与元能力培养 NotebookLM书籍转化为行动计划 CodeWiki代码解读工程 20 个 NotebookLM 提示词--帮助你更快学习 5个文件夹让Claude Code变身完整开发团队 AI应用-看图学英语单词手账 产品经理的AI副驾驶 泡泡玛特LABUBU冰箱的炒作现象经济学解读 8个Claude Code刚需高阶Skills 经济学原理分析2025年底计算机内存事件 小米MiMo-V2.5系列模型开源 回顾生成式AI的Skill AIGC大字海报 小米XiaoMiTTS-Local-Skill 2026年4月23日榴莲价格行情经济学原理分析 RAG技术落地核心要点 开源的 Agent Skills项目 AIGC=制作的 3x3 网格拼贴肖像 Chrome解锁“上帝模式”:免费AI+垂直标签,搞钱效率直接翻倍 n8n skills 灵感获取方法 Qwen Code免费额度到期后变更策略 Claude Code的Agent系统设计模式 AI时代个人竞争力的重构:从全科知识到异质性判断力 企业大模型LLM编程SDD方法落地方案 MemPalace 开源的本地 AI 记忆系统 QwenCode小试牛刀 行业中大佬的的知识管理方法 Graphify的AI编码助手 Trae国际版中代码审查功能初试 Trae国际版本中对话历史查询 Claude Code的源码泄露 Token是什么 GEO的场景与落地 代码工程文档生成:从代码到战略蓝图的 AI 化实践 智能体组织研发范式变革 关于企业群消息爆炸案例分析 AI + WMS:从自动化迈向自主智能仓储 2500路门店视频监控服务器配置 AI智能体时代财务人员的职业转型与组织变革
2026年4月发布的五款(LLM)架构
PetterLiu · 2026-04-27 · via 博客园 - PetterLiu

2026年4月发布的五款(LLM)架构

4LLM

整体来看,各大模型在向更大的参数规模迈进的同时,正在通过极其激进的混合专家(MoE)稀疏化注意力机制创新以及超长上下文支持来降低推理成本并提升效率。

以下是对图中五款模型架构的详细解读:

1. Gemma 4 (31B)

作为一款310亿参数的稠密(Dense)模型,Gemma 4 在结构上进行了精细的注意力机制优化。

  • 基础规格:词表大小 262k,支持 256k tokens 的上下文长度,共 60 层(Layers)。

  • 核心创新:采用了 5:1 的局部(Local)与全局(Global)注意力比例。局部注意力包含32个注意力头,全局注意力包含32个注意力头及4个键值头(Key & Value heads)。

  • 其他细节:嵌入维度(Embedding dim)为 5,376,前馈网络(FFN)中间层维度为 21,504,并使用了 QK-Norm 和 RoPE(旋转位置编码)。

2. Qwen3.6 (35B-A3B)

这是一款总参数量350亿,但推理时激活参数仅为30亿(3B)的高效 MoE 模型。

  • 基础规格:词表大小 248k,支持 262k 上下文长度(可扩展至 1M tokens),共 40 层。

  • 核心创新混合注意力架构。它将“门控 DeltaNet”(线性注意力)与“门控注意力”(全注意力)按照 3:1 的比例混合使用(例如前三层为线性注意力+MoE,第四层为全注意力+MoE),以此在长文本处理效率和全局理解能力之间取得平衡。

  • MoE 结构:拥有高达 256 个专家(Experts)。

3. GLM-5.1 (744B)

智谱的这款千亿级模型展示了早期层与深层架构的区别化设计。

  • 基础规格:总参数量 7440亿,推理时激活参数仅 400亿(40B)。词表大小 155k,支持 202k 上下文,共 78 层。

  • 核心创新:前3个模块采用稠密前馈网络(Dense FFN),隐藏层大小为 12,288;之后的层才使用 MoE 架构。

  • MoE 结构:采用 8 个普通专家 + 1 个共享专家的模式(Shared Expert)。

4. Kimi K2.6 (1T)

月之暗面(Moonshot)推出的万亿参数模型,将稀疏性推向了极致。

  • 基础规格:总参数量达 1万亿(1T),但每次推理仅激活 320亿(32B)参数。词表大小 160k,支持 256k 上下文,共 61 层。

  • 核心创新:与 GLM 类似,它的第1层使用了稠密 FFN(隐藏层大小 18,432),后续层使用 MoE。

  • MoE 结构:同样采用 8 个普通专家 + 1 个共享专家。

5. DeepSeek V4-Pro (1.6T)

图中占据最大篇幅的旗舰模型,总参数量高达 1.6 万亿,架构最为复杂前卫。

  • 基础规格:每次推理激活 490亿(49B)参数。词表大小 129k,支持高达 1M tokens 的超长上下文,共 61 层,128个注意力头。

  • 核心创新

    • mhC(流形约束超连接 / manifold-constrained hyper-connections):替代了普通的残差连接($x + F(x)$),采用具有4条并行残差流的多流混合结构。

    • 基于哈希的 MoE(Hash-based MoE):前3层没有使用传统的 Learned Top-k 路由,而是使用了哈希路由技术。

  • MoE 结构:采用 6 个普通专家 + 1 个共享专家。

架构演进趋势总结
  1. 极致的 MoE 稀疏化:万亿级模型(如 Kimi K2.6、DeepSeek V4-Pro)已成为常态,但它们的“激活参数率”极低(通常在 3% 左右)。1.6T 模型只需激活 49B,这意味着只需较小的算力即可运行万亿级知识库。

  2. 异构层设计(Heterogeneous Layers):不再是所有层都千篇一律。GLM、Kimi 和 DeepSeek 都在模型的最前几层放弃了标准 MoE,改为使用 Dense FFN 或 Hash-based MoE,以捕获更基础的浅层特征。

  3. 注意力机制的“混搭”:Qwen 3.6 的“线性+全注意力” 3:1 混合,以及 Gemma 的“局部+全局” 5:1 混合,说明学术界和工业界正在想尽办法突破标准 Transformer 中 $O(N^2)$ 的计算瓶颈。

  4. “共享专家(Shared Expert)”成为标配:GLM、Kimi、DeepSeek 均采用了 N个普通专家 + 1个共享专家 的 MoE 路由策略,这有助于保留通用知识,防止专家坍塌。