惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
Hugging Face - Blog
Hugging Face - Blog
博客园_首页
爱范儿
爱范儿
罗磊的独立博客
美团技术团队
Jina AI
Jina AI
量子位
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
酷 壳 – CoolShell
酷 壳 – CoolShell
有赞技术团队
有赞技术团队
V
V2EX
阮一峰的网络日志
阮一峰的网络日志
小众软件
小众软件
IT之家
IT之家
雷峰网
雷峰网
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 司徒正美
大猫的无限游戏
大猫的无限游戏
博客园 - 聂微东
月光博客
月光博客
人人都是产品经理
人人都是产品经理
博客园 - 三生石上(FineUI控件)

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
DeepSeek发布mHC新架构:解决大规模训练不稳定性,性能全面超...
站外新闻 · 2026-06-13 · via Prompt 语宙

💡 站外导读:随着基础模型参数规模突破千亿级,传统神经网络架构在超大规模训练中面临严重的信号不稳定、梯度消失与爆炸等问题,制约了模型能力的进一步提升。DeepSeek团队针对这一核心痛点,提出了名为mHC(流形约束超连接)的新型架构,旨在从底层信号传播机制上解决扩展性难题,为构建更强大、更稳定的基础模型铺平道路。

mHC(Manifold-Constrained Hyper-Connections)是DeepSeek团队推出的新型的神经网络架构设计方法,解决传统超连接(Hyper-Connections, HC)架构在大规模训练中的稳定性问题。mHC通过将HC的残差连接空间投影到特定的流形上,恢复了残差连接的恒等映射特性,有效避免了梯度爆炸或消失的问题。mHC利用Sinkhorn-Knopp算法将残差连接矩阵投影到双随机矩阵构成的流形上,确保信号在传播过程中的均值保持不变,同时严格规范信号范数。mHC结合了高效的基础设施优化,如内核融合、选择性重计算和通信重叠等技术,确保在大规模模型中的高效实现。实验表明,mHC在训练稳定性、收敛速度和下游任务性能上均优于基线模型和HC,且在大规模训练中的时间开销仅略有增加。mHC作为一种通用框架,为深度学习架构设计提供了新的思路,有望推动下一代基础架构的演进。

  • mHC是什么
  • mHC的主要功能
  • mHC的技术原理
  • mHC的项目地址
  • mHC的应用场景
      • 📝 站长洞察 (Editor’s Insight)

mHC

mHC的主要功能

  • 恢复恒等映射特性:通过将残差连接空间投影到特定流形上,mHC恢复了残差连接的恒等映射特性,有效解决了传统超连接架构在多层扩展时导致的信号不稳定问题,显著提升了大规模训练的稳定性。

  • 流形约束与信号规范:利用双随机矩阵流形,mHC确保信号在传播过程中保持均值不变,并严格规范信号范数,有效避免了梯度爆炸或消失的问题,显著增强了信号传播的稳定性。

  • 高效基础设施优化:通过内核融合、选择性重计算和通信重叠等技术,mHC在大规模模型中实现了高效运行,仅引入极小的训练开销,确保了在实际应用中的高效性和可扩展性。

  • 提升模型性能:实验表明,mHC在多个下游任务中显著优于基线模型和传统超连接架构,特别是在复杂任务如BBH和DROP中表现突出,提升了模型的推理能力和整体性能。

  • 可扩展性与灵活性:mHC作为一种通用框架,适用于多种模型规模,为未来探索不同的流形约束提供了新的方向,有望推动下一代基础架构的演进。

mHC的技术原理

  • 流形投影:mHC通过将残差连接矩阵投影到特定的流形空间(如双随机矩阵的Birkhoff多面体)来约束连接矩阵的性质。这种投影确保了信号在传播过程中保持稳定,同时保留了信息交互的能力。

  • 双随机矩阵的应用:双随机矩阵具有行和列之和均为1的特性,使信号在传播时保持均值不变,严格规范信号范数,有效避免梯度爆炸或消失的问题。

  • Sinkhorn-Knopp算法:mHC利用Sinkhorn-Knopp算法实现对残差连接矩阵的流形投影。通过迭代归一化行和列,将任意非负矩阵调整为双随机矩阵,实现稳定的信号传播。

  • 恒等映射的恢复:通过流形约束,mHC恢复了残差连接的恒等映射特性,确保信号在多层网络中稳定传播,解决了传统超连接架构中因缺乏恒等映射而导致的训练不稳定性。

  • 高效计算与优化:mHC结合了内核融合、混合精度计算、选择性重计算等技术,优化了计算效率,降低了内存访问开销,使得该架构在大规模模型训练中具有较高的效率和可扩展性。

  • 信号传播的稳定性:mHC通过约束残差连接矩阵,确保信号在前向传播和反向传播过程中保持稳定,显著降低了信号增益的极端值,提高了模型训练的稳定性和收敛速度。

mHC的项目地址

  • arXiv技术论文:https://arxiv.org/pdf/2512.24880

mHC的应用场景

  • 大规模语言模型预训练:mHC能有效提升语言模型在大规模数据集上的训练稳定性,适用于27B等超大规模语言模型的预训练任务,显著改善模型的收敛速度和性能表现。

  • 多任务学习与推理:在涉及多种下游任务(如BBH、DROP、GSM8K等)的场景中,mHC通过增强模型的推理能力和稳定性,帮助模型在复杂任务中取得更好的成绩,提升多任务学习的效率。

  • 高效分布式训练:mHC结合优化的基础设施设计,如内核融合和通信重叠,适用于分布式训练环境,尤其在大规模集群中能显著降低训练开销,提高训练效率。

  • 下一代架构演进:mHC作为一种通用框架,为探索新型神经网络架构提供了基础,支持研究者在不同的流形约束和优化策略下进行创新,推动下一代基础架构的演进。

  • 资源受限环境:由于mHC在保持性能的同时引入的计算开销极小,适用于资源受限的环境,如移动设备或边缘计算场景,能在有限的计算资源下实现高效的模型部署。

  • 学术研究与理论探索:mHC为研究深度学习中的信号传播和架构设计提供了新的视角,适用于学术研究中对神经网络拓扑结构和优化策略的深入探索。

📝 站长洞察 (Editor’s Insight)

mHC的提出,标志着深度学习架构设计正从经验主义向更严格的数学约束范式演进。它将残差连接的优化置于“流形约束”这一更高维度的思考框架下,这不仅是对现有HC架构的修补,更是一次深刻的范式探索。在AGI竞赛白热化的当下,架构的稳定性与可扩展性已成为决定胜负的隐形基石。DeepSeek此举,不仅展示了其深厚的理论功底,更精准地瞄准了行业下一步规模化发展的“卡脖子”环节。这或将引发新一轮关于“如何为超级模型设计稳定骨架”的技术竞赛,其影响将从学术界迅速蔓延至所有致力于训练前沿模型的企业。