惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

N
Netflix TechBlog - Medium
I
InfoQ
Engineering at Meta
Engineering at Meta
Jina AI
Jina AI
Recent Announcements
Recent Announcements
T
The Blog of Author Tim Ferriss
P
Proofpoint News Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
D
Docker
Microsoft Security Blog
Microsoft Security Blog
宝玉的分享
宝玉的分享
Last Week in AI
Last Week in AI
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
GbyAI
GbyAI
博客园 - Franky
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
博客园 - 叶小钗
酷 壳 – CoolShell
酷 壳 – CoolShell
B
Blog RSS Feed
WordPress大学
WordPress大学
MyScale Blog
MyScale Blog
月光博客
月光博客
罗磊的独立博客

雷峰网

1.8亿人在小红书读书:图书业在小红书电商营收规模年增超30% | 雷峰网 减重300kg,首搭5nm智驾芯片:2026款乐道L90正式亮相 | 雷峰网 阶跃和千⾥科技官宣战略合作:打造原⽣智驾基座模型,提升物理AI能⼒上限 | 雷峰网 “还债骑手”被强制下线240次:“开始我很反感过劳提醒,影响赚钱” | 雷峰网 石头科技:2025年营收高增56.51%,2026Q1营收增23.31% | 雷峰网 Mythos引爆攻击工业化时代,奇安信:构建三位一体内生安全体系是破解之道 | 雷峰网 曝两家科技大厂争投DeepSeek,估值飙至200亿美元;小米深夜放大招!最强大模型MiMo-V2.5系列发布;微软 Xbox 部门将裁员15% | 雷峰网 RGB-Mini LED电视普及风暴,海信正式发布小墨E5S Pro | 雷峰网 标配8255芯片与CDC,奇瑞试图终结“燃油车无智驾”时代 | 雷峰网 德赛西威也不相信,智驾能让Tier1躺着赚钱 | 雷峰网 找来刘翔做代言人,可能是智己LS8最好的一步棋 | 雷峰网 「中国版Grok上车」分水岭:阶跃交出首份量产答卷 | 雷峰网 百度Create大会双主论坛议程揭晓,多项重磅升级发布将集中亮相 | 雷峰网 泄露用户隐私!曝某AI助手将B用户简历发给A用户;苹果更换CEO原因曝光;微信宣布5国可用微信支付;航旅纵横「崩」了一天,借钱功能却正常 | 雷峰网 一季度交付1200件精益工具,希音深入技术创新提升按需时尚竞争力 | 雷峰网 从“替代”到“重构”:联想开天“1+2+N”如何重写信创AI PC逻辑? | 雷峰网 中山大学郭裕兰团队:数据充足却训练失败,多智能体到底卡在哪丨CVPR 2026 | 雷峰网 上交大 x vivo 团队:一个简单改动,让 diffusion 全面提升丨CVPR 2026 死亡率「99%」的芯片创业淘汰赛,为旌科技为何能活下来? | 雷峰网 清华段岳圻团队论文:从调参数到做控制,文生图迎来一次方法论升级丨CVPR 2026 | 雷峰网 东南大学耿新团队:模型不是不会做,而是被「挤掉了能力」丨CVPR 2026 | 雷峰网 西湖大学张驰团队:不重训,也能让视频生成更长更稳丨CVPR 2026 | 雷峰网 西湖大学张驰团队:从视觉合成到空间理解,视频 AI 正在「转向」丨CVPR 2026 | 雷峰网 21.0975 公里,是人形机器人的里程碑,也是 RISC-V 的新起点 | 雷峰网 独家 | 华为19级天才少年赵立晨离职创业,瞄准具身 Agentic OS 独家 | CMU系⼜诞⽣⼀家具⾝智能公司「Zeno AI」 | 雷峰网 Token消耗量翻10倍才算企业转型及格线?三位产业一线大佬教你用出性价比 | 雷峰网 阿里发布Qwen3.6-Max预览版,登顶最佳国产模型 | 雷峰网 郭达雅加入巨头背后:顶尖AI人才为何向大厂「回流」? | 雷峰网 解决机器人散热困境,华科冷芯高速悬浮泵液冷方案助力荣耀人形机器人“闪电”夺冠 | 雷峰网
DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术 | 雷峰网
2026-05-11 · via 雷峰网

雷峰网讯 越过数个发布窗口,4 月 24 日,DeepSeek 最新一代旗舰模型 DeepSeek-V4 终于正式发布。

此次发布的 DeepSeek-V4 主打百万字超长上下文,在 Agent 能力、世界知识和推理性能上均表现亮眼。有意思的是,4 月 8 日凌晨 DeepSeek 悄然上线了专家模式和快速模式,外界一度猜测是 V4 的不同版本。这一猜测得到了官方确认,按参数量大小,V4 此次同步推出了 pro 及 flash 两个版本。

DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术

相较于前代模型,V4 的 Agent 能力有了大幅提高。DeepSeek-V4-Pro 在 Agentic Coding 评测中,已达到当前开源模型最佳水平,且在其它 Agent 相关评测中同样表现优异。DeepSeek 内部评测反馈显示,DeepSeek-V4-Pro 使用体验优于 Sonnet 4.5,交付质量接近 Opus 4.6 非思考模式,但仍与 Opus 4.6 思考模式存在一定差距。

此外在 SimpleQA Verified、HLE 等知识推理类基准测试中,DeepSeek V4 的表现均居于前列,特别是在ApexShortlist、Codeforces 两项测试中分别以 90.2 和 3206 的成绩登顶,表现出了顶级的推理性能和世界知识储备。

DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术

价格方面,pro 版本和 flash 版本采取了阶梯定价。更小更快的 flash 版本继承了前代模型便宜大碗路线的,同时 pro 版本的降价也被官方排上日程,预计会随着今年下半年昇腾 950 超节点的批量上市实现大幅下调。

DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术

值得注意的是,DeepSeek-V4 针对昇腾等国产芯片进行了深度适配,实现推理环节全面兼容,有传闻称利用率可达 85% 以上。而据路透社报道,此前 DeepSeek 也拒绝向包括英伟达在内的美国芯片制造商提供 V4 模型的早期访问权限。

在美国对华出台高端 GPU 禁令、限制技术交流的背景下,DeepSeek 选择以技术对等的姿态回应,和美方的脱钩构成了一种有趣的镜像关系。而回到国内,DeepSeek-V4 的背书证明了国产芯片足以支持第一梯队大模型的推理部署,开始完成从“可用”到“好用”的跨越。同时被国产算力托住的 V4,也或可视为一个备战“全华班模型生态”的起点。

01

架构创新,破解模型推理“不可能三角”

DeepSeek-V4 的上下文窗口跨越式地来到了 100 万 Token 大关,并宣称这此后将是 DeepSeek 所有官方服务的标配。

据官方技术文档介绍,这种长文本能力的成熟源于 DeepSeek 开创的一种全新注意力机制,在 token 维度进行压缩,结合 DSA 稀疏注意力(DeepSeek Sparse Attention),此举不仅实现了全球领先的长上下文能力,并且相比于传统方法大幅降低了对计算和显存的需求。

DeepSeek-V4:华为昇腾适配、性价比王者、最新底层技术

DeepSeek 对长文本能力的探索早有迹象。在 V4 迟迟没有问世的时间里,DeepSeek 低调发布的两篇论文《mHC: Manifold-Constrained Hyper-Connections》,和两周以后紧随其后的《Engram: Conditional Memory via Scalable Lookup》,被外界视为其在长文本方面的有力技术储备。

在长文本推理任务中,大模型长期存在着成本、速度、精度的不可能三角,但 Engram 架构提供了一种破局思路。该架构包含一个静态知识检索模块,和一个动态推理协同模块,前者通过哈希查找机制,将事实性知识存储在廉价的 CPU 内存中,节省了对推理尤其宝贵的 GPU 显存,后者负责判断检索到的记忆是否应该调用,并在必要时将其无缝融入推理过程。

这种设计的本质是将模型的记忆和计算分离,通过对信息存储进行更精细的分层管理,使大模型能用上廉价、大容量的 CPU 内容,并确保 GPU 显存“好钢用在刀刃上”,在其擅长的动态并行计算中发挥出更大价值,最终在降低计算成本的同时保证关键信息不会丢失。其结果是当 MoE 的“专家”们再进行推理时,会像是配备了一位专门的助理,确保他们得到的信息及时、相关且准确。

DeepSeek-V4 的另一项底层创新,是其在训练中使用 的 mHC(流形约束超连接)技术。

V4 的参数总量达到了 1.6T,这种超大规模的神经网络训练,本身就是一个富于挑战的问题。传统的 Transformer 架构中,信息会在层层传递中呈指数级放大,模型参数量越大、层数越深,这种“信号爆炸”越严重,最终可能导致梯度爆炸,训练崩溃。

mHC 技术正是为解决“信号爆炸”现象提出,其核心思想是用严格的几何约束来控制信息流动,而不是放任自由连接。

这个防爆设计由三个环节组成。流形约束会把层间连接矩阵投影到双随机矩阵流形,强制规定每个节点的"输入总和"和"输出总和"必须守恒,具体的投影过程通过 Sinkhorn-Knopp 算法执行,两者共同把信号增益严格限制在合理倍数。最后的多流残差设计在扩展残差流宽度的同时,通过非负约束避免信号相互抵消,既能增强模型表达能力,又兼顾了复杂度和稳定性。

想象信息是一条奔腾的大河,多流残差拓宽了河道,流形约束和 Sinkhorn-Knopp 算法就是一道道闸门,三者的配合保证了大规模训练时的信息洪流不会引发梯度爆炸。

而 mHC 技术更深刻的意义在于,它和 MoE 架构、Engram 架构等技术共同为后 Scaling Law 时代的大模型扩展提供了一种可能的范式,也就是在参数规模、数据量的传统维度之外,转向追求更高的连接、参数和记忆效率。区别于前者的暴力美学,DeepSeek-V4 呈现了精致工程的魔力。

02

模型之争的工程转向

用流形约束防止信号爆炸的架构理论创新得以落地,离不开算子融合、选择性重计算、通信重叠等工程手段。参数量和稳定性之间的冲突曾经是制约大模型继续扩展的根本矛盾,而 mHC 技术对此的突破,建立在顶级的工程优化之上。

Engram 架构也有着类似的启示。内存访问如何精准配合 GPU 的计算过程,多级缓存需要什么样的精细管理……Engram 架构在 V4 上落地伴随的种种工程挑战,才是底层技术创新能否转化为模型能力关键。

智能的使用应有其边界,记忆管理的精细程度直接影响模型性能,这一范式重新诠释了对智能上限的追求。未来最聪明的模型,或许是最经济地界定了智能使用边界的模型。

DeepSeek-V4 问世之后,我们和应用爆发之间的距离或许又近了一大步。

原生多模态架构、百万 Token 上下文窗口纷纷走向成熟,背后是代码、法律和金融等场景的巨大想象空间。而 V4 所展现的顶级工程能力,和模型智能迭代逐渐放缓的背景合流,更便宜、可得的智能产品也会不断涌现。

雷峰网(公众号:雷峰网)文章

雷峰网原创文章,未经授权禁止转载。详情见转载须知

分享:

相关文章