惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Vercel News
Vercel News
博客园 - 【当耐特】
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
小众软件
小众软件
Hugging Face - Blog
Hugging Face - Blog
aimingoo的专栏
aimingoo的专栏
WordPress大学
WordPress大学
G
Google Developers Blog
博客园 - 叶小钗
大猫的无限游戏
大猫的无限游戏
P
Proofpoint News Feed
J
Java Code Geeks
U
Unit 42
云风的 BLOG
云风的 BLOG
阮一峰的网络日志
阮一峰的网络日志
N
Netflix TechBlog - Medium
宝玉的分享
宝玉的分享
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Docker
V
Visual Studio Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
H
Help Net Security
V
V2EX
T
Tailwind CSS Blog

IT之家

消息称大疆 Pocket 4 目标超千万,可能是一英寸 CMOS 出货量最大的单品 OpenAI 回应马斯克要求罢免奥尔特曼:搞法律突袭,扰乱诉讼 - IT之家 鸿蒙智行问界 M6 预订量突破 10 万台,预售 26.98 万元起 今年一季度全国铁路完成固定资产投资 1379 亿元,西十高铁、雄商高铁山东段联调联试 - IT之家 首届北京市中学生人形机器人足球赛今日启动,近 50 支队伍参赛 - IT之家 涉及“赵一鸣是日本品牌”等,抖音处置 1500 余条谣言内容 - IT之家 广汽集团与海尔集团签约,探索“人车家”互联生态 - IT之家 亚马逊调整云游戏平台 Luna 业务模式,取消 Ubisoft+、GOG 等第三方商店 消息称华擎将推出 X870E Taichi White,补全 AMD 800 系白色旗舰主板缺失 长城汽车归元平台首款方盒子全球征名,十二佳提名公布 - IT之家 消息称雷克萨斯新车即将支持苹果数字车钥匙 - IT之家 普京要求俄罗斯加速自研有竞争力的 AI 模型,彻底转向国产技术 - IT之家 影石刘靖康:已开源保真全景无人机仿真平台 AirSim360、DAP 全景度量深度模型等核心成果 - IT之家 长安汽车总经理赵非:当前车企仅靠卖车已难以盈利 - IT之家 地平线创始人余凯:4 月 22 日推出中国第一款舱驾融合智能体芯片“星空” - IT之家 冯兴亚:广汽集团具身智能机器人即将量产,飞行汽车预计今年完成适航认证并量产交付 - IT之家 模块化笔电制造商 Framework CEO 痛批业界追逐“AI 优先”,称个人计算设备可能就此消亡 16 年来首次:小米首届员工运动会今天启幕,雷军压轴致辞 - IT之家 比亚迪廉玉波:新能源汽车产业正进入确定性与不确定性并存的阶段 - IT之家 阿耳忒弥斯 2 号宇航员安全返回地球,有哪些技术和科研收获 - IT之家 曝索尼 Alpha 7R VI 全画幅无反相机将随 100-400mm f/4.0 GM 镜头一同登场,发布会预计在 5 月 小米产教融合最新成绩披露:合作院校超 400 家、成都基地启用 - IT之家 亚马逊 CEO 贾西:自研芯片年化收入预估 500 亿美元,规模超 AMD 与英特尔 马来西亚推动“AI 城市”转型,目标 2030 年成为“AI 国家” Galaxy S24 Ultra 手机用户反馈三星人为设限,无法使用 Galaxy Buds4 Pro 耳机高清语音 广汽集团董事长冯兴亚:当前县级市场新能源汽车渗透率不到 20% - IT之家 消息称《地铁:离去》新作下周公布,有望 State of Play 发布会亮相 广汽新一代智能座舱架构与电子电气架构明日发布,将宣布芯片生态建设的重大突破 - IT之家 苹果预订台积电 6 万片晶圆产能,2027 年全力冲刺 AI 服务器芯片 日本经济产业省向 Rapidus 追加 6315 亿日元支持,加速下一代半导体研发
北大与 DeepSeek 联合开源 DSpark:破解 AI 大模型高并发推理...
作者:问舟 · 2026-06-27 · via IT之家
AI 总结
  1. DSpark采用半自回归架构,并行主干网络一次性产出全部候选位置隐藏状态和基础logits,再由轻量级顺序模块逐token注入前缀依赖信息。同时引入置信度调度验证机制,根据每个位置的置信度得分动态决定验证长度,优先将目标模型计算资源分配给全局存活概率最高的token。该机制解决了并行草稿模型长候选块接受率低和固定验证策略资源浪费的问题。

  2. 在离线基准测试中,DSpark在Qwen3系列(4B/8B/14B)和Gemma4-12B等目标模型上,对比自回归草稿模型Eagle3与并行草稿模型DFlash,在数学推理、代码生成和日常对话三类任务中平均每轮接受长度均优于两类基线。以Qwen3-4B为例,DSpark相比Eagle3提升约30.9%,相比DFlash提升约16.3%。

  3. 在DeepSeek-V4-Flash和V4-Pro预览版引擎的生产环境中,DSpark与单token基线MTP-1对比。V4-Flash引擎上,保证单用户生成速度不低于80 token/s时,聚合吞吐量提升51%;35 token/s的SLA下V4-Pro吞吐量提升52%。在匹配的实际吞吐量水平下,单用户生成速度提升57%至85%,且调度器表现出负载自适应的验证预算分配能力。

IT之家 6 月 27 日消息,今日,DeepSeek 联合北京大学正式发布 DSpark 推理加速框架,旨在解决大语言模型在高并发生产环境中的推理效率瓶颈。

该框架已部署于 DeepSeek-V4-Flash 与 DeepSeek-V4-Pro 的预览版服务引擎中,相比此前生产环境采用的单 token 推测解码基线 MTP-1,在同等吞吐量水平下可将单用户生成速度提升 60% 至 85%。相关论文、训练代码等已在 GitHub 上开源。

大语言模型生成文本时采用自回归方式,每生成一个新 token 都需要一次完整的前向传播,推理延迟随输出长度线性增长,这是目前 AI 对话系统响应偏慢的核心原因之一。推测解码技术提供了一条解决路径:用一个轻量级的小模型快速生成若干候选 token,再由完整规模的大模型通过单次并行前向传播进行批量验证,接受其中符合目标分布的连续前缀。由于验证阶段可并行计算,且拒绝采样机制严格保证了输出分布与原始模型一致,推测解码能够在无损生成质量的前提下提升速度。

但推测解码的实际加速效果受制于两个因素:一是候选生成的质量,二是验证阶段对目标模型计算资源的占用。当前主流方案分为两派。自回归式草稿模型(如 Eagle3)逐 token 串行生成候选序列,依赖关系建模能力强、接受率高,但生成延迟随候选长度线性增长,迫使实际部署中只能使用短候选块和浅层网络。并行式草稿模型(如 DFlash)则在一个前向传播内一次性产出全部候选 token,生成延迟几乎与候选长度无关,理论上支持更长的候选块。

然而并行生成每个位置时无法依赖块内先前已采样的 token,导致随着候选位置后移,不同语义路径相互冲突、接受率迅速衰减,长候选块的后缀 token 往往在验证阶段被大量拒绝,造成目标模型计算资源的浪费。此外,在并发请求较多的生产环境中,固定长度的验证策略会迫使目标模型将宝贵的批量处理能力消耗在高拒绝风险的尾部 token 上,导致整体吞吐量下降。

DSpark 的设计围绕上述两个瓶颈展开,提出了两项互补机制。在候选生成阶段,DSpark 采用半自回归架构:计算量较大的并行主干网络(基于 DFlash 改进)一次性产出全部候选位置的隐藏状态和基础 logits,随后由一个轻量级顺序模块逐 token 注入前缀依赖信息。该顺序模块提供两种实现 —— 仅依赖前一个 token 的马尔可夫头,以及通过循环状态累积完整前缀信息的 RNN 头。

实验表明,两层 Transformer 深度的 DSpark 即可在所有测试领域上超过五层 DFlash 的接受长度,表明少量自回归依赖的引入在参数效率上优于单纯堆叠并行层。

在验证调度阶段,DSpark 引入置信度调度验证机制。模型在每个候选位置输出一个置信度分数,预测该 token 在给定此前所有 token 均被接受的条件下的存活概率。受训阶段完成后,团队在验证集上通过逐位置温度缩放对置信度进行校准,使其与经验接受率对齐。

在此基础上,硬件感知前缀调度器将验证长度选择建模为全局吞吐量最大化问题:给定一批并发请求及其各位置置信度,结合预先实测的引擎吞吐量曲线,调度器为每个请求动态决定验证多长的候选前缀,优先将目标模型的计算资源分配给全局存活概率最高的 token。

在离线基准测试中,研究团队选取了 Qwen3 系列(4B/8B/14B)和 Gemma4-12B 作为目标模型,对比自回归草稿模型 Eagle3 与并行草稿模型 DFlash。

在数学推理(GSM8K、MATH500、AIME25)、代码生成(MBPP、HumanEval、LiveCodeBench)和日常对话(MT-Bench、Alpaca、Arena-Hard)三类任务上,DSpark 的平均每轮接受长度均优于两类基线。

以 Qwen3-4B 为例,DSpark 相比 Eagle3 提升约 30.9%,相比 DFlash 提升约 16.3%。进一步的位置级条件接受率分析显示,DFlash 在首位的较高接受率源于并行架构可支撑更深网络带来的容量优势,但从第 2 位开始接受率迅速下降;Eagle3 虽然后续位置保持稳定甚至上升,但首位接受率受限于浅层网络。DSpark 继承了并行架构的首位容量优势,同时通过顺序依赖缓解了后续位置的衰减。

生产部署方面,DSpark 草稿模型与 DeepSeek-V4-Flash 及 DeepSeek-V4-Pro 预览版共同部署,并行主干包含三个 MoE 层与滑动窗口注意力,最大候选块长度设为 5,并采用马尔可夫头作为顺序模块。

训练阶段,研究团队在内部框架中实现了两项系统优化:其一,并行训练时仅传递目标模型的隐藏状态而非完整词表 logits,将通信复杂度从 O (V) 降至 O (d);其二,采用锚点定长序列打包策略,将训练序列中随机采样的多个预测块压缩为密集批次,避免传统填充带来的计算和内存开销。

在实际系统集成中,DSpark 的调度器面临两个工程约束:

  • 其一是 CUDA 图重放和零开销调度要求下一轮批处理大小在当前轮完成前即已确定,同步调度会导致 GPU 流水线停滞。团队将调度器改造为异步模式:以当前轮置信度排序候选 token,但截断长度(即批次容量上限)依据两轮前的历史置信度预测来确定,从而隐藏调度延迟并兼容现有系统框架。

  • 其二是动态变长验证前缀会导致标准解码内核因填充和负载不均而利用率下降。团队将物理执行与逻辑序列跟踪解耦,将所有 token 展平为独立元素处理,通过稀疏注意力中的标记张量传递序列内依赖关系,仅需修改索引注意力与压缩内核即可支持动态调度。

在线生产环境实测中,DSpark-5 与原有的单 token 基线 MTP-1 在真实用户流量下进行了对比。IT之家注意到,在 V4-Flash 引擎上,当系统保证单用户生成速度不低于 80 token/s 时,DSpark 的聚合吞吐量相比基线提升 51%;当 SLA 收紧至 120 token/s 时,单 token 基线已接近运行边界,DSpark 在维持可用并发批处理的前提下实现了标称 661% 的吞吐量优势。

在 V4-Pro 引擎上,35 token/s 的 SLA 下 DSpark 吞吐量提升 52%,50 token/s 的 SLA 下提升 406%。在匹配的实际吞吐量水平下,DSpark 将单用户生成速度提升了 57% 至 85%。

同时,调度器在系统并发数较低时会分配 4 至 6 个 token 的验证长度以充分利用空闲计算资源,随着并发数上升则平滑缩减验证长度以避免资源争用,表现出负载自适应的验证预算分配能力。

DSpark 的局限在于,即使后缀 token 最终被调度器截断,并行主干仍需为所有请求生成完整的初始候选块。对于接受率本身较低的复杂查询,这部分草稿计算开销无法回收。

目前 DeepSeek 已在 GitHub 的 DeepSpec 项目中开源了 DSpark、DFlash 和 Eagle3 三种草稿模型的训练代码、评估脚本及模型检查点。

参考资料:

  • GitHub:https://github.com/deepseek-ai/DeepSpec

  • Hugging Face:https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro-DSpark

广告声明:文内含有的对外跳转链接(包括不限于超链接、二维码、口令等形式),用于传递更多信息,节省甄选时间,结果仅供参考,IT之家所有文章均包含本声明。