惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Threat Research - Cisco Blogs
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
月光博客
月光博客
V
Vulnerabilities – Threatpost
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
S
Secure Thoughts
Microsoft Azure Blog
Microsoft Azure Blog
Blog — PlanetScale
Blog — PlanetScale
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
T
Tailwind CSS Blog
S
SegmentFault 最新的问题
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
云风的 BLOG
云风的 BLOG
The Last Watchdog
The Last Watchdog
L
LINUX DO - 热门话题
酷 壳 – CoolShell
酷 壳 – CoolShell
WordPress大学
WordPress大学
AWS News Blog
AWS News Blog
美团技术团队
G
Google Developers Blog
宝玉的分享
宝玉的分享
www.infosecurity-magazine.com
www.infosecurity-magazine.com
C
CXSECURITY Database RSS Feed - CXSecurity.com
Recent Commits to openclaw:main
Recent Commits to openclaw:main
I
InfoQ
小众软件
小众软件
Google DeepMind News
Google DeepMind News
P
Privacy & Cybersecurity Law Blog
Stack Overflow Blog
Stack Overflow Blog
Webroot Blog
Webroot Blog
D
DataBreaches.Net
IT之家
IT之家
PCI Perspectives
PCI Perspectives
人人都是产品经理
人人都是产品经理
Hacker News: Ask HN
Hacker News: Ask HN
L
LangChain Blog
SecWiki News
SecWiki News
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
C
Cisco Blogs
T
Threatpost
P
Proofpoint News Feed
Y
Y Combinator Blog
Cloudbric
Cloudbric
T
Tor Project blog
量子位
博客园_首页
B
Blog
Hugging Face - Blog
Hugging Face - Blog
GbyAI
GbyAI
D
Darknet – Hacking Tools, Hacker News & Cyber Security

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了! 从GPU到Token:AI基础设施竞争逻辑重构 2026萤石品牌新品发布会:驭智向前锚定长期主义,AI驱动多点开花 6分钟满电续航1500公里!宁王一夜终结加油时代 单Agent时代结束,AI们开始组团上班 前小鹏汽车自动驾驶一号位李力耘出任众擎CTO,加速打造具身大脑 5月20日,马上AI起来!中国AIGC产业峰会报名已启动|首波嘉宾官宣 物理优先+VLA闭环进化:高德ABot-World世界模型,破解具身智能零样本泛化难题 ISC.AI 2026创新独角兽沙盒大赛在京启动 聚焦智能体 共筑AI创新生态 都让让!赛博女娲蒸馏一切,让乔布斯马斯克集体给你打工 把人类驾驶员赶出机场,复旦大牛校友要港股IPO了 小米宣布上线PC版龙虾,Xiaomi miclaw正式开启PC、Mac、有屏音箱多终端封测 Agent正杀入软件研发一线!全球超60位技术专家拆解AI落地困局,2026奇点智能技术大会收官 Kimi新论文:把KVCache玩成新商业模式了 横扫全球15项SOTA!高德首个面向AGI的全栈具身技术体系大公开 大模型架构的下半场 高德发布全球首个面向AGI的全栈具身技术体系“ABot”:15项SOTA,构建持续进化的具身智能闭环 马斯克来抖音卖老干妈了?? 教龙虾玩手机!打通GUI智能体训练-评测-部署全流程,训练、真机、评测一站解决 黄仁勋都被问毛了:顶级AI厂商在去CUDA?“你的前提就是错的” 王濛代言的方盒子19万开卖,头顶激光雷达,底盘能“预瞄”路况 AI开始接管实验室了!玻尔·跃迁实验室:试剂、设备、数据一个入口搞定,1800+设备即插即用 OpenClaw的风,已经吹进了奶茶圈 11.58万,全系Lidar+L4同源算法,广汽文远把城区NOA打成白菜价 4.55亿美金!中国具身智能最大单笔融资诞生,高瓴红杉联手押注具身大脑 谷歌最强具身大脑发布!波士顿机器狗瞬间人模人样 π0.7发布,VLA押出了机器人的GPT-3时刻 18家具身顶尖势力集结,RoboChallenge 打造全球最大具身模型竞技场 空间智能第一股,开盘暴涨171%!李飞飞押注的赛道,杭州六小龙之一跑通了 ImageNet作者苏昊回国任教复旦!李飞飞高徒,具身第一高引,出任通用物理AI院长 PPIO上线PPHermes:云端沙箱一键部署Hermes Agent 72天,从0到千万小时产能,这个具身「新锐派」凭什么接管数据赛道? 打造全球领先“具身智能超级供应链”,京东发布行业首个具身数据全链路基础设施 世界客商排队体验讯飞AI眼镜,科大讯飞把多语种AI能力带进广交会第一现场 刚刚,机器人练成了宁次的「白眼」:∞帧画面边看边3D重建我们的世界! 宁王飘了!日赚2.3亿,回应比亚迪“闪充”:跟我学的,构不成挑战 腾讯官宣升级AI小程序成长计划,所有小程序都能申请 扔掉你的Token账单吧,荣耀YOYO Claw技术把养虾成本打下来了 Claude实名认证引众怒!强制验证是为了更精准封号 短短3个月,高德已拿下具身智能领域15项世界第一 我用1分钟开发了个上线应用,有阿里Meoo谁还学编程啊 继HappyHorse后,阿里又有一款模型登顶权威评测榜单 具身智能为什么还没真正落地?问题卡在这|沙龙报名 炸奥特曼的人被扒出来了 全球首创16cm极致外扩超级机械臂,MOVA扫地机开启清洁新纪元 百度Create大会官宣三大核心看点,国内最大AI开发者嘉年华5月北京揭幕 北电数智发布星火·AI云2.0,以AI系统工程重塑产城发展范式 | 酒仙桥论坛 CAAI携手中国人民大学高瓴人工智能学院、英博数科启动高校学院算力支持计划 今年最火的AI产品,不止龙虾|榜单申报中 入职Meta的吴翼,清华叉院官网已撤其教职信息 智能座舱“大脑”No.1冲刺港股,身价630亿,小米理想小鹏背后的共同供应商 别养龙虾了,硅谷Agent新潮流是「爱马仕」 Claude强到不敢发的Mythos,被质疑用了字节Seed技术 有人把巴菲特芒格炼化成Agent,然后开源了… 「Claude Code之父」其实是野路子来的…… 养虾人看哭了!字节扣子2.5出生即满级,手机对话就能Vibe Coding HTML-in-Canvas引爆前端!AI时代互联网视觉效果完全不一样了 36.4万超声图文对!中国团队构建首个大规模超声专属数据集,让AI真正读懂临床诊断语义丨CVPR’26 Claude复活30年前传奇游戏,仅用一个周末 超越人手!中国第一家脑机接口独角兽,要把仿生手带给机器人 滴滴自动驾驶张博:聚焦安全和体验 推动自动驾驶全球化落地 奥特曼遭遇死亡威胁:凌晨家中被投燃烧瓶 中国具身模型狂揽全球第一!机器人的人类数据时代来了 刘壮陈丹琦新作:开源通用视觉推理RL框架,0思考数据刷新SOTA 阿里视频生成大模型Wan2.7登顶DesignArena榜单 紫荆智康发布“紫荆AI医院”线上虚拟诊室 击败PI!星动纪元登顶具身奥林匹克,狂揽三项全球冠军 实测刘翔pick的国产AI汽车,BBA老车主的豪华滤镜碎了 奔驰崩了,在华销量大跌27% LeCun点赞:国产开源模型占领硅谷,性价比超10倍 刷屏的SBTI,底层算法有点东西…
梁文锋署名的DSpark,看懂这10个点就够了!
闻乐 · 2026-06-28 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-06-28 16:06:04 来源:量子位

精髓在于极强的系统工程

闻乐 发自 凹非寺

量子位 | 公众号 QbitAI

梁文锋署名的DeepSeek新论文DSpark你可能刷到过了——

单用户速度提升85%、高并发场景有效吞吐翻4倍。

但你真的看懂了吗?

别急,有人替你拆解了一遍。

Fireworks AI的联合创始人兼CTO、PyTorch核心维护者Dmytro Dzhulgakov将整篇论文梳理成了10个概念,从最底层的GPU访存特性讲到最上层的在线自适应调度。

他认为:

DeepSeek这套方案真正的精髓在于系统工程和模型协同设计

相关基础思路前人已有提出,难能可贵的是其将各类技术融合为一套自适应完整系统,实现了端到端的显著性能优化。

下面我们就顺着这10个概念过一遍DSpark。

10个概念理解DSpark

批处理解码(Batching in LLM Decoding)

想要搞懂大模型各类推理加速技术,首先要理解GPU一个非常特殊的运行特性:

让GPU同时解码10个token,其实只比解码1个token慢一点点。

卡帕西曾经讲过,原因在于大模型推理的瓶颈不是浮点运算,而是显存带宽,GPU大部分时间花在把模型权重从显存搬到计算核心上。

搬一次也是搬,搬十次也是搬,既然权重已经加载到了缓存里,不如一次搬运、干十件事。

这就是连续批处理:把多个请求的token塞进同一个batch,让每一次显存读取都物尽其用。

理解了这一点,就明白为什么推测解码能奏效,它的本质就是把“猜出来的多个候选token”打包成一个batch送给大模型验证,而验证batch的成本,远低于逐个生成的成本。

推测解码(Speculative Decoding)

大模型生成是自回归的,第N+1个token依赖第N个token的结果,没法直接并行。

但有一种绕路的办法,如果你能「猜」出接下来几个token是什么,就可以把猜出来的候选序列一次性喂给大模型做批量验证。

验证是通过拒绝采样,系统逐个检查候选token,接受最长的正确前缀,在第一个分歧点重新采样一个token。

这套规则在数学上保证输出分布与原模型完全一致,没有任何质量损失。

所以推测解码的本质是用“猜+验”替代“逐字生成”。

猜的环节用小模型可以很快,验的环节进行批量验证可以很高效,所以最终每一步都能往前跳好几个token。

DSpark就是这个方向上的最新进展。

草稿模型(Draft Model)

那怎么猜呢?

最直接的方案是拿一个小模型当“草稿器”。

比如用Qwen 0.8B给Qwen 397B探路,小模型跑得快,把候选序列生成好,大模型只需要做一次前向传播来验证。

通过了就全收,没通过就从分歧点重新来。

这个设计把推理过程分成了两个角色,速度型选手草稿器负责猜,力量型选手目标模型负责判

二者配合得好,整体速度就能大幅提升。

但要想配合得好,背后需要权衡大量工程取舍,接下来几个概念就是在讲这些取舍。

推测并不免费(Speculation is Not Free)

草稿模型引入了额外开销。

如果草稿器自己跑得太慢,或者一次猜了16个token但只有前3个被接受,那这笔帐就不划算了。

论文给出了一个核心公式来描述实际延迟:

每个token的耗时= (草稿耗时+验证耗时) /被接受的token数τ

在这个理论下,加速只有三条路可以走,降低草稿耗时(猜得更快)、提高τ(猜得更准)、减少验证浪费(验得更聪明)。

猜得越多不一定越好,因为如果多猜的token大概率被拒绝,它们只会白白占用验证batch的宝贵算力。

所以DSpark的整篇论文,可以理解为同时拉动这三个杠杆的一次系统性尝试。

Eagle与MTP,复用目标模型的内部理解

第一根杠杆,就是优化草稿模型本身的构造。

草稿模型不用从零训一个完整的小模型,有一种更聪明的做法是直接把目标模型最后一层的隐藏状态拿过来,在上面加1–2层Transformer头当草稿器。

这就是Eagle系列和MTP(Multi-Token Prediction)的思路。

△图源:DeepSeek-V3 Technical Report

好处有两个,一个是,草稿器只有1–2层,计算量极低;

二是,因为它直接吃的是目标模型的内部理解,也就是最后一层激活值,等于站在巨人肩膀上猜下一步,比从头用小模型独立推理要靠谱得多。

DeepSeek-V3就已经在用MTP做单token推测(MTP-1)。

DSpark论文中所有的加速数字都是跟MTP-1这个基线对比的,也就是说,60%–85%的速度提升是在已经优化过的基础上再叠加的

DFlash,用并行一口气猜完

但Eagle/MTP的问题在于,要生成N个候选token,就得跑N步,第2个token依赖第1个的输出,第3个依赖第2个……串行的链条没法打破。

DFlash的思路是借鉴扩散模型的做法,一次前向传播就把全部N个候选位置同时产出

速度确实快,但代价是各位置之间没有依赖关系。开头几个token可能很准,因为上下文信息充足,但越往后越拉胯。

论文管这个问题叫多模态碰撞

举个例子,位置1采样出“of”,位置2独立采样出“problem”,各自看概率都合理,拼在一起就变成了“of problem”这种不通顺的组合。

位置越靠后,这种跑偏的概率越大,接受率急剧下滑。

这就是所谓的后缀衰减(suffix decay),也是纯并行方案在实际部署中加速效果打折的主因。

DSpark≈Eagle+DFlash,两头都要

DSpark的核心创新,用一句话说清就是把并行和串行拼在一起,各取所长

具体做法分两步。第一步,用DFlash的并行骨干网络一口气生成所有位置的基础logits,这一步负责速度。

第二步,用一个轻量级的顺序头从前往后逐个位置注入前缀依赖偏置,这一步负责修正后缀衰减。

用上面的例子来看,效果是:

位置1采样出“of”之后,顺序头会把位置2的概率分布往“course”方向推,同时压低“problem”的概率。

并行骨干保证了整体速度不拖后腿,顺序头保证了后半段的接受率不崩盘。

在论文的离线测试中,DSpark的平均接受长度比Eagle3高26%–31%,比DFlash高16%–18%。

两层DSpark甚至打得过五层DFlash。

更便宜的串行模块,马尔可夫头

既然第二步要加一个顺序头,那它的成本不就把第一步省下来的时间又吃回去了吗?

DSpark的回答是:不会,因为并行骨干已经把上下文信息编码好了,串行步骤不需要再做完整的注意力计算,只需要做极轻量的修正。

默认方案是一个马尔可夫头,它只看前一个token就决定当前位置的修正方向,通过低秩分解(rank 256),即使词表有十几万个token,计算成本也几乎可以忽略。

实测数据就很能说明问题,草稿长度从4扩展到16,每轮额外增加的延迟只有0.2%–1.3%,但接受长度最高提升了30%。

论文里还提供了一个 RNN 头的可选方案,可以追踪整个草稿块的前缀信息,但实际增益有限,所以默认没有开启。

这也体现了DSpark的工程审美,不是越复杂越好,而是找到成本和收益的最优折中。

可变长度草稿与硬件感知调度

那每次应该猜几个token呢?这个问题没有固定答案。

首先,不同类型的请求天然不同。

代码生成的可预测性高(语法模式强),草稿器猜8–16个token可能都能过审;开放式闲聊不确定性大,猜4个就可能翻车。

其次,服务器的实时负载也在变化。

GPU空闲时,多猜几个token没什么额外成本,反正算力闲着也是闲着;高并发时,每一块验证batch的算力都很金贵,不该浪费在大概率被拒绝的尾部token上。

于是DSpark用一个置信度头给每个草稿位置打分,预估它在验证中存活的概率

这套方案会预先测算GPU在各类批次尺寸下的硬件吞吐数据,生成吞吐量参考曲线,再依据曲线结果为每条请求动态匹配最优验证长度。

整套调度逻辑完全在GPU内部执行,无需CPU参与,虽然实现门槛极高,但该方案已经落地了。

在线草稿器校准

接下来,就是最后一块拼图,在线草稿置信度校准

置信度头的思路很好,但有一个实际问题是“神经网络天生过度自信”

它觉得自己猜的每个token都对,这就会导致原始置信度评分不可靠,该停的时候不停,该放手的时候死撑。

如果直接用模型输出的概率设阈值,系统表现会跑偏。

DSpark 的做法是在运行时持续观察草稿器的实际表现。

论文中使用顺序温度缩放做后处理校准,把预期校准误差从3%–8%压到了约1%。

更关键的是,这个校准过程是在线的,系统边跑边调,根据当前工作负载的实际接受率动态修正阈值。

代码任务跑多了,它就学会对代码草稿更宽容;聊天任务来了,它自动收紧阈值。

越跑越准,真正做到了自适应。

这10个概念单独拎出来,大部分确实算不上全新,但整套方案完成了算法、调度、硬件适配三位一体的端到端工程闭环。

而且DeepSpec全栈训练库一并开源,Eagle3、DFlash、DSpark三种草稿模型的训练代码全部放出,支持Qwen3和Gemma等外部模型——

你想给自己的模型训一个草稿器,直接拿过去改就行。

OMT

DSpark配套的DeepSpec库目前在GitHub已经拿下1.4k Star,各路开发者都开始实操内卷。

海外大佬看完论文火速掏出两块RTX PRO 6000在家折腾DSpark。

两块显卡火力拉满,看得出来很努力了(doge)。

论文地址:https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf
参考链接:
[1]https://x.com/dzhulgakov/status/2070922887595499930?s=20
[2]https://x.com/Hikari_07_jp/status/2070842526450479188?s=20

版权所有,未经授权不得以任何形式转载及使用,违者必究。