惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

V
V2EX
aimingoo的专栏
aimingoo的专栏
S
SegmentFault 最新的问题
博客园_首页
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
博客园 - 【当耐特】
月光博客
月光博客
C
Check Point Blog
T
The Blog of Author Tim Ferriss
罗磊的独立博客
博客园 - Franky
MongoDB | Blog
MongoDB | Blog
H
Help Net Security
Microsoft Security Blog
Microsoft Security Blog
B
Blog
阮一峰的网络日志
阮一峰的网络日志
腾讯CDC
美团技术团队
N
Netflix TechBlog - Medium
Stack Overflow Blog
Stack Overflow Blog
Y
Y Combinator Blog
L
LangChain Blog
The Cloudflare Blog

LINUX DO - 最新话题

谷歌云盘下载700g数据集,求方法 OpenAI推出了100美元的Pro订阅后,plus的Codex 5小时限额大幅缩水 之前买的super grok居然还没掉 关于CPA认证文件周限 佬们,默认CDK的要求是什么等级啊? 最新版本的微信群聊机器人方案 有没有人知道如何free号没有封,那么是否可以循环使用,因为我看主要是周限 L站改版了?吓我一跳,我以为我浏览器崩了 淘宝这种宽带可信吗,500兆移动宽带月费8元到2099年 docker内部应用访问宿主机mysql和redis时被拒绝connection refuse Erp全栈想转行做Ai有什么推荐的吗 boost有bug 佬们,有没有靠谱点的 Plus 购买渠道 大妈,狗妈用的 lg 服务有源头开源项目吗? 有人有能过验证码打码的嘛 上次帖里好像发过通过大模型来打码的 gpt plus 封号似乎也太快了点,一天就给封号了 按流量/token收费的国产官方AI推荐 我算是知道了为什么Oracle总是ABC了 佬友们帮我分析一下 ChatGPT Team账号只有一个人使用和4个席位邀请满了使用的总额度是一样的吗? gpt-free 10个带rt CPA反代claude是默认1m吗? 我终于敢说我做出来windows上tmux的替代了,目标windows/全平台最强的终端Ai编程工具 claude pro升级max,除了原来的$20,好像还能再领一次$100 关于AI agent的知识框架 独乐乐不如众乐乐,分享一下我的的AI对话程序 佬们自建网站支付问题是怎么解决的 怎么能让gpt模仿claude风格输出 codex free已经死了,下一个会是plus或者team吗 请问chatgpt pro里的fast模式,速度快了,降智吗
DeepSeek发布DSpark推测解码框架,DeepSeek-V4单用户生成速度...
HCPTangHY · 2026-06-27 · via LINUX DO - 最新话题

DeepSeek-AI与北京大学联合发布了DSpark,一个面向大语言模型推理加速的推测解码框架。该框架已部署于DeepSeek-V4的线上服务系统,与此前的生产基线MTP-1相比,在相同吞吐量水平下将单用户生成速度提升了60%–85%(V4-Flash)和57%–78%(V4-Pro)。团队同步开源了DSpark模型权重及配套训练仓库DeepSpec。

image

image
image

字烂了

hwang 4

Rabe (Rabe) 5

设计一个 draft model 的意思吧,看上去是对各种模型都可以用的

jls (梨涡近点ಣ) 6

本地部署的 是不是还得自己弄下来重新部署这个框架

qbndp 8

在mimo ultra内测的时候,我就开始自发宣传最高1500tps的mimo ultra模型,快即无敌。在AI高速发展的今天,高tps肯定不止是mimo ultra一个,其他模型肯定会追赶上来,认真看了几篇ds的新闻都没有明说最高tps多少,等官方发通稿全量部署上线新功能,我再去测测

ds总是这么优秀 默默就更新了

4.1正式版快来吧 后训练冲冲冲

hanted (ᴇɴᴄ)

10

Screenshot_2026-06-27-11-41-39-355_com.microsoft.emmx-edit

感觉这两天都很快,已经连着三天玩两亿词元起步了

Adam.H (阿达姆)

11

ScreenShot_2026-06-27_174609_070

这不就是忙时降智么… :melting_face:

嗯,和gpt聊了一下,感觉不是这么回事

我的理解,以前大模型每一个词都要整个模型所有层都走一遍,现在是N个词一个batch,只走一遍,然后通过一定算法选择合适的字句输出;类似于人脑已经想好了大概要表达的意思,最后说的时候稍微调整下词汇让表达连贯的感觉

peop (peop) 12

这个新功能早就部署了吧 上次的扩容提速应该就是这个 论文里说v4上线2周后就部署了

Ryens 14

投机解码又越来越流行了,利好本地推理