惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

L
LangChain Blog
N
News | PayPal Newsroom
WordPress大学
WordPress大学
T
Tailwind CSS Blog
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
博客园 - Franky
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
H
Hacker News: Front Page
有赞技术团队
有赞技术团队
Scott Helme
Scott Helme
博客园_首页
Hugging Face - Blog
Hugging Face - Blog
博客园 - 司徒正美
V
Visual Studio Blog
S
Securelist
Jina AI
Jina AI
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
腾讯CDC
P
Palo Alto Networks Blog
K
Kaspersky official blog
IT之家
IT之家
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
大猫的无限游戏
大猫的无限游戏
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Security Latest
Security Latest
Webroot Blog
Webroot Blog
H
Hackread – Cybersecurity News, Data Breaches, AI and More
V
Vulnerabilities – Threatpost
W
WeLiveSecurity
T
Threat Research - Cisco Blogs
博客园 - 【当耐特】
Cisco Talos Blog
Cisco Talos Blog
P
Proofpoint News Feed
Cyberwarzone
Cyberwarzone
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
月光博客
月光博客
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
酷 壳 – CoolShell
酷 壳 – CoolShell
Google DeepMind News
Google DeepMind News
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
L
LINUX DO - 最新话题
Latest news
Latest news
T
Tenable Blog
The Register - Security
The Register - Security
Recorded Future
Recorded Future
博客园 - 叶小钗
人人都是产品经理
人人都是产品经理
爱范儿
爱范儿

博客园_首页

Linux实操--组管理、权限管理和定时任务 Java + EasyExcel 实现单个接口导出多个Excel Mem0 源码解析系列(二):提示词工程的深度剖析 Openclaw TaskFlow究竟是什么?和普通Skill技能有什么区别 博文阅读密码验证 - 博客园 嘉立创开源:应该是全网MicroPython教程最多的开发板 Hermes Agent 集成实践:从协议到生产 2026年AI编程工具横评:Cursor、Codex、Claude Code、Zed、Windsurf Java程序员必看的RAG入门教程 2026 AI效率神器:Superpowers + Claude Code 保姆级教程 本地大模型部署全攻略:从 0 到 1 玩转 Ollama 【从0到1构建一个ClaudeAgent】内存管理-上下文压缩 .NET 高级开发 | 设计、实现一个事件总线框架 电子小白入门之NE555 3. WorkBuddy:隐藏玩法,一键召唤专家,让 AI 以"专家身份"给你干活 和AI一起搞事情#3:Claude Teammate 游戏开发翻车实录 【OpenClaw】通过 Nanobot 源码学习架构---(7)Memory C# .NET 周刊|2026年3月3期 我在 Debian 11 上把 K8s 单机搭起来了,过程没你想的那么顺(/opt 目录版) 深度学习进阶(七)Data-efficient Image Transformer CLI+Skill搭建浏览器AI自动化框架,告别一切重复枯燥任务 告别Token账单无底洞:OpenClaw本地部署,重塑企业数据主权的唯一解 FastAPI+Vue:文件分片上传+秒传+断点续传,这坑我帮你踩平了! SBTI 爆火后,我做了个程序员版的 CBTI。。已开源 + 附开发过程 多模态检索开始进入工程期:用 Sentence Transformers 搭建可落地的 Multimodal RAG 100多行代码实现一个最简单的Agent(用ReAct) Claude Code 通关手册(八):推荐 5 个 Hooks,代码质量提升 3 倍 老板:“有人截图了!”。安全部门:“收到,马上查暗水印!” - why技术 技术之外,皆是人间 C#/.NET/.NET Core技术前沿周刊 | 第 69 期(2026年4.01-4.12) Snack JSONPath 项目架构分析 Claude Code Buddy 小析:一个非核心功能,如何体现产品的细节完成度 AI新时代下的图床管理方案-Cloudflare图床+MCP+Skills方案指南 化繁为简:顺丰速运App如何通过 HarmonyOS SDK实现专业级空间测量 从零实现富文本编辑器#13-React非编辑节点的内容渲染 AI开发-python-langchain框架(3-23-OpenAI Functions风格Tool Calling智能助手) .NET + AI 进阶实战:基于类的技能开发 - 打造可治理的 Agent 能力模块 【从0到1构建一个ClaudeAgent】规划与协调-技能 上周热点回顾(4.6-4.12) 电子小白的工具三件套:面包板、杜邦线、万能板 单表五亿数据的查询优化 | Mysql、StarRocks 2. WorkBuddy:从“我是谁”到“帮我干活” C# 如何减少代码运行时间:7 个实战技巧 基于HelixToolkit.SharpDX 渲染3D模型 - 笺上知微 从零开始的双臂具身VLA起源及现阶段发展综述 - SkyXZ 记对 xonsh shell 的使用, 脚本编写, 迁移及调优 - pluvium27 受够了Vibe Coding的失控?换个起点,让AI事半功倍 从开始配置漏洞环境到漏洞复现流程 - 難しい 关于10年工作经验的程序员对OpenClaw的实战经验分享以及看法 - 虚无境 Any metadata 的内存布局 C# .NET 周刊|2026年3月2期 - InCerry 我帮你测过了,测试圈排名第二的 Skill 依然很牛逼 Skill Discovery | 无监督技能发现的经典工作总结 - MoonOut PbootCMS 网站内容数量多导致访问慢?这些实用优化方案帮你提速! - 家兴网络技术工作室 上下文工程是什么?过时了么?一文讲明白! - 一枫说码 网站漏洞怎么发现并修复?一篇实用指南(附完整流程) - 家兴网络技术工作室 开了 TUN 模式还是直连?90% 的人都踩过这个坑 Github日报|2026年04月12日 - AI一族 AScript扩展多种脚本语言 - rockey627 AI 学习笔记:Agent 的记忆机制 你能被装进一个文件里吗?——7 万人把同事"蒸馏"成了 AI - 我没有三颗心脏 Claude Code 通关手册(七):给 AI 装上技能包——Skills 完全指南 - 暮色之狐 在浏览器中快速编辑代码:VSCode Web 集成实践 - Newbe36524 蒸馏自己 skill?基于 Deepseek 的蒸馏器,丐版蒸馏方式,简单便捷 - To_Carpe_Diem Spring AI Aliababa和AgentScope,哪个更好? - 苏三说技术 Etsy 把 1000 个 MySQL 分片迁进 Vitess:425TB 数据背后的真正问题不是性能,而是运维规模 MicroPython LVGL基础知识和概念:底层渲染与性能优化 - FreakStudio 数据库草图算法 Python 潮流周刊#146:CPython 引入 Rust 的进展 - 豌豆花下猫 最小生成树 - mofei1116 红日靶场七:从外网入口、容器逃逸到 AD 接管的完整利用链复盘 - YouDiscovered1t 分享四款开源且实用的 Kafka 管理工具 - 追逐时光者 vLLM 权重加载机制全解析:从挑战到理想架构 LCT 学习笔记 - ACehomoxue Avalonia UI 12.0.0 正式发布:架构演进和性能飞跃 - 张善友 当 AI Agent 把调用链拉长,延迟开始成为一门生意 conhost.exe 无法显示 U+2717 - 145a 太秀了,我把自己蒸馏成了 Skill!已开源 - 程序员鱼皮 ASP.NET Core 内存缓存实战:一篇搞懂该怎么配、怎么避坑 基于 Ghostty 带有分割标签页和为 Claude 编程设计的通知终端 - BugShare AI 焊死入口:教育的“操作系统级”重塑 - 郝hai 初级Java开发工程师使用sql脚本编写代码的过程是简单而且不糊涂 - CoderOilStation Claude Code通关手册(六):MCP协议完全指南 - 暮色之狐 边框灯光环绕动画特效实现指南 - Newbe36524 开源:子木蒸馏版的 SEO 审计工具 seo-audit-skill v1.0 我所理解的Python元模型 【从0到1构建一个ClaudeAgent】规划与协调-TodoWrite - 程序员Seven Claude 和 Codex 在审计 Skill 上性能差异探究 - ACai_sec AScript如何实现中文脚本引擎 - rockey627 【渗透测试】HTB Season10 Garfield 全过程wp - dynasty_chenzi Android 开发者为什么必须掌握 AI 能力?端侧视角下的技术变革 树状数组正确性证明 - AC-wyr 你的 AI 焦虑,可能比 AI 本身更危险——ATM 机没有消灭银行柜员,但恐慌消灭了你的判断力 - 我没有三颗心脏 一个拉胯的分库分表方案有多绝望?整个部门都在救火! - 冰河团队 动态规划入门必学之走方格问题 - Ofnoname PostgREST 与 PostgreSQL 角色权限配置全解析(生产级实践) - SheepDog1998 使用 UEFI 图形输出协议 GOP 在屏幕上显示图像的方法 - 阿源- Claude Code通关手册(五):组建你的AI专家团队,子代理系统 - 暮色之狐 一个程序员到架构师的催婚路之感悟(整整10年后的催婚相亲感悟) - MisterLip 用 Agent Skill 自动生成工作周报 - 赵康
DeepSeek搞了个DSpark,AI直接进入“秒回时代”,你还在傻等?
fengliaoai · 2026-06-28 · via 博客园_首页

DeepSeek搞了个DSpark,AI直接进入“秒回时代”,你还在傻等?

峰哥说:别让AI聊天,变成“等AI”

前几天,一个朋友跟我吐槽——

“峰哥,我现在用AI写周报,打个字它都要想半天,急得我差点把键盘吃了。”

我回他:“你那是上个时代的AI了。现在的AI,它不讲武德。”

就在2026年6月27日,DeepSeek联合北京大学,干了一件大事——

2PjygoWR.jpg
2PjygoWR.jpg

开源了DSpark。

一个让大模型推理速度飙升60%到85%的“加速器”。

你没看错,是**60%到85%**。

不是挤牙膏式的提升,是直接翻倍、甚至翻几倍地快。

一、起因:从“等AI回话”到“AI回话太快”

先给你捋一下,这事儿怎么来的。

2026年6月16日,DeepSeek刚拿下500亿融资,估值直接飙到500亿美元。梁文锋自己掏了200亿。

6月25日,DeepSeek高调宣布:“全部门规模翻倍,欢迎加入。”

6月27日,也就是昨天,DeepSeek就联合北京大学,把DSpark给开源了。同一天,还放出了配套全栈工具DeepSpec和完整技术论文。

ket6kAHV.png
ket6kAHV.png

这三件事连在一起看,不是巧合,是节奏。

这就像是打游戏,人家先在泉水里憋了件大装备,然后出门就是一顿砍。

而同一天的另一边,OpenAI也搞了个动静——

6月27日,OpenAI推出了GPT-5.6的限量版:Sol、Terra、Luna三个模型,分场景覆盖复杂推理、日常平衡、高速低成本。

但问题来了:这些强模型,一般人用得上吗?

答案很现实——用不上。

因为OpenAI这次访问附带严格安全审查,甚至美国政府都参与审核用户资格了。你做个小公司,想调用Sol?先拿资质证明去吧。

所以你看,一边是强者越来越强但越来越难用,另一边是DeepSeek把“快”和“便宜”直接甩给你。

峰哥说:这世界就是这么真实——你花大价钱追的新品,可能还不如别人开源的一份礼物实在。

二、结论:AI能力的竞争,已经变成“效率”的竞争

你不用管什么参数、什么架构。

你只需要记住一句话:

未来的大模型,不是比谁更聪明,而是比谁跑得更快、更便宜、更稳定。

什么意思?

你想想,你用AI写文章、做客服、写代码、跑Agent……

如果AI每句话都要想好几秒,你早就骂娘了。

但DSpark这种加速框架,它能让AI在几乎不降低质量的前提下,速度翻倍、甚至翻几倍。

你可以在同样的时间内,跟AI聊更多轮,做更多事,花更少的钱。

对于普通用户来说,它意味着:更快、更爽、更便宜。

对于企业来说:

  • 同样的GPU,多服务2倍的用户;

  • 同样的API钱,多干3倍的活;

  • 同样的服务器,承载4倍的并发。

峰哥说:别小看这个“快”。你每天省下的几十秒等待,积攒起来,就是一杯咖啡的时间,甚至能让你多追一集剧。

三、聊聊我身边的事——峰哥的“肺腑之言”

说出来你可能不信,我自己以前也是一个“等AI”的人。

去年有一段时间,我疯狂调教各种大模型,写公众号、做方案、查资料。

但每次点完“发送”,都得盯着屏幕等它一个字一个字往外蹦。

那感觉,像极了你在食堂打饭,排在你前面的人点了25个菜,厨师一个一个炒。

我不止一次想:“妈的,AI就不能一次把话说完吗?非要跟挤牙膏似的。”

直到昨天,我试了DSpark。

我直接在本地部署了DeepSeek-V4-Flash-DSpark(165B参数版本)。

点完发送,AI几乎是瞬间开始输出——不是“一个一个字蹦”,是“一行一行地滑”出来。

我写这篇文章的时候,就开着DSpark让它实时辅助,整篇写下来,几乎没有“等它回话”的感觉。

峰哥说:用上DSpark之后,我才发现,以前那些AI不是不聪明,是懒。现在它终于学会“说到做到”了。

四、大牛的做法、网友的案例

先上大牛的成果:

DeepSeek官方数据(真实线上流量测试):

更狠的是在高并发场景:

  • 当Flash引擎要求单用户速度不低于120 token/s时,原来基线已经拉不动了,DSpark反而暴涨661%的吞吐量!

  • Pro引擎在50 token/s SLA下,吞吐暴涨**406%**。

这是什么概念?

就是你本来只能服务100个用户,现在能服务400个。成本直接砍掉75%。

网友“赛伦盖蒂大草原”实测后发帖说:

“我在四卡A100服务器上跑了LLaMA-70B模型,接入DSpark之前每秒生成18个token,接入后直接飙到33个token,提升83%。而且连续跑了4个小时,输出质量没有退化。”

另一个开发者说:

“以前做AI客服,高峰时段服务器直接崩。现在接入DSpark,同样的机器,比之前多扛了4倍的并发。”

还有一位做AI编程助手的兄弟:

“程序员频繁生成代码,每一步等几秒,一天浪费几十分钟。现在DSpark让AI代码补全几乎实时,开发效率直接翻倍。”

峰哥说:这些不是实验室数据,是真实用户实测。它就像你买车,不是广告说了算,是开了几个月才知道真香。

五、技术原理 + 开源项目 + 实操说明

核心原理:先“打草稿”,再“批改”

你把大模型想象成一个超级学霸

它写答案特别厉害,但速度很慢,一个字一个字地写。

DSpark的做法是:先找个学渣(小模型)快速猜出一大段话(打草稿),然后让学霸一次性“批改”。

学霸批改的时候,猜对的直接通过,猜错的地方才重写

因为是一次性批改10个字,而不是一个字一个字写,所以速度暴增。

两个关键创新

第一招:半自归生成

以前的学渣要么“一个字一个字猜”(慢但准),要么“一次猜一长串”(快但后面全是错的)。

DSpark把它们结合起来——先并行猜主干,再用一个小模块补充词与词之间的关联。这样既快又准。

第二招:置信度调度验证

你上学时,是不是有些学霸会先扫一眼作业,把明显错的先挑出来?

DSpark也学会了这个——它给每个候选token打一个“存活概率”,系统忙的时候,直接跳过那些“大概率被拒绝”的token,把算力留给真正需要校验的地方。

配套开源项目:DeepSpec

DeepSeek这次不只是开源了DSpark,还开源了一个全栈平台DeepSpec

它帮你把“训练草稿模型→跑评估→部署加速”的流程全包了。

GitHub地址: https://github.com/deepseek-ai/DeepSpec

image.png
image.png

论文地址: https://github.com/deepseek-ai/DeepSpec/blob/main/DSpark_paper.pdf

实操:怎么用?

方案A:直接调用API(最简单)

直接调DeepSeek-V4-Flash-DSpark或V4-Pro-DSpark的API,零部署。

DeepSeek官方没有单独开一个“DSpark版API”,而是直接把加速集成到现有模型里了。你打开DeepSeek官网的API开放平台:https://platform.deepseek.com

选择V4-Flash或V4-Pro的API进行调用,就已经在享受DSpark加速了。

方案B:本地部署(自己动手)

Hugging Face上已经发布了两个DSpark版模型权重:

  • deepseek-ai/DeepSeek-V4-Pro-DSpark(889B参数)

  • deepseek-ai/DeepSeek-V4-Flash-DSpark(165B参数)

用vLLM部署:

# 安装vLLM
pip install vllm

启动DSpark加速的V4-Flash模型

vllm serve "deepseek-ai/DeepSeek-V4-Flash-DSpark"

用SGLang部署:

pip install sglang
python3 -m sglang.launch_server \
    --model-path "deepseek-ai/DeepSeek-V4-Flash-DSpark" \
    --host 0.0.0.0 \
    --port 30000

然后你的API地址就是:

http://你的服务器IP:8000/v1/chat/completions

然后你就可以在本地体验“秒回”了。

直接当OpenAI兼容接口用就行。注意Flash版165B参数,至少需要8卡A100的企业级服务器才能跑,Pro版还未公开配置,但从参数量上看肯定要多很多。

要想自己部署测试或进行复现,可以访问九章智算云,轻松获得大卡资源。有需要的朋友请联系峰哥。

注意:数据准备阶段存储需求极大

如果你要自己训练草稿模型,注意了——默认配置下的KV Cache大概需要38TB存储空间。

所以,除非你是大企业,否则老老实实直接调用API或下载官方已经训练好的模型即可。

六、读者可能的问题,我替你问了

Q1:DSpark会让AI的回答变差吗?

A:不会。它用了“拒绝采样”机制,数学上严格保证输出分布和原模型一致。快是快了,质量一丝一毫都没动。

Q2:我的显卡能跑吗?

A:165B参数的Flash-DSpark版,8张A100就能跑。企业级部署门槛不高。

Q3:DSpark只支持DeepSeek自己的模型吗?

A:不是。论文和实测显示,DSpark对Qwen、Gemma、LLaMA等主流开源模型同样适用。它是个通用“加速插件”。

Q4:对普通用户有什么实际好处?

A:更快的AI客服、更流畅的AI编程助手、更便宜的API服务。以后你点个“帮我写方案”,AI几乎秒回。

Q5:它们开源协议是什么?

A:MIT协议,商用、二次开发无版权限制。

七、总结:这个时代,谁跑得快谁赢

过去几年,AI行业一直在比:

  • 谁参数更大

  • 谁能力更强

  • 谁排名更高

但从2026年开始,风向变了——

真正的竞争,变成了:

  • 谁跑得更快

  • 谁成本更低

  • 谁更稳定

DSpark最大的价值,不是创造了一个“更聪明的AI”,而是让已有的AI跑得更快、更便宜、更稳定

它就像你买了一辆法拉利,但以前只能当自行车骑;现在突然换上了涡轮增压发动机,一脚油门下去,它才真正发挥实力。

峰哥最后说一句:

别再用“等AI”的陈旧体验,去定义AI的能力上限了。

去试试DSpark,感受一下“秒回”是什么感觉。

当你真正用过快的AI,你就再也回不去了。

🚀 关注峰哥,不错过每一次AI效率革命