惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

S
Securelist
博客园 - Franky
B
Blog RSS Feed
Apple Machine Learning Research
Apple Machine Learning Research
阮一峰的网络日志
阮一峰的网络日志
量子位
Hugging Face - Blog
Hugging Face - Blog
有赞技术团队
有赞技术团队
V
V2EX
宝玉的分享
宝玉的分享
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
F
Full Disclosure
L
LangChain Blog
大猫的无限游戏
大猫的无限游戏
雷峰网
雷峰网
G
Google Developers Blog
B
Blog
The Cloudflare Blog
T
The Blog of Author Tim Ferriss
小众软件
小众软件
博客园 - 【当耐特】
H
Help Net Security
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
Tailwind CSS Blog
博客园 - 叶小钗
Jina AI
Jina AI
Cloudbric
Cloudbric
N
Netflix TechBlog - Medium
Hacker News - Newest:
Hacker News - Newest: "LLM"
P
Proofpoint News Feed
L
Lohrmann on Cybersecurity
I
Intezer
IT之家
IT之家
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
H
Hackread – Cybersecurity News, Data Breaches, AI and More
WordPress大学
WordPress大学
W
WeLiveSecurity
G
GRAHAM CLULEY
J
Java Code Geeks
H
Heimdal Security Blog
Cyberwarzone
Cyberwarzone
MyScale Blog
MyScale Blog
Latest news
Latest news
Schneier on Security
Schneier on Security
H
Hacker News: Front Page
Martin Fowler
Martin Fowler
V
Visual Studio Blog
Webroot Blog
Webroot Blog
P
Palo Alto Networks Blog
T
Tor Project blog

人人都是产品经理

为什么你的产品找不到差异化?90%的失败都卡在第一步上(下) – 人人都是产品经理, 3年从30万到1300万用户、获2200万美元融资,这个AI教育产品用“抽卡”破解了获客难题 – 人人都是产品经理, 园区招商系统怎么做才能真正帮到去化?我加了这一个功能,推广链接转发400次阅读过万 – 人人都是产品经理, AI大事件:OpenAI发完网络安全模型又搞药物研发,小鹏汽车要抓”DeepSeek时刻” – 人人都是产品经理, 电商不是卖货,是一场更残酷的产品经理实战 – 人人都是产品经理, 没想到,活动营销又回来了! – 人人都是产品经理, 为何All-in海外KOC:一场关于AI时代窗口期的豪赌 – 人人都是产品经理, 重新理解企业的内部协作 – 人人都是产品经理, 苹果的 AI 战略到底是什么? – 人人都是产品经理, 医疗智能体·第2讲——合规护城河:等保、PIPL与HIPAA的架构实战 – 人人都是产品经理, 向量知识库五步法:从“答非所问”到“精准回复” – 人人都是产品经理, 鸿蒙PC三方库构建总指挥HPKBUILD(sha)库为例 – 人人都是产品经理, 何时该用LLM?AI产品经理的LLM设计指南 – 人人都是产品经理, 医疗信息领域的需求方、决策方、准入方以及关注点(二) – 人人都是产品经理, 即梦涨价:一场被误读的「傲慢」 – 人人都是产品经理, 面试AI PM必答题:Hermes和OpenClaw的区别,如何讲清楚业务价值 – 人人都是产品经理, AI的下一张船票:世界模型——AI产品经理必须理解的技术拐点 – 人人都是产品经理, 小红书做GEO,怎么让AI信你?记住这 3 个重要信息 – 人人都是产品经理, 5 家印度 AI 初创公司,看看印度 AI 再做什么 – 人人都是产品经理, AI项目跨团队协作:产品技术业务如何不打架 – 人人都是产品经理, Agentic Workflow(智能体工作流):让AI从”答案生成器”变成”数字员工” – 人人都是产品经理, lycium_plusplus 项目全景解读:OpenHarmony 三方库构建的“大管家” – 人人都是产品经理, 从爆单救火到前置履约:两套预采策略,把生鲜大促履约效率拉满 – 人人都是产品经理, 什么时候该补货?我用一轮数据做了一个决定 – 人人都是产品经理, 从“机械兜底”到“动态分流”:AI客服重复进线治理的4大底层逻辑 – 人人都是产品经理, 抖音拼效率,红书拼洞察 – 人人都是产品经理, 全民狂欢与退潮——为什么龙虾这波热潮冷却得如此之快? – 人人都是产品经理, Stripe押注!MPP重塑全球支付 – 人人都是产品经理, 小红书GEO:AI引用你的内容,不是因为你对,而是因为你看起来可信 – 人人都是产品经理, 前百度副总裁押注办公Agent,日韩付费爆发,Manus迎来强劲对手 – 人人都是产品经理, 企事业单位数字化的业务供需本质 – 人人都是产品经理, 医疗智能体·第1讲——医疗信息化重构:从“辅助软件”到“自主智能体”的范式转移 – 人人都是产品经理, 粉丝量就是空气!!! – 人人都是产品经理, 用户说“薯片碎了”,机器回“要买吗?”:意图识别的翻车与破局 – 人人都是产品经理, RAG召回准确率从75到90 我做对了这三件事 – 人人都是产品经理, AI大事件:Anthropic改收费、OpenAI发安全版、手术机器人纳入医保、阿里发布”秒悟” – 人人都是产品经理, Chrome 推出 Skills 新功能,Agent 重塑上网方式 – 人人都是产品经理, GitHub前创始人拿了a16z的1700万美元,做Agent时代的Git – 人人都是产品经理 拷贝或克隆其他 Flutter OH 项目到本地后无法运行 – 人人都是产品经理, 优惠券设计:优惠券创建 – 人人都是产品经理, 不用死磕文档!AI 助手 1 小时搞定飞书 CLI 安装 + 配置 + 知识库 – 人人都是产品经理, 用小龙虾做竞品分析报告:从2天到20分钟,我是怎么做到的 – 人人都是产品经理 用小龙虾做市场分析报告:搞懂这3个公式,市场规模不再靠猜 – 人人都是产品经理, 你早就在做 Harness 工程,只是不知道它叫这个名字 – 人人都是产品经理, Think Long就够?你可能想多了! – 人人都是产品经理, 货代SRM实战:供应商准入怎么做,才能让资源池不是通讯录而是可交付网络? – 人人都是产品经理, 如何做好用户调研?详解基本技巧 – 人人都是产品经理, 木鸟、途家、美团对打,平台春天行动开“卷” – 人人都是产品经理, 入职才发现公司不靠谱?小红书从业者求职避坑指南 – 人人都是产品经理, 美国 AI 三巨头联手封堵,中国 AI 突围之路在何方 – 人人都是产品经理, 小红书,放在需求对面的镜子 – 人人都是产品经理, AI 会带来大规模失业吗? – 人人都是产品经理, 从出单到补货前,我第一次犹豫:该不该放大? – 人人都是产品经理, Flutter 三方库鸿蒙化适配:5 种高效检查方式,快速判断是否需要适配 – 人人都是产品经理, 从做产品进阶拿结果:医美机构产品经理转岗科室运营经理 – 人人都是产品经理, 阿里HappyHorse,一场关于“Token经济”的阳谋 – 人人都是产品经理, To B AI:客户留存落地的观察与思考 – 人人都是产品经理, AI产品的“生命线”——数据采集、标注、清洗的产品化设计 – 人人都是产品经理, 谈谈AI Agent(二):当“孩子”能自己“体验世界”时,你该学什么? – 人人都是产品经理, UI/UX设计师的3层能力进阶,前两层让你活下来,第三层…才是真正的分水岭 – 人人都是产品经理, 2分钟 → 30秒,效率提升75%:B端产品经理如何用「规则枷锁」驯服AI幻觉? – 人人都是产品经理, 还没来得及学OpenClaw,来了个更猛的:Hermes Agent – 人人都是产品经理, AI日报:宇树机器人跑出10m/s刷新世界纪录 – 人人都是产品经理, 一文说透基金互金如何用情绪价值引导用户决策做转化 – 人人都是产品经理, 当浏览器开始替你”看”网页:AI 浏览器正在亲手拆掉它脚下的那张网 – 人人都是产品经理, 0代码,一天时间我Vibe Coding了个网站 – 人人都是产品经理, Hermes 和 OpenClaw 之争,Agent 的能力应该“装上去”还是“长出来”? – 人人都是产品经理 视频生成的“桌子”,字节Seedance 2掀完,阿里快乐马掀 – 人人都是产品经理, 从听不懂到完全信任:我的 Codex 深度产品体验 – 人人都是产品经理, 当虚拟偶像有了北京户口,与真人偶像还有什么区别? – 人人都是产品经理, 会说,远远比会做更重要 —— 对 SBTI 爆火现象的五层观察 – 人人都是产品经理, AI产品经理必看:当“搭环境”比“选模型”更重要,你的认知还在2024年吗? – 人人都是产品经理, 2026年AI产品商业化核心逻辑:从功能demo到规模化营收的3个必破卡点 – 人人都是产品经理, 京东围绕供应链,卷起裤腿下场的那些事儿 – 人人都是产品经理, SBTI一夜刷屏:它赢在了“太会说人话” – 人人都是产品经理, 折扣零售的真相:不是便宜,而是价值感! – 人人都是产品经理, 和甲方吵了一架,最后加钱做了——我学到的ToB产品经理生存法则 – 人人都是产品经理, 和几位小红书操盘手聊了8小时,干货全在这 – 人人都是产品经理, 智谱GLM-5.1登场,开源模型首超Opus4.6!!! – 人人都是产品经理 Anthropic收入凭什么反超OpenAI,终于有人把这事说清楚了 – 人人都是产品经理, 史上最有故事感的技术报告——Claude最强模型Mythos 7个极其精彩的细节 – 人人都是产品经理, 模型不是壁垒,Harness 也不是 – 人人都是产品经理, 抖音本地生活业务思考21 – 人人都是产品经理, Superpowers:145k Star的AI编码框架,到底是什么来头? Superpowers:145k Star的AI编码框架,到底是什么来头? – 人人都是产品经理, OpenAI 的路走错了,Anthropic Harness 解法启示:模型需要实践专科生 – 人人都是产品经理, 画原型图的前一步:设计站点地图 – 人人都是产品经理, 给 DeepSeek 的最后一封催更信 – 人人都是产品经理, 手把手教你用 Claude Code 搭建 AI 营销团队:5 个 Agent、12 项技能,独立完成研究、写作、设计全流程 – 人人都是产品经理, 你以为大模型在学语言?不,它在重新发明语言学 – 人人都是产品经理 所谓Skill,不过是AI时代的工业垃圾 – 人人都是产品经理, 聊一聊内容传播的几个方法 – 人人都是产品经理, 当平台开始吃掉生态:从 OpenClaw 被封杀,读懂 Anthropic 的这盘棋 – 人人都是产品经理, 你装了 10 个 AI 插件,Obsidian 还是一个文件夹 – 人人都是产品经理 关于AI智能体架构演进的系统性思考:从单体试水到多体协同的重构 – 人人都是产品经理, 当“人”变成Skill,我们又该何去何从? – 人人都是产品经理 Mythos 事件:前沿 AI 治理的意外实验 – 人人都是产品经理, 货代CRM:信用与风险管理怎么做,才能把坏账风险拦在放货之前? – 人人都是产品经理, 从HR收集自拍照到员工自助录入——我见证了园区人脸识别从”不可用”到”真好用”的全过程 – 人人都是产品经理 千问闯关AI混沌期:阿里画靶,吴嘉张弓,马云射箭? – 人人都是产品经理,
华为曝光两大黑科技!打破推理延迟魔咒,大模型从此「秒回」
新智元 · 2025-05-22 · via 人人都是产品经理

华为推出两大 AI 黑科技 ——FusionSpec 与 OptiQuant 。FusionSpec 打破大模型推理延迟魔咒,将耗时降至毫秒级;OptiQuant 支持灵活量化,推理性价比更高,二者为超大规模 MoE 模型推理开辟新路径,推动中国 AI 发展。

刚刚,昇腾两大技术创新,突破速度瓶颈重塑AI推理。FusionSpec创新的框架设计配合昇腾强大的计算能力,将投机推理框架耗时降至毫秒级,打破延迟魔咒。OptiQuant支持灵活量化,让推理性价比更高。

「前DeepSeek」时代,人们普遍认为「有卡才能推理,没卡寸步难行」。

而DeepSeek却凭借一系列软件层面的架构创新,把这一硬性门槛直接抬走,同时开创了中国人自己的AI大航海时代。

不过,虽然诸如V3和R1等超大规模MoE性能卓越,但在部署时却存在着非常大的挑战——推理的速度和延迟。

心理学和行业实验一致表明,LLM吐出第一个token所用的时间(TTFT),以及每秒生成的速度直接决定了用户的「等候感」。超过100毫秒即可感知,超过2秒即可打断思考。

对于AI应用来说,这里有一个简单的公式可以说明:更快速度+更低延迟=更高满意度+更高转化率。

为了解决这一核心问题,华为通过两个全新的方法和思路,对MoE模型进行了专门的推理优化,让中国模型在中国的服务器上的推理速度来到了全新的高度!

FusionSpec打破了大模型推理「延迟魔咒」,依托于昇腾「超高」计算带宽比的特点,创新性地重塑了主模型和投机模型的流程,结合轻量级步间准备,将投机推理框架耗时做到了1ms。

OptiQuant不仅支持主流量化算法,同时具备灵活的自定义组合能力,涵盖了业内主流评测数据集,为大模型推理提供了更强性价比。

华为挑战MoE推理的「两把刷子」

早期LLM的推理通常使用自回归解码方式,即「每次只能预测下一个token」。

且需将历史输出作为输入进行下一步解码,导致推理过程串行、效率低下、计算密集度低。

如何解决这个问题?投机推理技术应运而生。

投机推理(Speculative Inference),也被称为推测性解码,其核心思想是利用计算代价远低于大模型的小模型(也称为投机模型),先行对后续可能的输出进行猜测,然后由大模型对这些猜测结果进行验证,从而实现并行化推理,提升整体推理速度。

这个道理其实也简单,就像写作文的时候,你先在草稿上「预测」几个可能句子(投机模型猜测),再挑出合适的句子写到正式作文里(大模型或者叫主模型验证)。

如果草稿上预测的都不对,那就把作文里的擦掉重写就好了(回退修正)。但要是预测对了,写作文的速度(大模型的输出速度)就能更快——毕竟草稿纸上的修改成本远低于正式作文。

这种「先试错再优化」的思路,让大模型能更快、更准的给出答案(也就是推理速度又快又好)。

然而,是想要完美将投机模型和主模型相结合,依然面临很大的困难。

1. 推测准确性与草稿生成效率的权衡

小模型的主要任务是快速生成可能的输出,但这往往与生成结果的准确性相矛盾。如何在两者之间找到最佳平衡点,是投机推理技术面临的一大挑战。

2. 批处理推理场景的适配

在实际应用中,批处理推理可以提高系统的整体吞吐量。投机推理本质上来说是用空闲的算力换取更高的吞吐,需要处理好投机模型和投机框架引入的耗时,不然无法发挥投机推理在批处理场景下的加速潜力。

另一方面,仅有投机推理技术也不够,推理性能提升还需与模型压缩、量化、增量式解码等有效集成。

超大规模MoE动辄百亿、千亿参数量,对显存带宽、计算能力和互联网带宽需求,提出了极高要求。尤其长序列推理中的KV cache,更是堪称显存「无底洞」。

在此背景下,量化技术就成了缓解资源约束、优化部署效率的「救命稻草」——在大幅降低资源占用的同时,还能尽量保留模型精度。

以INT8量化为例:

权重量化可以将模型参数的显存需求降低50%,配合激活值量化,利用Cube-Core的INT8算力加速矩阵乘运算。

KV cache量化则进一步压缩了显存占用,支持更长的序列和更高的并发请求,大幅提升了Decode阶段的系统吞吐量。

尽管低比特量化被视为LLM推理的灵丹妙药,但若要实现高质高效的量化,并非易事。

1. 精度的损失

将模型参数从高精度压缩到低精度,不可避免会导致精度下降。尤其是,在极低比特数(如二值)情况下更为明显。

2. 算法的「两难抉择」

如何去设计高效、抗噪的量化算法,在保持精度同时,降低计算和访存复杂度,依旧是行业研究重点。

过于复杂的算法,虽能提升精度,但会增加计算开销,抵销量化的效率优势。而过于简单的算法,又会牺牲过多精度,最终导致模型效果不佳。

3. 硬件兼容的适配

量化后的模型还需与硬件深度适配,而现有的量化算法在昇腾硬件上还有很多创新优化的空间。

此外,量化误差的控制和推理过程中的动态调整策略,也充满了挑战。

4.校准集泛化性缺失

校准集的泛化性缺失导致了在很多任务上,难以达到与原有模型相近的精度水平,甚至在某些场景下精度下降十分严重。

不论是投机推理,还是低比特量化,都是推理优化过程核心,它们所面临的难题,是LLM飙速推理路上最大的绊脚石。

而现在,华为的这套方案,彻底攻克所有挑战,解锁了AI模型的中国速度。

投机推理框架FusionSpec创1ms奇迹

具体来说,在投机推理方面,华为团队提出了投机推理框架FusionSpec。

FusionSpec充分利用了昇腾服务器高计算带宽比的特点,在低时延大并发场景下,深度优化了DeepSeek提出的MTP在昇腾上的推理性能,将投机推理框架耗时减小至1ms,并在三个方面进行了重大创新:

1. 考虑到DeepSeek的模型架构,MTP层需要主体模型的最后一层结果作为输入,将MTP层的执行直接排在主体模型执行之后。

这样做带来两个优势:

优化后的调度顺序避免了推理的步间数据传输

在PD分离的部署场景下,投机模型的后置解耦了PD分离系统与投机框架,同时有效减少了节点间的数据传输

昇腾基于PD分离部署的vLLM框架调度示意图

2. 参考MTP层训练模式,将MTP层视为模型的一部分,注意力算子复用主体模型的控制参数。

DeepSeek V3/R1为代表的主流的大语言模型采用旋转位置编码RoPE。在使用投机模型进行预测时,会按实际推理的token个数进行位置编码。

但对MTP层而言,计算时会忽略输入的第0个token。因此,研究团队把MTP层输入的第0个token舍去,前移其余token,并复用主体模型的控制参数。

而RoPE保证了对所有token进行平移后的attention score不发生改变。这样,就可以保证MTP层的正确计算,同时节省CPU上的准备时间,并简化整个系统的block管理。

· 参数复用省去了控制参数的重新构造,降低了框架耗时

通过主体模型前置与流程拼接,将单步投机推理中输入准备从两次降低为一次,避免主体模型和投机模型之间CPU同步打断流水,压缩了单步推理内主体模型与投机模型间的框架耗时,使得投机推理的整体框架时延与非投机场景一致。

基于上述优化,FusionSpec框架实现了在较低时延下的高并发、大吞吐。

3. 实现了NPU上的轻量步间准备,支撑了vLLM v0的multi-step以及vLLM v1前后处理全异步,进一步降低了步间的框架耗时。

除了模型结构和框架设计优化外,在算子级别的细化加速同样关键——这就是FusionSpec进一步优化的重点。

· 投机场景MLA算子加速

DeepSeek提出的对多头潜注意力机制MLA,通过对Key和Value的低秩联合压缩,不仅大幅减少了所需的KV缓存量,同时性能还超过了传统的MHA。

为了充分利用昇腾的计算能力,压缩端到端输出时间,FusionSpec进一步优化了投机场景MLA计算流程,减少矩阵的搬运时间。

投机场景下多头潜在注意力MLA算子优化

· TopK、TopP算子加速

在投机推理场景中,若预测m个token,单步推理需进行1+m次词表采样操作,所以采样操作的速度变得更加重要。

采样操作一般包含温度、TopK、TopP三步,其中TopK、TopP需要排序,并且计算前缀和,这些是采样操作的瓶颈。

未来,FusionSpec将采用流式过滤策略、昇腾归并排序API优化TopK、TopP计算。

量化框架OptiQuant让MoE巨兽飞起来

在量化方面,华为团队则提出了OptiQuant量化框架。

它不仅兼容业界主流量化算法,通过一系列功能创新,为高效部署提供了强力支撑。具体来说,它有四大核心亮点:

· 丰富的量化和数值类型

OptiQuant支持了Int2/4/8和FP8/HiFloat8等数据类型,与业界Qserve、HQQ、LUT等主流量化方法兼容。

在此基础上,OptiQuant创新性提出「可学习截断」、「量化参数优化」等算法,将量化误差进一步降低。

· 业内主流评测数据集

OptiQuant支持多样化评测任务,包括判断题、问答题、代码题和数学题等多个方向,覆盖了十种常见的语言。

为了提升量化模型的泛化能力,OptiQuant还引入了混合校准集的方法,按一定的比例混合不同数据集。

· 量化权重以及元数据的生成

OptiQuant提出了自适应层间混精算法和PD分离量化权重,并且根据对应的量化配置生成对应的权重参数,通过去冗余技术减少参数保存的参数量。

同时,FlexSmoothQuant等算法在数据校准过程中,将搜索到的元数据进行保存,并用于后续推理过程。

· 量化权重推理

OptiQuant提出了KVCache量化和MoE TopK专家剪枝技术。

结合昇腾亲和的量化算子,OptiQuant通过高效数据并行/流水并行,针对不同大小的大语言模型实现精度验证性能加速,将对各个数据集精度评估性能提高了5x以上。

此外,OptiQuant还支持Vector Quantization、DFloat11、可逆变换、量化模型微调等技术点。

OptiQuant量化框架

通过OptiQuant和相关优化算法,华为实现了W8A8C16/W4A8C16的模型精度,媲美FP8精度的效果,并充分发挥了昇腾硬件性能。

表1:DeepSeek-R1模型精度测试结果

注1:如无特殊说明, 测试为单次结果

注2:测试3次以上结果取平均

注3:单次测试结果

表2:DeepSeek-V3-0324模型精度测试结果

注1:单次测试结果

下一步,团队还将探索PD差异量化、KV cache量化、TopK专家剪枝、通用的等价变换建模、和量化微调等方向,实现更高效、更低比特的权重、激活和KV cache的量化模型推理技术。

总而言之,FusionSpec和OptiQuant的双剑合璧,将为超大规模MoE模型推理开辟了全新路径。

这两大框架的提出,打破了LLM推理的延迟魔咒、资源瓶颈。

这不仅仅是一次技术的突破,更是中国AI在全球舞台上的一次强势发声。

本文由人人都是产品经理作者【汪仔4260】,微信公众号:【新智元】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议。