惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
Vercel News
Vercel News
博客园_首页
Y
Y Combinator Blog
美团技术团队
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
阮一峰的网络日志
阮一峰的网络日志
aimingoo的专栏
aimingoo的专栏
H
Hackread – Cybersecurity News, Data Breaches, AI and More
MyScale Blog
MyScale Blog
GbyAI
GbyAI
人人都是产品经理
人人都是产品经理
T
Tailwind CSS Blog
MongoDB | Blog
MongoDB | Blog
D
DataBreaches.Net
博客园 - Franky
Engineering at Meta
Engineering at Meta
量子位
The GitHub Blog
The GitHub Blog
F
Fortinet All Blogs
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
酷 壳 – CoolShell
酷 壳 – CoolShell
N
Netflix TechBlog - Medium

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
摩尔线程 MUSA 合入SGLang主线,国产GPU开源生态从“代码共建”...
李冬梅 · 2026-05-13 · via InfoQ - 促进软件开发领域知识与创新的传播

5 月 10 日,由摩尔线程与 SGLang 社区联合主办的“MUSA 开源技术沙龙|SGLang × MUSA Meetup”在北京成功举行。

本次 Meetup 不仅集结了 SGLang 核心开发成员,并邀请到 TileLang、Triton、Mooncake 等开源社区的顶尖技术专家,吸引了近百位前沿开发者到场参与。各方围绕大模型推理引擎、算子编译、工程优化与生态共建等核心议题,展开了一场高密度、深层次的技术交流。

图片

作为 MUSA 后端正式合入 SGLang 主线后的首场线下技术活动,此次 Meetup 集中展现了摩尔线程在推动国产 GPU 深度融入全球主流开源框架、加速 AI 软件栈生态共建方面取得的里程碑成果。基于这一官方支持体系,开发者在使用 SGLang 运行大语言模型及多模态推理任务时,已可直接调用摩尔线程全功能 GPU,无需依赖第三方适配层,国产算力与国际主流推理框架的协同由此迈入“原生支持”的新阶段

立足通用计算,以 MUSA 开放架构拥抱开源生态

摩尔线程 CTO 张钰勃在开场致辞中,深度阐释了 MUSA(Meta-computing Unified System Architecture)统一系统架构的核心设计理念。他强调,摩尔线程始终坚持“通用计算”的初衷,以真正通用及高度统一的底层计算平台,支撑从物理世界仿真、数字孪生到具身智能的未来技术演进,不为创新设限;同时,通过全产品线“统一”的指令集与架构标准,确保软件生态能够持续沉淀与积累。

图片

针对开发者最为关心的生态迁移体验,张钰勃表示:“摩尔线程秉持开放的态度,MUSA 在接口设计上最大程度复用了开发者熟悉的 GPU 编程习惯。我们不希望独立创造一套封闭的生态,而是以零学习成本,全面融入现有的繁荣生态。”基于这一开放理念,他指出,此次 MUSA 获得 SGLang 官方支持,正是摩尔线程拥抱开源社区的关键一步。未来,摩尔线程将与广大开发者并肩前行,持续在框架底层创新上贡献更多核心力量

技术分享:从推理框架到算子内核,共探国产 GPU 落地路径

技术分享环节,SGLang、Triton、TileLang 及 Mooncake 社区的核心专家围绕推理框架、算子编译与训推系统等议题,带来了五场深度技术分享。

图片

▼ 解析演进路线,SGLang 以创新架构挑战大模型推理极限

SGLang 核心开发成员 Xiaoyu Zhang(BBuf)重点解析了框架的关键演进:支撑 DeepSeek-V4 等模型的 Prefill-Decode 分离架构与分层缓存机制,以及 Zero‑overhead Speculative Decoding 带来的推测解码效率跃升。在算子层,原有的 sgl‑kernel 包因体积膨胀(超 1.5GB)已逐步迁移至全新的 Jit‑kernel 体系,基于 TVM‑FFI 实现按需编译,大幅提升开发与发版效率。同时,SGLang 积极引入 Vibe Coding 实践,利用 AI Agent 自动完成了超 60 项性能分析与调优任务。发布 2026 年 Q2 Roadmap 时,他明确表示摩尔线程 MUSA 已正式纳入 SGLang 硬件适配核心阵列,未来双方将深化原生算子支持,共同推动顶级推理框架与国产算力底座的“原生”级融合。

图片

▼ 打通原生生态,MUSA 释放主流模型“开箱即用”算力

摩尔线程 Contributor ROCKSTAR 分享了 SGLang 在 MUSA 平台上的优化与工程落地实践。

他重点介绍了实现快速兼容的关键——torchada 适配层,通过一次 import torchada 即可让开发者现有 CUDA 代码无缝运行在摩尔线程 GPU 上,大幅降低适配与维护成本。在算子层面,摩尔线程开源的 MATE(MUSA AI Tensor Engine)算子库提供了高性能 Attention 与 GEMM 算子,已对接 FlashAttention、FlashMLA、DeepGEMM 等主流接口。目前,基于 MUSA 的 SGLang 已支持 DeepSeek、Qwen、GLM 等主流大模型及 Wan、LTX 等视频生成模型,在 MTT S5000 等硬件上实现真正的“开箱即用”与无缝加速,显著降低了开发者的算力迁移门槛。截至 5 月 12 日,摩尔线程在 SGLang 主线累计提交 47 个 PR,其中 41 个已合入,完成了从环境构建到分布式推理的全链路打通,为开源生态持续贡献了扎实的工程能力。

SGLang × MUSA Roadmap 地址:

https://github.com/sgl-project/sglang/issues/16565

SGLang 安装文档:

https://docs.sglang.io/docs/hardware-platforms/mthreads_gpu

北京智源人工智能研究院 AI 编译器研究员肖航的演讲聚焦于大模型 Triton 关键算子的优化及其在 MUSA 平台上的深度适配。他介绍了旨在打通多种 AI 芯片的统一开源软件栈 FlagOS,其 FlagGEMs 算子库已涵盖超 497 个算子,并依托 FlagTree 编译器与 Triton-TLE 语言扩展,实现了跨芯片的高性能算子生成。通过融化、量化等方式加速 Fused MoE 和 FP8 GEMM 等算子性能 4 倍以上。

在 DeepSeek-V4 的 Day0 适配中,通过摩尔线程专用的张量加速引擎与 FlagOSTune 调优方案,TTFT 时延降低 56.7%,吞吐量提升 65.7%。这种跨芯片的统一抽象与优化机制,正为摩尔线程等国产 GPU 构建起更加丰富、高效的算力应用生态。

图片

▼ 破解硬件依赖,TileLang 以极简抽象重塑算子开发范式

TileLang Maintainer 唐正举深入探讨了作为 Tile 级领域特定编程语言(DSL),TileLang 在化解算子硬件依赖与性能调优上的核心优势。通过对计算与数据搬运基本单元(Tile)的显式控制,开发者能以极简代码实现极致性能——例如用约 50 行代码写出比肩 FlashAttention 专家库的 kernel,在 Attention‑Sinks 等算子上更获得 20 倍以上加速。TileLang 提供 Beginner、Developer、Expert 三种编程模式,兼顾上手简易与深度调优;DeepSeek-V4 已在训练中原生采用其编写核心 kernel,达到硬件峰值性能。作为开源近一年即斩获超 6000 星的热门社区,TileLang 正与 MUSA 生态深度联调共同构建适配摩尔线程全功能 GPU 的高性能算子库。未来,Tile‑AI 社区还将围绕分布式算子编程、自动调度等新项目发力,持续赋能 AI 算力演进。

TileLang-MUSA 开源地址:

https://github.com/tile-ai/tilelang-musa

TileKernels 算子库开源地址:

https://github.com/tile-ai/tilelang-musa/tree/main/tilekernels

图片

▼ 践行极致解耦,Mooncake 训推一体系统在国产 GPU 的高效实践

Mooncake Contributor 马腾分享了 Mooncake 与 SGLang 深度结合的技术演进。其核心传输引擎(Transfer Engine)充分利用零拷贝 RDMA 与多协议支持,实现高吞吐与超低延迟;KV Cache Store 将 GPU 显存、DRAM、SSD 等异构存储统一池化,显著降低长上下文推理成本。在弹性 EP 架构中,Mooncake 支持故障节点动态摘除与 Expert 映射调整,大幅提升集群容错能力;在 RL 权重更新场景,通过 P2P 传输将同步时间从 53 秒压缩至 7.2 秒。目前,摩尔线程已作为 Mooncake 项目的核心 Maintainer 之一,深度参与多节点通信协议等关键特性共建。这一系列工程创新,正将 Mooncake 打造为现代 AI 生产与部署软件栈的关键一环。

圆桌讨论:SGLang+MUSA 生态共建与工程化破局

在圆桌对话环节,摩尔线程软件副总裁杨上山担任主持人,与 Xiaoyu Zhang(BBuf)、ROCKSTAR、肖航、唐正举及马腾五位技术专家同台,围绕“SGLang + MUSA 生态共建与工程化破局”展开深度探讨。

图片

面对开源技术创新提速国产多硬件生态复杂度加剧的双重挑战,嘉宾们从框架、算子、通信到系统架构逐一破题:BBuf 呼吁框架层建立更干净的硬件抽象,避免侵入式修改;R0CKSTAR 分享了 MUSA 在兼容 CUDA 生态过程中“接口兼容、底层创新”的关键路径;肖航结合 Triton 及 TLE 扩展,探讨了可编程性与极致性能之间的再平衡策略;唐正举强调 TileLang 的 Tile 抽象可作为连接模型、算子和硬件的统一纽带,助力国产芯片全链路形成合力;马腾则从系统视角指出,最佳实践的沉淀与端到端场景验证是生态繁荣的关键。

嘉宾们一致认为,未来 12 个月应优先建立跨层级的统一抽象边界、标准化适配接口与共享的基准测试体系,以开放协作替代重复适配,共同推动国产 AI 软硬件生态的协同突破。

此次“SGLang × MUSA Meetup”的成功举办,标志着 MUSA 后端合入 SGLang 主线后,国产 GPU 与全球顶级推理框架的协同从“代码共建”迈向“生态共聚”