惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
人人都是产品经理
人人都是产品经理
IT之家
IT之家
T
The Blog of Author Tim Ferriss
V
V2EX
博客园 - 聂微东
The Cloudflare Blog
Blog — PlanetScale
Blog — PlanetScale
A
About on SuperTechFans
U
Unit 42
Vercel News
Vercel News
L
LangChain Blog
博客园 - 司徒正美
H
Help Net Security
Recent Announcements
Recent Announcements
Recorded Future
Recorded Future
V
Visual Studio Blog
Jina AI
Jina AI
Microsoft Azure Blog
Microsoft Azure Blog
GbyAI
GbyAI
Y
Y Combinator Blog
C
Check Point Blog
博客园 - 三生石上(FineUI控件)
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
J
Java Code Geeks
The Register - Security
The Register - Security
The GitHub Blog
The GitHub Blog
B
Blog RSS Feed
F
Fortinet All Blogs
B
Blog
G
Google Developers Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
云风的 BLOG
云风的 BLOG
爱范儿
爱范儿
MongoDB | Blog
MongoDB | Blog
F
Full Disclosure
有赞技术团队
有赞技术团队
罗磊的独立博客
博客园_首页
MyScale Blog
MyScale Blog
aimingoo的专栏
aimingoo的专栏
Google DeepMind News
Google DeepMind News
M
MIT News - Artificial intelligence
N
Netflix TechBlog - Medium
Engineering at Meta
Engineering at Meta
量子位
I
InfoQ
小众软件
小众软件
P
Proofpoint News Feed

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
摩尔线程 MUSA 合入SGLang主线,国产GPU开源生态从“代码共建”迈入“原生支持时代”
李冬梅 · 2026-05-13 · via InfoQ - 促进软件开发领域知识与创新的传播

5 月 10 日,由摩尔线程与 SGLang 社区联合主办的“MUSA 开源技术沙龙|SGLang × MUSA Meetup”在北京成功举行。

本次 Meetup 不仅集结了 SGLang 核心开发成员,并邀请到 TileLang、Triton、Mooncake 等开源社区的顶尖技术专家,吸引了近百位前沿开发者到场参与。各方围绕大模型推理引擎、算子编译、工程优化与生态共建等核心议题,展开了一场高密度、深层次的技术交流。

图片

作为 MUSA 后端正式合入 SGLang 主线后的首场线下技术活动,此次 Meetup 集中展现了摩尔线程在推动国产 GPU 深度融入全球主流开源框架、加速 AI 软件栈生态共建方面取得的里程碑成果。基于这一官方支持体系,开发者在使用 SGLang 运行大语言模型及多模态推理任务时,已可直接调用摩尔线程全功能 GPU,无需依赖第三方适配层,国产算力与国际主流推理框架的协同由此迈入“原生支持”的新阶段

立足通用计算,以 MUSA 开放架构拥抱开源生态

摩尔线程 CTO 张钰勃在开场致辞中,深度阐释了 MUSA(Meta-computing Unified System Architecture)统一系统架构的核心设计理念。他强调,摩尔线程始终坚持“通用计算”的初衷,以真正通用及高度统一的底层计算平台,支撑从物理世界仿真、数字孪生到具身智能的未来技术演进,不为创新设限;同时,通过全产品线“统一”的指令集与架构标准,确保软件生态能够持续沉淀与积累。

图片

针对开发者最为关心的生态迁移体验,张钰勃表示:“摩尔线程秉持开放的态度,MUSA 在接口设计上最大程度复用了开发者熟悉的 GPU 编程习惯。我们不希望独立创造一套封闭的生态,而是以零学习成本,全面融入现有的繁荣生态。”基于这一开放理念,他指出,此次 MUSA 获得 SGLang 官方支持,正是摩尔线程拥抱开源社区的关键一步。未来,摩尔线程将与广大开发者并肩前行,持续在框架底层创新上贡献更多核心力量

技术分享:从推理框架到算子内核,共探国产 GPU 落地路径

技术分享环节,SGLang、Triton、TileLang 及 Mooncake 社区的核心专家围绕推理框架、算子编译与训推系统等议题,带来了五场深度技术分享。

图片

▼ 解析演进路线,SGLang 以创新架构挑战大模型推理极限

SGLang 核心开发成员 Xiaoyu Zhang(BBuf)重点解析了框架的关键演进:支撑 DeepSeek-V4 等模型的 Prefill-Decode 分离架构与分层缓存机制,以及 Zero‑overhead Speculative Decoding 带来的推测解码效率跃升。在算子层,原有的 sgl‑kernel 包因体积膨胀(超 1.5GB)已逐步迁移至全新的 Jit‑kernel 体系,基于 TVM‑FFI 实现按需编译,大幅提升开发与发版效率。同时,SGLang 积极引入 Vibe Coding 实践,利用 AI Agent 自动完成了超 60 项性能分析与调优任务。发布 2026 年 Q2 Roadmap 时,他明确表示摩尔线程 MUSA 已正式纳入 SGLang 硬件适配核心阵列,未来双方将深化原生算子支持,共同推动顶级推理框架与国产算力底座的“原生”级融合。

图片

▼ 打通原生生态,MUSA 释放主流模型“开箱即用”算力

摩尔线程 Contributor ROCKSTAR 分享了 SGLang 在 MUSA 平台上的优化与工程落地实践。

他重点介绍了实现快速兼容的关键——torchada 适配层,通过一次 import torchada 即可让开发者现有 CUDA 代码无缝运行在摩尔线程 GPU 上,大幅降低适配与维护成本。在算子层面,摩尔线程开源的 MATE(MUSA AI Tensor Engine)算子库提供了高性能 Attention 与 GEMM 算子,已对接 FlashAttention、FlashMLA、DeepGEMM 等主流接口。目前,基于 MUSA 的 SGLang 已支持 DeepSeek、Qwen、GLM 等主流大模型及 Wan、LTX 等视频生成模型,在 MTT S5000 等硬件上实现真正的“开箱即用”与无缝加速,显著降低了开发者的算力迁移门槛。截至 5 月 12 日,摩尔线程在 SGLang 主线累计提交 47 个 PR,其中 41 个已合入,完成了从环境构建到分布式推理的全链路打通,为开源生态持续贡献了扎实的工程能力。

SGLang × MUSA Roadmap 地址:

https://github.com/sgl-project/sglang/issues/16565

SGLang 安装文档:

https://docs.sglang.io/docs/hardware-platforms/mthreads_gpu

北京智源人工智能研究院 AI 编译器研究员肖航的演讲聚焦于大模型 Triton 关键算子的优化及其在 MUSA 平台上的深度适配。他介绍了旨在打通多种 AI 芯片的统一开源软件栈 FlagOS,其 FlagGEMs 算子库已涵盖超 497 个算子,并依托 FlagTree 编译器与 Triton-TLE 语言扩展,实现了跨芯片的高性能算子生成。通过融化、量化等方式加速 Fused MoE 和 FP8 GEMM 等算子性能 4 倍以上。

在 DeepSeek-V4 的 Day0 适配中,通过摩尔线程专用的张量加速引擎与 FlagOSTune 调优方案,TTFT 时延降低 56.7%,吞吐量提升 65.7%。这种跨芯片的统一抽象与优化机制,正为摩尔线程等国产 GPU 构建起更加丰富、高效的算力应用生态。

图片

▼ 破解硬件依赖,TileLang 以极简抽象重塑算子开发范式

TileLang Maintainer 唐正举深入探讨了作为 Tile 级领域特定编程语言(DSL),TileLang 在化解算子硬件依赖与性能调优上的核心优势。通过对计算与数据搬运基本单元(Tile)的显式控制,开发者能以极简代码实现极致性能——例如用约 50 行代码写出比肩 FlashAttention 专家库的 kernel,在 Attention‑Sinks 等算子上更获得 20 倍以上加速。TileLang 提供 Beginner、Developer、Expert 三种编程模式,兼顾上手简易与深度调优;DeepSeek-V4 已在训练中原生采用其编写核心 kernel,达到硬件峰值性能。作为开源近一年即斩获超 6000 星的热门社区,TileLang 正与 MUSA 生态深度联调共同构建适配摩尔线程全功能 GPU 的高性能算子库。未来,Tile‑AI 社区还将围绕分布式算子编程、自动调度等新项目发力,持续赋能 AI 算力演进。

TileLang-MUSA 开源地址:

https://github.com/tile-ai/tilelang-musa

TileKernels 算子库开源地址:

https://github.com/tile-ai/tilelang-musa/tree/main/tilekernels

图片

▼ 践行极致解耦,Mooncake 训推一体系统在国产 GPU 的高效实践

Mooncake Contributor 马腾分享了 Mooncake 与 SGLang 深度结合的技术演进。其核心传输引擎(Transfer Engine)充分利用零拷贝 RDMA 与多协议支持,实现高吞吐与超低延迟;KV Cache Store 将 GPU 显存、DRAM、SSD 等异构存储统一池化,显著降低长上下文推理成本。在弹性 EP 架构中,Mooncake 支持故障节点动态摘除与 Expert 映射调整,大幅提升集群容错能力;在 RL 权重更新场景,通过 P2P 传输将同步时间从 53 秒压缩至 7.2 秒。目前,摩尔线程已作为 Mooncake 项目的核心 Maintainer 之一,深度参与多节点通信协议等关键特性共建。这一系列工程创新,正将 Mooncake 打造为现代 AI 生产与部署软件栈的关键一环。

圆桌讨论:SGLang+MUSA 生态共建与工程化破局

在圆桌对话环节,摩尔线程软件副总裁杨上山担任主持人,与 Xiaoyu Zhang(BBuf)、ROCKSTAR、肖航、唐正举及马腾五位技术专家同台,围绕“SGLang + MUSA 生态共建与工程化破局”展开深度探讨。

图片

面对开源技术创新提速国产多硬件生态复杂度加剧的双重挑战,嘉宾们从框架、算子、通信到系统架构逐一破题:BBuf 呼吁框架层建立更干净的硬件抽象,避免侵入式修改;R0CKSTAR 分享了 MUSA 在兼容 CUDA 生态过程中“接口兼容、底层创新”的关键路径;肖航结合 Triton 及 TLE 扩展,探讨了可编程性与极致性能之间的再平衡策略;唐正举强调 TileLang 的 Tile 抽象可作为连接模型、算子和硬件的统一纽带,助力国产芯片全链路形成合力;马腾则从系统视角指出,最佳实践的沉淀与端到端场景验证是生态繁荣的关键。

嘉宾们一致认为,未来 12 个月应优先建立跨层级的统一抽象边界、标准化适配接口与共享的基准测试体系,以开放协作替代重复适配,共同推动国产 AI 软硬件生态的协同突破。

此次“SGLang × MUSA Meetup”的成功举办,标志着 MUSA 后端合入 SGLang 主线后,国产 GPU 与全球顶级推理框架的协同从“代码共建”迈向“生态共聚”