惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

T
Tailwind CSS Blog
博客园 - Franky
博客园 - 司徒正美
Stack Overflow Blog
Stack Overflow Blog
GbyAI
GbyAI
Y
Y Combinator Blog
Microsoft Azure Blog
Microsoft Azure Blog
Blog — PlanetScale
Blog — PlanetScale
博客园 - 叶小钗
罗磊的独立博客
The GitHub Blog
The GitHub Blog
H
Help Net Security
cs.AI updates on arXiv.org
cs.AI updates on arXiv.org
Engineering at Meta
Engineering at Meta
Martin Fowler
Martin Fowler
Spread Privacy
Spread Privacy
Google DeepMind News
Google DeepMind News
AWS News Blog
AWS News Blog
N
Netflix TechBlog - Medium
T
The Exploit Database - CXSecurity.com
云风的 BLOG
云风的 BLOG
小众软件
小众软件
aimingoo的专栏
aimingoo的专栏
Cyberwarzone
Cyberwarzone
T
Threatpost
T
Threat Research - Cisco Blogs
Recent Announcements
Recent Announcements
T
Tor Project blog
D
Darknet – Hacking Tools, Hacker News & Cyber Security
Last Week in AI
Last Week in AI
L
Lohrmann on Cybersecurity
量子位
V
V2EX
V
Vulnerabilities – Threatpost
L
LINUX DO - 热门话题
www.infosecurity-magazine.com
www.infosecurity-magazine.com
P
Proofpoint News Feed
I
Intezer
Schneier on Security
Schneier on Security
雷峰网
雷峰网
B
Blog RSS Feed
Jina AI
Jina AI
爱范儿
爱范儿
Attack and Defense Labs
Attack and Defense Labs
Google DeepMind News
Google DeepMind News
M
MIT News - Artificial intelligence
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
P
Palo Alto Networks Blog
美团技术团队
博客园 - 【当耐特】

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
摩尔线程 MUSA 合入SGLang主线,国产GPU开源生态从“代码共建”迈入“原生支持时代”
李冬梅 · 2026-05-13 · via InfoQ - 促进软件开发领域知识与创新的传播

5 月 10 日,由摩尔线程与 SGLang 社区联合主办的“MUSA 开源技术沙龙|SGLang × MUSA Meetup”在北京成功举行。

本次 Meetup 不仅集结了 SGLang 核心开发成员,并邀请到 TileLang、Triton、Mooncake 等开源社区的顶尖技术专家,吸引了近百位前沿开发者到场参与。各方围绕大模型推理引擎、算子编译、工程优化与生态共建等核心议题,展开了一场高密度、深层次的技术交流。

图片

作为 MUSA 后端正式合入 SGLang 主线后的首场线下技术活动,此次 Meetup 集中展现了摩尔线程在推动国产 GPU 深度融入全球主流开源框架、加速 AI 软件栈生态共建方面取得的里程碑成果。基于这一官方支持体系,开发者在使用 SGLang 运行大语言模型及多模态推理任务时,已可直接调用摩尔线程全功能 GPU,无需依赖第三方适配层,国产算力与国际主流推理框架的协同由此迈入“原生支持”的新阶段

立足通用计算,以 MUSA 开放架构拥抱开源生态

摩尔线程 CTO 张钰勃在开场致辞中,深度阐释了 MUSA(Meta-computing Unified System Architecture)统一系统架构的核心设计理念。他强调,摩尔线程始终坚持“通用计算”的初衷,以真正通用及高度统一的底层计算平台,支撑从物理世界仿真、数字孪生到具身智能的未来技术演进,不为创新设限;同时,通过全产品线“统一”的指令集与架构标准,确保软件生态能够持续沉淀与积累。

图片

针对开发者最为关心的生态迁移体验,张钰勃表示:“摩尔线程秉持开放的态度,MUSA 在接口设计上最大程度复用了开发者熟悉的 GPU 编程习惯。我们不希望独立创造一套封闭的生态,而是以零学习成本,全面融入现有的繁荣生态。”基于这一开放理念,他指出,此次 MUSA 获得 SGLang 官方支持,正是摩尔线程拥抱开源社区的关键一步。未来,摩尔线程将与广大开发者并肩前行,持续在框架底层创新上贡献更多核心力量

技术分享:从推理框架到算子内核,共探国产 GPU 落地路径

技术分享环节,SGLang、Triton、TileLang 及 Mooncake 社区的核心专家围绕推理框架、算子编译与训推系统等议题,带来了五场深度技术分享。

图片

▼ 解析演进路线,SGLang 以创新架构挑战大模型推理极限

SGLang 核心开发成员 Xiaoyu Zhang(BBuf)重点解析了框架的关键演进:支撑 DeepSeek-V4 等模型的 Prefill-Decode 分离架构与分层缓存机制,以及 Zero‑overhead Speculative Decoding 带来的推测解码效率跃升。在算子层,原有的 sgl‑kernel 包因体积膨胀(超 1.5GB)已逐步迁移至全新的 Jit‑kernel 体系,基于 TVM‑FFI 实现按需编译,大幅提升开发与发版效率。同时,SGLang 积极引入 Vibe Coding 实践,利用 AI Agent 自动完成了超 60 项性能分析与调优任务。发布 2026 年 Q2 Roadmap 时,他明确表示摩尔线程 MUSA 已正式纳入 SGLang 硬件适配核心阵列,未来双方将深化原生算子支持,共同推动顶级推理框架与国产算力底座的“原生”级融合。

图片

▼ 打通原生生态,MUSA 释放主流模型“开箱即用”算力

摩尔线程 Contributor ROCKSTAR 分享了 SGLang 在 MUSA 平台上的优化与工程落地实践。

他重点介绍了实现快速兼容的关键——torchada 适配层,通过一次 import torchada 即可让开发者现有 CUDA 代码无缝运行在摩尔线程 GPU 上,大幅降低适配与维护成本。在算子层面,摩尔线程开源的 MATE(MUSA AI Tensor Engine)算子库提供了高性能 Attention 与 GEMM 算子,已对接 FlashAttention、FlashMLA、DeepGEMM 等主流接口。目前,基于 MUSA 的 SGLang 已支持 DeepSeek、Qwen、GLM 等主流大模型及 Wan、LTX 等视频生成模型,在 MTT S5000 等硬件上实现真正的“开箱即用”与无缝加速,显著降低了开发者的算力迁移门槛。截至 5 月 12 日,摩尔线程在 SGLang 主线累计提交 47 个 PR,其中 41 个已合入,完成了从环境构建到分布式推理的全链路打通,为开源生态持续贡献了扎实的工程能力。

SGLang × MUSA Roadmap 地址:

https://github.com/sgl-project/sglang/issues/16565

SGLang 安装文档:

https://docs.sglang.io/docs/hardware-platforms/mthreads_gpu

北京智源人工智能研究院 AI 编译器研究员肖航的演讲聚焦于大模型 Triton 关键算子的优化及其在 MUSA 平台上的深度适配。他介绍了旨在打通多种 AI 芯片的统一开源软件栈 FlagOS,其 FlagGEMs 算子库已涵盖超 497 个算子,并依托 FlagTree 编译器与 Triton-TLE 语言扩展,实现了跨芯片的高性能算子生成。通过融化、量化等方式加速 Fused MoE 和 FP8 GEMM 等算子性能 4 倍以上。

在 DeepSeek-V4 的 Day0 适配中,通过摩尔线程专用的张量加速引擎与 FlagOSTune 调优方案,TTFT 时延降低 56.7%,吞吐量提升 65.7%。这种跨芯片的统一抽象与优化机制,正为摩尔线程等国产 GPU 构建起更加丰富、高效的算力应用生态。

图片

▼ 破解硬件依赖,TileLang 以极简抽象重塑算子开发范式

TileLang Maintainer 唐正举深入探讨了作为 Tile 级领域特定编程语言(DSL),TileLang 在化解算子硬件依赖与性能调优上的核心优势。通过对计算与数据搬运基本单元(Tile)的显式控制,开发者能以极简代码实现极致性能——例如用约 50 行代码写出比肩 FlashAttention 专家库的 kernel,在 Attention‑Sinks 等算子上更获得 20 倍以上加速。TileLang 提供 Beginner、Developer、Expert 三种编程模式,兼顾上手简易与深度调优;DeepSeek-V4 已在训练中原生采用其编写核心 kernel,达到硬件峰值性能。作为开源近一年即斩获超 6000 星的热门社区,TileLang 正与 MUSA 生态深度联调共同构建适配摩尔线程全功能 GPU 的高性能算子库。未来,Tile‑AI 社区还将围绕分布式算子编程、自动调度等新项目发力,持续赋能 AI 算力演进。

TileLang-MUSA 开源地址:

https://github.com/tile-ai/tilelang-musa

TileKernels 算子库开源地址:

https://github.com/tile-ai/tilelang-musa/tree/main/tilekernels

图片

▼ 践行极致解耦,Mooncake 训推一体系统在国产 GPU 的高效实践

Mooncake Contributor 马腾分享了 Mooncake 与 SGLang 深度结合的技术演进。其核心传输引擎(Transfer Engine)充分利用零拷贝 RDMA 与多协议支持,实现高吞吐与超低延迟;KV Cache Store 将 GPU 显存、DRAM、SSD 等异构存储统一池化,显著降低长上下文推理成本。在弹性 EP 架构中,Mooncake 支持故障节点动态摘除与 Expert 映射调整,大幅提升集群容错能力;在 RL 权重更新场景,通过 P2P 传输将同步时间从 53 秒压缩至 7.2 秒。目前,摩尔线程已作为 Mooncake 项目的核心 Maintainer 之一,深度参与多节点通信协议等关键特性共建。这一系列工程创新,正将 Mooncake 打造为现代 AI 生产与部署软件栈的关键一环。

圆桌讨论:SGLang+MUSA 生态共建与工程化破局

在圆桌对话环节,摩尔线程软件副总裁杨上山担任主持人,与 Xiaoyu Zhang(BBuf)、ROCKSTAR、肖航、唐正举及马腾五位技术专家同台,围绕“SGLang + MUSA 生态共建与工程化破局”展开深度探讨。

图片

面对开源技术创新提速国产多硬件生态复杂度加剧的双重挑战,嘉宾们从框架、算子、通信到系统架构逐一破题:BBuf 呼吁框架层建立更干净的硬件抽象,避免侵入式修改;R0CKSTAR 分享了 MUSA 在兼容 CUDA 生态过程中“接口兼容、底层创新”的关键路径;肖航结合 Triton 及 TLE 扩展,探讨了可编程性与极致性能之间的再平衡策略;唐正举强调 TileLang 的 Tile 抽象可作为连接模型、算子和硬件的统一纽带,助力国产芯片全链路形成合力;马腾则从系统视角指出,最佳实践的沉淀与端到端场景验证是生态繁荣的关键。

嘉宾们一致认为,未来 12 个月应优先建立跨层级的统一抽象边界、标准化适配接口与共享的基准测试体系,以开放协作替代重复适配,共同推动国产 AI 软硬件生态的协同突破。

此次“SGLang × MUSA Meetup”的成功举办,标志着 MUSA 后端合入 SGLang 主线后,国产 GPU 与全球顶级推理框架的协同从“代码共建”迈向“生态共聚”