惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

The Last Watchdog
The Last Watchdog
Exploit-DB.com RSS Feed
Exploit-DB.com RSS Feed
S
Secure Thoughts
MongoDB | Blog
MongoDB | Blog
博客园 - Franky
T
Tor Project blog
Threat Intelligence Blog | Flashpoint
Threat Intelligence Blog | Flashpoint
Google DeepMind News
Google DeepMind News
L
LINUX DO - 最新话题
博客园_首页
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
Vercel News
Vercel News
Last Week in AI
Last Week in AI
月光博客
月光博客
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
P
Proofpoint News Feed
博客园 - 叶小钗
NISL@THU
NISL@THU
C
Check Point Blog
K
Kaspersky official blog
N
News and Events Feed by Topic
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
A
Arctic Wolf
T
Threatpost
GbyAI
GbyAI
L
LINUX DO - 热门话题
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
P
Privacy & Cybersecurity Law Blog
N
News and Events Feed by Topic
Scott Helme
Scott Helme
P
Privacy International News Feed
The Register - Security
The Register - Security
G
GRAHAM CLULEY
Recorded Future
Recorded Future
Apple Machine Learning Research
Apple Machine Learning Research
C
Cybersecurity and Infrastructure Security Agency CISA
B
Blog
Project Zero
Project Zero
Cyberwarzone
Cyberwarzone
Webroot Blog
Webroot Blog
Microsoft Security Blog
Microsoft Security Blog
cs.CV updates on arXiv.org
cs.CV updates on arXiv.org
D
DataBreaches.Net
J
Java Code Geeks
AWS News Blog
AWS News Blog
Help Net Security
Help Net Security
Engineering at Meta
Engineering at Meta
M
MIT News - Artificial intelligence
T
Threat Research - Cisco Blogs
Google DeepMind News
Google DeepMind News

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了! 从 Coding 到 Agent:QCon 北京 2026 全景复盘,优秀出品人 & 明星讲师名单揭晓 全链路支撑大模型国产化“Day 0适配”,商汤大装置构建全栈能力底座 凌晨,OpenAI 与亚马逊云科技史上最大联合发布来了 HashiCorp Vault 2.0 发布:引入新身份联邦机制,迈入 IBM 生命周期体系 Yelp 实现超 1,000 个 Cassandra 节点零停机升级 写了 17 年开源代码,我为什么认为 Coding Agents 堆功能是在瞎折腾? 基于 Apache Camel 编排智能体与多模态 AI 管道 面向智能体与人类用户的AI记忆系统:架构设计与核心场景实践|AICon上海 Anthropic 推出 Managed Agents,简化 AI 代理部署流程 阿里HappyHorse开启灰测,720P视频生成低至0.44元/秒 讯飞联合清华团队押注量子AI:不看营收、不设KPI,一群“无人区”科学家,抢夺下代AI算力入口 小米万亿模型全面开源:MIT 协议、1M 上下文,但还是打不过 DeepSeek Cortex Code 入门指南:面向数据工程师的实践路径 | 技术实践 openJiuwen社区首发Team Skills,定义Coordination Engineering新范式 用 Snowflake Cortex Agents 释放结构化数据的最大价值 | 技术实践 Grafana 利用 Kafka 对 Loki 进行了架构重构,并发布了一款命令行工具,旨在将可观测性引入编码代理 ClickHouse重构全文索引:对象存储上跑出高性能 Full-Text Search 可观测性和遥测技术如何提升软件工程实践 Dropbox 与 GitHub 合作,将单体库大小从 87GB 缩减至 20GB Agent 的下一站:基于长期记忆系统 EverOS 的自我演进|AICon上海 同一赛道,四种收费:Agent 控制层(Harness)开始分裂 Cloudflare Sandboxes 正式发布,为 AI 代理提供持久化隔离环境 Agent 的“记忆断片”困局,该怎么破?_AI&大模型_AICon 全球人工智能开发与应用大会_InfoQ精选视频 数据分析师如何快速建立在 AI 时代最值钱的能力:一份可落地的行动路线图 摩尔线程最新财报:研发占比超86%,万卡级大规模智算集群落地 当云区域失效:地缘动荡环境下的高可用重构 Slack 重构通知系统,设置参与度提升 5 倍 智能体工程的隐性技术债务 “我把所有模型都换成了DeepSeek V4”:月账单将降 90%,效果还更好 阿里云智能集团高级技术专家刘少伟已确认出席AICon上海站,并分享如何构建企业 Agent 的自动化行动架构 构建生产就绪的 tRPC API:Apollo Federation 的 TypeScript 替代方案 Anthropic推出面向Claude Code的基于智能体的代码审查功能 北京车展直击:斑马智能甩出车载Agent短剧,比亚迪率先落地,AI让智能座舱又热起来了 Snowflake 作为智能体运行时:从静态管道迈向自主数据系统 | 技术实践 Snowflake 上的本体体系:基于 Cortex Code 能力实现从架构到部署 | 技术实践 Cloudflare 公布 MCP 架构方案,应对企业面临的安全与治理风险 复杂的项目管理怎么做到「AI 友好」?飞书项目用「开放」给出答案 Snowflake Cortex Code 的规范驱动开发:将 SDLC 方法论引入 AI 辅助工作流 | 技术实践 Copilot 不让注册了:从“随便用”到“全面限”,agent 把原有订价模型顶穿了 当互联网用AI卷效率时,这家公司先问了一连串“能不能” Meta 开始记录员工每一次点击:AI 要接管工作,先监控会工作的人 Meta“Token榜”逼疯打工人,一夜烧掉公司几万刀!AI时代Token焦虑越来越离谱 智源FlagOS完成DeepSeek-V4-Flash在八款芯片Day0适配,实现三重技术突破 DeepSeek V4 重磅开源!首次打通华为Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 李志飞的“新实验”:当超级个体撞上真实组织 GPT-5.5 登顶时刻,Anthropic 亲口承认 Claude 变笨了!网友群嘲:太敷衍 那些没空写的小需求,龙虾真能做吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从 Pandas 到生产:使用任意 IDE 进行可扩展的 ML 数据管道与分布式处理 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 pnpm 11 候选版本发布,带来 ESM 分发、供应链默认设置以及新的存储格式 银行业PDF表格提取方案重构:基于Java的分层方案 GPT-5.5 赢了 Opus 4.7 和 Mythos?奥特曼晒黄仁勋内部信:英伟达全员用上 Codex! Cloudflare 推出 Think:一款面向 AI 代理的持久化运行时 1850亿美元天价支出、75%代码由AI生成!谷歌正式宣告:全面转向智能体工作流 xAI落后太多,马斯克“开大”重金求购Cursor,100亿美金“分手费”都敢签! Pulumi 新增对 Bun 运行时的全面支持 姚顺雨腾讯模型首秀!不卷参数只做 “听话打工人”,Hy3 preview登场 | 附实测 老板让你“忽悠”投资人,你敢发给龙虾吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 Gemini CLI 引入子代理机制,实现任务委派与并行代理工作流 清华系团队星工聚将完成数千万天使轮融资,轮式机器人拿下头部制造企业亿级大单 Pretext.js 绕过 DOM 布局重排,实现 120 FPS 的高级交互体验 靠“AI 云”爆红的 Vercel,栽在一个第三方AI工具手里!IPO前夕遭黑,200万美元赎金谈崩? 高能研讨会|端侧 AI 正在重写实时感知效率上限_AI&大模型_王玮_InfoQ精选视频 2050大会看这篇就够了|报名、交通食宿指引大全 Java 近期资讯:OpenJDK JEP、Jakarta EE 12、Spring Framework、Micrometer、Camel、JBang 金融智能的架构编排:基于 Snowflake Cortex Agents 实现结构化与非结构化数据统一分析 | 技术实践 在AK大神爆火的任务里,摸清国产AI真实水平 百灵Ling-2.6-flash 正式发布:高 Token 效率,以 1/10 消耗实现 SOTA 级 Agent 能力 当 PM 懂AI,当技术懂产品:AI 时代产品力的双向进化|PM x AI产品力领航者大会即将开幕 为 AI 智能体设计记忆机制:揭秘 LinkedIn 的认知记忆智能体 获奖名单公布|2026主题征文第一期|分享你最有价值的龙虾场景与核心 Skill_热门活动_InfoQ写作社区官方_InfoQ写作社区
从兼容 CUDA 到自我进化,摩尔线程想用 MUSA 解决真正的难题
凌敏 · 2026-05-21 · via InfoQ - 促进软件开发领域知识与创新的传播

没有发布芯片,但这场发布会还是“出圈”了。

5 月 18 日,摩尔线程在北京举办主题为“词元时代,万物智能”的年度产品发布会,现场座无虚席。摩尔线程用接近 2 个小时的时间,一口气完成六大重磅发布:

从万卡级规模的夸娥智算集群,到自研“长江”SoC 驱动的智能终端 MTT AICUBE 和 MTT AIBOOK;从数字世界智能体“小麦”,到加速物理 AI 落地的首个全栈具身智能仿真平台 MT Lambda,再到持续进化的 MUSA 生态

摩尔线程全面展示了一个覆盖“云 - 边 - 端”的全栈智算矩阵,每个都值得深入讨论。但在笔者看来,这场发布会带来的最大惊喜,是压轴发布的 MUSA 生态进化。

过去几年,国产 GPU 已经验证了硬件能力。通过架构迭代、工程优化,国产 GPU 是能够在硬件上交出高分答卷的。但企业采购 GPU 从来不是只买一张卡,而是在押注其背后的软件生态和开发体系。摩尔线程用一场发布会向开发者证明,MUSA 不只是国产 GPU 的生态底座,更是一个开放、自进化、与开发者共同成长的智能生态。

国产 GPU,加速融入全球开源生态

在过去很长一段时间里,国产 GPU 软件生态与全球主流开源生态之间,始终存在一道微妙的裂痕。国产 GPU 能支持不少主流框架运行,却少有人能进入真正的牌桌,融入全球开源生态。

这意味着,即便开发者能在国产 GPU 上完成训练或推理任务,但需要做的额外工作一点也不少。最显著的代价是,维护成本高昂。同样的模型跑在国产 GPU 上,如果缺乏原生支持,开发者需要针对不同训练或推理框架单独维护适配层,不少核心算子也无法直接调用,需要开发者手动替换实现方案,甚至重新编写部分 kernel。如果上游框架迭代,开发者还需要投入额外的精力维护 patch、跟进版本更新和兼容测试。

开发者用大量的时间和精力,填补生态上的空白。这也是为什么,MUSA 近期在开源生态层面的进展,值得拿来放到发布会上压轴讨论。

在当前最主流的两个大模型推理框架 SGLang 和 vLLM 上,MUSA 都带来了好消息:

  • SGLang 方面,MUSA 后端正式加入 SGLang 的官方支持体系,相关代码也已成功合入 SGLang 主线。截至 5 月 12 日,摩尔线程已向 SGLang 提交 47 个 PR,其中 41 个完成合并,并成功进入 SGLang 2026 年 Q2 官方硬件支持矩阵,与 GB200/GB300、AMD、TPU 等主流算力平台并列。

  • vLLM 方面,MUSA 成为 vLLM 的官方后端,并开源 vLLM-MUSA,开发者可原生获得摩尔线程 GPU 加速能力。

与单纯地多支持了一个框架相比,加入大模型推理框架官方后端矩阵意味着,国产 GPU 在生态适配上拥有更充分、更直接的兼容路径。以 SGLang 为例,无论开发者使用的是 SGLang 框架本体 sglang、高性能算子库 sgl-kernel,还是多模态生成组件 multimodal_gen,都能在原生框架环境中直接调用摩尔线程 GPU,开发者不需要维护额外分支或适配层,就能在熟悉的工作流中完成推理部署和性能优化。

除了推理框架,摩尔线程在底层编译生态上也有关键进展。

据介绍,摩尔线程正与智源研究院合作推进 Triton 生态,Triton-MUSA 已升级支持至 Triton 3.6 最新版本。基于 Triton 的 FlagOS 正在成为连接不同 AI 芯片的软件中间层,其重要性不言而喻。此前,在一场由摩尔线程举办的技术 Meetup 上,智源研究院展示了打通多种 AI 芯片的统一开源软件栈 FlagOS,其 FlagGEMs 算子库已涵盖超 497 个算子,并依托 FlagTree 编译器与 Triton-TLE 语言扩展,实现了跨芯片的高性能算子生成。

这一能力已经在实际场景中得到验证。以 DeepSeek-V4 的 Day0 适配为例,基于摩尔线程专用张量加速引擎与 FlagOSTune 调优方案,模型首 Token 返回时延(TTFT)降低 56.7%,吞吐量提升 65.7%。

从这个角度看,Triton-MUSA 升级更大的意义在于,开发者可以基于 Triton 这一主流高性能算子开发工具,在 MUSA 上进行更高效的算子开发与优化,进一步降低底层开发门槛。

在全球开源社区中,TileLang-MUSA 已成功合入开源主线。作为近一年快速崛起的热门开源社区,TileLang 开源不足一年便斩获超 6000 Stars,其目标是解决 Triton 等现有方案在极致性能控制上的不足,让开发者用更少的代码实现专家级的算子性能。

目前,TileLang 正与 MUSA 生态深度联调,共同构建适配摩尔线程全功能 GPU 的高性能算子库。在 GEMM 类算子上,已经实现了 95% 以上的汇编级性能效率,Attention 类算子也达到了 90% 以上的效率。

从 SGLang 到 vLLM,再到 Triton、TileLang,MUSA 正在加速进入主流开源生态,串联起从上层应用到底层优化的完整路径。降低开发者维护成本的同时,也让国产 GPU 更有可能被大规模采用。这或许才是国产 GPU 生态走向成熟的重要分野。

100% 兼容,MUSA 把迁移成本打下来了

降低维护成本决定了开发者能否长期留下来,但在这之前,决定开发者是否愿意用起来的,是迁移成本。

正如前文所说,企业采购 GPU 从来不是只买一张卡,而是在押注其背后的软件生态和开发体系。代码能否复用、框架能否兼容、工作流是否需要重构,往往比单纯的算力参数更影响最终决策。

此次发布会上新的 MUSA SDK 5.1.0,直指的正是迁移痛点——它完全对标 CUDA 12.8,后者为 Blackwell 架构提供了完整、全工具链的支持,也是当前业界广泛使用的主力版本。

图片

升级后,基于 CUDA 12.8 开发的 AI 模型、科学计算应用,都能以极高的效率运行在摩尔线程 GPU 上。MUSA 软件栈全链路覆盖了底层驱动、编译器、算子加速库、训练与推理框架,并且迁移流程得到了大幅简化:

图片

兼容只是第一步,决定开发者体验的,还有性能。针对 FlashAttention3、Sage Attention、DSA、GDN、DeepGEMM 等当前业界最常用的计算算子,摩尔线程推出了 MATE(MUSA AI Tensor Engine)加速库,并围绕核心算子进行了专项性能增强。

其中,FlashAttention3 在摩尔线程 GPU 上的计算效率高达 95%,整体热点算子覆盖率突破 90%。在 Attention 类算子上,MATE 已实现全场景、全覆盖支持,为大规模语言模型提供了核心性能保障。

这些数据代表的是,迁移不再以牺牲性能为代价,开发者将现有 CUDA 应用迁移至 MUSA 后,在热点计算环节的实际运行速度与原有平台几乎无差别。

为了提升开发者应用体验,摩尔线程还提供了“产品化”的训练与推理套件。比如在训练侧,基于 MTT S5000 全功能 GPU 的超大规模集群训练能力已实现全面产品化,同时,强化了对强化学习的支持,兼容业界主流的 VeRL 与 Slime 框架,并完成了对多项微调框架的适配。无论是千卡集群训练,还是模型微调,MUSA 都能提供稳定高效的开发体验。

从兼容 CUDA,到强化热点算子性能,再到训练与推理能力产品化,这些“上新”直指的,是国产 GPU 在过去很长一段时间里,最深层的痛点——迁移门槛太高了。

过去,开发者迁移至国产 GPU,既要考虑底层兼容性问题,比如接口差异、调用习惯,又要考虑性能,比如算子执行效率是否打折。此外,训练和推理环境本身也存在迁移成本。一次迁移,往往需要重新验证训练流程、部署推理框架、适配集群环境和工具链。

本次 MUSA 的更新,本质上就是在逐层拆解这些迁移障碍。这些变化对于开发者真正的意义,不只是把迁移门槛打下来。更重要的是,它尽可能保留了开发者既有的开发习惯和工作流,让整个迁移几乎零成本。

从兼容 CUDA 到构建自进化生态,为什么是摩尔线程?

从进入主流开源生态到 100% 兼容,不难看出,上市后的摩尔线程,技术路线更加清晰了,也再次印证了摩尔线程创始人、董事长兼 CEO 张建中此前的判断:生态体系才是 GPU 行业的核心护城河与价值所在

过去十多年,英伟达围绕 CUDA 构建起来的 API、编译器、算子库、框架适配和开发者社区,铸就了其坚实壁垒。MUSA 的路径,某种程度上也是在验证这一逻辑。但不同的是,摩尔线程试图用更高效率的方式补齐生态短板——引入 AI 技术加速生态的自我演进

为了降低 MUSA 编程门槛,本次发布会上,摩尔线程带来了面向开发者打造的新一代 AI 编程工具 MUSACODE

图片

MUSACODE 支持自然语言生成代码,能实现 30 天自动生成、测试 PP 库 12015 个算子,并基于 TileLang 自动调优 Group GEMM 算子实现 60% 性能提升。此外,MUSACODE 还支持 Python、C++、Rust、Go 等多种主流语言,并提供 MUSA VSCode Edition 官方插件,支持代码完全在本地端侧运行,保护企业的隐私与数据安全。

在编程辅助之外,摩尔线程还进一步引入了 AI Agent 自动化迁移体系,从工具层、基础层到使用层,全方位降低开发者接入门槛。

图片

在工具层,Automusify Skill 能够实现零干预、自动化地将现有工程迁移至 MUSA 平台,无需手动修改代码,极大提升迁移效率;在基础层,实现了对 Top 100 人工智能与 Top 100 科学计算两大领域加速仓库的 100% 自动迁移;在使用层,MUSA 提供了加速库在线源,开发者可通过在线源直接获取编译后的仓库及开源代码,真正做到即拿即用、开箱即跑。

从自动迁移工具,到兼容核心 API,再到在线加速库和 AI 编程助手,摩尔线程正试图用一条完整的自动化链路,将生态建设从人力追赶推进到自进化。

在一众国产 GPU 厂商中,为什么是摩尔线程率先把生态建设推到这一阶段?

背后的答案,或许就藏在其长期坚持的技术路线中。

不同于单一场景导向的 GPU 产品思路,摩尔线程一直走的是 基于统一系统架构的全功能 GPU 路线,同一颗芯片同时支持 AI 计算、图形渲染、物理仿真和超高清视频编解码,具备极高的全场景全栈计算通用性。

也正因此,MUSA 从诞生之初就被放在了核心战略位置。

回看近几年摩尔线程围绕 MUSA 的持续投入,无论是硬件架构迭代、软件栈补齐,还是如今加速融入主流开源生态、引入 AI 驱动生态自进化,可以看出,摩尔线程对于 GPU 竞争终局的判断一直围绕着一个主线:开发者

硬件层面,MUSA 架构从 2021 年的“苏堤”起步,历经“春晓”、“曲院”、“平湖”,再到去年年末预告的“花港”,持续围绕全功能 GPU 能力演进。相比聚焦单一 AI 场景的产品路线,统一系统架构能让开发者基于更统一的算力底座进行开发和部署,这本身就是开发效率的重要保障。

软件层面,从早期补齐驱动、运行时和编译器等基础能力,到逐步完善数学库、算子加速库、训练与推理框架支持,再到持续提升 CUDA 兼容能力并接入 SGLang、vLLM、Triton、TileLang 等主流开源生态,MUSA 正通过降低迁移成本让开发者用起来、降低维护成本让开发者留下来。

相比单纯比拼硬件参数,摩尔线程显然更早意识到,GPU 行业的竞争终局,从来不只是芯片本身,而是谁能赢得更多开发者。只有当开发者愿意用起来、留下来,一家 GPU 厂商才真正拥有长期竞争力。