惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Martin Fowler
Martin Fowler
博客园 - 【当耐特】
GbyAI
GbyAI
M
MIT News - Artificial intelligence
Microsoft Azure Blog
Microsoft Azure Blog
A
About on SuperTechFans
罗磊的独立博客
Apple Machine Learning Research
Apple Machine Learning Research
腾讯CDC
F
Fortinet All Blogs
IT之家
IT之家
WordPress大学
WordPress大学
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
Last Week in AI
Last Week in AI
Google DeepMind News
Google DeepMind News
Jina AI
Jina AI
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
DataBreaches.Net
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
H
Help Net Security
V
Visual Studio Blog
小众软件
小众软件
Y
Y Combinator Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
Cloudflare构建了面向LLM的高性能基础设施
作者:Renato Lo · 2026-05-09 · via InfoQ - 促进软件开发领域知识与创新的传播

Cloudflare 最近发布了全新的基础设施,可以在其全球边缘网络上运行大型的 AI 大语言模型。由于这类模型依赖昂贵的硬件,并且需要处理海量的输入和输出文本数据,Cloudflare 将模型输入处理与输出生成拆分到不同的专用优化系统中,并自研推理引擎实现 GPU 资源的更高效调度。

Cloudflare 团队表示,其中的一个核心优化是把模型推理拆分为两个阶段,由不同服务器分别进行处理,一个阶段负责读取并预处理输入文本,另一阶段专注生成输出内容。Cloudflare 首席产品经理Michelle Chen、高级工程经理Kevin Flansburg和首席系统工程师Vlad Krasnov撰文指出:

我们用来提升性能与资源效率的硬件架构叫做解耦预填充(disaggregated prefill)。LLM 请求处理分为两个阶段,预填充阶段处理输入 Token 并填充 KV 缓存,解码阶段逐一生成输出 Token。预填充通常属于计算密集型负载,而解码则是内存密集型负载。

Cloudflare 还自研了名为Infire的 AI 推理引擎。该引擎在 2025 年 Cloudflare 周年庆活动期间正式发布,它可以跨多 GPU 更高效地运行大语言模型,降低内存占用、缩短模型启动时间,最终实现更低的响应延迟。

像 Kimi K2.5 这类大语言模型体量极其庞大(参数规模超万亿、模型大小约 560GB),必须拆分部署到多块 GPU 上,仅加载模型到内存就至少需要 8 块 H100 显卡,这还未计入推理过程额外占用的内存开销。当谈及 Infire 引擎与硬件优化为何能高效支撑超大规模的模型、并为用户提供更快的响应时,Chen、Flansburg 和 Krasnov 补充说:

在流水线并行方面,Infire 会对流水线所有阶段做合理的负载均衡,避免某一阶段 GPU 空闲等待而其他阶段满载执行的资源饥饿问题。在张量(tensor)并行方面,Infire 以减少 GPU 间通信开销为优化目标,尽可能提升通信效率。对绝大多数模型而言,流水线并行与张量并行结合使用,就能在吞吐量和延迟之间取得最优平衡。

Cloudflare 此前曾发文介绍如何在自己的AI推理平台部署开源模型,率先在 Workers AI 上线了 Moonshot AI 的 Kimi K2.5 模型,并透露团队正在采用多样化的硬件配置,适配各类大模型的最优运行需求。

图片来源:Cloudflare 的博客文章

Cloudflare 表示,团队进一步对 Infire 做了内存优化,缩减内部流程的 GPU 内存开销,如今仅需 2 块 H200 GPU 即可运行 Llama 4 Scout,并且仍留有充足容量支撑上下文 Token,8 块 H100GPU 便可运行 Kimi K2.5,同时预留出足够内存用于 KV 缓存。

Cloudflare 近期还推出了Unweight模型压缩系统,官方称可在无损精度的前提下,将大语言模型权重压缩了 15%–22%,减少推理时 GPU 加载与传输的数据量,让模型运行更快、资源效率更高。

并不是只有 Cloudflare 在关注大模型生产落地方面的基础设施挑战。Cockroach Labs最新“AI基础设施现状”报告指出,随着企业将 AI 系统投入日常业务,大量企业发现现有基础设施无法承载 AI 负载所需的规模与可靠性要求:

传统基础设施围绕间歇性的人机交互而设计,无法承受 AI 这种高压力的负载。想要适配 AI 业务的高并发与不可预测性,企业不能只做性能升级,更需要从系统架构层面进行根本性的重构。

Cloudflare 还分享了他们在提示词缓存(prompt caching)层面的效率优化方案

原文链接:

Cloudflare Builds High-Performance Infrastructure for Running LLMs