惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

有赞技术团队
有赞技术团队
Martin Fowler
Martin Fowler
N
Netflix TechBlog - Medium
WordPress大学
WordPress大学
罗磊的独立博客
H
Help Net Security
MongoDB | Blog
MongoDB | Blog
A
About on SuperTechFans
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
D
Docker
云风的 BLOG
云风的 BLOG
Microsoft Security Blog
Microsoft Security Blog
Blog — PlanetScale
Blog — PlanetScale
P
Proofpoint News Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
I
InfoQ
J
Java Code Geeks
博客园 - 聂微东
大猫的无限游戏
大猫的无限游戏
Engineering at Meta
Engineering at Meta
美团技术团队
小众软件
小众软件
Stack Overflow Blog
Stack Overflow Blog
C
Check Point Blog

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
OpenAI 推出基于 WebSocket 的执行模式,减少代理工作流延迟
作者:Leela Kum · 2026-05-13 · via InfoQ - 促进软件开发领域知识与创新的传播

OpenAI 针对其响应 API 引入了基于 WebSocket 的执行模式,旨在提升编码代理和实时 AI 系统中使用的代理工作流的性能。这一变更将传统的 HTTP 请求-响应模式替换为客户端与服务器之间的持久化双向连接,可以解决多步骤推理工作流中的延迟和协调开销问题。据 OpenAI 称,早期生产环境的使用数据显示,在高并发场景下,延迟降低了多达 40%,吞吐量也得到了提升。

本次更新解决了代理系统中日益突出的瓶颈问题。此前,工作流中的每个步骤(例如工具调用、中间推理和后续查询)都需要单独的 HTTP 请求。随着推理速度的提升,这些多次反复的网络往返时间逐渐成为延迟和运维复杂性的主要来源。

传统 HTTP 流程(图片来源:OpenAI 博客

基于 WebSocket 的执行模式利用了长期存在的双向连接,不用重复握手就可以进行持续的数据交换。这可以支持流式响应、更快的工具执行以及多步骤工作流的高效协调。这种设计符合分布式系统中的事件驱动设计模式,通过跨交互维护状态来提升响应速度和吞吐量。这一变更体现了对代理系统传输层的更广泛关注——正如“AI 代理传输层”一文中所讨论的,通信模式和连接管理会影响整体性能。

Vibe Coder Ofek Shaked 将这一变更描述为:

将 WebSockets 用于代理状态管理,是一个显而易见的重大优势。从此,冷启动再也不会让你的多工具链瘫痪了。

OpenAI 报告称,在早期生产环境应用中,延迟降低了多达 40%,同时保持了约 1000 次/秒的持续吞吐量,峰值吞吐量可达 4000 次/秒。这些结果表明,除了模型层面的改进外,传输层面的优化也显著影响了端到端 AI 系统的性能。

OpenAI DX 工程师 Gabriel Chua 表示

你可以先发送系统提示和工具定义来预热连接。该功能兼容零数据保留(ZDR)标准。

开发工具和编码代理平台迅速采纳了这一技术。Vercel 将其 WebSocket 模式集成到了 AI SDK 中,并报告称延迟降低了多达 40%。Cline 发现,多文件工作流的性能提升了 39%,而 Cursor 则报告称性能提升高达 30%。从这些结果可以明显看出,模型本身之外的系统级优化正日益影响着现实世界中 AI 的性能表现。

基于持久会话的代理工作流演进(图片来源: OpenAI 博客

从实现角度来看,开发人员通过用单个持久会话取代多个 HTTP 调用来集成 WebSocket 模式。这减少了重复建立连接的过程,并简化了多步骤工作流中的协调逻辑,此外还增强了对流式处理用例的支持,例如增量代码生成和交互式推理。在这些场景中,部分输出可以在生成后立即被使用。

微软工程师 Kevin Cho 指出,这种方法反映出:

回归到原始软件栈的问题。WebSockets 和有状态连接。

这次转变引入了新的系统设计考量,包括连接生命周期管理、高并发下的背压以及分布式系统的可靠性,这些设计均与成熟的有状态系统模式相契合。

经过为期两个月的测试,OpenAI 已经向包括 Codex 在内的部分合作伙伴发布了该功能的 Alpha 版本。此后,Codex 已经将大部分 Responses API 流量迁移至 WebSocket 模式,这表明该功能已经具备投入生产环境的条件。

原文链接:https://www.infoq.com/news/2026/05/openai-websocket-responses-api/