惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

J
Java Code Geeks
月光博客
月光博客
aimingoo的专栏
aimingoo的专栏
Google DeepMind News
Google DeepMind News
Recent Announcements
Recent Announcements
MyScale Blog
MyScale Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
S
SegmentFault 最新的问题
Hugging Face - Blog
Hugging Face - Blog
Martin Fowler
Martin Fowler
WordPress大学
WordPress大学
F
Fortinet All Blogs
小众软件
小众软件
D
Docker
U
Unit 42
博客园 - 聂微东
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
爱范儿
爱范儿
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
IT之家
IT之家
云风的 BLOG
云风的 BLOG
博客园 - 司徒正美
有赞技术团队
有赞技术团队
腾讯CDC

InfoQ - 促进软件开发领域知识与创新的传播

Meta 收购 Manus 这事儿泡汤了 5.5万 Star 开源项目 Ghostty 被迫出走,GitHub 正在终结一代技术人的乌托邦 Slack 长时运行多智能体系统的上下文管理方案 从 T+1 到分钟级:金城银行基于 Apache Doris 构建高可靠、强一致的实时数据平台 谷歌云推出 Agents CLI,简化 AI 智能体开发全流程 Claude官方击穿高薪、高学历的安全防线!Anthropic点名10大高危职业,但有群人暂时稳了 亚马逊云科技终止 WorkMail 服务,并将 App Runner 转入维护模式 OPPO小布记忆:全模态碎片化内容的理解与智能整理实践|AICon上海 模力工场038周AI应用周榜:工具在消失,工作流在出现 Akamai CEO Tom Leighton:Agent 时代来临,云基础设施正从“中心化”转向“分布式边缘” 日均数百亿入库背后:从“人肉调度”到K8s弹性架构,度小满金融基于OceanBase重构入库架构实践 百度文库网盘发布GenFlow 4.0:月活用户超1亿,要把网盘变成全端AI工作台 Altman 投的 Agent 终端 Warp 开源了!斩获3.5万star 哪些客户需要拒, 敢让龙虾决定吗?_AI&大模型_InfoQ 中文站_InfoQ精选视频 从开发到生产:为什么越来越多的机器学习团队纷纷迁移到 Snowflake | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 探索多智能体工作流:LangGraph Snowflake Cortex AI | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 腾讯云分布式缓存数据库:AI Agent - 从提示词工程到 Harness 工程 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 基于 Streamlit 为 CSV 数据构建分析智能体 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 AI 智能体:告别文档缺漏 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 构建 AI 驱动的数据管道:深度探讨 Snowflake Openflow 与非结构化数据 | BUILD 2025_AI&大模型_王玮_InfoQ精选视频 云端太贵、本地不够聪明,英特尔押注“端云混合AI”:智能体PC会替人完成工作 不到10%的存储投入,可能拖垮90%的GPU投资!IBM把AI Agent塞进存储系统,算清企业最容易忽略的一笔账 Snowpark 上手实战 | BUILD 2025_大数据_王玮_InfoQ精选视频 ClickHouse + Langfuse,构建 Agent 可观测基石 腾讯云分布式缓存数据库:Cluster Proxy 共享连接架构深度解析 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 AI 写代码太烧钱了:Copilot、Claude 一起涨价,不如把程序员请回来? 英特尔发布至强600系列工作站处理器与锐炫Pro B70 GPU,全新AI工作站来了 腾讯云分布式缓存数据库:从 Redis 到 Valkey - 开源社区如何快速创新 | 腾讯云数据库 DBTalk_腾讯_凌敏_InfoQ精选视频 印奇这次要“从0重做”智驾模型!首谈阶跃和千里双公司布局:中国AI商业闭环要靠车跑出来 从Cursor返聘归来,90后华裔女高管带Claude开启日更模式:token成本比工程师工资低多了!
OpenAI 详解规模化低延迟语音 AI 的 WebRTC 架构
作者:Eran Stiller明知山 · 2026-05-23 · via InfoQ - 促进软件开发领域知识与创新的传播

OpenAI 近期介绍了如何为全球规模的低延迟语音 AI 调整 WebRTC。新的架构将传统的媒体终结模型替换为更适合 Kubernetes 和云负载均衡器的中继收发器架构。它将 WebRTC 会话状态保留在专用的收发器层,同时利用轻量级中继来减少公共 UDP 暴露,并让媒体路由更贴近用户。

在这篇文章中,OpenAI 的技术人员 Zhang Yi 和 William McDonald 解释说,实现全球覆盖、快速建立连接以及保障媒体往返时延偏低且稳定是此次架构调整背后的主要制约因素。团队评估了多种媒体会话对外暴露的方案,各类方案在实际运行中各有利弊。

第一种方案是直接对外暴露 UDP 端口,沿用传统 WebRTC 架构模式。但该方案会把运维压力转嫁至基础设施层面,尤其是在 Kubernetes 环境中,大规模的公网端口难以安全管控。为每台服务器单独分配专属端口虽能简化部分路由决策,却依旧会让运维人员面临端口规划困难、端口使用率失衡以及部署发布稳定性差等问题。

选项 1:SFU 方案——将 AI 作为 WebRTC 参与者(来源

TURN 风格的中继也是一个可行的选项,但它们会在媒体路径中引入更重量级的中间层,所能解决的问题超出了 OpenAI 以一对一为主的模型与用户会话的需求。OpenAI 选择在两层之间划分职责,轻量级中继负责接收传入的数据包并转发,收发器则承载所有有状态的 WebRTC 机制,包括 ICE 协商、DTLS 握手、SRTP 加密以及整体会话生命周期。

选项 2:收发器方案——在边缘终结 WebRTC 并转换为后端协议(来源

这种职责分离让中继能够保持简单、快速且基本无状态,收发器成为唯一需要理解完整协议的组件。这既避免了后端服务之间重复堆砌复杂逻辑,也不会将复杂逻辑转嫁到客户端层面。作者表示:“新增复杂逻辑最合理的位置是精简的路由层,而非各个后端服务,也不是客户端。”

中继将数据包无状态地转发给收发器(来源

WebRTC 是实时 AI 业务场景中常用的技术方案。除了低延迟媒体传输外,它还提供 NAT 穿透、加密传输、编解码器协商、抖动缓冲以及回声消除等跨浏览器和移动平台的音频功能。STUN 是这个技术体系的基础组成部分,能够协助终端设备确认自身在网络中的对外地址,并在连通性检测阶段为 ICE 流程提供支撑。

许多团队都会默认使用选择性转发单元(SFU),用来为多方系统集中管理媒体路由和传输策略。但 OpenAI 的工作负载主要是用户与模型之间的一对一会话,相比把模型当作会议架构里的普通参与端,采用收发器设计会更为合适。

这篇文章补充了 OpenAI 在实时语音技术布局中更多基础设施层面的细节,相关功能已在其产品中提供,例如 ChatGPT 语音和 Realtime API。对于搭建交互式媒体系统的架构师而言,这套架构拆分思路更具参考价值:在边缘保留协议行为,将硬会话状态集中在一处,并将复杂性移入薄路由层,而不是将其分散到后端服务中。

查看英文原文https://www.infoq.com/news/2026/05/openai-voice-ai-scale/