就在昨天凌晨 2 点 ChatGPT 发布了自己最新的语音模型 GPT-Live 已经很接近和真人对话了,在听你说话的时候也会“嗯嗯”、“啊啊”的回复你说的话,以及也会重复你说的话比如你正在给一个人报手机号码 GPT-LIve 现在会重复小声嘀咕你报的号码,大家肯定也遇到过吧?对方再报一遍一免记错,这点简直太厉害了。
现在科技越来越发达,这些进展带来了更智能、更自然易用的Ai体验。我们相信,随着时间推移,这项研究还将让人们能够用语音完成越来越复杂、持续时间更长、也更具智能体特性的工作。
GPT-Live希望解决的,正是这种"不像真人交流"的问题。
从轮流说话,变成边听边说
GPT-Live采用全双工架构,能够在生成语音回应的同时持续处理用户输入。
这项变化带来的体验更接近日常交流:
用户在ChatGPT回答时插入问题,模型可以及时调整回应。
用户短暂停顿整理思路,模型会更愿意等待。
用户让它先安静听着,它可以保持倾听状态。
模型会用“嗯嗯”明白了"等简短反馈提示自己仍在跟进对话。
面对车辆、环境谈话等背景噪声,模型会更集中地识别用户声音。
传统语音模式需要把一次对话切分成一轮轮独立消息,而GPT-Live会连续判断当前应该说话、倾听、暂停、打断,还是调用工具。对于语言练习、头脑风暴、实时翻译、通勤聊天等场景,这种变化尤其明显。
复杂问题给后台模型,过程不必停下来
GPT-Live的另一项核心升级,是把"自然语音交流"和"深度任务处理"拆分开来。
当用户提出的问题需要网页搜索、复杂推理或多步骤执行时,GPT-Live可以把任务委派给后台模型处理。发布初期,后台能力由GPT-5.5提供支持。
例如,用户正在讨论一个旅行计划,突然询问某地天气、航班安排或相关信息。GPT-Live可以继续和用户交流,同时在后台搜索并整理结果,等信息准备完成后再带回对话。
这种设计让语音交互从"问一个问题、等一个答案”,逐步变成"边聊边推进任务”。
语音加入不同推理强度
新版ChatGPT语音允许用户根据需求选择不同推理级别:
Instant:适合快速回答和日常交流。
Medium:适合需要更多分析的任务。
High:适合更复杂、更需要深入思考的问题。
GPT-Live-1和GPT-Live-1mini在后台使用GPT-5.5Instant;更高推理强度的版本则使用GPT-5.5Thinking。用户在语音中提问时,既可以获得快速反馈,也能在需要时让模型投入更多推理能力。
语音回答开始“能看见”
新版体验不只提供声音,也会针对部分内容展示可视化卡片。
目前,天气、股票、体育等信息可以在语音交谈过程中以视觉形式呈现。用户既能听到结论,也能快速查看关键数据、赛程或预报信息。
ChatGPT语音原有的搜索、记忆、图片上传和文件上传能力也会继续保留。语音正在成为调用多种AI能力的自然入口,而不只是一个朗读界面。
九种声音重新制作
OpenAI为GPT-Live重新制作了ChatGPT中的九种声音,使表达更自然、更具节奏感。
这项调整的重点在于减少机械式播报感。模型可以根据交谈场景表现出更自然的停顿、回应与语速变化,让用户在长时间聊天、听故事或练习语言时获得更连贯的体验。
这项调整其实还是需要再优化的,对于中文还是差很多。
增加面向语音场景的安全保护
语音对话具有实时、沉浸和情绪表达更强的特点,因此GPT-Live也加入了更专门的安全机制。
OpenAI针对自伤、精神病性症状、躁狂、情感依赖、暴力和性内容等风险领域进行了音频原生评测与红队测试。当系统识别到潜在不安全内容时,可以引导模型给出更安全的回答、展示额外提示或资源,并在风险较高时结束语音对话。
针对青少年用户,家长可以通过家长控制选择是否开放ChatGPT语音功能。在识别到潜在自伤或自条意图的高风险情形时,关联的家长可能收到通知。
此外,GPT-Live使用ChatGPT内置的预设声音,并加入措施防止模仿真实人物声音,降低语音冒充风险。
免费和付费用户使用不同版本
GPT-Live正面向全球ChatGPT用户逐步推出,覆盖iOS、Android和ChatGPT.com。
具体安排如下:
Go、Plus和Pro用户:默认使用GPT-Live-1。
Free用户:默认使用GPT-Live-1mini。
API:OpenAI计划后续开放,开发者和企业目前可登记接收通知。
OpenAI表示,每周已有超过1.5亿人通过语音、听写等功能与ChatGPT交流。GPT-Live的推出,意味着语音功能将从日常问答、陪聊和语言练习,进一步走向搜索、推理和智能体式任务协作。























