惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

GbyAI
GbyAI
Martin Fowler
Martin Fowler
I
InfoQ
腾讯CDC
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
爱范儿
爱范儿
Microsoft Security Blog
Microsoft Security Blog
Google DeepMind News
Google DeepMind News
D
DataBreaches.Net
云风的 BLOG
云风的 BLOG
F
Fortinet All Blogs
N
Netflix TechBlog - Medium
博客园 - 聂微东
Microsoft Azure Blog
Microsoft Azure Blog
D
Docker
博客园 - 三生石上(FineUI控件)
Y
Y Combinator Blog
博客园 - Franky
Engineering at Meta
Engineering at Meta
B
Blog
罗磊的独立博客
Apple Machine Learning Research
Apple Machine Learning Research
Jina AI
Jina AI
V
Visual Studio Blog

量子位

AI自主监测宠物健康,陪狗都不用自己来了!涂鸦Hey Tuya打造全屋智能“超级入口” 燃油SUV车主熬出头了!华为乾崑智驾加持,全新奥迪Q5L率先实现智能化 华人再破硅谷天花板!AI黑马新任CTO,中科大80后 0博士组合拿下ICLR时间检验奖!两个GPT天才本科生+二本逆袭LeCun弟子,十年论文终封神 DeepSeek V4报告太详尽了!484天换代之路全公开 优必选发布Thinker cosmos:加码开发者生态,推动人形机器人走向规模化 DeepSeek-V4发布,华为云首发适配 Mobileye 2026财年一季度营收增长27%,自动驾驶商业化进程持续推进 100%主流车企的共同选择:一个AI“通用底座”正在汽车行业成型 真有人做AI小猫啊?!生产力和情绪价值都拉满了 Coordination Engineering关键一环,JiuwenClaw再发布Team Skills技能新范式 DeepSeek V4终于发布!打破最强闭源垄断,明确携手华为芯片 荣耀WIN游戏本等多款新品正式发布,荣耀PC家族全面爆发 刚刚,GPT-5.5发布!内测英伟达工程师:失去它像被截肢 河南师傅,左手扳手,右手飞书,竟然能搞数据分析! 国内首家百亿估值纯推理GPU独角兽诞生!专访曦望联席CEO王湛:谁的推理成本更低谁就是赢家 印奇站上AI+车浪潮之巅:7个月,千里科技和华为「五五开」 飞书项目开放平台焕新升级,全面迈向“AI Friendly” 半壁华人!GPT Image 2团队曝光:无锡才俊带队,13人4个月封神 Nature封面:机器人乒乓球干翻人类职业选手 特斯拉开源硬件,中国公司回应来了:直接把机器人大脑开源了 挖漏洞何必Mythos,国产智能体早跑通了 “不造车的特斯拉”亮出“舱驾一体”全家桶,汽车长出“主动理解力”,奇瑞比亚迪等10+巨头力挺 科大讯飞发布燎原N30m笔记本,重塑全栈国产AIPC新标杆 神秘模型「大象」:仅100B拿下SOTA,Token效率超高! 香港科创标杆奖项!商汤首席科学家林达华荣获中银香港科创奖 国产多模态Agent拿下医学分割SOTA!不用改模型、不加token 这些人读个博一年能挣几十万?2026苹果学者名单公布了 大厂AI抢人大战,从实习生开始 全球首个世界统一模型发布,机器人家庭成员来了!
阶跃最新语音模型位列 Artificial Analysis 评测榜中国第一
量子位的朋友们 · 2026-05-09 · via 量子位

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

2026-05-09 18:29:31 来源:量子位

5 月 9 日,全球权威 TTS 评测榜单 Artificial Analysis Speech Arena Leaderboard 更新,阶跃语音生成模型 StepAudio 2.5 TTS 跻身全球前三,成为当前榜单排名最高的中国大模型。

不同于传统实验室指标,该榜单采用盲测 Elo 评分机制,由用户在不知道模型身份的情况下,直接对同一文本生成的两段语音进行听感判断,测试覆盖客户服务、知识分享、数字助手、娱乐等真实应用场景。这意味着,StepAudio 2.5 TTS 的领先并不只是参数或指标上的提升,而是在真实用户听感中展现出更自然、更接近真人表达的能力,在实际落地中具备更强竞争力。

据了解,阶跃近期集中发布 StepAudio 2.5 系列模型,包括 TTS、ASR 和 Realtime 三款模型,覆盖语音生成、语音识别与实时语音交互全链路。其中,StepAudio 2.5 TTS 面向高自然度语音生成,StepAudio 2.5 ASR 主打高速高精度识别,就在昨日 StepAudio 2.5 Realtime 也火速上线,聚焦打造更有“活人感”的 AI 聊天搭子,具备顶级副语言能力、千万人设自定义、领先智商情商等特点,强调带来“有温度、有灵魂、有态度”的实时语音交互体验。

AI 语音模型一直被行业视为实现人机交互的核心入口,包括 OpenAI、Google 等全球顶尖科技公司均在长期且高强度投入。记者观察到,阶跃在 AI 语音领域已进行长期深度布局:开源原生推理语音模型 Step Audio R1.1 已连续 4 个月霸榜 Artificial Analysis Speech Reasoning,目前仍位于全球第一;开源全球首个迭代式情绪风格语音编辑模型 Step Audio EditX,该模型为 zero-shot TTS,仅用 3s 复刻的音色效果可打败许多闭源 TTS 模型主音色;目前位列 Artificial Analysis Speech Arena Leaderboard 开源榜全球第二。

在商业化方面,阶跃语音模型已在多个核心终端场景实现规模化商业落地。比如搭载吉利银河 M9,阶跃率先实现端到端语音大模型量产上车;为整车智能体超级 Eva 提供语音交互能力,首发搭载极氪 8X 也已实现量产上市。

-本文系量子位授权转载-

版权所有,未经授权不得以任何形式转载及使用,违者必究。