惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

量子位
雷峰网
雷峰网
博客园 - 三生石上(FineUI控件)
月光博客
月光博客
有赞技术团队
有赞技术团队
阮一峰的网络日志
阮一峰的网络日志
Last Week in AI
Last Week in AI
G
Google Developers Blog
腾讯CDC
B
Blog
Microsoft Azure Blog
Microsoft Azure Blog
酷 壳 – CoolShell
酷 壳 – CoolShell
Microsoft Security Blog
Microsoft Security Blog
人人都是产品经理
人人都是产品经理
博客园_首页
T
Tailwind CSS Blog
C
Check Point Blog
博客园 - 【当耐特】
MongoDB | Blog
MongoDB | Blog
A
About on SuperTechFans
Y
Y Combinator Blog
L
LangChain Blog
Engineering at Meta
Engineering at Meta
GbyAI
GbyAI

秋码分享

我是如何解决将 c++ 编译成可以在 node.js 中使用的 *.node,中间出现的一大堆问题的(指纹浏览器基石篇) eSIM Plus 爱沙尼亚手机号彻底翻车?“永久有效”悄然变成了一年! 接码平台 SMS-Activate 余额可以转移到新平台使用,截止日期:2026年1月29日 是时候将 hugo-theme-kiwi 主题提交到 themes.gohugo.io 站点上了 Flux2 刚开源就凉了?Z-Image 本地部署狠狠打了个样 还以为那只是换个背景?Qwen-Image-Edit 在 ComfyUI 中能做到更离谱的事 Windows 结合最新版 ComfyUI 部署阿里最新开源的 Qwen-Image 图像大模型 从零样本到跨场景:Seed-VC语音转换技术的革命性突破 大语音模型轻量化革命:MegaTTS3 如何重新定义文本生成语音的技术边界(windows篇) 竞赛级编程大模型OlympicCoder-7B之本地部署(Windows篇) 阿里开源了端到端全模态大模型Qwen-2.5-Omini-7B之本地部署(windows篇) 语音识别之whisper本地部署(实时语音之开篇) 甭管是个人还是企业都能部署的Mistral-Small3.1,远超同级别的模型 文生音乐开源项目DiffRhythm,8G显存本地部署之Windows篇 阿里QwQ-32B本地部署指南:用Ollama轻松运行320亿参数大模型 基于Qwen2.5大模型的Spark-TTS,零样本语音克隆,CPU可运行之本地部署(Windows篇) 智谱开源了文生图CogView4-6B模型,支持中文提示词之本地部署(Windows篇) 基于歌词生成整首歌的开源AI音乐模型,支持中、英、日、韩等多种语言,本地化部署YuE(windows篇) 阿里云开源的文生视频万相 Wan2.1之本地部署Wan2.1-T2V-1.3B模型 互动式开源AI图像编辑神器,Windows11本地部署 MagicQuill 本地部署Qwen2.5-VL-7B-Instruct多模态视觉大模型(Windows篇) 保持角色一致性的绘本生成AI开源项目之Story-Adapter本地部署Windows篇 本地部署 Stable Diffusion 3.5(最新 ComfyUI记录篇) 谁说Win7安装不了Node.js最新版的呢?都2025年,还不更新系统到Win11 vs code远程调试Linux服务器上的php代码 浏览器定制 | Windows11 编译 Chromium 133.0.6885.0(截稿前Chromium最新版之编译篇[一]) 不说是彻底搞懂,至少让你不再惧怕c/c++指针,以及各种奇葩指针变种 解决windows下php8.x及以上版本,在Apache2.4中无法加载CURL扩展的问题 在 Windows8.1 下编译 Chromium (103.0.5060.68 之三) 安装 depot_tools 和 Windows 10 SDK 为在Windows下构建基于 chromium 的浏览器(103.0.5060.68 之二)
声音的未来:Chatterbox —— 用「夸张度旋钮」提升表现力的开...
一个游离于山间之上的江湖漫行者。A jungle wanderer who wanders above the mountain · 2025-09-04 · via 秋码分享

在开源 TTS(文本转语音)界,情感控制一直是科研与实际应用追求的目标。然而,当 Resemble AI 提出的 Chatterbox 宣称自己是「第一个支持情感夸张控制的开源 TTS 模型」时,我们该如何审视这项说法的准确性,又该如何展现它真正的创新所在?

一、情感控制:开源 TTS 项目的竞争图谱

实际上,在 Chatterbox 之前,已有多个开源项目在“情感控制”层面做出了重要探索:

EmoSphere-TTS(INTERSPEECH 2024 官方实现)

  • 通过在三维情感空间(arousal, valence, dominance)基础上引入“球面情感向量”,支持连续的 情绪风格 + 强度控制,精细度和自然表现力都值得称道。GitHubarXiv

EmotiVoice(网易有道,2024)

  • 提供离线开源引擎,支持中文和英文,可使用情绪标签(如“开心”“激动”“悲伤”“愤怒”)控制语调与情绪表达。GitHub

其他探索类工具和基础组件

  • 包含 Coqui TTS、ESPnet TTS、Mozilla TTS 等框架,它们支持通过调节音高、音量、速度等参数来生成情绪化语音。Reddit

最新研究成果

  • 包括 EmoVoice(LLM + 自然语言情绪提示控制)、EmoSteer-TTS(训练自由的激活引导方式)、EmoMix(情绪混合与强度调控)、EmoKnob(克隆 + 情绪细致调控)等研究,为开源情感 TTS 系带来更多可能。arXiv+3arXiv+3arXiv+3

结论:Chatterbox 并非历史上第一个拥有情感控制能力的开源 TTS。但它的情绪“夸张度”滑块是一种独特且易用的控制方式。

二、Chatterbox 的真正卖点:更直观、更生产力

1. 「情感夸张度(emotion exaggeration)旋钮」

  • Chatterbox 将复杂的情绪表现提取为一个用户可调节的单参数滑块,从「冷静」到「夸张」,让用户更容易定制。(官网与 README 均强调该功能)GitHubchatterbox.run

2. 面向生产的用户体验

  • 安装简便:支持 pip,一行代码启动。
  • 实时化:延迟低于 200ms,适合在线服务、互动式应用。Resemble AIchatterbox.run

3. 零样本语音克隆 + 多语言支持

  • 支持仅用少量参考音进行克隆,无需训练即可生成个性化声音。
  • 官方页面提及支持“23+”语言,让它更适配全球多语内容生成。Resemble AI

4. 水印保障:PerTh 隐形音频水印

  • 嵌入人耳不易察觉但可精确检测的水印,支持追责与内容溯源,即使经过压缩剪辑也能识别。chatterbox.run

5. 质量方面

  • 宣称优于 ElevenLabs,在盲测中获得更高偏好率(约 63.75% 的听众更喜欢 Chatterbox 输出)。chatterbox.run

三、本地部署(基于 windows 系统下)

虽然官方是在 Debain 11系统下进行测试,但 windows系统下也是可以把玩的,唯一不足的便是,目前 chatterbox 只支持 英语。

按官方的要求,python 版本得在 3.11 及以上,然而我的电脑已经装有 python3.10.9 了,故而,索性就选用它了。

我使用的是 python 3自带的虚拟模块,来搭建 python 的虚拟环境。

image-20250904191040239

随后,将 chatterbox 推理代码 clone 下来。

git clone https://github.com/resemble-ai/chatterbox.git

image-20250904191253679

之后,使用以下命令安装项目的所需依赖。

image-20250904191512573

当依赖安装完成后,运行项目根路径下的 example_tts.py 文件。

image-20250904192910933

首次,会先下载模型。(会从 hugging face 网站上下载,所以得确保网络)

前面安装的依赖环境是 cpu,也就是说 chatterbox可以在 CPU环境下运行。

image-20250904193446117

image-20250904195022786