惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
DataBreaches.Net
IT之家
IT之家
The Cloudflare Blog
Apple Machine Learning Research
Apple Machine Learning Research
WordPress大学
WordPress大学
N
Netflix TechBlog - Medium
阮一峰的网络日志
阮一峰的网络日志
P
Proofpoint News Feed
L
LangChain Blog
博客园 - Franky
美团技术团队
J
Java Code Geeks
Microsoft Security Blog
Microsoft Security Blog
博客园 - 叶小钗
小众软件
小众软件
Y
Y Combinator Blog
B
Blog RSS Feed
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
D
Docker
Hugging Face - Blog
Hugging Face - Blog
Jina AI
Jina AI
罗磊的独立博客
大猫的无限游戏
大猫的无限游戏
Vercel News
Vercel News

博客园 - Joy_CShow

搭建OpenClaw实现钉钉 AI 员工自动化 (二) 搭建OpenClaw实现钉钉 AI 员工自动化 (一) fantasy-talking:实现图片加音频生成对嘴数字人 window中搭建wsl环境 图片对嘴生成视频:HunyuanVideo-Avatar 音频克隆:对话文本到口语对话生成MOSS-TTSD 图片生成对嘴视频FLOAT 开源AI工具-文字生成图片Fooocus 文生图:介绍一个文字生成图片的开源工具 音频克隆-Index-TTS进阶版(ComfyUI_IndexTTS)可以实现多人对话 文字生成视频开源AI大模型项目 音频克隆-Index-TTS 视频音频对嘴--Wav2Lip 音频克隆-GPT-SoVITS 自己写了一个视频拆分工具 本地搭建一个图片对嘴转视频工具-进阶版 本地搭建一个对嘴AI工具 搭建一个图片变视频的AI(二):开始搭建 搭建一个图片变视频的AI(一):模型介绍
音频克隆阿里版-CosyVoice
Joy_CShow · 2025-07-09 · via 博客园 - Joy_CShow

前面介绍过了音频克隆

IndexTTS: https://www.cnblogs.com/cj8988/p/18973016

ComfyUI_IndexTTS: https://www.cnblogs.com/cj8988/p/18973609

GPT-SoVITS:https://www.cnblogs.com/cj8988/p/18962212

今天再介绍要给音频克隆的开源工具:https://github.com/FunAudioLLM/CosyVoice

CosyVoice 是阿里云通义语音实验室研发的新一代生成式语音大模型,旨在提供高度拟人化、自然流畅的语音合成体验。

它将文本理解和语音生成技术深度融合,能够精准解析并诠释各种文本内容,将其转化为如同真人发声般的自然语音。

多样化的推理模式:

  • 预训练音色: 提供多种预设的音色供用户选择,满足不同场景下的个性化需求(例如新闻播报、故事讲述等)。

  • 3s 极速复刻 (Zero-shot Voice Cloning): 仅需 3 秒的参考音频,就能快速克隆出特定说话人的音色,并用这个音色合成任意文本。这极大地降低了音色定制的门槛。

  • 跨语种复刻 (Cross-lingual Voice Cloning): 能够使用一种语言的语音样本来合成另一种语言的文本,同时保留原始说话人的音色和部分韵律特征。这是一个非常强大的功能,尤其适用于多语言内容创作。

  • 自然语言控制 (Instructed Voice Generation): 允许用户通过自然语言描述(如“用高兴的语气说”、“语速快一点”)来控制语音的风格、情感、语速、音调等,提供了更直观和灵活的控制方式。

  • 多语言和混合语言支持: 除了中文外,还支持英文、日文、韩文以及多种中文方言(粤语、四川话、上海话、天津话、武汉话等),并支持跨语种和混合语言场景下的零样本语音克隆

安装:

代码下载:https://github.com/FunAudioLLM/CosyVoice

#虚拟环境搭建
conda create -n cosyvoice -y python=3.10

conda activate cosyvoice

pip install -r requirements.txt -i https://mirrors.aliyun.com/pypi/simple/ --trusted-host=mirrors.aliyun.com
#模型下载,这里下载最新的2.0模型

mkdir -p pretrained_models

#也可手动下载,然后放入相应位置就行 pretrained_models/CosyVoice2-0.5B
git clone https://www.modelscope.cn/iic/CosyVoice2-0.5B.git pretrained_models/CosyVoice2-0.5B

可能出现的问题:没有找到cosyvoice.yaml。

修改一下:cosyvoice.py  中 __init__()  大约34行:添加一个

if not os.path.exists(model_dir):
  model_dir = snapshot_download(model_dir)


hyper_yaml_path = '{}/cosyvoice.yaml'.format(model_dir)


if not os.path.exists(hyper_yaml_path):
  hyper_yaml_path = '{}/cosyvoice2.yaml'.format(model_dir)

如果有报ffmpeg错误的话,需要下载ffmpeg.exe和ffprobe.exe,放入根目录就行。

下载地址:https://ffmpeg.org/download.html