惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Y
Y Combinator Blog
IT之家
IT之家
博客园_首页
量子位
博客园 - 三生石上(FineUI控件)
小众软件
小众软件
博客园 - 聂微东
罗磊的独立博客
酷 壳 – CoolShell
酷 壳 – CoolShell
Hugging Face - Blog
Hugging Face - Blog
V
V2EX
爱范儿
爱范儿
大猫的无限游戏
大猫的无限游戏
宝玉的分享
宝玉的分享
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
雷峰网
雷峰网
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Google DeepMind News
Google DeepMind News
Microsoft Azure Blog
Microsoft Azure Blog
有赞技术团队
有赞技术团队
S
SegmentFault 最新的问题
Engineering at Meta
Engineering at Meta
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

博客园 - Joy_CShow

搭建OpenClaw实现钉钉 AI 员工自动化 (二) 搭建OpenClaw实现钉钉 AI 员工自动化 (一) fantasy-talking:实现图片加音频生成对嘴数字人 window中搭建wsl环境 图片对嘴生成视频:HunyuanVideo-Avatar 音频克隆:对话文本到口语对话生成MOSS-TTSD 图片生成对嘴视频FLOAT 开源AI工具-文字生成图片Fooocus 文生图:介绍一个文字生成图片的开源工具 音频克隆阿里版-CosyVoice 文字生成视频开源AI大模型项目 音频克隆-Index-TTS 视频音频对嘴--Wav2Lip 音频克隆-GPT-SoVITS 自己写了一个视频拆分工具 本地搭建一个图片对嘴转视频工具-进阶版 本地搭建一个对嘴AI工具 搭建一个图片变视频的AI(二):开始搭建 搭建一个图片变视频的AI(一):模型介绍
音频克隆-Index-TTS进阶版(ComfyUI_IndexTTS)可以实现多人对话
Joy_CShow · 2025-07-08 · via 博客园 - Joy_CShow

之前介绍过Index-TTS,音频克隆,现在是他的ComfyUI版本,实现了多人对话版本。

单人音频克隆:https://www.cnblogs.com/cj8988/p/18973016

一:参考之前的文档,搭建ComfyUI工具。

https://www.cnblogs.com/cj8988/p/18949573

二:下载源码:

https://github.com/billwuhao/ComfyUI_IndexTTS

解压到文件夹ComfyUI\custom_nodes 中,修改文件夹名字为ComfyUI_IndexTTS

下载模型:如果之前下载过:https://www.cnblogs.com/cj8988/p/18973016  直接复制过来就行。

模型下载(下载最新的1.5):https://huggingface.co/IndexTeam/IndexTTS-1.5/tree/main

下载位置放到(没有文件夹,就新建): \ComfyUI\models\TTS\Index-TTS\

 三:修改一下配置:

修改一些配置文件中的配置:\ComfyUI\custom_nodes\ComfyUI_IndexTTS\checkpoints\config_v1_5.yaml

模型名字修改为什么下载的模型名字。

将文件中的 _v1_5 去掉:

比如:
bpe_v1_5.model  修改为   bpe.model 。
gpt_v1_5.pth 修改为 gpt.pth 。
bigvgan_generator_v1_5.pth  修改为  bigvgan_generator.pth。

四:安装

下载 pynini:   https://github.com/billwuhao/pynini-windows-wheels/releases/tag/v2.1.6.post1

根据你的python版本选择一个选择:

下载完成后,安装:

pip install pynini-2.1.6.post1-cp3xx-cp3xx-win_amd64.whl

pip install importlib_resources

pip install WeTextProcessing>=1.0.4 --no-deps

五:运行:

#在 \ComfyUI\ 文件夹下:

python .\main.py

推拽文件: \ComfyUI\custom_nodes\ComfyUI_IndexTTS\workflow-examples\

推拽多人对话json:S1是第一个音频说的话,S2是第二个人说的话。

当然你可以修改人口文件:indexttsnode.py ,增加更多人对话:S1是第一个音频说的话,S2是第二个人说的话,S3是第三个人说的话。

输出的文件在文件夹:\ComfyUI\output