惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

WordPress大学
WordPress大学
博客园 - 司徒正美
小众软件
小众软件
H
Help Net Security
博客园 - 聂微东
宝玉的分享
宝玉的分享
Jina AI
Jina AI
酷 壳 – CoolShell
酷 壳 – CoolShell
阮一峰的网络日志
阮一峰的网络日志
M
MIT News - Artificial intelligence
博客园 - 【当耐特】
U
Unit 42
大猫的无限游戏
大猫的无限游戏
Apple Machine Learning Research
Apple Machine Learning Research
S
SegmentFault 最新的问题
腾讯CDC
MongoDB | Blog
MongoDB | Blog
云风的 BLOG
云风的 BLOG
J
Java Code Geeks
I
InfoQ
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
Martin Fowler
Martin Fowler
博客园 - 三生石上(FineUI控件)
Vercel News
Vercel News

少数派

派早报:Google 发布 Fitbit Air 等 - 少数派 「新人报到」確認需求,再開始 - 少数派 从 SOLO 独立开发者社区,我看到了越来越多开发者开始做自己的产品 - 少数派 我怎么管理那些"不常做,但总会忘"的生活事项 - 少数派 人形机器人量产元年,数据才是具身智能的“生死线” - 少数派 BuhoLaunchpad 高度还原 Mac 启动台:开发历程与思考 - 少数派 五年陪伴依然不舍,DIY 换壳后让罗技 MX Master 3 继续服役 - 少数派 新玩意 240|少数派的编辑们最近买了啥? - 少数派 一日一技|为什么你应该关闭 iOS 的键盘声音 - 少数派 我做了个插件和 Skills,一键提取任何网站的设计规范 Design.md - 少数派 住在三四线城市的你,该开始录播客了 - 少数派 甘南秘境,大白高国 - 少数派 AI的审美:谁让把我变成川内倫子 - 少数派 返工怎能不烦恼,打工人片单总有一部是你的「嘴替」 - 少数派 为了让「上厕所」更健康,我做了一个小工具 - 少数派 AI + Skill,能够让生成的文章去除 AI 味吗? - 少数派 新玩意|韶音OpenDots ONE 耳夹式耳机 - 少数派 《美满》| 在每一个春天的晚上相爱(362) - 少数派 新玩意|优篮子 PS01 MagSnap 磁吸支架 - 少数派 自我整合手记 | 我开始早睡了:用稳定规则,为自由托底 - 少数派 用龙虾(OpenClaw)两个多月,我最深的12个体会 - 少数派 听歌时间到,12 张你可能错过的 2025 华语乐坛好专辑 - 少数派 承诺能追吗 - 少数派 macOS 26启动台没了? 我做了个不一样的App启动器 - Keboard - 少数派 《四海为家的人》| INTJ对话INTJ(361) - 少数派 你发过的那些黑历史,是时候一次清干净了 - 少数派 新玩意:安安静静玩,越玩越专注:计客密码机 - 少数派 iPad 用户首次体验 Android 平板:vivo Pad6 Pro - 少数派 数据逻辑强 - 少数派 极北行+ | 一路向北,探访日本至北之地 | 001 - 少数派
管家级教程:在 Windows 上配置 WSL2、CUDA 及 VLLM,开源音频...
2025-08-06 · via 少数派

ok,那么今天给大家分享一下之前看到过的一个 音频克隆项目

使用体验音色效果没有那么高的效果,不过开源嘛,搞来玩一玩试看看。

源地址: https://github.com/index-tts/index-tts

关于IndexTTS

IndexTTS是一个基于 GPT 风格的文本转语音 (TTS) 模型,主要基于 XTTS 和 Tortoise 算法。

它能够通过拼音纠正汉字发音,并通过标点符号控制任意位置的停顿。

我们增强了系统的多个模块,包括改进说话人条件特征表示,并集成 BigVGAN2 以优化音频质量。我们的系统基于数万小时的数据进行训练,达到了最佳性能,超越了目前流行的 TTS 系统,例如 XTTS、CosyVoice2、Fish-Speech 和 F5-TTS。

源项目基于torch ,

本文实践项目是改用VLLM进行的项目https://github.com/Ksuriuri/index-tts-vllm

vllm暂不支持windows运行,所以需要通过wsl 虚拟机虚拟linux系统

目前wsl主力版本为wsl2所以我们采用wsl2

需要的设备与流程:

足够的存储空间

显卡支持CUDA,同样意味着显存也要够大

安装WLS2,安装配置pip

安装uv,g++,cuda-tookit配置工具

配置虚拟环境,安装requirements

下载模型文件,转义模型文件

运行webui.py

确认开启hyper-v

管理员身份下运行

自行开启魔法,以防被443拒绝

wsl --install

手动安装 指定版本 也可以选择其他

wsl --install Ubuntu-22.04

安装完往后可以在开始菜单找到并且固定

也可以通过命令行启动

安装和配置pip

在刚安装好的虚拟机里面进行安装

修改为国内镜像

# 默认注释了源码镜像以提高 apt update 速度,如有需要可自行取消注释
deb https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy main restricted universe multiverse
# deb-src https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy main restricted universe multiverse
deb https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-updates main restricted universe multiverse
# deb-src https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-updates main restricted universe multiverse
deb https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-backports main restricted universe multiverse
# deb-src https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-backports main restricted universe multiverse
 
# 以下安全更新软件源包含了官方源与镜像站配置,如有需要可自行修改注释切换
deb http://security.ubuntu.com/ubuntu/ jammy-security main restricted universe multiverse
# deb-src http://security.ubuntu.com/ubuntu/ jammy-security main restricted universe multiverse
 
# 预发布软件源,不建议启用
# deb https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-proposed main restricted universe multiverse
# # deb-src https://mirrors.tuna.tsinghua.edu.cn/ubuntu/ jammy-proposed main restricted universe multiverse

编辑文件 vi/etc/apt/sources.list文件

sudo vi /etc/apt/sources.list

按dd清除每一行,按i進入insert,按右鍵黏貼,按esc退出insert,:wq保存後離開。 (WSL2安装Debian(Ubuntu)并配置国内apt源 - 知乎

执行更新

sudo apt update

安装pip

sudo apt install pip

安装必要工具

安装uv, 安装gcc和g++

pip install uv
pip install gcc
pip install g++

安装和配置cuda

windows需要安装cuda driver

wls2需要安装不包含driver的cuda tookit

参考 NVIDA CUDA 文档

windows安装cuda

NVIDA CUDA 12.9 toolkit

Wsl 安装cuda-toolkit

wget https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/cuda-keyring_1.1-1_all.deb
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt-get update
sudo apt-get -y install cuda-toolkit-12-9

Nvidia参考文档

wsl配置环境变量

export CUDA_HOME="/usr/local/cuda-12.9"
export PATH="/usr/local/cuda-12.9/bin:$PATH"

输入一下命令确保ok

nvidia-smi

配置克隆项目

git clone https://github.com/Ksuriuri/index-tts-vllm.git

进入工作目录

cd index-tts-vllm

创建uv虚拟环境

un .venv

设置python版本

uv python install 3.10

安装依赖包

uv pip install -r requirements.txt

下载模型权重

地址

模型权重转换

需要转换为transformers库兼容的版本,

bash convert_hf_format.sh /path/to/your/model_dir

/path/to/your/model_dir 需要修改成你需要保存的位置

这个是我的
bash convert_hf_format.sh /home/leia/IndexTTS-1.5/

将项目中的webui.py的model_dir修改为模型权重下载路径

运行下命令启动程序

VLLM_USE_V1=0 python webui.py

往后再启动就是

leia@leia:~/index-tts-vllm$

 source .venv/bin/activate

.venv 为我们创建的虚拟环境

运行成功的截图

API支持

该项目使用fastapi封装了api接口,调用如下命令可以启动相关示例:

VLLM_USE_V1=0 python api_server.py --model_dir /home/leia/IndexTTS-1.5 --port 11996

编写如下python文件testindex-tts-vllm.py,

import requests

url = "http://127.0.0.1:11996/tts_url"
data = {
    "text": "你好,我叫leia,很高兴认识你",
    "audio_paths": [  
        "spk_1234232323.wav",
        "spk_2344423234.wav"
    ]
}

response = requests.post(url, json=data)
with open("output.wav", "wb") as f:
    f.write(response.content)