惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

月光博客
月光博客
Martin Fowler
Martin Fowler
Last Week in AI
Last Week in AI
罗磊的独立博客
阮一峰的网络日志
阮一峰的网络日志
博客园 - 【当耐特】
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
博客园 - 三生石上(FineUI控件)
S
SegmentFault 最新的问题
V
Visual Studio Blog
Hugging Face - Blog
Hugging Face - Blog
雷峰网
雷峰网
博客园_首页
人人都是产品经理
人人都是产品经理
量子位
美团技术团队
The Cloudflare Blog
小众软件
小众软件
WordPress大学
WordPress大学
有赞技术团队
有赞技术团队
M
MIT News - Artificial intelligence
Microsoft Security Blog
Microsoft Security Blog
D
DataBreaches.Net
博客园 - Franky

博客园 - 彭成刚

"editor.cursorSurroundingLines": 3, 光标周围行数 设置光标在第几行的时候滚动页面滚动条 Prettier - Code formatter BUG 读不到 根目录的 .prettierrc.js prettier.configPath 格式化失效 vue2 mounted后面括号应该没有空格 _.flow 管道函数 lodash 同步函数列表很哇塞啊 _.flow(caozuo1, caozuo2, caozuo3)(my_data) vue2 iview 组件 ref 起名规则 应该用文件名 <shouye_book_left ref="shouye_book_left" /> iview 日期组件 BUG 赋值变量选年度 然后当前年会有个蓝色底, 解决方案 :key="ccValue" ⭐️⭐️⭐️ 自定义组件 表单验证 v-model 自动更新验证 trigger: 'change' 不触发,解决方案 加 <Input v-model="formData.abc" /> vue2 iview ComfyUiApi comfyui_xy 安装-使用 mergeLeft 左合并json函数 alt+k vscode 执行 ccdev - 在editor 和 terminal 之间切换 splitTwo 分割2个元素,主要分割文件名和id等 pi.dev 试试这个cli - deepseek-flash-v4 C盘清理空间软件 c盘没空间了 Wise Disk Cleaner kceve 鼠标2口控制器 kvm 鼠标同步器 穿屏幕 快捷键 是 s + * 操作列css每个按钮a后面加竖线.css operation_class .prettierrc.js 我发现 这个格式化的配置 默认就不建议放全局,都是跟项目走的 grid-gap 在 chrome58 支持,然后chrome58 不支持 gird的gap,不支持flex的gap iview table columns.js 表头 带* 带星 renderHeader alt+F9 设置 open in terminal 打开当前文件terminal vscode idea 都设置成这个快捷键 配合 ccdev使用 ccdev go开发 cli开发 读取本地模版复制到剪切板 where.exe node 查看命令位置 powershell 注意不是 where node (新建了一个ccwhere.bat) vue2 vModel 组件绑定数据写法 ccValue reloadenv 函数 `code $PROFILE` vscode在不关闭下刷新环境变量 volta 安装记录 node多版本控制 && @native-sdk voiceclone-env 记录 vscode pwsh 全选快捷键 ctrl+a (powershell) ai专属使用 aitree 命令 ai配合重要命令 powershell vscode code $PROFILE 备份,配合conda使用vscode $setHideObjProp 设置js json对象属性 隐藏变量 不可枚举,post的时候不带这个变量 GPT-SoVITS 环境搭建及应用 回车小问题 vscode markdown 开始几次回车不好使 markdown.extension.onEnterKey
OmniVoice 记录 我觉得音色还原还不错
彭成刚 · 2026-07-22 · via 博客园 - 彭成刚

https://github.com/k2-fsa/OmniVoice

需求

文字生成音频

python 3.11

conda create -n omniVoice-env python=3.11
conda activate omniVoice-env
conda install pip
python -m pip -V 这个查看pip命令是哪里的,默认不装pip,

torch

我是1650 只能装老版本

pip install torch==2.4.1 torchvision==0.19.1 torchaudio==2.4.1 --index-url https://download.pytorch.org/whl/cu121
2.4.1 版本太低了,omniVoice 用不了,换一个
pip install torch==2.6.0 torchaudio==2.6.0 torchvision==0.21.0 --index-url https://download.pytorch.org/whl/cu126
这个ok了

查看安装版本

(omniVoice-env) ➥ omniVoice-env $ python -c "import torch; print('PyTorch:', torch.__version__); print('CUDA:', torch.cuda.is_available()); print('cuDNN:', torch.backends.cudnn.is_available()); print('Version:', torch.backends.cudnn.version() if torch.backends.cudnn.is_available() else 'N/A')"
PyTorch: 2.4.1+cu121
CUDA: True
cuDNN: True
Version: 90100

cudnn 跳过

1650版本
安装完torch是带cudnn的,现看看是什么版本

pip show nvidia-cudnn-cu12
conda install -c conda-forge cudnn=8.9.7

runtime 跳过

1650版本

pip install onnxruntime-gpu==1.19.2

omnivoice

pip install omnivoice

从hf上下载了个模型, 查看缓存目录

(omniVoice-env) ➥ omniVoice-env $ python -c "from huggingface_hub import constants; print(constants.HF_HOME)"
C:\Users\Reciter\.cache\huggingface

设置的变量查看

echo $env:HF_HOME
我这里没有显示,就放c盘吧 我就现不折腾了

代码

测试可以用,参考10秒里面的内容很重要,这个我特意裁剪了个带哈哈哈的,注意要没有背景环境音的参考音频。

from omnivoice import OmniVoice
import soundfile as sf
import torch

model = OmniVoice.from_pretrained(
    "k2-fsa/OmniVoice",
    device_map="cuda:0",
    dtype=torch.float16
)
# Apple Silicon users: use device_map="mps" instead
# Intel Arc GPU users: use device_map="xpu" instead

audio = model.generate(
    language="zh",
    text="这是一个测试的文本。哈哈哈哈哈哈,好了好了,现不说了,Callback!",
    ref_audio="douyin_voice_9s.wav",
    ref_text="笑死我了,哈哈哈。这个配音,哈哈哈。你们赶紧用一下吧,哈哈哈。这个配音名字叫做真人博客女。",
) # audio is a list of `np.ndarray` with shape (T,) at 24 kHz.

# If you don't want to input `ref_text` manually, you can directly omit the `ref_text`.
# The model will use Whisper ASR to auto-transcribe it. To use a local copy (or
# a different Whisper model), pass `asr_model_name="..."` to `from_pretrained`.
# To control which device Whisper is loaded on (e.g. another GPU in multi-GPU
# setups, or the CPU), pass `asr_device="cuda:1"` (or `"cpu"`).

sf.write("out.wav", audio[0], 24000)

ApplioV3.6.3

这个音色转换的也不错,这个是音频转音频的。需要找音色模型
E:\aizzz-env-dev\rvc-env\ApplioV3.6.3