惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - Franky
T
Tailwind CSS Blog
Microsoft Azure Blog
Microsoft Azure Blog
The Cloudflare Blog
博客园 - 叶小钗
N
Netflix TechBlog - Medium
罗磊的独立博客
量子位
MyScale Blog
MyScale Blog
A
About on SuperTechFans
Blog — PlanetScale
Blog — PlanetScale
V
Visual Studio Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
GbyAI
GbyAI
B
Blog
腾讯CDC
爱范儿
爱范儿
Recent Announcements
Recent Announcements
有赞技术团队
有赞技术团队
F
Fortinet All Blogs
雷峰网
雷峰网
G
Google Developers Blog
Google DeepMind News
Google DeepMind News

机器学习

llama.cpp 服务开启 embedding 是否稳定? 深度学习的 LLM 就像受伤的大脑 大语言模型会被其他技术取代吗? llm 训练最 dirty work 的就是数据处理! 做机器学习强烈推荐看看 MIT 18.S096 矩阵微积分 求助微信聊天记录训练 ai 请问 AI 训练大佬 : 目前大家不写 blog, stackoverflow 等,如何训练新的优质数据,还是拿 AI 数据训练自己? 想要真正理解目前的深度学习(不仅是打杂的炼丹师),需要怎样的数学基础 怎样加快 onnx 模型在 cpu 上的推理速度啊 AI 公司瞄准的顺序是浏览器、输入法、操作系统 有什么能本地跑的机器学习项目吗? 求助 使用 ddddocr 自训练模型场景下,遇到了 onnxruntime.capi.onnxruntime_pybind11_state.InvalidArgument BERT 论文复现: 经验 & 教训 求推荐一些 LLM/深度学习方面打基础的书籍或者课程 2025 年底,如果想做一个图像分类模型,用什么模型来微调比较好 目前使用 yolov8 训练了一个目标检测模型,但是上线使用效果不是很好,怎么优化? 最近看 1-2 万主机发现 3090 还是能打的 [AI Glimpse 科普系列] KV Cache 的原理推导与代码实现(基于 GPT2) 关于 OCR 以及以图找图识别 这类型的英语学习视频,是用哪个模型生成? 怎么实现提取俩个图片的一些特征,然后进行特征比对 检测画面中存在漏水,给点思路 学习 AI, 跑下模型, 应该用什么 N 卡? 有没有大佬了解机器学习的 mlops 框架或者平台 如何把本地文件作为大模型的知识库 使用大语言模型进行文本分类任务需要微调吗? lima 和 colima 居然是有关系的 gpt4o 图像生成的技术讨论(自回归模型又好起来了?) [AI Glimpse 科普系列] 不到 100 行 Python 代码从零实现 LLM 的推测采样算法 什么?唠唠嗑就能生成游戏关卡! Unreal Engine + MCP 来了!
想做有声小说声音克隆, 3060Ti 能扛得住吗?
EasonIndie · 2025-10-13 · via 机器学习

V 友们好,最近想自己做一个 中文有声小说项目,希望呻吟自然流畅、语气生动、有停顿、笑声这些表达。 目标是 克隆自定义声音(我自己或一些受欢迎的配音),然后批量生成小说音频。


💡 我的需求大致是:

  1. 先克隆/微调一个中文声音,让声音自然、不机械。
  2. 风格希望像相声那种“说学逗唱”的语气——要能控制节奏、停顿、情绪。
  3. 后期做有声小说输出

🖥️ 当前设备配置:

  • CPU:R5 5600G
  • 内存:32GB DDR4
  • 显卡:暂未购买,考虑 RTX 3060 ( 12GB ) 或 RTX 3060Ti ( 8GB )大概就是 2000 元价位的
  • 系统:Windows / Ubuntu 都能装(开发环境可切换)

🔧 初步技术路线:

我目前查下来主要有两条思路:

  1. 快速上手路线(生成类)

    • 使用 Suno Bark 或类似大模型,直接生成多情感中文语音;
    • 适合先试效果、调节 prompt 实现“相声语气”;
    • 缺点是声音不一定稳定、不可控。
  2. 高可控路线(训练类)

    • 管线:Speaker Encoder → VITS / Coqui-TTS → HiFi-GAN ;
    • 录制 20 ~ 60 分钟高质量音频做微调;
    • 目标是克隆稳定音色、能生成自然语调的中文语音;
    • 支持 prosody / style token 控制节奏语气。

计划在本地用 PyTorch + CUDA 训练/推理,显存有限的话准备上 fp16 + LoRA + 梯度累积 等优化。


❓ 想请教 V 友们:

  1. 3060 12GB 或 3060Ti 8GB 能胜任 TTS / 声音克隆任务?

    • 听说显存容量在 TTS 场景下比算力更关键,想听下大家的实测经验。
  2. 如果只做轻量微调(不从零训练),3060Ti 是否足够?

  3. 有没有人实际在本地跑过 Bark / VITS / Coqui-TTS / HiFi-GAN 这类项目?

    • 推理速度和显存占用大概怎样?
    • 有没有推荐的显存优化技巧?
  4. 对于“相声风格”的语音,有没有成熟的风格迁移或 prosody 控制方法?


✅ 目标:

能在家用机上稳定生成相声风格的有声小说音频,自己做声音模型和后期,长期迭代。


大家有做过类似声音克隆 / 本地 TTS 项目的,求分享经验和显卡选型建议 🙏