惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Security Latest
Security Latest
Know Your Adversary
Know Your Adversary
S
Schneier on Security
K
Kaspersky official blog
cs.CL updates on arXiv.org
cs.CL updates on arXiv.org
Google DeepMind News
Google DeepMind News
Project Zero
Project Zero
Recorded Future
Recorded Future
T
The Blog of Author Tim Ferriss
P
Palo Alto Networks Blog
Engineering at Meta
Engineering at Meta
MyScale Blog
MyScale Blog
L
LINUX DO - 热门话题
The Register - Security
The Register - Security
B
Blog
V
Vulnerabilities – Threatpost
M
MIT News - Artificial intelligence
P
Proofpoint News Feed
Cyberwarzone
Cyberwarzone
Latest news
Latest news
Webroot Blog
Webroot Blog
Cyber Security Advisories - MS-ISAC
Cyber Security Advisories - MS-ISAC
美团技术团队
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
C
CXSECURITY Database RSS Feed - CXSecurity.com
L
LINUX DO - 最新话题
K
KPMG report finds enterprise disconnect between AI and its ROI | CIO
B
Blog RSS Feed
aimingoo的专栏
aimingoo的专栏
The GitHub Blog
The GitHub Blog
D
Docker
G
Google Developers Blog
T
Threatpost
F
Full Disclosure
Attack and Defense Labs
Attack and Defense Labs
L
Lohrmann on Cybersecurity
Application and Cybersecurity Blog
Application and Cybersecurity Blog
月光博客
月光博客
D
DataBreaches.Net
WordPress大学
WordPress大学
F
Fortinet All Blogs
S
Secure Thoughts
Y
Y Combinator Blog
博客园 - Franky
Scott Helme
Scott Helme
Apple Machine Learning Research
Apple Machine Learning Research
Hacker News: Ask HN
Hacker News: Ask HN
酷 壳 – CoolShell
酷 壳 – CoolShell
Cloudbric
Cloudbric
N
News | PayPal Newsroom

机器学习

llama.cpp 服务开启 embedding 是否稳定? - V2EX 深度学习的 LLM 就像受伤的大脑 大语言模型会被其他技术取代吗? - V2EX llm 训练最 dirty work 的就是数据处理! - V2EX 做机器学习强烈推荐看看 MIT 18.S096 矩阵微积分 - V2EX 求助微信聊天记录训练 ai - V2EX 请问 AI 训练大佬 : 目前大家不写 blog, stackoverflow 等,如何训练新的优质数据,还是拿 AI 数据训练自己? - V2EX 想要真正理解目前的深度学习(不仅是打杂的炼丹师),需要怎样的数学基础 - V2EX 怎样加快 onnx 模型在 cpu 上的推理速度啊 - V2EX AI 公司瞄准的顺序是浏览器、输入法、操作系统 - V2EX 有什么能本地跑的机器学习项目吗? - V2EX 求助 使用 ddddocr 自训练模型场景下,遇到了 onnxruntime.capi.onnxruntime_pybind11_state.InvalidArgument - V2EX BERT 论文复现: 经验 & 教训 - V2EX 求推荐一些 LLM/深度学习方面打基础的书籍或者课程 - V2EX 2025 年底,如果想做一个图像分类模型,用什么模型来微调比较好 - V2EX 目前使用 yolov8 训练了一个目标检测模型,但是上线使用效果不是很好,怎么优化? - V2EX 最近看 1-2 万主机发现 3090 还是能打的 - V2EX [AI Glimpse 科普系列] KV Cache 的原理推导与代码实现(基于 GPT2) - V2EX 关于 OCR 以及以图找图识别 - V2EX 这类型的英语学习视频,是用哪个模型生成? - V2EX 怎么实现提取俩个图片的一些特征,然后进行特征比对 - V2EX 检测画面中存在漏水,给点思路 - V2EX 学习 AI, 跑下模型, 应该用什么 N 卡? - V2EX 有没有大佬了解机器学习的 mlops 框架或者平台 - V2EX 如何把本地文件作为大模型的知识库 - V2EX 使用大语言模型进行文本分类任务需要微调吗? - V2EX lima 和 colima 居然是有关系的 - V2EX gpt4o 图像生成的技术讨论(自回归模型又好起来了?) - V2EX [AI Glimpse 科普系列] 不到 100 行 Python 代码从零实现 LLM 的推测采样算法 - V2EX 什么?唠唠嗑就能生成游戏关卡! Unreal Engine + MCP 来了! - V2EX 大模型是如何执行像数学运算、编程等精确性要求比较高的任务的? - V2EX 有没有 LLM 入门的系统学习教程 - V2EX mtranserver 的翻译效果还是差一点 - V2EX 求助,有没有视觉大模型可以识别一个 UI 设计图中各个模块的划分 - V2EX 多模态大模型的大小远低于单文本模型啊。 - V2EX 利用 deepseek 分析医学影像找出结节这是什么技术原理? - V2EX 大语言模型与深度学习书籍推荐 - V2EX 为什么 LLM 不擅长数饺子? - V2EX 突然冒出一个点子,利用现在热门的 AI 来做 web 外挂工具 - V2EX 请问训练或者调试 yolo 用什么配置性价比较高。 - V2EX 大模型能记住所有它训练过的数据吗? - V2EX 如何从头构建一个自己的大模型呢?从底层最基础的神经网络开始实现 - V2EX LLM 静态批处理和 Continuous Batch 相关疑问的求解 - V2EX 有没有久坐提醒类服务,最好是基于啥啥啥模型的那种活体检测。 - V2EX LLMs 文本标签(分类)任务怎么做比较好? - V2EX 能推荐个偏实战的 tranformer/LLM 的课程么? 模型部署的姿势 深度学习在自己电脑上跑, Linux 环境,选择 WSL 还是物理机 Ubuntu? - V2EX CUDA 搞深度学习, 1TB 的一块硬盘, C 盘留多大合适? - V2EX 怎么理解 RNN 循环神经网络工作原理? ReLU 函数在 x> 0 的时候也是线性的,套 ReLU 函数是怎么实现激活作用的?
想做有声小说声音克隆, 3060Ti 能扛得住吗? - V2EX
EasonIndie · 2025-10-13 · via 机器学习

V 友们好,最近想自己做一个 中文有声小说项目,希望呻吟自然流畅、语气生动、有停顿、笑声这些表达。 目标是 克隆自定义声音(我自己或一些受欢迎的配音),然后批量生成小说音频。


💡 我的需求大致是:

  1. 先克隆/微调一个中文声音,让声音自然、不机械。
  2. 风格希望像相声那种“说学逗唱”的语气——要能控制节奏、停顿、情绪。
  3. 后期做有声小说输出

🖥️ 当前设备配置:

  • CPU:R5 5600G
  • 内存:32GB DDR4
  • 显卡:暂未购买,考虑 RTX 3060 ( 12GB ) 或 RTX 3060Ti ( 8GB )大概就是 2000 元价位的
  • 系统:Windows / Ubuntu 都能装(开发环境可切换)

🔧 初步技术路线:

我目前查下来主要有两条思路:

  1. 快速上手路线(生成类)

    • 使用 Suno Bark 或类似大模型,直接生成多情感中文语音;
    • 适合先试效果、调节 prompt 实现“相声语气”;
    • 缺点是声音不一定稳定、不可控。
  2. 高可控路线(训练类)

    • 管线:Speaker Encoder → VITS / Coqui-TTS → HiFi-GAN ;
    • 录制 20 ~ 60 分钟高质量音频做微调;
    • 目标是克隆稳定音色、能生成自然语调的中文语音;
    • 支持 prosody / style token 控制节奏语气。

计划在本地用 PyTorch + CUDA 训练/推理,显存有限的话准备上 fp16 + LoRA + 梯度累积 等优化。


❓ 想请教 V 友们:

  1. 3060 12GB 或 3060Ti 8GB 能胜任 TTS / 声音克隆任务?

    • 听说显存容量在 TTS 场景下比算力更关键,想听下大家的实测经验。
  2. 如果只做轻量微调(不从零训练),3060Ti 是否足够?

  3. 有没有人实际在本地跑过 Bark / VITS / Coqui-TTS / HiFi-GAN 这类项目?

    • 推理速度和显存占用大概怎样?
    • 有没有推荐的显存优化技巧?
  4. 对于“相声风格”的语音,有没有成熟的风格迁移或 prosody 控制方法?


✅ 目标:

能在家用机上稳定生成相声风格的有声小说音频,自己做声音模型和后期,长期迭代。


大家有做过类似声音克隆 / 本地 TTS 项目的,求分享经验和显卡选型建议 🙏