惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Engineering at Meta
Engineering at Meta
G
Google Developers Blog
WordPress大学
WordPress大学
M
MIT News - Artificial intelligence
D
DataBreaches.Net
云风的 BLOG
云风的 BLOG
爱范儿
爱范儿
Microsoft Security Blog
Microsoft Security Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Blog — PlanetScale
Blog — PlanetScale
T
Tailwind CSS Blog
S
SegmentFault 最新的问题
阮一峰的网络日志
阮一峰的网络日志
博客园 - 三生石上(FineUI控件)
酷 壳 – CoolShell
酷 壳 – CoolShell
Recent Announcements
Recent Announcements
T
The Blog of Author Tim Ferriss
I
InfoQ
MyScale Blog
MyScale Blog
V
V2EX
B
Blog
罗磊的独立博客
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More

博客园 - Joy_CShow

搭建OpenClaw实现钉钉 AI 员工自动化 (二) 搭建OpenClaw实现钉钉 AI 员工自动化 (一) fantasy-talking:实现图片加音频生成对嘴数字人 window中搭建wsl环境 图片对嘴生成视频:HunyuanVideo-Avatar 音频克隆:对话文本到口语对话生成MOSS-TTSD 图片生成对嘴视频FLOAT 开源AI工具-文字生成图片Fooocus 文生图:介绍一个文字生成图片的开源工具 音频克隆阿里版-CosyVoice 音频克隆-Index-TTS进阶版(ComfyUI_IndexTTS)可以实现多人对话 文字生成视频开源AI大模型项目 音频克隆-Index-TTS 视频音频对嘴--Wav2Lip 音频克隆-GPT-SoVITS 自己写了一个视频拆分工具 本地搭建一个图片对嘴转视频工具-进阶版 搭建一个图片变视频的AI(二):开始搭建 搭建一个图片变视频的AI(一):模型介绍
本地搭建一个对嘴AI工具
Joy_CShow · 2025-06-27 · via 博客园 - Joy_CShow

图片+音频=说话视频

这就是本次需要实现的功能。

一:环境

window10电脑(GPU越大越好,我的是专享8G,有点小了)。

Python 3.11.9。

CUDA Version: 12.9。(驱动支持的最大 CUDA 版本,之前版本太低了,下载个新的安装,升级,重新启动电脑)

二:ComfyUI工具

ComfyUI:作为Stable Diffusion用户界面。之前的文章介绍过怎么安装:https://github.com/comfyanonymous/ComfyUI

ComfyUI_Sonic: 核心框架:https://github.com/smthemex/ComfyUI_Sonic 。 下载后解压到文件夹\ComfyUI\custom_nodes\下面。

直接根据安装文档进行安装,包括模型下载:“3.Model“。

三:直接运行

1:运行过程中有错误,比如有的模块没有安装,直接安装就行。

python .\main.py

成功启动后,浏览器直接访问 : http://127.0.0.1:8188

2:加载移动json。在文件夹下:\ComfyUI\custom_nodes\ComfyUI_Sonic\example_workflows  找到example.json。

将其推到浏览器打开的ui界面中。

3:上传自己的图片和音频:将图片和音频上传到相应位置,注意有个时长需要调整为跟音频一样的时间长度。

4:点击运行后,需要等待了,如果你的GPU比较大,那等待的时间就比较短。

生成的视频文件根据你最后的那个输出配置,一般在文件夹 \ComfyUI\output 中。

查看文档:https://github.com/smthemex/ComfyUI_Sonic