惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

D
Docker
Apple Machine Learning Research
Apple Machine Learning Research
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
博客园 - 三生石上(FineUI控件)
月光博客
月光博客
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
WordPress大学
WordPress大学
Hugging Face - Blog
Hugging Face - Blog
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
M
MIT News - Artificial intelligence
腾讯CDC
B
Blog RSS Feed
H
Help Net Security
J
Java Code Geeks
有赞技术团队
有赞技术团队
Y
Y Combinator Blog
博客园_首页
Last Week in AI
Last Week in AI
博客园 - 【当耐特】
博客园 - Franky
B
Blog
MongoDB | Blog
MongoDB | Blog
博客园 - 叶小钗
Martin Fowler
Martin Fowler

博客园 - Joy_CShow

搭建OpenClaw实现钉钉 AI 员工自动化 (二) 搭建OpenClaw实现钉钉 AI 员工自动化 (一) fantasy-talking:实现图片加音频生成对嘴数字人 window中搭建wsl环境 图片对嘴生成视频:HunyuanVideo-Avatar 音频克隆:对话文本到口语对话生成MOSS-TTSD 图片生成对嘴视频FLOAT 开源AI工具-文字生成图片Fooocus 文生图:介绍一个文字生成图片的开源工具 音频克隆阿里版-CosyVoice 音频克隆-Index-TTS进阶版(ComfyUI_IndexTTS)可以实现多人对话 文字生成视频开源AI大模型项目 音频克隆-Index-TTS 音频克隆-GPT-SoVITS 自己写了一个视频拆分工具 本地搭建一个图片对嘴转视频工具-进阶版 本地搭建一个对嘴AI工具 搭建一个图片变视频的AI(二):开始搭建 搭建一个图片变视频的AI(一):模型介绍
视频音频对嘴--Wav2Lip
Joy_CShow · 2025-07-04 · via 博客园 - Joy_CShow

进阶版(加表情) :https://www.cnblogs.com/cj8988/p/18957718

这里介绍一个视频对嘴,一个视频加音频进行对嘴,生成新的视频。

Wav2Lip-HD:改进以实现高保真视频。

一:源码下载

核心源码:https://github.com/saifhassan/Wav2Lip-HD

高清处理源码:https://github.com/xinntao/Real-ESRGAN

Real-ESRGAN解压后放到Wav2Lip-HD文件夹中。

二:模型下载

根据文档,下载相应模型,然后放到相应的位置上。

Wav2Lip: https://drive.google.com/drive/folders/1tB_uz-TYMePRMZzrDMdShWUZZ0JK3SIZ

ESRGAN: https://drive.google.com/file/d/1Al8lEpnx2K-kDX7zL2DBcAuDnSKXACPb/view

Face_Detection: https://drive.google.com/file/d/1uNLYCPFFmO-og3WSHyFytJQLLYOwH5uY/view

Real-ESRGAN: https://drive.google.com/drive/folders/1BLx6aMpHgFt41fJ27_cRmT8bt53kVAYG

Real-ESRGAN: https://drive.google.com/file/d/1qNIf8cJl_dQo3ivelPJVWFkApyEAGnLi/view

下载的相应模型就放到相应位置:

下载一个ffmpeg.exe 放到根目录下Wav2Lip-HD:https://ffmpeg.org/download.html
(如果最新版本不行,可以下载6.1版本:ffmpeg version 6.1-full_build)

三:运行

(1):安装一个虚拟环境(window的Anaconda)进行运行,这样就不会破坏本地的换,没有Anaconda的需要下载安装:https://www.anaconda.com/download/success

(2)创建虚拟环境:

#创建虚拟环境,这里使用3.10的环境:
conda create --name wavalip python=3.10

#查看环境:
conda info --envs

#激活环境:
conda activate wavalip

#退出:
# conda deactivate

(3)运行:

需要先修改一下文件:run_final.bat。将视频和音频放到相应位置,然后修改这里的文件名字。

可以先注释代码中的 REM Step 2 ~ REM Step 4,只保留第一个 Step 1。

第一步就是视频根据你的音频进行对嘴处理,生成新的视频。

Step 2 ~ Step 4 就是对你的视频进行高清处理,这一步是很耗时的,很慢的。

#在虚拟环境中运行
#激活环境:
conda activate wavalip

#运行
run_final.bat

#如果有报错,根据报错安装相应的包
# pip  install  ...

不打开高清处理,应该还是很快的,生成的视频在文件夹: output_videos_wav2lip 中。没有问题后,可以打开Step 2 ~ Step 4。打开后会很慢,建议找的视频和音频时长一样,而且尽量段一些,这样可以减少生成时间。

打开高清处理,生成的视频在:output_videos_hd 文件夹中。

看了一下日志,先使用Wav2Lip生成对嘴视频,然后将视频拆分为每一帧图片(文件夹frames_wav2lip中查看),然后将所有图片高清处理(处理后的图片在文件夹frames_hd 中),最后将高清图片转为视频,并且加上音频。

最后生成的就是高清对嘴视频。(如果视频有两人,音频也有应该有两个人)。

平台视频截图:

高清视频截图:

很明显,如果条件可以,最好进行高清处理,这样生成的视频才能看。 

最后看看效果(第一个就是使用该工具生成的),即梦AI没找到上传音频的地方,所以用的是它自己的音频:

Wav2Lip-HD 即梦 AI vozo AI

查看文档:

https://github.com/saifhassan/Wav2Lip-HD

https://github.com/Rudrabha/Wav2Lip