惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
The Cloudflare Blog
有赞技术团队
有赞技术团队
H
Help Net Security
V
Visual Studio Blog
F
Fortinet All Blogs
Apple Machine Learning Research
Apple Machine Learning Research
博客园 - 司徒正美
G
Google Developers Blog
Google DeepMind News
Google DeepMind News
腾讯CDC
H
Hackread – Cybersecurity News, Data Breaches, AI and More
Stack Overflow Blog
Stack Overflow Blog
I
InfoQ
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
L
LangChain Blog
N
Netflix TechBlog - Medium
罗磊的独立博客
The GitHub Blog
The GitHub Blog
云风的 BLOG
云风的 BLOG
Hugging Face - Blog
Hugging Face - Blog
A
About on SuperTechFans
aimingoo的专栏
aimingoo的专栏
Recent Announcements
Recent Announcements

分享创造

分享 KCase 脑图测试用例生成平台(AI 辅助生成测试用例) 标签页囤积症自救:写了个插件 TabRack,主打快速检索、自动分类和 AI 摘要 [file-preview]一个比较全面的在线文件预览组件库-支持 react 和 vue 撸了个 iOS 小应用[极简水印相机],直接免费 做了一个 V2EX Skill 写了个 iOS 打码 App「遮鸭 Maskduck」,纯离线免费 35 岁前端,裁员失业后,我花 1 个月做了个 AI 生图网站 亲身经历猫咪急症,我做了一款猫狗疼痛检测工具,希望能救你家毛孩一命 如何用 AI 做比较酷炫的落地页? 求真!最近 AI 生图的能力强到可怕 开源一个查看 k8s 的菜单栏工具-kubebar Packpour:我做了个专门给 App Store Connect 填多语言元数据的小工具 面对 140 年一遇的超级厄尔尼诺,我做了个全球监测小站 做了一个自动翻译的 Hacker News 客户端 做了一个 AI 头像生成器,可以免费生成 2 次 [送码 50 个] 自己手搓了个高颜值的倒数日 App——拾光机,求 V 友们指点 一个将苹果健康 APP 数据导出的工具,然后把你的数据喂给 AI 分析 我做了一个叫「订阅斩」的 iOS App,专门对付那些悄悄扣钱的订阅 做了个草率的日麻互动漫画,听听反馈 喜欢自己洗车的朋友们,我用 ai 做了一款洗车小程序 -- 洗车志 感谢 V2EX 上各位 NAS🍆 和 Datahoarder 玩家的关注和真实反馈!作为个人开发者,能得到这么多硬核玩家们的讨论,我非常荣幸。 用 AI 开发熊孩子自律的小程序 用 OpenClaw 搭建个人运动助手 今天摸鱼给 NanaAI 也接入了 GPT-Image-2 [Video Companion]一个 chrome 插件,解决大多对视频操作的需求~欢迎使用提 bug AI 时代,做产品简单了,把产品推广出去却变的更难了~ bestskills.dev - Skills 精选和评测站点 免 ROOT 强力卸载安卓广告软件 一个 All In One 的运维工具,支持 SSH、数据库、Redis 管理 [开源] Codeg V0.10:专注于代码生成的多智能体 IDE(cc、codex、gemini、opencode……),新版本重构了工作区,飞一般的体验,支持桌面端、服务器部署
[开源] OpenTalking 进展同步: Avatar 资产预热、本地语音链...
xuxin123122 · 2026-05-21 · via 分享创造

前两天在 V2EX 分享过一次 OpenTalking ,当时主要介绍的是实时数字人完整链路:LLM 、STT 、TTS 、数字人视频驱动、WebRTC 播放、字幕同步和用户打断。
这两天我们又继续往前推进了一版,重点不是单独换某个模型,而是把实时数字人里比较影响体验的工程链路再补一补。
项目地址: https://github.com/datascale-ai/opentalking
这次主要做了几件事:
1. Avatar 资产管理和缓存预热
2. 新增了几个内置的 Avartar 资
之前做数字人 demo 的时候,一个比较麻烦的地方是:不同后端对 Avatar 资产的要求不一样。
比如 Wav2Lip 需要预处理帧和嘴型 metadata ,QuickTalk 会有自己的 template 和 face cache ,FlashTalk 又是另外一套实时推理链路。
如果每个模型都各管各的,后面加角色、切模型、做 WebUI 展示都会很乱。
所以这两天主要在整理 Avatar 资产结构,让前端选择一个角色之后,后端能更明确地知道:
这个 Avatar 支持哪些模型;
哪些缓存已经准备好;
哪些需要提前预热;
缺失时应该怎么提示或自动准备。
目标是让用户不是“点一下角色,然后等模型慢慢现算”,而是尽量把可以提前做的事情前置掉。
QuickTalk / Wav2Lip 的链路继续对齐
上次我们已经支持了 wav2lip 、musetalk 、flashtalk 、quicktalk 等几种模式。
这次继续补的是 QuickTalk 和 Wav2Lip 的资产处理一致性,尤其是预览、缓存、模板视频和 runtime 之间的关系。
简单说,就是希望同一个 Avatar 在 WebUI 里看起来是一个角色,而不是用户需要理解背后每个模型各自的目录结构。
对开发者来说,这样后面新增 Avatar 或者新增模型后端也会更清楚一点。
本地 ASR / TTS 方向开始整理
之前为了让大家更容易跑起来,默认链路里很多语音能力会走云 API 。
这两天也开始把本地语音链路补起来,比如本地 SenseVoiceSmall 做 ASR ,本地 CosyVoice 做 TTS ,并且在前端里标注清楚哪些是本地模型,哪些是云端 API 。
这个方向还在继续调,但目标很明确:OpenTalking 不能只做一个云 API 拼起来的 demo ,也要能支持更本地化、更可控的部署方式。
端到端 benchmark 工具
实时数字人最怕只看单点效果。
单独看 TTS 很快,或者单独看 talking head 模型能跑,不代表完整体验就顺。
所以这次也加了端到端 benchmark 的方向,用来更系统地看:
语音输入到识别;
LLM 流式回复;
TTS 首包;
视频首帧;
字幕和播放状态;
打断和下一轮恢复。
后面优化低延迟体验的时候,不能只凭感觉说“快了”,需要有一套能复现的指标。
目前项目还比较早期,但这几天的方向基本是:从“能跑一个 demo”,继续往“更容易部署、更容易加角色、更容易评估体验”走。
后面还会继续做:
更低的首帧延迟;
更清晰的 Avatar 资产库;
更多本地模型组合;
QuickTalk / Wav2Lip / FlashTalk 等后端的体验对齐;
面向电商、主播、客服、培训等场景的案例整理。
欢迎大家继续试用、提 issue 、拍砖。
也想听听大家对实时数字人最在意的是哪块:低延迟、本地部署、口型效果、音色复刻、Avatar 制作,还是完整产品链路?