惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

博客园_首页
IT之家
IT之家
博客园 - Franky
Stack Overflow Blog
Stack Overflow Blog
宝玉的分享
宝玉的分享
Recent Announcements
Recent Announcements
Engineering at Meta
Engineering at Meta
S
SegmentFault 最新的问题
V
Visual Studio Blog
freeCodeCamp Programming Tutorials: Python, JavaScript, Git & More
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Last Week in AI
Last Week in AI
H
Help Net Security
V
V2EX
H
Hackread – Cybersecurity News, Data Breaches, AI and More
量子位
博客园 - 叶小钗
J
Java Code Geeks
博客园 - 【当耐特】
月光博客
月光博客
爱范儿
爱范儿
人人都是产品经理
人人都是产品经理
酷 壳 – CoolShell
酷 壳 – CoolShell
小众软件
小众软件

V2EX

我用 AI 写代码,但终端管理反而成了累赘——于是我做了 codux [调研] 各位在公司都用什么 ide 和 agent 写代码? 老运维 share 一个运维平台 看到有公司考核 token 指标,很好奇大家上个月的 AI 账单是多少 GLM-Coding 调用持续报错: z.ai 的 Lite 套餐几乎无法使用,官方 Pro/Max 是否稳定? 现在还有什么渠道可以稳定安全地使用 Claude 吗? 上海漕河泾内推,本组有 2 个 hc,一个后端,一个前端,预算都是 20k 左右,不打卡,氛围好 如果 V2EX 上有一组不永久保存聊天记录(比如只保存 7 天或者 24 小时)的聊天室,那么会开启哪些有用或者有趣的可能? gemini cli 貌似挂了,一直返回 403 第一次在自媒体上赚到钱 收集了最近在使用的低价 GPT, Gemini,邮箱等 AI 会员的小店合集 讨论个大实话:现在企业还在说 AI 编程提效 20%, 30%的,真的太落后,没用懂 AI。因为包括很多前沿公司,已经狂奔到提效 200%-500%的情况 [招聘][远程][币安] 前端/后端/QA/iOS/Android 至少 3 年以上经验 目前有大量 HC 欢迎投递 Chatgpt Pro 用量用不完的可以开这些设置 面试的时候好像遇到钓鱼了,给各位避个坑 cursor 年续费 22 号到期, 自动续费是否还是老的计次套餐呢 被两件破事毁掉的一下午,琐碎的内耗消磨人的精力 使用 Planet 存储 Codex 的会话或者重要信息 如果业务部门领导不要你开发功能,而是要求你教会它用 claude code 开发功能,你会怎么做? 分享一个 MacOS 接绿联 CM818 USB 转 DP 转接器使用感受 我的 HR 朋友 10 年老 Java ,非全大专,大家帮忙看看简历 开源了一个 AI 口语练习工具,音素级发音评分,完全免费可自部署 V2EX 上有哪些你觉得很有趣、印象深刻的妹纸? 字节为啥不出个国内版 Vercel? 有在大马的朋友吗? 问个运营商问题 你们在有领导的公司大群发过的最大胆的消息是什么 公司裁员,目前没有工作。想试试摆摊,做一个移动鲜啤打酒车 我的硬盘 Memblaze Pblaze 5 Linux 下不识别,给 Linux 内核提交了补丁, AI 说有望被合并 只有我一个人觉得 codex 不好用?
[开源] OpenTalking 进展同步: Avatar 资产预热、本地语音链...
xuxin123122 · 2026-05-21 · via V2EX

前两天在 V2EX 分享过一次 OpenTalking ,当时主要介绍的是实时数字人完整链路:LLM 、STT 、TTS 、数字人视频驱动、WebRTC 播放、字幕同步和用户打断。
这两天我们又继续往前推进了一版,重点不是单独换某个模型,而是把实时数字人里比较影响体验的工程链路再补一补。
项目地址: https://github.com/datascale-ai/opentalking
这次主要做了几件事:
1. Avatar 资产管理和缓存预热
2. 新增了几个内置的 Avartar 资
之前做数字人 demo 的时候,一个比较麻烦的地方是:不同后端对 Avatar 资产的要求不一样。
比如 Wav2Lip 需要预处理帧和嘴型 metadata ,QuickTalk 会有自己的 template 和 face cache ,FlashTalk 又是另外一套实时推理链路。
如果每个模型都各管各的,后面加角色、切模型、做 WebUI 展示都会很乱。
所以这两天主要在整理 Avatar 资产结构,让前端选择一个角色之后,后端能更明确地知道:
这个 Avatar 支持哪些模型;
哪些缓存已经准备好;
哪些需要提前预热;
缺失时应该怎么提示或自动准备。
目标是让用户不是“点一下角色,然后等模型慢慢现算”,而是尽量把可以提前做的事情前置掉。
QuickTalk / Wav2Lip 的链路继续对齐
上次我们已经支持了 wav2lip 、musetalk 、flashtalk 、quicktalk 等几种模式。
这次继续补的是 QuickTalk 和 Wav2Lip 的资产处理一致性,尤其是预览、缓存、模板视频和 runtime 之间的关系。
简单说,就是希望同一个 Avatar 在 WebUI 里看起来是一个角色,而不是用户需要理解背后每个模型各自的目录结构。
对开发者来说,这样后面新增 Avatar 或者新增模型后端也会更清楚一点。
本地 ASR / TTS 方向开始整理
之前为了让大家更容易跑起来,默认链路里很多语音能力会走云 API 。
这两天也开始把本地语音链路补起来,比如本地 SenseVoiceSmall 做 ASR ,本地 CosyVoice 做 TTS ,并且在前端里标注清楚哪些是本地模型,哪些是云端 API 。
这个方向还在继续调,但目标很明确:OpenTalking 不能只做一个云 API 拼起来的 demo ,也要能支持更本地化、更可控的部署方式。
端到端 benchmark 工具
实时数字人最怕只看单点效果。
单独看 TTS 很快,或者单独看 talking head 模型能跑,不代表完整体验就顺。
所以这次也加了端到端 benchmark 的方向,用来更系统地看:
语音输入到识别;
LLM 流式回复;
TTS 首包;
视频首帧;
字幕和播放状态;
打断和下一轮恢复。
后面优化低延迟体验的时候,不能只凭感觉说“快了”,需要有一套能复现的指标。
目前项目还比较早期,但这几天的方向基本是:从“能跑一个 demo”,继续往“更容易部署、更容易加角色、更容易评估体验”走。
后面还会继续做:
更低的首帧延迟;
更清晰的 Avatar 资产库;
更多本地模型组合;
QuickTalk / Wav2Lip / FlashTalk 等后端的体验对齐;
面向电商、主播、客服、培训等场景的案例整理。
欢迎大家继续试用、提 issue 、拍砖。
也想听听大家对实时数字人最在意的是哪块:低延迟、本地部署、口型效果、音色复刻、Avatar 制作,还是完整产品链路?