惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

Blog — PlanetScale
Blog — PlanetScale
爱范儿
爱范儿
MongoDB | Blog
MongoDB | Blog
腾讯CDC
aimingoo的专栏
aimingoo的专栏
月光博客
月光博客
Engineering at Meta
Engineering at Meta
C
Check Point Blog
N
Netflix TechBlog - Medium
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
L
LangChain Blog
大猫的无限游戏
大猫的无限游戏
IT之家
IT之家
Microsoft Security Blog
Microsoft Security Blog
GbyAI
GbyAI
奇客Solidot–传递最新科技情报
奇客Solidot–传递最新科技情报
T
The Blog of Author Tim Ferriss
Last Week in AI
Last Week in AI
B
Blog
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com
人人都是产品经理
人人都是产品经理
博客园 - 叶小钗
WordPress大学
WordPress大学
博客园 - 司徒正美

推广

Codex 助力小项目,全部重写了一遍,有点意思! 管转满血模型 GPT-5.5 / gpt-image-2 API 已上线,倍率调低 0.3,注册留 ID 送 5 美金额度 GPT-5.5 / gpt-image-2 API 已上线, 0.06$/张,注册留 ID 送 5 美金额度 不知道为什么, V2EX 的铜币实在是用不完。今天也没什么特别要宣传的,就随便来发发牢骚,消费一下铜币吧。 腾讯云国际站代充值渠道-支持 USDT 支付-免绑卡注册——LingduCloud 零度云! [发 15 个码] 开发的 Mac 应用 Deepseek coding plan 限量供应 腾讯云国际企业认证账号出售:阿里云/华为云国际可开国内节点 codex 中转,留邮箱就送。 5.1 香港旅游, Za bank 众安银行开户额外返现 300HKD 目前 GPT Plus 价格已经顶上天了,我们开发了 Pro 200 刀 拼车功能.... 3.3 元 即可上车 GPT5.5 出了? 限时 0.1x 倍率 送刀了 评论区抽 10 刀共*10 阿里云国际站充值代充-官方授权分销商开户——LingduCloud 零度云 [福利] 分享一个完美解锁 GPT-5.4 限制的住宅代理: Novproxy(内附 500M 免费试用) GPT 5.5 上了 0.1x 还不来? SentiCat 开启公测:一款自研架构的桌面 Agent,主打“任务执行+情感陪伴” 自用 OpenAI API 中转 🤡 自己搞了个 AI token 中转,能用 Codex / Claude Code,随便测下 Ai2You 智友社-让更多的人用上更好的 Ai,解决您的 AI 焦虑! 一个英语学习 APP [iOS] ,送 50 个终身会员 [中转] A 社官方满血 Opus-4-7 上线,限时免费开蹬!支持对接 & 开票! aicoding.sh: Claude API 企业级中转服务,数万用户稳定运行 GPT-5.5 上线 0.2x 倍率 Codex Plus/Pro 高缓存号池 持续稳定一个月 5.4 典型用量 8 元一亿 Token 新开业中转站 kir 0.2x GTP 0.1x gpt-image-2 0.08 华为云实名号购买:阿里云|腾讯云实名号免费开 感谢 V2EX 上各位 NAS🍆 和 Datahoarder 玩家的关注和真实反馈!作为个人开发者,能得到这么多硬核玩家们的讨论,我非常荣幸。 今天摸鱼给 NanaAI 也接入了 GPT-Image-2 腾讯云国际站实名账号 LingduCloud 零度云:腾讯云国际站实名账号认证教程! 价格差不多是官方 8 分之一的 codex 渠道,分享给大家 [星问] 紫微斗数 AI 智能解盘送福利了
一个开源实时数字人项目,一个月到 1.1K Star,复盘我们做对...
xuxin123122 · 2026-06-09 · via 推广

我们最近在做实时数字人开源项目,OpenTalking 。项目开源大概一个月左右,现在 GitHub 到了 1.1K Star (感谢 V 站各位大佬的支持)。这个数字当然谈不上什么大成功,但对一个比较重、比较工程向的数字人项目来说,反馈比我预期好不少。所以想简单复盘一下,我觉得这一个月里可能有几件事做对了。

GitHub:https://github.com/datascale-ai/opentalking
官网:https://www.opentalking.net

它做的事情其实挺直接:把一个数字人从“能生成一段视频”,往“能实时和人对话”推了一步。

不是只给你一个 talking head 模型,然后让你自己去接语音、接大模型、接前端、接播放链路;而是把这些七七八八的东西先接到一起。你可以换模型、换声音、换形象,也可以直接在 Web 页面里试一轮实时对话。

第一个感受是,这个方向确实有人需要。

过去一年看了不少数字人项目和 Demo ,很多效果都挺惊艳,但我自己真正想上手的时候,经常会卡在另一个问题上:这个东西能不能跑起来?能不能接自己的 LLM ?能不能换自己的声音?能不能在浏览器里实时说话?能不能部署到自己的 GPU 机器上?

也就是说,大家缺的可能不只是一个更强的模型,而是一条能从 Demo 走到应用的工程链路。

OpenTalking 一开始就是围着这个问题做的。我们没有把它设计成“展示某个模型效果”的项目,而是更像一个数字人实验台:你可以先跑通最小链路,再慢慢换模型、换声音、换形象、换后端。

第二个我觉得比较重要的是,没有一上来就把门槛拉满。

数字人项目很容易变成这样:一堆模型权重、一堆环境依赖、一堆服务要启动,最后 README 看完人已经累了。效果可能很好,但普通开发者第一步就被挡住了。

所以 OpenTalking 现在尽量把路线拆开:

路线速览

最简单可以用 mock 模式,不需要下载数字人模型,先把前端、对话、语音和 WebRTC 播放跑起来。

如果想看真实视频效果,可以走 QuickTalk 或 Wav2Lip local ,在消费级显卡上先试起来。

如果更关心私有化,可以继续接本地 SenseVoice 、CosyVoice 和 QuickTalk 。

如果追求更高质量或者远端多卡部署,再接 OmniRT 和 FlashTalk 。

这几个路线听起来只是文档组织问题,但我觉得对开源项目挺关键的。很多用户不是不愿意试,而是不知道自己应该从哪一步开始。

第三个是,我们花了不少时间在“不性感但很有用”的地方。

比如统一启动脚本、模型 backend 解耦、avatar 预热和缓存、权重下载说明、Windows / WSL2 文档、benchmark 、本地 STT/TTS provider 、WebUI 里的状态展示。

这些东西单独拿出来都不像一个很大的 feature ,但它们决定了一个人 clone 项目之后,会不会真的继续往下跑。

我现在越来越觉得,开源项目的第一印象不只是截图和 demo ,还是用户第一次执行命令时的体验。他遇到问题的时候,项目有没有告诉他下一步该看哪里。

第四个是,数字人项目一定要多放真实场景。

只讲 LLM 、TTS 、WebRTC 、audio2video ,其实大家很难有感觉。因为这些词很多人已经看麻了。

所以我们在 README 里放了一些更具体的 demo ,比如手机实录、电商带货、新闻主播、陪伴角色、创意演唱之类的。它们不是为了证明效果已经完美,而是让人更快理解:这个框架大概可以往哪些方向长。

比如 AI 客服、直播数字人、私有数字人助手、互动陪伴、内容生成工作流,都是可以继续试的方向。

REAMDE 中的 demo 演示之一

第五个是,边界要说清楚。

OpenTalking 不是说所有模型都是自己训练的,也不是说开箱就能直接商用。它更像是一个实时数字人产品的工程底座,把不同模型、语音服务、前端交互和播放链路接到一起。

模型后端可以是 local ,也可以是 mock 、direct_ws ,或者接 OmniRT 这种外部推理服务。轻量模型可以先在本地跑,高质量模型也可以放到远端 GPU/NPU 机器上。

Opentalking 工程底座图

把边界讲清楚之后,大家反而更容易判断它有没有用:如果你只想找一个模型,可能它不是最直接的答案;但如果你想做一个能对话、能换角色、能部署、能继续二次开发的数字人系统,它会更合适。

最后也同步一下后面想继续补的东西。

现在项目还很早期,很多地方都不够顺。接下来会继续补 Windows / WSL2 一键化、更多显卡 benchmark 、更多本地模型路线、avatar 资产管理、长会话体验、打断和音画同步这些工程问题。

如果你也在做 AI 客服、直播数字人、陪伴类角色、私有化数字人助手,或者只是想研究实时数字人的工程链路,可以试一下 OpenTalking 。

GitHub:https://github.com/datascale-ai/opentalking
官网:https://www.opentalking.net

欢迎 star 、issue 、PR ,也欢迎直接提部署问题。这个方向现在还挺早,很多东西都需要在真实机器和真实场景里慢慢打磨。