惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

P
Proofpoint News Feed
V
V2EX
WordPress大学
WordPress大学
Google DeepMind News
Google DeepMind News
Martin Fowler
Martin Fowler
小众软件
小众软件
Blog — PlanetScale
Blog — PlanetScale
月光博客
月光博客
The Cloudflare Blog
T
Tailwind CSS Blog
H
Help Net Security
腾讯CDC
爱范儿
爱范儿
人人都是产品经理
人人都是产品经理
H
Hackread – Cybersecurity News, Data Breaches, AI and More
The GitHub Blog
The GitHub Blog
Microsoft Security Blog
Microsoft Security Blog
Stack Overflow Blog
Stack Overflow Blog
D
DataBreaches.Net
C
Check Point Blog
量子位
酷 壳 – CoolShell
酷 壳 – CoolShell
美团技术团队
让小产品的独立变现更简单 - ezindie.com
让小产品的独立变现更简单 - ezindie.com

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
阿里联合高校开源Live Avatar:140亿参数实时数字人模型,20F...
站外新闻 · 2026-06-15 · via Prompt 语宙

💡 站外导读:当前数字人技术虽快速发展,但面临长时生成面部漂移、色彩失真及实时交互延迟等核心痛点。在AIGC浪潮下,电商直播、虚拟主播等应用对稳定、高保真的实时数字人需求激增。阿里巴巴联合多所高校开源的Live Avatar,旨在突破这些瓶颈,为行业提供可落地的解决方案。

Live Avatar 是阿里巴巴联合多所高校推出的实时数字人模型,能通过音视频驱动生成无限时长的数字人视频。Live Avatar 依托 140 亿参数扩散模型,实现 20FPS 的实时流式生成,支持长达 10000 秒以上稳定输出,避免长时生成中的面部漂移和色彩失真。可用在电商直播、新闻播报、虚拟助手等多种场景,提供高保真、低延迟的交互体验。

  • Live Avatar是什么
  • Live Avatar的主要功能
  • Live Avatar的技术原理
  • Live Avatar的项目地址
  • Live Avatar的应用场景
      • 📝 站长洞察 (Editor’s Insight)

Live Avatar

Live Avatar的主要功能

  • 实时音视频驱动:通过麦克风和摄像头捕捉用户的语音和表情动作,驱动数字人进行口型、表情的同步响应,实现低延迟的面对面交互。

  • 无限时长稳定生成:支持长达 10,000 秒以上的连续视频生成,过程中数字人的面容、肤色、风格等特征保持一致,避免长时生成中的身份漂移和画质下降。

  • 高保真画质:基于 140 亿参数的扩散模型,生成细节丰富、清晰自然的数字人画面。

  • 流式生成:采用流式处理技术,支持实时视频流的连续扩展,适用于直播等实时应用场景。

Live Avatar的技术原理

  • 扩散模型优化用 140 亿参数的扩散模型,通过 Distribution Matching Distillation(分布匹配蒸馏)技术,将多步双向扩散模型转化为高效的 4 步流式扩散模型,大幅提升生成速度。采用 Timestep-forcing Pipeline Parallelism(时间步强制流水线并行)技术,将去噪阶段解耦并分配到多个设备上,实现线性加速,支持大规模并行计算。

  • 无限时长生成机制

    • 滚动 RoPE(Relative Positional Encoding):动态更新参考帧的相对位置编码,保持生成帧与参考帧的相对位置关系,避免身份漂移。

    • 自适应注意力池(Adaptive Attention Sink):将初始参考帧替换为生成帧,消除导致分布漂移的持续因素,保持生成帧的分布一致性。

    • 历史干扰机制:向 KV 缓存注入噪声,模拟推理中的误差,引导模型从历史帧中提取运动信息,从参考帧中提取稳定细节,避免误差积累。

  • 实时交互技术结合麦克风和摄像头输入,通过音频和视频信号实时驱动数字人模型,实现低延迟的交互响应。优化生成速度和延迟,达到 20FPS 的实时生成速度,首帧延迟仅 2.89 秒,确保流畅的交互体验。

Live Avatar的项目地址

  • 项目官网:https://liveavatar.github.io/
  • GitHub仓库:https://github.com/Alibaba-Quark/LiveAvatar
  • HuggingFace模型库:https://huggingface.co/Quark-Vision/Live-Avatar

Live Avatar的应用场景

  • 电商直播:Live Avatar 能实现 7×24 小时不间断产品展示与讲解,降低人力成本,提升直播效率。

  • 新闻播报:模型支持自动生成虚拟主播播报新闻,快速生成多语言视频,提高新闻时效性。

  • 娱乐直播:虚拟偶像通过 Live Avatar 实时互动表演,举办线上演唱会等活动,增强观众参与感。

  • 智能客服:数字人客服可实时回答用户问题,提供 24 小时不间断服务,提升用户体验。

  • 银行柜员:虚拟金融顾问提供标准化业务咨询,辅助人工服务,提升银行运营效率。

📝 站长洞察 (Editor’s Insight)

Live Avatar的发布标志着数字人技术从‘演示可用’迈向‘生产就绪’的关键一步。其140亿参数模型与流式生成架构,结合滚动RoPE、自适应注意力池等创新,系统性解决了长时生成的身份漂移难题,这正是此前许多方案无法商用的核心障碍。20FPS的实时生成能力,使数字人真正具备了实时交互的可能,深度契合电商、客服等场景对即时响应的要求。阿里与高校的联合开源模式,不仅加速技术普惠,更可能催生新一轮数字人应用创新潮。从行业视角看,这预示着数字人正从‘高成本定制’走向‘标准化、实时化、无限时长’的新阶段,为元宇宙、AI Agent的落地提供了关键基础设施。