惯性聚合 高效追踪和阅读你感兴趣的博客、新闻、科技资讯
阅读原文 在惯性聚合中打开

推荐订阅源

L
LangChain Blog
J
Java Code Geeks
P
Proofpoint News Feed
Recent Announcements
Recent Announcements
罗磊的独立博客
H
Hackread – Cybersecurity News, Data Breaches, AI and More
博客园_首页
Hugging Face - Blog
Hugging Face - Blog
MongoDB | Blog
MongoDB | Blog
人人都是产品经理
人人都是产品经理
博客园 - 【当耐特】
雷峰网
雷峰网
D
DataBreaches.Net
B
Blog RSS Feed
钛媒体:引领未来商业与生活新知
钛媒体:引领未来商业与生活新知
博客园 - 聂微东
V
Visual Studio Blog
Apple Machine Learning Research
Apple Machine Learning Research
N
Netflix TechBlog - Medium
OSCHINA 社区最新新闻
OSCHINA 社区最新新闻
Martin Fowler
Martin Fowler
有赞技术团队
有赞技术团队
Blog — PlanetScale
Blog — PlanetScale
Engineering at Meta
Engineering at Meta

Prompt 语宙

kimi-thinking-preview – 月之暗面推出的多模态思考模型 pdf-craft – 开源 PDF 转 Markdown 工具 UltraMem – 字节豆包大模型团队推出的全新超稀疏模型架构 EasyControl – Tiamat AI 联合上海科大等开源的图像生成控制框架 GaussianCity – 南洋理工大学 S-Lab 团队推出的 3D 城市生成框架 X-Prompt – 用于多模态视频目标分割的通用框架 豆包大模型1.5 – 字节跳动推出的最新版大模型 GaussianAnything – 南洋理工 S-Lab 和上海 AI Lab 等推出的 3D 生成框架 Cube 3D – Roblox 推出的 AI 3D 生成模型 OpenMath-Nemotron – 英伟达开源的数学推理系列模型 MAI Transcribe-1.5 – 微软 MAI 推出的语音转文本模型 Seed1.5-Embedding – 字节跳动 Seed 团队推出的向量模型 2026世界杯人机大战引爆!联想携手DeepSeek等顶尖AI大模型,对战亿万球迷预测冠军 高考公平守护战!豆包、文心等主流大模型集体禁用拍题功能 ShotAdapter – Adobe联合UIUC推出的多镜头视频生成框架 Devstral – Mistral AI联合All Hands AI开源的编程专用AI模型 MMaDA – 字节联合普林斯顿大学等推出的多模态扩散模型 Software Copyright Materials Skill – 开源软著资料生成Skill Dulus – 开源的 CLI AI Agent,可驱动多模型工具调用 Reasonix – 专为 DeepSeek 推出的开源终端编程 Agent Mega-ASR – NTU、NUS、上海AI Lab开源的语音识别模型 CodeGraph – 开源代码知识图谱工具,加速代码理解和分析 MiniCPM5-1B – 面壁智能联合清华开源的端侧文本基座模型 Horizon – 开源 AI 信息聚合系统,构建专属新闻雷达 BitCPM-CANN – 面壁智能联合清华开源的端侧大模型 Xiaomi Auto World Model – 小米推出的辅助驾驶世界模型 opera-browser-cli – Opera Neon 开源的命令行工具 omp – 开源的 AI 终端编程智能体,能与 IDE 深度联动 Claude Opus 4.8 – Anthropic 推出的旗舰级大语言模型 Hy-Memory – 腾讯混元推出的 Agent 记忆插件
腾讯AI Lab发布SongBloom:全长度AI歌曲生成模型,10秒样本生...
站外新闻 · 2026-06-20 · via Prompt 语宙

💡 站外导读:随着AIGC技术的爆发,AI音乐生成正从“玩具”走向实用工具,但如何生成结构完整、音质卓越的全长度歌曲仍是巨大挑战。腾讯AI Lab最新推出的SongBloom框架,通过创新的“交错生成”技术,结合自回归与扩散模型,一举解决了这一痛点。用户只需提供10秒样本和歌词,就能获得长达2分30秒的专业级歌曲,这标志着AI音乐创作进入了新的实用化阶段。

SongBloom 是腾讯 AI Lab 开发的全长度歌曲生成框架,结合了自回归草图绘制和基于扩散的细化技术,通过交错生成范式(Interleaved Generation)交替生成语义和声学上下文,生成高质量的完整歌曲。模型只需输入 10 秒音频样本和对应歌词,即可生成长达 2 分 30 秒的双通道、48kHz 音频。SongBloom 在音频质量和歌词准确性方面表现出色,接近领域最佳水平(SOTA),已成功开源。

  • SongBloom是什么
  • SongBloom的主要功能
  • SongBloom的技术原理
  • SongBloom的项目地址
  • SongBloom的应用场景
      • 📝 站长洞察 (Editor’s Insight)

SongBloom

SongBloom的主要功能

  • 高效歌曲生成:仅需 10 秒音频样本和对应歌词,即可生成长达 2 分 30 秒的完整歌曲,支持双通道、48kHz 高质量音频输出。

  • 创新生成范式:采用交错生成范式,结合自回归草图绘制和基于扩散的细化技术,交替生成语义和声学上下文,优化歌曲整体结构和音质。

  • 卓越音质与准确性:在音频质量和歌词准确性方面表现出色,接近领域最佳水平(SOTA),超越现有开源模型。

  • 开源与易用性:项目已开源,提供详细的使用指南和多种模型版本,支持低显存设备运行,方便用户快速上手。

  • 广泛的应用前景:为音乐创作、音频制作等领域提供了强大的工具,能够显著提升创作效率,激发音乐创作的新灵感。

SongBloom的技术原理

  • 交错生成范式:通过交替生成语义和声学上下文,动态切换生成过程,优化歌曲整体结构和音质。

  • 自回归草图绘制:利用自回归模型生成音乐草图,确保结构连贯性和音素对齐。

  • 扩散模型细化:结合扩散模型对生成的草图进行高保真细化,提升音频质量。

  • 离散与连续输出结合:使用离散的 sketch token 和 VAE latent 输出最终结果,兼顾结构和音质。

  • 多模态输入融合:输入包含歌词和音频样本,模型通过多模态融合实现精准生成。

SongBloom的项目地址

  • Github仓库:https://github.com/tencent-ailab/SongBloom
  • HuggingFace模型库:https://huggingface.co/CypressYang/SongBloom
  • arXiv技术论文:https://arxiv.org/pdf/2506.07634
  • 在线体验Demo:https://cypress-yang.github.io/SongBloom_demo/

SongBloom的应用场景

  • 音乐创作:为音乐人和创作者提供灵感,快速生成高质量的歌曲基础框架,帮助他们探索新的音乐风格和创作方向。

  • 音频制作:在影视、游戏、广告等行业的音频制作中,用于快速生成背景音乐或主题曲,提升制作效率。

  • 教育领域:作为音乐教育工具,帮助学生理解音乐结构和创作过程,激发学习兴趣。

  • 娱乐产业:在社交媒体、短视频等平台,为用户生成个性化的音乐内容,增强互动性和趣味性。

  • 商业应用:为企业和品牌生成定制化的音乐,用于产品推广、活动宣传等,提升品牌影响力。

📝 站长洞察 (Editor’s Insight)

SongBloom的发布不仅是技术上的突破,更揭示了AIGC领域下一个核心战场:高质量、长序列内容生成。它采用的“自回归草图+扩散细化”范式,巧妙地平衡了结构连贯性与音频保真度,这为解决视频、3D等领域的长程生成难题提供了新思路。更值得关注的是,腾讯将如此先进的模型开源,意在加速生态建设,这与当前大厂间“开放生态”的竞争策略不谋而合。可以预见,集成此类能力的AIGC平台,将彻底重塑游戏、影视、短视频行业的音频生产流程,催生全新的创作范式和商业模式。