🧊 前沿科技知识库
全部 / 人工智能(AI)

音乐与音频生成

2026-09-26 · 人工智能(AI)
最后更新:2026-09-26 | 领域:AI·生成与多模态 | 说明:信息来源为公开网络资料,详见文末参考来源

概述

音乐与音频生成覆盖三条主线:歌曲生成(Suno、Udio 等)、语音合成与识别(TTS/ASR,如 ElevenLabs、VibeVoice、Whisper 生态),以及音效与通用音频生成(Stable Audio、MusicGen 等)。2025–2026 年最显著的产业变化是「版权合规化」:头部音乐生成公司与唱片公司达成授权合作,并陆续以「完全授权训练数据」重建模型;同时开源权重音频模型的规模与质量快速提升。本周期三条主线的代表分别是:Suno 以授权曲库重建 v6、Stability AI 发布完全授权数据训练的 Stable Audio 3.0、Microsoft Research 开源 VibeVoice 语音模型家族(Suno Launches v6 AI Music Models with Licensed Catalogs、Meet Stable Audio 3.0、VibeVoice)。

最新进展(2025–2026)

核心技术与关键概念

代表性项目 / 公司 / 产品(附官方链接)

关键数据与评测结果(附来源)

趋势与争议

参考来源

← AI 安全攻防对话助手与语音(Conversational Assistants & Voice) →