ElevenLabs推出Music v2.5音频模型,同时开放APP与API访问

ElevenLabs推出Music v2.5音频模型:生成式音乐迈向实用化新阶段

2025年5月,ElevenLabs正式发布其最新音频生成模型 **Music v2.5**,并同步开放了独立的移动端APP以及面向开发者的API访问通道。这一举措标志着这家以语音合成闻名的公司,正加速从“语音克隆”向“全品类音频生成”战略转型,同时也意味着AI音乐创作工具真正走向了消费级市场。

模型升级:更可控的创作与更真实的音质

据官方技术说明,Music v2.5相较于前代v2.0在三个维度实现了显著跃升。首先是**指令跟随能力**:模型能够更精准地理解自然语言提示中的风格、节奏、乐器编配等复杂描述,例如“带有爵士钢琴的电子舞曲,120BPM”可被直接转化为结构完整的音频片段,而非此前常见的模糊混奏。其次是**音频保真度**:通过引入新的扩散后处理模块,v2.5生成的音频采样率提升至48kHz,乐器分离度与动态范围接近专业录音棚水准,大幅降低了AI音乐常见的“数码感”与压缩伪影。第三是**时长扩展**:单次生成上限从30秒延长至120秒,且支持循环结构与淡出处理,更符合音乐制作的实际需求。

开放APP与API:降低门槛,构建生态

同步推出的ElevenLabs Music APP(iOS/Android)将核心功能封装为直观的“哼唱+文字”双输入界面,用户可录制一段人声旋律或哼唱作为参考,再配合文字描述进行风格化重塑。这一设计降低了音乐创作的专业门槛,目标用户从专业制作人扩展至短视频创作者、播客主播和普通爱好者。

更值得关注的是API的全面开放。开发者可通过RESTful接口将Music v2.5嵌入游戏音效生成、实时背景音乐、个性化视频配乐等场景。结合ElevenLabs此前成熟的语音合成API,开发者能构建“文本→语音→音乐”的全链路音频生成管线,这对独立游戏、短剧制作和虚拟人直播领域具有潜在价值。

行业影响与挑战

Music v2.5的推出使ElevenLabs直接对标Suno、Udio等专注于AI音乐生成的竞品。其差异化优势在于**多模态输入**(语音+文字)和**生态协同**(与语音模型的无缝衔接),但版权归属和训练数据合规性仍是悬而未决的问题。此外,模型对中文歌词和民族乐器的支持程度尚未公布,在国内市场的落地仍有待观察。总体而言,本次更新将AI音乐从“实验性玩具”推向了“生产力工具”的临界点。

相关文章