共计 1143 个字符,预计需要花费 3 分钟才能阅读完成。
Stability AI 推出音频模型 Stability Audio 3.0, 可生成最长 6 分钟专业级歌曲
AI 音乐生成正在从“片段试玩”走向更完整的歌曲创作。Stability AI 最新推出的 Stability Audio 3.0, 将模型规格、生成时长和商业化路径进一步拉开层次, 其中高阶模型据称可生成超过 6 分钟的专业级音乐作品。
📌 Stability Audio 3.0 一次推出四档模型
此次发布的 Stability Audio 3.0 并非单一模型, 而是一个覆盖不同算力和使用场景的音频生成模型家族。根据已披露信息, 该系列包含四个规格: 约 4.59 亿参数的小型 SFX 与小型版、14 亿参数的中型版, 以及 27 亿参数的大型版。
这种分层设计意味着 Stability AI 希望同时服务两类需求: 一类是对本地运行、低延迟和可控成本有要求的开发者; 另一类则是希望生成更长、更完整音乐作品的专业用户或商业团队。
🔍 从短音频到完整乐曲, 生成时长明显提升
在能力定位上, 两款小型模型更偏向设备端运行 , 可在本地生成两分钟以内的声音或音乐内容。对于音效制作、短视频配乐草稿、互动应用中的即时音频生成等场景, 这类模型更容易落地。
中型和大型模型则主打更复杂的音乐结构控制。 官方披露的信息显示 , 它们能够生成最长约 6 分钟 20 秒 的完整乐曲, 并在较长时段内维持旋律走向和整体结构。相比 Stability AI 在 2024 年推出的 Stable Audio 2.0, 新版本在生成长度上实现了超过一倍的提升。
💡 开源与商业授权并行
Stability AI 这次延续了部分开放策略 。已知小型 SFX、小型版和中型模型开放给公众下载, 并允许用户修改权重。这对研究人员、独立开发者和音频工具团队来说, 意味着可以围绕模型进行二次开发。
- 开源部分: 小型 SFX、小型版与中型模型。
- 闭源服务: 大型模型通过 API 与托管服务使用。
- 商业门槛: 年营收超过 100 万美元的企业需获取商业授权。
📊 版权合规成为 AI 音乐竞争焦点
生成式音乐模型长期面临训练数据和版权争议。Stability AI 表示, 新音频模型基于合法授权的数据集训练。此前, 该公司已与华纳音乐集团、环球音乐集团展开合作, 这也被视为其降低合规风险、进入专业音乐市场的重要铺垫。
从行业角度看,AI 音乐工具能否被制作人、唱片公司和商业品牌采用 , 除了模型质量之外, 版权来源和授权边界同样关键。尤其是在广告、影视、游戏和流媒体等商业场景中, 合规可追溯可能会直接影响产品能否规模化应用。
🚀 面向专业音乐人的产品线仍待揭晓
Stability AI 还透露, 正在为专业音乐人打造新的产品线 , 但目前尚未公布具体功能。为了推进相关业务, 曾在环球音频与芬达担任首席数字官的伊桑·卡普兰已加入公司, 负责专业音乐产品方向。