行业分析 Stability AI 发布 Stability Audio 3.0:AI 作曲最长可达 6 分钟以上 Stability AI 推出 Stability Audio 3.0 音频模型家族,覆盖端侧与云端场景,最高可生成 6 分钟 20 秒完整乐曲。
科技 美团发布LongCat-AudioDiT音频生成模型,说话人相似度达0.818并开源 美团近日发布LongCat-AudioDiT音频生成模型,采用波形潜空间直接建模,彻底抛弃传统梅尔谱中间表示,在零样本音色克隆上取得突破,说话人相似度指标提升至0.818,现已开源。