美团开源LongCat-AudioDiT音频生成模型,零样本音色克隆再突破

120次阅读
没有评论

共计 1550 个字符,预计需要花费 4 分钟才能阅读完成。

Analysis

美团发布 LongCat-AudioDiT 音频生成模型: 说话人相似度指标提升至 0.818, 现已开源

在人工智能语音合成领域,一项新的技术突破正引发关注。美团近期正式发布并开源了名为 LongCat-AudioDiT 的音频生成模型, 其核心目标直指“零样本音色克隆”的性能上限, 并已在关键指标上取得了亮眼成绩。

📌 传统 TTS 的瓶颈与革新方向

长期以来,主流的文本转语音 (TTS) 系统普遍采用一种“多阶段”的处理流程。简单来说, 这类系统通常需要先将文本转换为梅尔频谱等中间声学特征, 然后再通过一个独立的神经声码器将这些特征“翻译”成最终的音频波形。这种在两个不同表示空间之间进行转换的方式, 虽然技术成熟, 但也存在固有的缺陷。

最大的问题在于误差累积。每一次转换都可能丢失一部分原始信息 , 导致最终合成的语音在保真度和个性化细节上有所折损, 听起来可能不够自然或缺乏说话人独特的音色质感。这成为了提升 TTS, 尤其是零样本音色克隆(即仅凭少量甚至无需目标说话人语音样本即可模仿其音色) 效果的主要障碍。

🔍 LongCat-AudioDiT 的核心架构创新

美团 LongCat-AudioDiT 模型的设计思路,正是为了从根本上绕过上述瓶颈。它摒弃了传统的中间特征表示, 选择了一条更为直接的路径。

该模型的核心架构非常简洁, 主要由两部分构成:

  • 波形变分自编码器(Wav-VAE): 负责将原始音频波形高效地压缩到一个低维的“潜空间”中。
  • 扩散 Transformer(DiT): 在这个波形潜空间内, 直接基于文本输入进行扩散建模, 逐步生成目标语音的潜表示。

这意味着,声音的压缩、建模和重建全过程都在统一的波形隐空间内完成, 避免了不同空间转换带来的信息损失。为了支撑这一架构, 研究团队还引入了多项技术创新, 例如高效的下采样与多尺度建模策略、用于稳定训练的非参数捷径, 以及结合对抗式训练的多目标优化方法。

这种“端到端”在波形空间建模的思路, 旨在最大化保留原始声音的高保真细节, 为音色克隆的逼真度打下基础。

💡 技术细节与性能表现

在模型骨干网络上,LongCat-AudioDiT 基于 Transformer 构建, 并集成了多项前沿的结构优化技术, 以提升训练稳定性和表现力, 包括全局自适应层归一化(Global AdaLN), 以及结合了 QK-Norm 与 RoPE 的注意力稳定机制。此外, 模型还通过一种双重约束机制, 专门针对流匹配 TTS 中常见的“训练 - 推理”不匹配问题进行了修复。

那么, 它的实际效果如何? 根据公布的数据,其参数量为 3.5B 的版本在权威测试集上取得了突破性进展:

  • 在 Seed-ZH 测试集上,说话人相似度 (SIM) 指标达到了 0.818。
  • 在更具挑战性的 Seed-Hard 测试集上, 该指标也达到了 0.797。

这一成绩已经超过了包括 Seed-TTS、CosyVoice3.5、MiniMax-Speech 在内的多个当前知名的音频生成模型,显示出其在音色模仿保真度上的竞争优势。

📊 开源影响与行业看点

此次美团不仅发布了模型,更关键的一步是将其全面开源。目前, 模型的 1B 和 3.5B 参数版本均已公开, 相关论文、代码及模型权重已在学术平台和开源社区发布, 可供研究人员和开发者自由获取、研究与应用。

这一举动可能为行业带来几个值得关注的看点:

🚀 总结

总体来看,美团 LongCat-AudioDiT 的发布, 是音频生成领域一次聚焦于核心瓶颈的技术突破。它通过架构简化与多项技术创新, 在关键的说话人相似度指标上实现了显著提升。模型的全面开源, 进一步放大了其技术价值, 有望吸引社区共同参与, 推动语音合成技术向更自然、更个性化、更易获取的方向持续演进。未来, 基于此类技术的实际应用落地与用户体验, 将成为新的观察焦点。

以上为阶段性观察。
本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0