共计 1536 个字符,预计需要花费 4 分钟才能阅读完成。
美团发布 LongCat-AudioDiT 音频生成模型: 说话人相似度指标提升至 0.818, 现已开源
IT 之家 4 月 2 日消息, 美团昨天发布 LongCat-AudioDiT 音频生成模型, 彻底抛弃梅尔谱等中间表示, 直接在波形潜空间进行基于扩散模型的文本转语音(TTS), 号 …
在 AI 语音合成领域,一项新的技术突破正引发关注 。美团近日正式发布了名为 LongCat-AudioDiT 的音频生成模型, 该模型通过直接在波形潜空间进行建模, 实现了更高效、更逼真的文本转语音(TTS) 效果, 并已在多个测试集上超越当前主流模型。
📌 传统 TTS 的瓶颈与挑战
长期以来,业界主流的文本转语音引擎普遍采用“多阶段”处理流程。这种流程通常需要先预测中间声学特征(如梅尔频谱), 再通过独立的神经声码器将这些特征转换为最终的音频波形。这种在两个不同空间之间“传话”的方式, 不可避免地会累积误差, 导致合成声音在保真度和个性化细节上有所损失。
具体来说, 传统方法的局限性主要体现在:
- 流程复杂: 多阶段处理增加了系统复杂度和计算开销。
- 误差累积: 特征预测与波形生成之间的转换容易引入失真。
- 细节丢失: 高保真、个性化的音色特征难以完全保留。
🔍 LongCat-AudioDiT 的核心创新
LongCat-AudioDiT 模型的核心思路是简化架构,直接在波形潜空间完成整个生成过程 。它仅使用一个波形变分自编码器(Wav-VAE) 和一个扩散 Transformer(DiT), 实现了声音的压缩、建模与重建一体化处理。
这一设计带来了多方面的技术优势:
- 架构简化: 抛弃中间表示, 减少误差传递路径。
- 高效建模: 采用高效下采样与多尺度建模, 提升处理效率。
- 训练稳定: 通过非参数捷径和对抗式多目标训练, 增强模型鲁棒性。
此外, 模型的骨干网络基于 Transformer 架构,并集成了全局自适应层归一化(Global AdaLN)、QK-Norm 与 RoPE 等优化技术, 有效稳定了注意力训练过程。同时, 通过双重约束机制, 解决了流匹配 TTS 中常见的“训练 - 推理”不匹配问题。
💡 性能表现与开源情况
在性能方面,LongCat-AudioDiT 展现了令人印象深刻的结果 。其 3.5B 参数版本在 Seed-ZH 测试集上的说话人相似度(SIM) 指标达到了 0.818, 在 Seed-Hard 测试集上也达到了 0.797。这一成绩超过了包括 Seed-TTS、CosyVoice3.5、MiniMax-Speech 在内的多个知名模型。
美团称, 该模型“突破零样本 TTS 音色克隆上限”, 意味着在无需大量目标说话人数据的情况下, 也能实现高质量的音色模仿。
目前, 美团已经将该模型开源,提供了 1B 和 3.5B 两个参数版本, 相关论文、代码和模型权重均已公开, 方便研究者和开发者进一步探索与应用。
📊 行业影响与未来展望
LongCat-AudioDiT 的发布,为 AI 语音合成领域带来了新的技术思路。其直接波形潜空间建模的方法, 不仅提升了合成质量, 也为后续研究提供了可借鉴的架构范式。
从应用角度看, 这项技术有望在多个场景中发挥作用:
- 智能助手: 提升语音交互的自然度和个性化体验。
- 内容创作: 为有声书、播客等提供更逼真的语音合成支持。
- 无障碍技术: 帮助语音障碍者生成更接近本人音色的语音。
随着模型的开源, 预计将有更多团队基于此进行优化与拓展, 进一步推动 AI 语音技术的发展。
🚀 总结
美团 LongCat-AudioDiT 模型的推出,标志着 AI 语音合成在技术路径上的一次重要演进。通过简化架构、直接波形建模, 它在音色克隆质量上取得了显著提升, 并为行业提供了新的开源选择。未来, 随着技术的不断成熟与应用场景的拓展, 这类模型有望在更多领域发挥价值, 推动语音交互体验的持续升级。