共计 1617 个字符,预计需要花费 5 分钟才能阅读完成。
美团发布 LongCat-AudioDiT 音频生成模型: 说话人相似度指标提升至 0.818, 现已开源
建议按 ” 变化—原因—影响 ” 的顺序阅读。
在人工智能语音合成领域,追求更自然、更逼真的音色克隆一直是技术演进的核心目标 。近日, 美团发布并开源了名为 LongCat-AudioDiT 的音频生成模型, 其宣称在零样本文本转语音(TTS) 的音色克隆能力上取得了重要突破, 为这一赛道带来了新的技术思路。
📌 传统 TTS 的瓶颈与挑战
长期以来,业界主流的语音合成引擎普遍采用一种“多阶段”的处理流程。简单来说, 模型需要先预测出梅尔频谱等中间声学特征, 然后再通过一个独立的神经声码器将这些特征“翻译”成最终我们能听到的音频波形。这个过程就像在两个不同的语言空间里进行信息传递, 每一次转换都可能引入误差, 导致最终合成的声音在保真度和个性化细节上有所损失, 听起来不够自然、缺乏“人味”。
🔍 LongCat-AudioDiT 的核心创新: 化繁为简
美团此次推出的 LongCat-AudioDiT 模型,其核心思路正是为了从根本上解决上述问题 。它彻底抛弃了传统的中间表示环节, 选择直接在波形的潜在空间(潜空间) 里, 利用扩散模型 (Diffusion Model) 来完成从文本到语音的端到端生成。
模型的架构设计非常简洁, 主要由两部分构成:
- 波形变分自编码器(Wav-VAE): 负责将原始音频波形高效地压缩到一个低维的潜空间表示中。
- 扩散 Transformer(DiT): 在这个潜空间内, 基于输入的文本条件, 学习并生成对应的音频潜表示。
通过这种方式,声音的压缩、建模与重建全部在同一个连贯的空间内完成, 避免了多阶段流程中的信息损耗。此外, 模型还集成了多项技术创新来保障效果与稳定性, 例如高效的下采样与多尺度建模、非参数捷径以稳定训练过程, 以及对抗式多目标训练等。
💡 技术细节与性能表现
在模型骨干网络上,LongCat-AudioDiT 基于强大的 Transformer 架构 , 并进行了多项优化。它集成了全局自适应层归一化(Global AdaLN), 并采用了 QK-Norm 结合 RoPE(旋转位置编码) 的技术来稳定注意力机制的训练。更重要的是, 模型通过一套双重约束机制, 有效修复了在流匹配 TTS 中常见的“训练 - 推理”不匹配问题, 使得模型在实际应用中的表现更加可靠。
那么, 它的实际效果如何? 根据公布的数据,其参数量为 35 亿 (3.5B) 的版本在权威测试集上表现亮眼:
- 在 Seed-ZH 测试集上, 其说话人相似度 (SIM) 指标达到了0.818。
- 在更具挑战性的 Seed-Hard 测试集上,SIM 指标也达到了0.797。
这一成绩已经超过了包括 Seed-TTS、CosyVoice3.5、MiniMax-Speech 在内的多个当前知名的音频生成模型,显示出其在音色保真和克隆能力上的领先优势。
📊 开源发布与行业影响
目前, 美团已经将 LongCat-AudioDiT 模型在 GitHub、Hugging Face 等平台开源 , 并同步发布了相关技术论文。开源版本包括了 10 亿(1B) 和 35 亿 (3.5B) 参数两种规格, 供研究者和开发者自由使用、研究和改进。
这一举动不仅展示了美团在 AI 底层技术上的投入与积累,也为整个语音合成社区贡献了一个新的、高性能的基线模型。
该模型的成功, 可能为行业带来几个值得关注的看点:
- 技术路径验证: 证明了直接在波形潜空间进行端到端扩散模型生成是一条可行的、高效的技术路线, 可能会引导更多研究向此方向探索。
- 应用前景拓宽: 更高保真度的零样本音色克隆能力, 可以极大地丰富有声内容创作、虚拟人交互、个性化语音助手等场景的应用体验。
🚀 总结与展望
总体来看,美团 LongCat-AudioDiT 的发布, 是 AI 语音合成领域一次重要的技术迭代。它通过架构上的大胆简化与多项精细优化, 在核心的说话人相似度指标上取得了显著提升。其开源策略也体现了技术共享与推动行业发展的积极态度。