人工智能 美团发布LongCat-AudioDiT音频生成模型,零样本音色克隆能力再突破 美团近日开源了LongCat-AudioDiT音频生成模型,该模型采用全新架构,直接在波形潜空间进行文本转语音,显著提升了说话人相似度指标,在多个测试集上超越了当前主流模型。