人工智能 美团发布LongCat-AudioDiT音频生成模型,零样本音色克隆能力再突破 美团近日开源了LongCat-AudioDiT音频生成模型,该模型采用全新架构,直接在波形潜空间进行文本转语音,显著提升了说话人相似度指标,在多个测试集上超越了当前主流模型。
人工智能 美团开源LongCat-AudioDiT音频生成模型,零样本音色克隆再突破 美团近日发布并开源了LongCat-AudioDiT音频生成模型,该模型采用全新架构,直接在波形潜空间进行文本转语音,显著提升了说话人相似度指标,在多个测试集上超越了当前主流模型。
科技 美团发布LongCat-AudioDiT音频生成模型,说话人相似度达0.818并开源 美团近日发布LongCat-AudioDiT音频生成模型,采用波形潜空间直接建模,彻底抛弃传统梅尔谱中间表示,在零样本音色克隆上取得突破,说话人相似度指标提升至0.818,现已开源。