人工智能 谷歌发布 Gemini 3.8 Flash TTS 系列:语音生成转向动态创作,逐行台词可控 谷歌推出 Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持自然语言定制语音、逐行控制表演,并内置 SynthID 水印与同意验证。
人工智能 AI语音人格化定制开启,谷歌Gemini推出四滑块调节功能 谷歌Gemini推出语音自定义功能,通过速度、活力、正式度、亲切感四个滑块精细化调整AI交流风格,标志着AI语音交互进入人格化定制新阶段。
科技 美团发布LongCat-AudioDiT音频生成模型,说话人相似度达0.818并开源 美团近日发布LongCat-AudioDiT音频生成模型,采用波形潜空间直接建模,彻底抛弃传统梅尔谱中间表示,在零样本音色克隆上取得突破,说话人相似度指标提升至0.818,现已开源。