谷歌发布 Gemini 3.8 Flash TTS 系列:语音生成转向动态创作,逐行台词可控

3次阅读
没有评论

共计 1317 个字符,预计需要花费 4 分钟才能阅读完成。

信息整理

谷歌推出 Gemini 3.8 Flash / Flash-Lite 文本转语音模型, 每一行台词都能精确控制

谷歌在 Gemini 家族中新增两款文本转语音模型——Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。官方将其定位为把语音生成从静态预设升级为动态创作工具, 面向创作者、开发者和企业, 并同步改善 Gemini Notebook 与 Google Vids 的音频体验。

📌 两款模型的分工

  • Gemini 3.8 Flash TTS: 聚焦深度创意与角色设计, 可通过自然语言提示从零创建全新语音, 适用于游戏、沉浸式有声读物、播客和互动媒体, 并支持对表演提示、节奏、方言转换等进行精细控制。
  • Gemini 3.8 Flash-Lite TTS: 面向大容量、高性价比的规模场景, 优化了大容量配音、音频内容创作和富有表现力的语音代理, 可对音调、节奏和表现力细节进行控制。

🔍 从 30 种预设到 2000+ 语音库

用户原有的 30 种原始语音选择被大幅扩展。新模型支持通过自然语言在 100 多种语言和方言中自定义角色、口音和语音特征, 并可直接访问超过 2000 种现成语音, 覆盖墨西哥西班牙语、魁北克法语、苏格兰英语等区域变体。语音复制功能仅需 30 秒音频样本即可重现一致的声音特征, 同时内置同意验证、SynthID 水印和 C2PA 凭据。

💡 逐行控制与长篇生成能力

  • 逐行指导表演: 可编写舞台指导, 或让 Gemini 通过自然脚本提示引导交付, 覆盖平静客服到低声悬疑等场景。
  • 长篇生成: 在数小时连续音频中保持高语音质量、自然节奏和角色音色, 扬声器漂移极小, 适合播客和有声读物。
  • 原生双声音场景编排: 从单个脚本无缝指导多轮对话, 保持两种声音清晰分离。
  • 脚本化声音爆发和背景反馈 : 可添加非语言提示(如 ) 和主动倾听插入语(如 mhm、yeah), 增强对话真实感。

📊 性能表现与安全措施

在 Hume AI 的语音设计基准测试中 ,Gemini 3.8 Flash TTS 以 71.4 分位居总体第一, 口音建模得分 60.8 分同样领先。两款模型在 Hume AI 整体质量指数中分别占据第一和第二, 相比 Gemini 3.1 Flash TTS 在长格式内容和双扬声器剧本控制等场景有显著改进。在 Voice Arena 的盲法人类偏好评估中, 两款模型在全球主要语言(日语、巴西葡萄牙语、越南语、现代标准阿拉伯语、墨西哥西班牙语和印地语) 的竞争对手中处于领先位置。

谷歌在语音创建和复制功能中内置了严格保护措施: 语音复制需提供来自语音所有者的口头同意记录, 并与参考说话者匹配后才能创建; 所有生成的音频片段都带有难以察觉的 SynthID 水印, 帮助检测 AI 生成语音。

🚀 可用性与行业影响

即日起, 开发者可在 Google AI Studio 中体验新功能, 通过提示创建全新声音身份或复制自己的声音, 并带入双扬声器剧本编辑器逐行指导。两款模型均已通过 Gemini API 和 Google AI Studio 向开发者推送; 企业用户很快可通过 Gemini Enterprise 中的 API 使用; 普通用户则可在 Gemini Notebook 中使用 Gemini 3.8 Flash TTS, 在 Google Vids 中使用 Flash-Lite TTS。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0
评论(没有评论)
验证码