谷歌为 Gboard 加入 Gemini 听写功能:一句话混用多语言也能识别

127次阅读
没有评论

共计 1175 个字符,预计需要花费 3 分钟才能阅读完成。

核心摘要

谷歌 Gboard 输入法新增 Gemini 驱动听写功能, 可识别一句话中的多种语言

一句话

谷歌正在把输入法变成更主动的 AI 工具。 在 Android Show: I/O Edition 2026 活动上, 谷歌宣布为自家输入法 Gboard 引入一项名为 Rambler 的 AI 语音听写能力。它不只是把语音转换成文字, 还会尝试理解说话过程中的停顿、口误修正, 以及一句话中不同语言之间的切换。

📌 Gboard 新增 Rambler:Gemini 驱动语音听写

Rambler 将集成在 Gboard 中, 这意味着用户无需单独打开专门的听写应用, 只要在支持输入的场景中调用 Gboard, 就有机会使用这项语音转写功能。谷歌在发布中将其描述为一种覆盖全应用场景的输入能力, 试图让语音输入更接近日常说话方式。

与传统听写相比,Rambler 的重点不只是识别词语本身, 而是处理真实表达中的“杂质”。例如用户说话时常见的“呃”“啊”等填充词, 系统可以自动去除, 从而让输出文本更简洁。

🔍 可理解临时改口, 不再机械照录

谷歌特别提到,Rambler 能够识别用户在一句话中临时修改的信息。比如用户先说“周三下午 3 点见面”, 随后又补充“呃,2 点”, 系统会理解这是对前面时间的修正, 而不是简单把所有内容原样记录下来。

这类能力对于移动端输入很关键。 语音听写过去常常需要用户先把话想完整再说 , 否则修改成本较高; 如果 AI 能理解自然口语中的纠正逻辑, 语音输入就更像一次顺畅的对话, 而不是一次严格的朗读。

💡 支持“代码切换”: 同一句话可混用多种语言

Rambler 采用基于 Gemini 的多语言模型, 并支持所谓“代码切换”。简单来说, 用户可以在同一句话里从一种语言切到另一种语言, 系统仍会尽量保持上下文连续, 不因语言变化而中断识别。

  • 自动清理填充词: 减少“呃”“啊”等口语停顿进入文本。
  • 理解即时修正: 识别说话者对时间、地点等信息的临时改口。
  • 多语言连续识别: 支持一句话中切换语言, 并尽量保留上下文。
  • 跨应用使用: 作为 Gboard 功能, 可覆盖更多输入场景。

📊 隐私提示与处理方式成为关注点

针对外界可能将 Rambler 与第三方听写工具进行对比的隐私顾虑, 谷歌 Android Core Experiences 负责人 Ben Greenwood 表示, 相关能力结合了设备端与云端处理, 并称公司已在安全和隐私友好方面进行了长期投入。不过, 具体哪些任务在本地完成、哪些需要云端参与, 当前公开信息仍较有限。

🚀 先登陆 Galaxy 与 Pixel, 后续扩展至更多 Android 设备

按照谷歌公布的节奏,Rambler 初期将在今年夏季面向三星 Galaxy 和谷歌 Pixel 手机上线, 之后再扩展到其他 Android 设备。对于 Android 生态而言,Gboard 是覆盖范围很广的输入入口, 如果该功能体验成熟, 可能会推动更多用户重新尝试语音输入。

本文基于公开信息整理, 如有侵权请联系删除。
正文完
 0