共计 1241 个字符,预计需要花费 4 分钟才能阅读完成。
科大讯飞发布全新语音识别大模型 Spark-ASR-2.0, 明日上线讯飞输入法
IT 之家 9 月 23 日消息, 今日, 科大讯飞正式发布最新一代语音识别大模型 Spark-ASR-2.0。
据官方介绍,Spark-ASR-2….
科大讯飞今日正式发布新一代语音识别大模型 Spark-ASR-2.0。官方称, 该模型在通用识别、复杂声学场景、上下文理解与文本流畅规范性等维度均有明显改善, 并将从明天起逐步上线讯飞输入法, 同时通过讯飞开放平台提供 API 服务。
📌 从“还原内容”到“流畅成文”
官方对 Spark-ASR-2.0 的定位是: 过去语音识别追求一字不差地还原所说内容, 而新一代模型更进一步, 让识别结果“流畅成文”。具体而言, 它在提升准确率的同时, 会结合上下文逻辑与语境理解, 精简冗余表达、精修细节, 使文字更连贯、语义更清晰。
如果说过去的语音识别追求的是一字不差地还原所说内容, 那么 Spark-ASR-2.0 则更进一步, 让识别结果“流畅成文”。
🔍 三项关键技术支撑效果提升
据官方介绍,Spark-ASR-2.0 的效果提升主要来自三方面技术创新:
- 非自回归与 LLM 增强自回归协同: 兼顾识别效率与语言理解能力;
- 中英文混合文本与声学联合增强: 针对混合语言场景优化识别表现;
- 动态上下文注入: 让模型在识别过程中更好地利用语境信息。
在这些技术支持下,模型在通用识别 (中英文混合、方言、专业术语)、复杂声学场景(高噪、小音量、快语速、儿童) 以及上下文识别和文本流畅规范性等方面改善明显。
💡 重点场景表现与成本控制
相较于 Spark-ASR-1.0,Spark-ASR-2.0 在中英文混合、方言、高噪声、文本流畅规范性等维度上的效果大幅提升,WER(词错误率)明显降低。官方称, 与当前业界最好水平相比,Spark-ASR-2.0 在方言、高噪和小音量场景上拥有显著优势, 主要任务效果均好于业界最优水平。
测试集来自语音真实任务请求数据,来源覆盖讯飞星火 APP、讯飞听见 APP、讯飞翻译机、讯飞输入法、讯飞开放平台语音 API 真实开发者场景等, 并进行滚动更新。ASR 任务使用 WER / CER 作为评价指标, 数值越低表示效果越好。
值得注意的是,在效果提升的同时,Spark-ASR-2.0 的整体推理成本相对 Spark-ASR-1.0 仅增加了 10%。
📊 落地节奏与产品覆盖
按照官方计划,Spark-ASR-2.0 将从明天开始逐步上线讯飞输入法, 并通过讯飞开放平台提供 API 服务。此外, 该模型还将陆续在讯飞 AI 眼镜、讯飞智能办公本、讯飞听见等更多产品业务上落地应用。
🚀 行业观察
语音识别赛道长期围绕准确率竞争, 而 Spark-ASR-2.0 将“流畅成文”和上下文理解作为差异化方向, 意味着评价标准可能从单纯的字准率向可读性与语义完整性延伸。在推理成本仅小幅增加的前提下, 这一能力若能在输入法、办公本、翻译机等高频场景稳定落地, 或将对语音交互体验带来实际改变。后续实际表现仍需以产品上线后的用户反馈为准。