返回全部动态

科大讯飞发布全国产算力语音识别大模型Spark-ASR-2.0

原标题:口语转录,一步到位!全国产算力语音识别模型,听得懂上下文了

智东西模型发布质量 60

AI 摘要

科大讯飞于9月24日推出语音识别大模型Spark-ASR-2.0,基于全国产算力训练的语音基座模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。该模型融合非自回归与LLM增强的自回归识别能力,通过投机解码实现先快速识别再重点纠错,推理成本较上代仅增10%,已上线讯飞输入法并通过讯飞开放平台提供API服务。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

智东西(公众号:zhidxcom) 作者 |  杨京丽 编辑 |  李水青 智东西9月24日报道,昨日,科大讯飞推出最新语音识别大模型Spark-ASR-2.0。该模型基于讯飞语音基座大模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。 值得注意的是,语音基座大模型Spark-Audio-1.0-Preview和语音识别模型Spark-ASR-2.0均基于全国产算力展开训练。讯飞正在以多年积累的智能语音技术和国产算力平台大模型训练经验为基础,持续推进语音基座模型、专用模型等技术迭代。 尽管大多数语音识别模型在日常使用中基本能够准确转写,但在嘈杂环境中输入、中英文混合输入,或者对专业会议进行转录时,仍可能出现错字、漏字;语气词、重复和临时改口,也常让转写结果需要二次整理。目前大部分语音识别模型的目标还停留在单纯的精准识别转写上。 为了验证Spark-ASR-2.0能否解决上述问题,智东西围绕通用识别、复杂声学场景识别、上下文识别、文本流畅规范性四个方向展开实测。 实测中,Spark-ASR-2.0整体识别表现较为稳定,


发布时间:—
抓取时间:2026-09-25 01:43
来源机构:智东西
阅读原文zhidx.com