返回全部动态

ESPnet 发布 OWSM-CTC v4 1B 开源语音基础模型

原标题:espnet/owsm_ctc_v4_1B

Hugging Face New and Trending Models一手来源模型发布质量 76

AI 摘要

ESPnet 团队发布 OWSM-CTC v4 1B 语音基础模型,基于分层多任务自条件 CTC 的纯编码器架构,在 32 万小时公开音频上训练三个 epoch,支持多语言语音识别、任意语言对语音翻译和语种识别。该模型完全开源,代码、权重和训练日志均已公开,其配套论文获得 INTERSPEECH 2025 最佳学生论文奖。模型提供批量推理、长音频解码和 CTC 强制对齐等使用示例。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- datasets: - espnet/yodas_owsmv4 language: multilingual library_name: espnet license: cc-by-4.0 metrics: - cer - bleu - accuracy tags: - espnet - audio - automatic-speech-recognition - speech-translation - language-identification pipeline_tag: automatic-speech-recognition --- 🏆 **News:** Our [OWSM v4 paper](https://www.isca-archive.org/interspeech_2025/peng25c_interspeech.html) won the [Best Student Paper Award](https://isca-speech.org/ISCA-Awards) at INTERSPEECH 2025! [Open Whisper-style S


发布时间:2026-09-20 18:00
抓取时间:2026-09-20 18:04
来源机构:Hugging Face
阅读原文huggingface.co