返回全部动态

Oruk AI 发布 25 语言语音识别模型 Orukeet

原标题:oruk/orukeet

Hugging Face New and Trending Models一手来源模型发布质量 73

AI 摘要

Oruk AI 联合斯坦福、剑桥等机构发布 Orukeet,一个基于 NVIDIA Parakeet TDT 0.6B v3 微调的 25 语言语音识别模型。该方法将编码器一半的时序深度可分离滤波器替换为 12,288 个拟合后冻结的 Gabor 核,仅训练其余参数。在 74 个测试划分中的 61 个上超过 Parakeet,LibriSpeech test-clean WER 为 1.46%(对比 1.53%),25 种 FLEURS 语言合并 WER 为 9.85%(对比 11.01%)。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

--- language: [bg, hr, cs, da, nl, en, et, fi, fr, de, el, hu, it, lv, lt, mt, pl, pt, ro, ru, sk, sl, es, sv, uk] license: cc-by-sa-4.0 base_model: nvidia/parakeet-tdt-0.6b-v3 base_model_relation: finetune pipeline_tag: automatic-speech-recognition library_name: nemo transcribe_cpp: streaming: false translate: false lang_detect: true timestamps: token tags: [parakeet, tdt, onnx, sherpa-onnx, gguf, multilingual, speech-recognition, gabor, fastconformer] --- <!-- orukeet-brand:start -->


发布时间:2026-09-25 04:33
抓取时间:2026-09-25 03:21
来源机构:Hugging Face
阅读原文huggingface.co