Oruk AI 发布 25 语言语音识别模型 Orukeet
原标题:oruk/orukeet
AI 摘要
Oruk AI 联合斯坦福、剑桥等机构发布 Orukeet,一个基于 NVIDIA Parakeet TDT 0.6B v3 微调的 25 语言语音识别模型。该方法将编码器一半的时序深度可分离滤波器替换为 12,288 个拟合后冻结的 Gabor 核,仅训练其余参数。在 74 个测试划分中的 61 个上超过 Parakeet,LibriSpeech test-clean WER 为 1.46%(对比 1.53%),25 种 FLEURS 语言合并 WER 为 9.85%(对比 11.01%)。
正文节选
--- language: [bg, hr, cs, da, nl, en, et, fi, fr, de, el, hu, it, lv, lt, mt, pl, pt, ro, ru, sk, sl, es, sv, uk] license: cc-by-sa-4.0 base_model: nvidia/parakeet-tdt-0.6b-v3 base_model_relation: finetune pipeline_tag: automatic-speech-recognition library_name: nemo transcribe_cpp: streaming: false translate: false lang_detect: true timestamps: token tags: [parakeet, tdt, onnx, sherpa-onnx, gguf, multilingual, speech-recognition, gabor, fastconformer] --- <!-- orukeet-brand:start -->