多语言语音识别中的Token Merging:跨模型规模与微调的系统研究
原标题:Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning
AI 摘要
该论文系统评估了 token merging 技术在多语言语音识别模型 Whisper 上的效果,覆盖十六种语言和三种模型规模。研究发现,合并 token 能提升计算效率,在大多数低资源语言和模型规模下几乎不损失转录准确率,且在 DoRA 微调后依然有效。结果表明 token merging 是一种让多语言语音识别部署更快、更便宜的高实用方法。
正文节选
Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning Abstract Leading multilingual speech recognition models like Whisper transcribe diverse, low-resource languages without language-specific training but are computationally expensive to deploy. Token merging mitigates this inefficiency by dynamically combining redundant features, shortening the sequence length during inference without requiring retraining. In this paper, we systematically eval