返回全部动态

多语言语音识别中的Token Merging:跨模型规模与微调的系统研究

原标题:Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning

arXiv cs.CL一手来源研究质量 82

AI 摘要

该论文系统评估了 token merging 技术在多语言语音识别模型 Whisper 上的效果,覆盖十六种语言和三种模型规模。研究发现,合并 token 能提升计算效率,在大多数低资源语言和模型规模下几乎不损失转录准确率,且在 DoRA 微调后依然有效。结果表明 token merging 是一种让多语言语音识别部署更快、更便宜的高实用方法。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Token Merging for Multilingual Speech Recognition: A Systematic Study Across Model Scale and Fine-Tuning Abstract Leading multilingual speech recognition models like Whisper transcribe diverse, low-resource languages without language-specific training but are computationally expensive to deploy. Token merging mitigates this inefficiency by dynamically combining redundant features, shortening the sequence length during inference without requiring retraining. In this paper, we systematically eval


发布时间:2026-09-15 12:00
抓取时间:2026-09-15 12:11
来源机构:arXiv
阅读原文arxiv.org