返回全部动态

无参考后训练提升开源大模型多语言机器翻译质量

原标题:Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

Hugging Face Daily Papers一手来源研究质量 82

AI 摘要

该研究提出了一种针对多语言机器翻译的无参考后训练方法,从监督微调的MiLMMT-46-v0.1模型出发,应用GRPO算法结合两个无参考质量估计模型的平均奖励,并通过语言识别门控,最后对SFT和RL检查点进行线性插值得到MiLMMT-46-v1.0。在46种语言上,该模型持续优于SFT版本,并超越Seed-X、HY-MT2、TranslateGemma等开源基线,在无参考评分上领先Google Translate、Gemini 3 Pro和GPT-5等专有系统。研究还发现,在线策略蒸馏能达到但未超越RL加检查点插值的质量前沿,并已发布模型和代码。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation Abstract Open multilingual translation models are improved via group relative policy optimization with reference-free quality rewards and checkpoint interpolation, surpassing strong open and proprietary baselines. We study reference-free post-training for multilingual machine translation with open large language models. Starting from the supervised-finetuned MiLMMT-46-v0.1 models, we apply Group Relat


发布时间:—
抓取时间:2026-08-12 13:20
来源机构:Hugging Face
阅读原文huggingface.co