返回全部动态
无监督在线策略自蒸馏:仅靠内部一致性提升大模型推理
原标题:On-Policy Self-Distillation without Any Supervision
AI 摘要
该研究提出无监督在线策略自蒸馏方法(U-OPSD),仅利用模型自身生成和内部一致性(多数投票)构建伪解决方案,无需外部监督即可纠正模型自信的错误。在多个数学推理基准上,U-OPSD 在 Qwen3 非思考模式下相比基础模型提升 8.5% 和 10.7%,并优于或持平于有监督方法 OPSD 和 GRPO。代码已开源。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
On-Policy Self-Distillation without Any Supervision Abstract Unsupervised on-policy self-distillation improves large language models by using internal consistency and majority-vote pseudo-solutions to correct confident errors without external supervision. On-policy (Self-)Distillation (OPD / OPSD) has shown strong potential for post-training large language models (LLMs). However, existing methods still rely heavily on external supervision, including ground-truth signals, environmental feedback,
发布时间:—
抓取时间:2026-08-12 05:42
来源机构:Hugging Face