ABSeeker:通过答案回溯信用分配训练长时程搜索智能体
原标题:ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment
AI 摘要
Hugging Face 每日论文介绍了 ABSeeker,一种通过答案回溯信用分配(ABC)框架训练长时程搜索智能体的方法。ABC 将稀疏的轨迹级结果转化为密集的步骤级监督信号,奖励有用动作并抑制错误或冗余动作。基于 Qwen3.5-4B 训练的 ABSeeker 在 BrowseComp 和 BrowseComp-ZH 上分别达到 37.3% 和 39.1% 的准确率,通过上下文管理可提升至 55.3% 和 52.9%,显著优于同规模智能体,甚至匹配约 30B 参数的更大模型。
正文节选
ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment Abstract Long-horizon search agents must make multiple sequential actions (steps) to search, retrieve, verify, and integrate evidence to reach a final answer. However, existing methods for training these agents typically treat all steps within a trajectory uniformly during both supervised fine-tuning (SFT) and reinforcement learning (RL), failing to distinguish useful actions from erroneous or redundant ones.