返回全部动态

LongHorizon-Harness:推进真实世界长时程智能体任务

原标题:LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

Hugging Face Daily Papers一手来源研究质量 84

AI 摘要

LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Abstract Large language model (LLM) agents increasingly undertake long-horizon tasks that require sustained reasoning, tool use, and revision across many interdependent steps. However, existing agent harnesses maintain task execution, task state, and completion assessment within a growing context, making the state difficult to track and allowing incorrect self-assessments to propagate into later decisions. We reformulate lon


发布时间:
抓取时间:2026-08-04 14:13
来源机构:Hugging Face
阅读原文huggingface.co