返回全部动态
LongHorizon-Harness:推进真实世界长时程智能体任务
原标题:LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
AI 摘要
LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks Abstract Large language model (LLM) agents increasingly undertake long-horizon tasks that require sustained reasoning, tool use, and revision across many interdependent steps. However, existing agent harnesses maintain task execution, task state, and completion assessment within a growing context, making the state difficult to track and allowing incorrect self-assessments to propagate into later decisions. We reformulate lon
发布时间:—
抓取时间:2026-08-04 14:13
来源机构:Hugging Face