返回全部动态
美团开源LoHoSearch:基于知识图谱的下一代搜索智能体评测基准
原标题:下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知
AI 摘要
美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知 过去一年,我们见证了 Search Agent 能力的显著演进。在 BrowseComp 等评测上,顶尖模型准确率从最初的30%区间迅速攀升至90%以上。然而,当基准迅速饱和,其区分模型能力的价值也随之递减。 BrowseComp 的题目由人工设计,局限在于只能基于标注者已知的实体和关系构思,无法站在全局知识网络视角判断:哪些条件真的难检索?哪些约束的候选空间足够大?正是这种局限,让我们开始思考另一种可能性:能不能让机器自己来出题? 美团 LongCat 团队在最新论文中提出的 LoHoSearch 基准,就是把这种可能性变成了现实。 - 知识图谱自动化构造。 以覆盖762万维基百科实体的知识图谱为基础自动生成题目,替代人工出题。基准含544道经人工核验的题目,覆盖11个领域。 - 双维度难度控制。 在生成中系统控制搜索空间与结构复杂度。构建出难度显著高于现有基准的挑战性问题。 - 当前模型性能表现。 已评测模型中,GPT-5.5准确率为34.74%;现有上下文管理策略在LoHoSearch上提升幅度为
发布时间:—
抓取时间:2026-08-17 17:59
来源机构:Meituan