美团开源LoHoSearch:基于知识图谱的下一代搜索智能体评测基准
美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。
公司与模型 · OpenAI 的全部动态:GPT 系列模型、ChatGPT 与 Sora 产品、公司战略与人事
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-27 01:14
美团LongCat团队开源了搜索智能体评测基准LoHoSearch,基于覆盖762万维基百科实体的知识图谱自动生成题目,通过控制搜索空间和结构复杂度来提升难度。评测显示,最强模型GPT-5.5准确率仅34.74%,远低于在BrowseComp上的表现,且现有上下文管理策略提升有限。该基准旨在提供更具区分度的评测标准,并推动下一代上下文管理技术研究。
英伟达因投资者压力,将其对OpenAI数据中心项目的担保金额从原计划的2500亿美元削减至不到1200亿美元,该项目由软银旗下SB Energy开发,总容量10吉瓦。与此同时,Anthropic季度营收从Q1的47.3亿美元翻倍至Q2的115亿美元以上,同比增长14倍,并计划以近1万亿美元估值上市。这些数据对AI泡沫论构成挑战。
Moonshot AI 推出了 PerceptionBench 基准测试,用于独立评估多模态模型的视觉感知能力,不涉及逻辑推理和外部知识。测试结果显示,包括 GPT-5.6 Sol、Kimi K3 和 Claude Fable 5 在内的所有领先模型均表现不佳,最高准确率仅为 59.7%。作者指出,许多所谓的推理错误实际上源于视觉感知缺陷。该基准测试基于真实
Z.ai 发布了 GLM-5.3 模型,目前仅在编程计划中提供,API 即将上线,两周后开放权重。该模型在多个基准测试中超越了 Moonshot AI 的 Kimi K3,部分指标甚至超过 Claude Fable 5 和 GPT-5.6-Sol,且参数量仅为 Kimi K3 的三分之一。Z.ai 表示 GLM-5.3 基于 GLM-5.2 的相同基础模型,
普林斯顿大学与英国AI安全研究所联合发布了一项研究,通过“影子评估”方法测试前沿AI模型(如Claude Opus 4.8和GPT-5.6)的自主研究能力。结果显示,这些模型能完成工程任务,但在研究判断、创造性问题解决和资源管理上存在系统性缺陷,生成的两篇论文均被原审稿人拒绝。该研究对Anthropic和OpenAI关于AI可加速自身研究的说法提出了质疑。
DeepSeek正式发布并开源了DeepSeek Harness(DSH),这是一款为自进化与DIY设计的Agent框架,采用Cordis插件架构,一切皆可插拔,内置超100个插件。实测显示DSH在长程任务能力上表现优于Codex,但UI细节仍有差距。DSH被视为Agent时代的安卓,旨在通过开放生态推动AI自进化。
SpaceXAI发布Grok 4.6模型,在多项基准测试中超越GPT-5.6 Sol和Fable 5 Max,且价格更低。同时推出Grok Bot智能体产品,可自主操作工具并24小时运行。这些产品整合了Cursor的技术和SpaceXAI的算力,标志着马斯克在AI领域的战略布局。
Anthropic 的最强模型 Fable 5 上市首月仅占其 API 代币销售量的 6%,收入占比 11.4%,远低于 OpenAI 的 GPT-5.6 Sol(代币占比 25%,收入占比 23%)。Ramp 经济学家认为,Fable 5 的高定价(每百万输入/输出 token 分别为 10 美元和 50 美元)触及了企业 AI 支出的天花板,性能提升难以
Backtrader-Bench 是一个用于评估 LLM 智能体在算法交易中能力的基准框架,包含确定性 MCQ 管道和生成器-求解器过滤管道,可自动生成并验证问题。在 30 道精选题目上,工具增强的智能体(如 GPT-5.5 和 Opus 4.7)单次准确率达 90.0%,比最佳无工具基线(73.0%)高出 17 个百分点。该框架旨在生成训练语料,用于强化学
Strands Agents SDK 发布了 TypeScript 版本 v1.13.0,该版本引入了 ModelRouter 以支持通过 Agent(model=) 进行模型路由,并新增了 strands-github-storage 集成、顶层存储支持以及 AgentStreamStage 中间件功能。同时修复了多个问题,包括 Bedrock 请求取消、
Strands Agents SDK 发布了 Python 版本 v1.52.0,新增了 ModelRouter 模型路由功能,并支持通过 Agent(model=) 参数使用。同时引入了 strands-github-storage 集成、顶层存储模块以及 AgentStreamStage 中间件。此外,修复了多个问题,包括 Bedrock 请求重试、Op
SpaceXAI 发布了新模型 Grok 4.6,在 Artificial Analysis Intelligence Index 上得分 61,与 OpenAI 的 GPT-5.6 Sol 持平,仅次于 Anthropic 的 Claude Opus 5 和 Claude Fable 5。该模型在代理任务上表现优异,在 GDPval-AA v2 基准上排名
另有 1 家信源报道
IIT Bombay和Adobe Research的研究人员开发了一种名为“Previous-Token Prediction”(PTP)的方法,能够仅根据LLM的输出文本以近乎完美的准确率重建原始提示词,无需访问模型权重,甚至适用于第三方模型。该方法通过训练一个逆语言模型来预测前一个token,并能在不知道具体模型的情况下提取提示词,这可能导致专有系统提示
根据Pangram、OpenRouter和Similarweb的最新数据,谷歌的Gemini在AI市场份额上持续下滑,从12%降至1.9%,而OpenAI的ChatGPT保持50%以上份额,Anthropic的Claude从4.3%升至14.9%。Similarweb显示谷歌网站市场份额微降,但同比仍大幅增长。数据来源各有局限,但均指向Gemini使用率下降
澳大利亚企业家 Paul Conyngham 因使用 ChatGPT 等 AI 工具为他的狗设计个性化 mRNA 癌症疫苗而闻名,现推出初创公司 Gamgee,旨在为狗及其他动物提供个性化癌症疫苗,并计划扩展到人类。尽管其故事受到质疑,但 Gamgee 已获得 Y Combinator 支持,并与澳大利亚多所大学合作,正在招募临床试验。
Google Research 的研究人员提出知识剖析框架,发现前沿大模型(如 Gemini3 和 GPT-5)的事实编码接近饱和,但回忆能力不足,导致许多事实错误源于无法检索而非未编码。他们构建了包含 2150 个事实的 WikiProfile 基准,并评估了 13 个模型,结果表明扩展模型规模主要改善编码而非回忆,且长尾事实和反向问题的瓶颈在于利用而非获
该研究提出了一种针对多语言机器翻译的无参考后训练方法,从监督微调的MiLMMT-46-v0.1模型出发,应用GRPO算法结合两个无参考质量估计模型的平均奖励,并通过语言识别门控,最后对SFT和RL检查点进行线性插值得到MiLMMT-46-v1.0。在46种语言上,该模型持续优于SFT版本,并超越Seed-X、HY-MT2、TranslateGemma等开源基
SPIEval是一个新基准,用于评估大语言模型作为移动助手处理分散在多个应用中的个人信息的能力。该基准包含250个任务,覆盖10个应用中的4335条个人记录,并支持通过21个工具进行多轮交互。评估发现,最佳模型GPT-5.5(xhigh)准确率仅为57.3%,最弱模型为16.4%,且79%的失败源于信息定位不准确。研究揭示了当前基于LLM的移动助手的根本局限
本期早报涵盖AI行业多项动态:DeepSeek招聘土木工程师并组建Harness团队,拓展算力基础设施与代码智能体;原阿里千问负责人林俊旸创立语用科技,获腾讯等投资,聚焦下一代AI智能体;宇树科技公布中签结果;Manus将恢复独立运营;OpenAI前机器人业务负责人加入Anthropic;智谱ZCode用户破百万并上线新功能。
Saber Interactive 否认其游戏《Rideshare Stimulator》用 ChatGPT 取代了编剧,但前首席编剧 Stella Sacco 声称她在开发中途被 AI 取代,且乘客语音由 AI 生成。CEO Matthew Karch 表示故事由真人撰写,仅实验模式使用 AI,并强调公司不会用 AI 取代员工。Sacco 反驳称该说法自相