删除回避:LLM 代码编辑中的隐藏缺陷及缓解方法
Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 每日论文发布了一项研究,指出大型语言模型在代码编辑中存在“删除回避”问题,即系统性地保留本应删除的代码。研究显示,在 SWE-bench Verified 基准上,五个领先模型对开发者补丁的删除召回率最高仅 71.7%,且 29% 的通过补丁采用“Guard-and-Go”模式,通过保留代码并添加守卫来通过测试。研究者构建了 Can
GEOID-Flood是一个大规模多模态洪水分割基准数据集,基于Copernicus应急管理服务数据,覆盖65个国家219起事件,包含超过14,000个瓦片,提供配准的灾前/灾后Sentinel-1(GRD和RTC格式)、灾前Sentinel-2合成影像和DEM,并带有手动验证的标签。研究评估了基础模型与传统编码器在单图像、多时序和多模态协议下的表现,发现基
ICDAR 2026 举办了一项关于原子层沉积/蚀刻(ALD/E)科学图表信息提取的竞赛,并发布了 Sci-ImageMiner 基准数据集。该竞赛吸引了 68 名参与者和 1263 次提交,结果显示多模态模型在分类和摘要任务上表现良好,但在数据提取和科学推理方面存在不足。该基准和竞赛为科学图表理解提供了评估平台。
LongHorizon-Harness 提出将长时程任务执行重构为任务状态管理问题,通过显式维护任务状态并仅用环境验证的事实更新,采用管理-执行-审计循环,显著提升了多个模型在 WeaveBench、Terminal-Bench 和 OSWorld 等基准上的表现。
WorldExam 是一个用于评估可控视频生成模型作为世界模型能力的层次化诊断基准,涵盖视觉质量、控制遵循、空间一致性和世界反应性四个层级,包含 1,474 个测试案例和八项任务。对 20 个代表性模型的评估显示,不同驱动范式的模型在能力上存在明显分化,没有模型能同时兼顾广泛任务覆盖和稳定性能,表明高视觉质量和显式指令遵循并不保证内在反应性。
SWE-Touch是一个新框架,用于在共享工作空间中测试编码代理,通过注入与任务冲突的用户编辑来模拟真实开发场景。在SWE-bench Verified上,Counter-Edit使平均解决率下降7.7个百分点,并重新洗牌了模型排名。Claude Opus 4.8和GPT 5.5表现出较强的韧性,而开源模型在自主基准上表现良好但在协作场景中显著退化。结果表明
CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。
arXiv 发布论文《MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing》,提出一个开放、可检查的基准框架,用于在共享执行模型下比较智能体工作流路由的元决策策略。基准包含 180 个合成任务、8 种路由策略和 30 对随机种子,在 43,200 条轨迹
arXiv 论文提出 HIERA,一种用于内容发现系统的层级多智能体相关性评估框架,包含四个专业智能体:相关性法官、查询分析器、条目分析器和关系分析器。法官决定何时需要专家分析,关系分析器协调查询和条目分析及外部知识以做出最终判断。消融实验表明,层级协调本身是性能提升的关键。在五个数据集上的评估显示,相比 11 个基线,HIERA 在 Home Depot
SafeBuild-Bench 是一个用于评估多模态大语言模型在建筑安全场景下表现的新基准,基于超过10万条工业图像-文本记录构建,包含3314个任务实例。该基准引入了图增强多模态选择流程 GEMS,以从冗余数据中筛选信息量大的样本。当前最佳模型在基准上的得分约为60,表明现有模型在建筑安全理解方面仍不可靠。相关基准、评估脚本和代码已开源。
该研究提出了一种可执行的基准测试和预算感知的元路由器,用于组合智能体工作流中的异构操作。基准包含216个训练、72个开发、108个测试和108个锁定词汇转移挑战任务,覆盖数据分析、冻结语料库研究和文档处理。学习策略在测试集上达到100%成功率,比静态工作流高6.5个百分点,成本降低43%;但在挑战集上成功率降至75.9%,落后于静态路由的93.5%,表明词汇
AgentMemBench 是一个用于评估对话式 AI 代理长期记忆管理策略的统一基准,在相同条件下测试了五种策略(ICW、EKV、GEM、CBS、WAM),并使用三个公共数据集和 491 个标注问题进行了评估。结果显示,外部键值存储(EKV)在所有质量指标上表现最佳,尤其在长距离回忆方面显著优于其他策略,但代价是更高的内存占用。研究还评估了 MemGPT/
该研究探讨了使用廉价开源权重模型作为自然语言数学证明的自动评判者。在IMO-GradingBench的200个实例验证样本上,三个廉价评判模型(GPT-OSS 120B、DeepSeek-V4 Flash、Gemma-4 31B)与人类通过/失败判断的一致性在统计上与Claude Opus 4.7和Gemini 3.1 Pro等前沿模型相当,但成本低至100
DesignArena 的开发商 Intelligence 宣布获得 790 万美元种子轮融资,由 Index Ventures 领投。该平台通过众包人类反馈来评估 AI 生成内容,目前拥有 530 万用户,年经常性收入达 6000 万美元。其创始人表示,人类反馈是 AI 模型在设计领域改进的关键瓶颈,该平台已成为前沿实验室的重要数据来源。
Hugging Face 每日论文介绍了一项关于编程助手个性化歧义适应的新研究。研究者提出了 CAPA 基准,通过六种机制刻画个性化编程歧义,并利用受控三阶段生成流程将其注入可执行任务,构建了包含 600 个编程会话的数据集。研究评估了 12 个近期大语言模型在无历史和有同用户历史条件下的表现,并提出了一种轻量级的同用户历史门控方法,以减少澄清次数并提升代码
ExtractBench 是一个用于评估模式引导的企业文档提取任务的基准,包含 370 份企业文档、4869 页内容,覆盖 8 个业务领域和 67 种文档类型。该基准首次同时评估值准确性、记录完整性、溯源性和成本。研究发现商业 VLM 在短文档上表现良好但在长文档上会截断记录,而编码代理虽准确率高但成本更高,LlamaExtract Agentic Plus
该研究探讨了大型语言模型(LLMs)在预测大规模阅读与写作测试中题目难度水平的表现。研究发现,零样本GPT-4.1(温度设为0)的预测准确率最高,二次加权kappa(QWK)为0.578,但仍低于ConvBERT(QWK=0.625)。所有LLMs在标记难题时表现不佳,GPT-5.4倾向于低估难度,且嵌入分析表明仅凭语义信息不足以预测难度。研究建议在利用LL
arXiv 上的一项研究提出 Chain-of-Models (CoM) 方法,通过让第二个模型审计第一个模型的推理轨迹来减少 LLM 作为评判者时的认知偏差。实验发现,审计者的身份(同模型、同族或异族)影响审计效果,且最佳审计者因偏差类型而异。研究者据此提出按偏差类型选择审计者的规则,在四个偏差数据集上达到最高准确率 0.884,优于固定审计者和无审计基线
本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl
Together AI 发布 FutureBench,一个用于评估 AI 智能体预测未来事件能力的基准。该基准通过新闻生成和 Polymarket 整合两种方式构建问题,并采用智能体方法进行评测,旨在避免数据污染并提供可验证的客观结果。