RAG 三重稳健性分析:揭示通用病理与条件后果
一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.
本文提出AI红队评估的“证据上限”概念,即固定测试预算下评估结果能改变信念的最大倍数,并给出闭式解。研究发现,在可计算的危害率之上,适度规模的基准可严格证明模型安全性,而低于该阈值时,任何被动基准都无法提供所需的安全证据。对8个评估套件的审计显示,现有基准对高频危害有效,但对罕见灾难性危害的评估能力相差数个数量级。
FinanceHarness 是一个用于金融深度研究的自动化框架,集成了金融工具、工作流和奖励模型,并提出了 FinanceGym 基准,包含基于论文的研究问题和评分标准。专家验证通过率为 82%,而领先的 LLM 和代理在评分标准上得分低于 40%,表明该基准具有挑战性。使用相同的开放权重骨干,FinanceHarness 将整体评分从 25.3% 提升至
SIGNPOST-Bench 是一个用于评估多模态大语言模型(MLLMs)在文本与视觉信息冲突时仲裁能力的基准。该基准通过将图像转换为原始、空白、相似、随机和对抗五种变体,构建了 5,111 个反事实组和 25,555 个图像变体,并评估了来自七个提供商的 20 个 MLLM。结果显示,对抗性变体使中位定位误差从 282 公里增加到 1,347 公里,提升了
阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA
Hugging Face 每日论文发布了一项关于个性化LLM的研究,揭示了过度推断现象:模型会捏造用户属性。研究团队推出了MirageBench基准,包含150个角色和6个任务,评估了12个模型,发现所有模型都存在过度推断,平均41.6%的声明为捏造。最引人注目的是“自我监控反转”:模型自我评估的过度推断水平与外部评判结果呈负相关,表明自我报告不可靠,外部验
Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的
本文介绍了Brex公司AI工作流平台采用的一种运行时无关(runtime-agnostic)模式,将工作流编排逻辑与执行运行时解耦,使同一套逻辑既能用于生产环境的持久化分布式执行,也能用于快速迭代的离线评估。该模式通过纯业务逻辑和可插拔运行时,避免了逻辑版本漂移问题,但需要架构强制保证代码的运行时无关性,并需权衡对运行时原生特性的访问。
Mastra 发布 2026 年 8 月 5 日更新,核心亮点包括:工作流支持声明式 JSON 图定义与持久化,可通过 HTTP API 和客户端 SDK 管理存储的工作流;新增谓词 DSL 和嵌套工作流步骤,实现可持久化的条件与循环;实验与评估功能增强,支持更细粒度的评分器控制和工具策略;可观测性与流式传输可靠性改进。同时包含破坏性变更,移除平台工作区的密
本文介绍了黑箱优化词问题(BBOWP)这一新问题设置,要求系统从自然语言描述中推断搜索空间和优化算法。作者建立了BBOWP基准套件(BBOWP-Bench),包含数据集和评估框架,每个实例结合自然语言问题描述、可执行评估环境和人工设计的基线公式。初步评估显示,当前LLM能根据评估预算选择合适算法,但在搜索空间设计上存在困难,尤其是在问题描述信息不足或搜索空间
arXiv 发布了一项名为 MemArena 的基准测试,用于评估端侧个人记忆助手。该基准通过 MASim 模拟器生成了 50 个智能体在 15 天内的对话数据,并测试了多种记忆后端。结果显示,记忆后端的选择对内容准确性的影响大于模型规模,且权限感知访问在所有后端中均表现不佳。
FinPerMA是一个针对LLM代理的个性化记忆基准测试,基于理论信息和事件驱动,用于评估代理在长期金融咨询场景中维护和更新用户模型的能力。该基准包含2994个问题,覆盖276个用户画像,测试结果显示前沿LLM和多种记忆配置均未达到饱和,最高准确率仅约0.47。分析表明,基于摘要的记忆方法在保留事实细节的同时丢失了偏好信号,简单检索方法在事件冲击后表现优于专
arXiv 发布了一项名为 FinProBench 的金融 AI 智能体评估基准,并提出了角色接地评分标准构建(RGRC)流程,从专业人员的交付物中提取评分标准。实验表明,RGRC 在专业角色任务上显著优于仅用提示词的方法(99.1% vs 78.0%),而在常规角色上两者接近。该基准包含 1,723 个交付物,覆盖 57 个职业,初步评估集包含 20 个任
arXiv 论文提出 SONAR,一个无需参考摘要的代码摘要评估框架,从正确性、抽象性、简洁性和流畅性四个维度评估代码摘要。SONAR 采用基于代码再生成的方法,利用摘要重建代码作为质量信号,避免依赖人工或 LLM 的主观判断。实验表明,正确性和抽象性与 LLM 在下游软件工程任务中的表现显著相关,相关性比最佳基线高 14 倍,而简洁性和流畅性对 LLM 消
GEB-Bench 是一个新基准,用于评估模型识别抽象结构(如自指、怪圈、莫比乌斯扭转)的能力,这些结构通过自然场景、民间故事、数学定理和程序骨架等多种形式呈现。对十二个开源和专有模型的评估发现,模型在单一形式内识别结构的能力远强于跨形式映射,且所有模型都存在这一差距,只有前沿模型能缩小差距。错误模式与设计的正式几何结构高度一致,表面复杂度对所有模型都有影响
arXiv 发布了一项名为 OncoTriad-QA 的基准,用于评估医学大语言模型和视觉语言模型在泛癌推理中的能力,该基准整合了放射学、病理学、基因组学和临床元数据。研究团队还提出了参考模型 OncoVLM,在微调后其性能显著优于 MedGemma-4B,平均提升 10.7 分。该基准包含 86.1k 个问题,覆盖 32 个癌症队列的 9,281 个 TC
一项独立研究首次系统评估了OpenAI的隐私过滤器(OPF),这是一个15亿参数的双向PII检测器,在42个跨22种语言和5个领域的合成基准上进行测试。零样本情况下,OPF在AI4Privacy上F1=0.855,在SPY medical上为0.464,优于Presidio和XLM-RoBERTa,但在多语言NER任务中,XLM-RoBERTa在所有13种印
开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡
AgentStream 是一个统一框架,用于评估自进化 LLM 代理在流式任务中的表现,通过将基准组织为可配置任务流,并实例化隔离、顺序和交错三种流式场景。研究发现自进化可靠性随场景变化,其收益受模型能力限制且非单调,没有单一方法在所有模型和场景中占优。该研究倡导在现实任务流而非孤立单任务设置中评估自进化代理。
DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,