返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月7日周五 · 4 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

RAG 三重稳健性分析:揭示通用病理与条件后果

一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

AI红队评估能证明什么:证据上限的量化分析

本文提出AI红队评估的“证据上限”概念,即固定测试预算下评估结果能改变信念的最大倍数,并给出闭式解。研究发现,在可计算的危害率之上,适度规模的基准可严格证明模型安全性,而低于该阈值时,任何被动基准都无法提供所需的安全证据。对8个评估套件的审计显示,现有基准对高频危害有效,但对罕见灾难性危害的评估能力相差数个数量级。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

FinanceHarness:自动化金融深度研究框架

FinanceHarness 是一个用于金融深度研究的自动化框架,集成了金融工具、工作流和奖励模型,并提出了 FinanceGym 基准,包含基于论文的研究问题和评分标准。专家验证通过率为 82%,而领先的 LLM 和代理在评分标准上得分低于 40%,表明该基准具有挑战性。使用相同的开放权重骨干,FinanceHarness 将整体评分从 25.3% 提升至

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

SIGNPOST-Bench:多模态大语言模型文本-视觉冲突解决基准

SIGNPOST-Bench 是一个用于评估多模态大语言模型(MLLMs)在文本与视觉信息冲突时仲裁能力的基准。该基准通过将图像转换为原始、空白、相似、随机和对抗五种变体,构建了 5,111 个反事实组和 25,555 个图像变体,并评估了来自七个提供商的 20 个 MLLM。结果显示,对抗性变体使中位定位误差从 282 公里增加到 1,347 公里,提升了

8月6日周四 · 13 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Qwen3.8 Max追平Claude Opus 4.8,但Kimi K3更优且成本低25%

阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

个性化幻象:LLM捏造用户画像,自我监控误导

Hugging Face 每日论文发布了一项关于个性化LLM的研究,揭示了过度推断现象:模型会捏造用户属性。研究团队推出了MirageBench基准,包含150个角色和6个任务,评估了12个模型,发现所有模型都存在过度推断,平均41.6%的声明为捏造。最引人注目的是“自我监控反转”:模型自我评估的过度推断水平与外部评判结果呈负相关,表明自我报告不可靠,外部验

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Meta 发布 Muse Spark 1.2 与编码代理 Muse Code,以低价换数据

Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

运行时无关AI工作流:兼顾生产持久性与快速评估迭代

本文介绍了Brex公司AI工作流平台采用的一种运行时无关(runtime-agnostic)模式,将工作流编排逻辑与执行运行时解耦,使同一套逻辑既能用于生产环境的持久化分布式执行,也能用于快速迭代的离线评估。该模式通过纯业务逻辑和可插拔运行时,避免了逻辑版本漂移问题,但需要架构强制保证代码的运行时无关性,并需权衡对运行时原生特性的访问。

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布更新:声明式工作流持久化与实验评估增强

Mastra 发布 2026 年 8 月 5 日更新,核心亮点包括:工作流支持声明式 JSON 图定义与持久化,可通过 HTTP API 和客户端 SDK 管理存储的工作流;新增谓词 DSL 和嵌套工作流步骤,实现可持久化的条件与循环;实验与评估功能增强,支持更细粒度的评分器控制和工具策略;可观测性与流式传输可靠性改进。同时包含破坏性变更,移除平台工作区的密

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

BBOWP-Bench:评估LLM解决黑箱优化词问题的基准

本文介绍了黑箱优化词问题(BBOWP)这一新问题设置,要求系统从自然语言描述中推断搜索空间和优化算法。作者建立了BBOWP基准套件(BBOWP-Bench),包含数据集和评估框架,每个实例结合自然语言问题描述、可执行评估环境和人工设计的基线公式。初步评估显示,当前LLM能根据评估预算选择合适算法,但在搜索空间设计上存在困难,尤其是在问题描述信息不足或搜索空间

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

MemArena:端侧个人记忆助手的自我中心基准测试

arXiv 发布了一项名为 MemArena 的基准测试,用于评估端侧个人记忆助手。该基准通过 MASim 模拟器生成了 50 个智能体在 15 天内的对话数据,并测试了多种记忆后端。结果显示,记忆后端的选择对内容准确性的影响大于模型规模,且权限感知访问在所有后端中均表现不佳。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

FinPerMA:面向LLM代理的个性化记忆基准测试

FinPerMA是一个针对LLM代理的个性化记忆基准测试,基于理论信息和事件驱动,用于评估代理在长期金融咨询场景中维护和更新用户模型的能力。该基准包含2994个问题,覆盖276个用户画像,测试结果显示前沿LLM和多种记忆配置均未达到饱和,最高准确率仅约0.47。分析表明,基于摘要的记忆方法在保留事实细节的同时丢失了偏好信号,简单检索方法在事件冲击后表现优于专

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

FinProBench:基于专业交付物的角色接地评分标准评估金融 AI 智能体

arXiv 发布了一项名为 FinProBench 的金融 AI 智能体评估基准,并提出了角色接地评分标准构建(RGRC)流程,从专业人员的交付物中提取评分标准。实验表明,RGRC 在专业角色任务上显著优于仅用提示词的方法(99.1% vs 78.0%),而在常规角色上两者接近。该基准包含 1,723 个交付物,覆盖 57 个职业,初步评估集包含 20 个任

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

SONAR:面向 LLM 消费者的无参考代码摘要评估框架

arXiv 论文提出 SONAR,一个无需参考摘要的代码摘要评估框架,从正确性、抽象性、简洁性和流畅性四个维度评估代码摘要。SONAR 采用基于代码再生成的方法,利用摘要重建代码作为质量信号,避免依赖人工或 LLM 的主观判断。实验表明,正确性和抽象性与 LLM 在下游软件工程任务中的表现显著相关,相关性比最佳基线高 14 倍,而简洁性和流畅性对 LLM 消

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

GEB-Bench:多声部讲述的抽象结构基准

GEB-Bench 是一个新基准,用于评估模型识别抽象结构(如自指、怪圈、莫比乌斯扭转)的能力,这些结构通过自然场景、民间故事、数学定理和程序骨架等多种形式呈现。对十二个开源和专有模型的评估发现,模型在单一形式内识别结构的能力远强于跨形式映射,且所有模型都存在这一差距,只有前沿模型能缩小差距。错误模式与设计的正式几何结构高度一致,表面复杂度对所有模型都有影响

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

OncoTriad-QA:泛癌推理的放射-病理-基因组学基准

arXiv 发布了一项名为 OncoTriad-QA 的基准,用于评估医学大语言模型和视觉语言模型在泛癌推理中的能力,该基准整合了放射学、病理学、基因组学和临床元数据。研究团队还提出了参考模型 OncoVLM,在微调后其性能显著优于 MedGemma-4B,平均提升 10.7 分。该基准包含 86.1k 个问题,覆盖 32 个癌症队列的 9,281 个 TC

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

OpenAI隐私过滤器跨语言跨领域评估:42个基准测试结果

一项独立研究首次系统评估了OpenAI的隐私过滤器(OPF),这是一个15亿参数的双向PII检测器,在42个跨22种语言和5个领域的合成基准上进行测试。零样本情况下,OPF在AI4Privacy上F1=0.855,在SPY medical上为0.464,优于Presidio和XLM-RoBERTa,但在多语言NER任务中,XLM-RoBERTa在所有13种印

8月5日周三 · 3 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源

Ponytail 技能修正自身基准,回应质疑并推动技能评估标准

开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

AgentStream:评估自进化LLM代理在流式任务中的表现

AgentStream 是一个统一框架,用于评估自进化 LLM 代理在流式任务中的表现,通过将基准组织为可配置任务流,并实例化隔离、顺序和交错三种流式场景。研究发现自进化可靠性随场景变化,其收益受模型能力限制且非单调,没有单一方法在所有模型和场景中占优。该研究倡导在现实任务流而非孤立单任务设置中评估自进化代理。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-27B 多阶段微调模型突破 ARC-C 700 分

DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,