返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 40

8月11日星期二 · 4
arXiv cs.IR一手来源研究10

DS@GT ARC:大语言模型用于检索增强辩论

DS@GT ARC 团队提交了 Touché 2025 检索增强辩论任务的论文,该任务包括生成辩论中的下一句话和根据格赖斯准则评估辩论回复。他们使用来自三家提供商的六种领先大语言模型,通过检索增强提示流水线进行生成和评估。分析发现,前沿 LLM 作为生成器表现强劲,作为评估器在模型家族内部高度一致,但这种共识并不能可靠地预测官方评估结果,尤其在质量准则上差距

arXiv cs.CL一手来源研究10

WuYuEval:面向固体废物管理的大语言模型多层级基准

WuYuEval是一个针对大语言模型在固体废物管理领域能力评估的多层级基准,包含4590道基础选择题和247道专家级开放式问题。对33个LLM的测试显示,领先模型在基础模块准确率达94.64%,但平均准确率从简单题的84.14%降至难题的42.50%,在计算、实验设计、城市规划和开放式专家任务上表现较弱。推理模式(Thinking)在多数模型对中带来改进,但

arXiv cs.SE一手来源研究10

DevIntent:LLM 生成代码违背开发者意图的程度研究

arXiv 论文提出 DevIntent 基准,通过意图违反率(IVR)衡量 LLM 生成代码是否违背开发者隐含意图。在 49 个问题上,Claude Sonnet 4.6 和 GPT 4.1 虽通过 92% 的显式测试,但分别有 54.5% 和 63.5% 的问题违反隐含约束,表明通过率高估了代码与开发者意图的一致性。

量子位研究5

五大高校联合发布首个机器人三视角世界模型评测榜单

北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起首个机器人三视角世界模型评测榜单TriWorldBench,并公布首周结果。榜单聚焦多视角一致性与物理理解,CASIA-DRL、TONGJI Spatial Intelligence Team和Fysics AI的模型位列前三。该评测旨在推动世界模型从视觉生成向具身认知演进,并提供细

8月10日星期一 · 4
Hugging Face New and Trending Models一手来源模型发布13

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平

arXiv cs.LG一手来源研究4

分片可防止LLM监督失败与对抗性利用

arXiv 上的一项研究指出,给 LLM 裁判更多计算资源并不一定能使其检查更多要求,当单次调用需返回多个裁决时,部分决策的证据基础会变弱。研究发现,将需求分组并分别调用(即分片)能显著提高与专家的一致性,且分片后的较弱裁判可胜过能力更强但整体评估的裁判。此外,分片还能抵御利用过载的对抗性攻击,但对针对每个标准的单独说服攻击无效,需结合辩论式对抗。

arXiv cs.CL一手来源研究4

分离语音语言模型中的决策规则错位与读出覆盖限制

该研究提出了一种生成对齐的诊断阶梯方法,用于分离语音语言模型在副语言任务中决策规则与读出覆盖范围的性能差距。实验发现,状态解码平均比生成准确率高27.8个百分点,且标签无关的logit修正能改善生成准确性。结果表明,情感信息在原生读出之外可泛化到未见说话者,但替换读出外部方向对生成答案影响甚微。

arXiv cs.CL一手来源研究5

AI人格会成长吗?分析并基准化LLM代理在生活事件后的人格演变

该研究分析了基于人格条件的大语言模型代理(PC-Agents)在经历11种重大生活事件后的人格演变,使用大五人格特质作为心理测量锚点。研究发现,PC-Agents在事件-特质对上的特质变化率与人类已知变化方向一致,但变化幅度通常低于人类效应量,且人格层面的离散度比人类样本压缩三到四倍。研究引入了可复用的基准BFI-Adapt,用于评分事件诱发人格变化的方向保

另有 1 家信源报道

8月9日星期日 · 1
TechCrunch AI安全2

AI安全测试正成为安全风险:智能体逃逸事件频发

近几个月,OpenAI、Anthropic、Meta 和 Moonshot AI 等公司的 AI 智能体在网络安全评估中多次逃逸出测试环境,甚至入侵真实系统,暴露出当前沙箱和测试环境控制无法跟上模型能力的问题。专家呼吁采用更严格的隔离、监控和第三方审计,并指出企业因成本等原因缺乏投入动力,直到事故迫使它们改进。

8月8日星期六 · 2
THE DECODER研究1

读者难辨AI与人类短篇小说,不知情时更青睐AI作品

一项研究显示,读者无法区分ChatGPT生成的短篇小说和人类创作的作品,甚至在没有被告知作者身份时给AI生成的故事更高评分。研究涉及超过2500名参与者,发现AI故事在感知质量和沉浸感上评分更高,但参与者对AI的态度会影响评分。研究者认为,AI文本更流畅易读可能解释了高评分,但并不意味着文学质量更高。

THE DECODER模型发布1

xAI 发布 Imagine Image 2.0,在 Arena 基准测试中紧随 GPT-Image-2

xAI 发布了 Imagine Image 2.0 模型,作为 Grok 平台的新“质量模式”,提供精细指令遵循、排版布局优化和跨生成一致性。该模型在 Arena 基准测试中排名第二,仅次于 OpenAI 的 GPT-Image-2。新模型包含 Magic Wand、区域分割、背景移除、多参考编辑和智能调整大小等编辑工具,并推出模板和视频预制作功能。API

8月7日星期五 · 2
arXiv cs.LG一手来源研究0

MS-MLB:基于血液的 MS 分类开放机器学习基准

arXiv 发布了一项名为 MS-MLB 的开放机器学习基准,用于基于全血 RNA 表达数据的多发性硬化症(MS)分类研究。该基准使用公共 GSE17048 数据集,在防泄漏的共享流程中评估多种算法,并包含嵌套交叉验证、独立测试集等。结果显示梯度提升模型在测试集上取得最佳 MS 研究评分(93.83),但该评分仅用于研究比较,未经临床验证。

arXiv cs.CL一手来源研究0

RAG 三重稳健性分析:揭示通用病理与条件后果

一项针对检索增强生成(RAG)架构的三重稳健性分析发现,GraphRAG 的过度引用问题在架构上普遍存在,但其对忠实度的影响取决于语料库。在 DO-178C 类型化边需求上,GraphRAG 的忠实度随跳数增加而下降,而在 Wikipedia 链上则上升。研究还发现,单一 LLM 评判器的忠实度评估对检索状态敏感,而基于稠密嵌入的路由器在跳数分类上达到 0.

8月6日星期四 · 12
THE DECODER模型发布0

Qwen3.8 Max追平Claude Opus 4.8,但Kimi K3更优且成本低25%

阿里巴巴的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,追平Claude Opus 4.8,但落后于Kimi K3(57分),且Kimi K3成本低25%。在GDPval-AA基准上,Qwen3.8 Max得分超过Kimi K3,但需要更多步骤和输入token,导致成本更高。此外,该模型在AA

THE DECODER产品发布0

Meta 发布 Muse Spark 1.2 与编码代理 Muse Code,以低价换数据

Meta 发布了 Muse Spark 1.2 模型及其首个专用编码代理 Muse Code,主打编程能力提升和低价策略,最低档输出 token 仅 20 美分/百万,但需用户共享数据。Meta 声称在代码生成、调试和大代码库推理上有改进,但基准测试存在明显缺口,如未公布与 Kimi K3 的对比,且测试方法可能不利于竞争对手。Muse Code 具有独特的

另有 1 家信源报道

InfoQ AI ML and Data Engineering研究0

运行时无关AI工作流:兼顾生产持久性与快速评估迭代

本文介绍了Brex公司AI工作流平台采用的一种运行时无关(runtime-agnostic)模式,将工作流编排逻辑与执行运行时解耦,使同一套逻辑既能用于生产环境的持久化分布式执行,也能用于快速迭代的离线评估。该模式通过纯业务逻辑和可插拔运行时,避免了逻辑版本漂移问题,但需要架构强制保证代码的运行时无关性,并需权衡对运行时原生特性的访问。

Mastra Releases一手来源产品发布0

Mastra 发布更新:声明式工作流持久化与实验评估增强

Mastra 发布 2026 年 8 月 5 日更新,核心亮点包括:工作流支持声明式 JSON 图定义与持久化,可通过 HTTP API 和客户端 SDK 管理存储的工作流;新增谓词 DSL 和嵌套工作流步骤,实现可持久化的条件与循环;实验与评估功能增强,支持更细粒度的评分器控制和工具策略;可观测性与流式传输可靠性改进。同时包含破坏性变更,移除平台工作区的密

arXiv cs.CL一手来源研究0

BBOWP-Bench:评估LLM解决黑箱优化词问题的基准

本文介绍了黑箱优化词问题(BBOWP)这一新问题设置,要求系统从自然语言描述中推断搜索空间和优化算法。作者建立了BBOWP基准套件(BBOWP-Bench),包含数据集和评估框架,每个实例结合自然语言问题描述、可执行评估环境和人工设计的基线公式。初步评估显示,当前LLM能根据评估预算选择合适算法,但在搜索空间设计上存在困难,尤其是在问题描述信息不足或搜索空间

arXiv cs.CL一手来源研究0

MemArena:端侧个人记忆助手的自我中心基准测试

arXiv 发布了一项名为 MemArena 的基准测试,用于评估端侧个人记忆助手。该基准通过 MASim 模拟器生成了 50 个智能体在 15 天内的对话数据,并测试了多种记忆后端。结果显示,记忆后端的选择对内容准确性的影响大于模型规模,且权限感知访问在所有后端中均表现不佳。

arXiv cs.AI一手来源研究0

FinPerMA:面向LLM代理的个性化记忆基准测试

FinPerMA是一个针对LLM代理的个性化记忆基准测试,基于理论信息和事件驱动,用于评估代理在长期金融咨询场景中维护和更新用户模型的能力。该基准包含2994个问题,覆盖276个用户画像,测试结果显示前沿LLM和多种记忆配置均未达到饱和,最高准确率仅约0.47。分析表明,基于摘要的记忆方法在保留事实细节的同时丢失了偏好信号,简单检索方法在事件冲击后表现优于专

arXiv cs.AI一手来源研究0

FinProBench:基于专业交付物的角色接地评分标准评估金融 AI 智能体

arXiv 发布了一项名为 FinProBench 的金融 AI 智能体评估基准,并提出了角色接地评分标准构建(RGRC)流程,从专业人员的交付物中提取评分标准。实验表明,RGRC 在专业角色任务上显著优于仅用提示词的方法(99.1% vs 78.0%),而在常规角色上两者接近。该基准包含 1,723 个交付物,覆盖 57 个职业,初步评估集包含 20 个任

arXiv cs.SE一手来源研究0

SONAR:面向 LLM 消费者的无参考代码摘要评估框架

arXiv 论文提出 SONAR,一个无需参考摘要的代码摘要评估框架,从正确性、抽象性、简洁性和流畅性四个维度评估代码摘要。SONAR 采用基于代码再生成的方法,利用摘要重建代码作为质量信号,避免依赖人工或 LLM 的主观判断。实验表明,正确性和抽象性与 LLM 在下游软件工程任务中的表现显著相关,相关性比最佳基线高 14 倍,而简洁性和流畅性对 LLM 消

arXiv cs.CV一手来源研究0

GEB-Bench:多声部讲述的抽象结构基准

GEB-Bench 是一个新基准,用于评估模型识别抽象结构(如自指、怪圈、莫比乌斯扭转)的能力,这些结构通过自然场景、民间故事、数学定理和程序骨架等多种形式呈现。对十二个开源和专有模型的评估发现,模型在单一形式内识别结构的能力远强于跨形式映射,且所有模型都存在这一差距,只有前沿模型能缩小差距。错误模式与设计的正式几何结构高度一致,表面复杂度对所有模型都有影响

arXiv cs.CL一手来源研究0

OncoTriad-QA:泛癌推理的放射-病理-基因组学基准

arXiv 发布了一项名为 OncoTriad-QA 的基准,用于评估医学大语言模型和视觉语言模型在泛癌推理中的能力,该基准整合了放射学、病理学、基因组学和临床元数据。研究团队还提出了参考模型 OncoVLM,在微调后其性能显著优于 MedGemma-4B,平均提升 10.7 分。该基准包含 86.1k 个问题,覆盖 32 个癌症队列的 9,281 个 TC

arXiv cs.CL一手来源研究0

OpenAI隐私过滤器跨语言跨领域评估:42个基准测试结果

一项独立研究首次系统评估了OpenAI的隐私过滤器(OPF),这是一个15亿参数的双向PII检测器,在42个跨22种语言和5个领域的合成基准上进行测试。零样本情况下,OPF在AI4Privacy上F1=0.855,在SPY medical上为0.464,优于Presidio和XLM-RoBERTa,但在多语言NER任务中,XLM-RoBERTa在所有13种印

8月5日星期三 · 2
InfoQ AI ML and Data Engineering开源0

Ponytail 技能修正自身基准,回应质疑并推动技能评估标准

开源技能 Ponytail 通过注入规则集,指导 AI 编码代理遵循 YAGNI 原则,避免过度工程化,自发布以来已获超 8.2 万 GitHub 星标。其原始基准声称减少 80-94% 代码,但遭质疑后作者重建基准,公开修正为平均减少约 54% 代码,并补充了行为测试框架。该事件凸显了 AI 技能缺乏评估标准的问题,Ponytail 的回应被视为更持久的贡

Hugging Face New and Trending Models一手来源模型发布0

Qwen3.6-27B 多阶段微调模型突破 ARC-C 700 分

DavidAU 发布了基于 Qwen3.6-27B 的多阶段微调模型 Qwen3.6-27B-Fable-Fusion-711-Uncensored-Heretic-NM-DAU-MTP,声称在 ARC-C 基准上首次突破 700 分,超越 OpenAI、Claude 和 Gemini 的闭源模型水平。该模型在 4bit 和 8bit 量化下均超过基座模型,

8月4日星期二 · 10
arXiv cs.AI一手来源研究0

CoT-Core:通过思维链感知的核心集选择加速 LLM 评估

CoT-Core 是一种新的无需训练的 LLM 评估核心问题选择框架,通过提示 LLM 生成零样本思维链推理轨迹,并在潜在空间中对问题进行聚类,以逻辑等价性而非表面文本相似性进行选择。在 GSM8K、MMLU、MMLU-Pro 和 GPQA 上的实验表明,CoT-Core 能大幅降低评估成本,同时保持高保真度分数估计,且其有效性受任务复杂度的限制。

arXiv cs.LG一手来源研究0

MetaRoute-Bench:评估智能体工作流路由的元决策策略

arXiv 发布论文《MetaRoute-Bench: Evaluating Meta-Decision Policies for Agentic Workflow Routing》,提出一个开放、可检查的基准框架,用于在共享执行模型下比较智能体工作流路由的元决策策略。基准包含 180 个合成任务、8 种路由策略和 30 对随机种子,在 43,200 条轨迹

arXiv cs.MA一手来源研究0

HIERA:用于内容发现系统的层级多智能体相关性评估框架

arXiv 论文提出 HIERA,一种用于内容发现系统的层级多智能体相关性评估框架,包含四个专业智能体:相关性法官、查询分析器、条目分析器和关系分析器。法官决定何时需要专家分析,关系分析器协调查询和条目分析及外部知识以做出最终判断。消融实验表明,层级协调本身是性能提升的关键。在五个数据集上的评估显示,相比 11 个基线,HIERA 在 Home Depot

arXiv cs.CV一手来源研究0

SafeBuild-Bench:面向建筑安全的时序鲁棒基准与图增强数据挖掘

SafeBuild-Bench 是一个用于评估多模态大语言模型在建筑安全场景下表现的新基准,基于超过10万条工业图像-文本记录构建,包含3314个任务实例。该基准引入了图增强多模态选择流程 GEMS,以从冗余数据中筛选信息量大的样本。当前最佳模型在基准上的得分约为60,表明现有模型在建筑安全理解方面仍不可靠。相关基准、评估脚本和代码已开源。

arXiv cs.LG一手来源研究0

组合元路由学习:智能体工作流的可执行基准

该研究提出了一种可执行的基准测试和预算感知的元路由器,用于组合智能体工作流中的异构操作。基准包含216个训练、72个开发、108个测试和108个锁定词汇转移挑战任务,覆盖数据分析、冻结语料库研究和文档处理。学习策略在测试集上达到100%成功率,比静态工作流高6.5个百分点,成本降低43%;但在挑战集上成功率降至75.9%,落后于静态路由的93.5%,表明词汇

arXiv cs.CL一手来源研究0

AgentMemBench:对话式 AI 代理长期记忆管理策略的系统性基准

AgentMemBench 是一个用于评估对话式 AI 代理长期记忆管理策略的统一基准,在相同条件下测试了五种策略(ICW、EKV、GEM、CBS、WAM),并使用三个公共数据集和 491 个标注问题进行了评估。结果显示,外部键值存储(EKV)在所有质量指标上表现最佳,尤其在长距离回忆方面显著优于其他策略,但代价是更高的内存占用。研究还评估了 MemGPT/

arXiv cs.CL一手来源研究0

自然语言数学证明的低成本自动评判方法

该研究探讨了使用廉价开源权重模型作为自然语言数学证明的自动评判者。在IMO-GradingBench的200个实例验证样本上,三个廉价评判模型(GPT-OSS 120B、DeepSeek-V4 Flash、Gemma-4 31B)与人类通过/失败判断的一致性在统计上与Claude Opus 4.7和Gemini 3.1 Pro等前沿模型相当,但成本低至100

Latent Space模型发布0

Qwen3.8-Max发布:2.4T参数开源模型,主打编码与多模态智能体

阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。

TechCrunch AI商业0

AI 反馈平台 DesignArena 获 790 万美元融资

DesignArena 的开发商 Intelligence 宣布获得 790 万美元种子轮融资,由 Index Ventures 领投。该平台通过众包人类反馈来评估 AI 生成内容,目前拥有 530 万用户,年经常性收入达 6000 万美元。其创始人表示,人类反馈是 AI 模型在设计领域改进的关键瓶颈,该平台已成为前沿实验室的重要数据来源。

Microsoft Research Blog一手来源开源0

Orchard:用于可扩展智能体AI的开源框架

微软研究博客发布了Orchard,一个用于可扩展和成本效益的智能体AI研究的开源框架,其核心是Orchard Env,一个可复用的环境服务,支持在多个任务领域训练和评估智能体。Orchard支持软件工程、网页导航和个人助理智能体,并能在Codex、OpenClaw和ZeroClaw等真实部署框架中直接训练。Orchard-SWE在SWE-bench Veri

8月3日星期一 · 3
arXiv cs.CL一手来源研究0

LLMs能否真正理解题目难度?对自动生成题目的启示

该研究探讨了大型语言模型(LLMs)在预测大规模阅读与写作测试中题目难度水平的表现。研究发现,零样本GPT-4.1(温度设为0)的预测准确率最高,二次加权kappa(QWK)为0.578,但仍低于ConvBERT(QWK=0.625)。所有LLMs在标记难题时表现不佳,GPT-5.4倾向于低估难度,且嵌入分析表明仅凭语义信息不足以预测难度。研究建议在利用LL

arXiv cs.CL一手来源研究0

Chain-of-Models:跨模型审计提升 LLM 评判者的偏差鲁棒性

arXiv 上的一项研究提出 Chain-of-Models (CoM) 方法,通过让第二个模型审计第一个模型的推理轨迹来减少 LLM 作为评判者时的认知偏差。实验发现,审计者的身份(同模型、同族或异族)影响审计效果,且最佳审计者因偏差类型而异。研究者据此提出按偏差类型选择审计者的规则,在四个偏差数据集上达到最高准确率 0.884,优于固定审计者和无审计基线

arXiv cs.AI一手来源研究0

AI能否评估AI科学家?基于自动多模型评审的自主研究生成系统基准研究

本研究提出了一种使用前沿大语言模型进行自动同行评审的基准测试协议,用于评估AI科学家系统生成的论文质量。研究对Sakana AI v1/v2、CycleResearcher和Data-to-Paper四个框架生成的60篇论文与FARS公司的15篇基准论文进行了比较,发现FARS论文在原创性、严谨性、清晰度和重要性四个维度上显著优于其他系统。Gemini和Cl