OmniAssistBench:全模态LLM助手式交互基准测试
OmniAssistBench是一个用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手能力的基准测试。该基准通过逆向工程现有互联网视频构建多轮交互数据集,要求模型根据预定义路径引导用户。测试结果显示,专有模型Gemini-3-Pro得分66.4,开源模型Qwen3-Omni-Instruct得分51.2,当前模型普遍存在视觉提示理解、上下文保持和
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
OmniAssistBench是一个用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手能力的基准测试。该基准通过逆向工程现有互联网视频构建多轮交互数据集,要求模型根据预定义路径引导用户。测试结果显示,专有模型Gemini-3-Pro得分66.4,开源模型Qwen3-Omni-Instruct得分51.2,当前模型普遍存在视觉提示理解、上下文保持和
本研究提出level-k可区分机制,用于评估大语言模型在有限理性环境中的策略推理深度。作者构建了满足level-k可区分性的新博弈结构,并测试了四个LLM在递归推理和对手行为归纳下的策略深度,发现模型在递归推理下表现准确,但在归纳推理下性能下降。研究还指出,错误源于推理深度步骤数错误而非最佳响应计算错误。
该研究通过审查240项测试与评估实践,识别出军事指挥控制中智能体AI系统测试所依赖的八项假设,并指出智能体特性削弱了这些假设,导致测试结果无法充分推断实际部署行为。研究提出十项保证声明,并认为在限定任务包线、轨迹正确性等条件下可恢复部分信心,同时部分证据负担需转移至部署阶段。
一项新研究指出,当前世界模型(如Sora、Genie 3等)仅建模物理层,忽略了人类信念、意图等心理状态,导致预测行为不准确。研究者提出“心理世界建模”(MWM)框架,并构建无需训练的参考实现MENTIS,在Menti-Bench基准上显著提升模型表现。该框架通过耦合物理与心理变量,使AI代理能更准确地预测人类行为,但模拟阶段仍是主要瓶颈。
一项由英国AI安全研究所等机构参与的研究,借鉴心理测试方法,分析了192个模型在5000多个测试问题上的表现,发现当前AI安全基准测试存在三大缺陷:单一安全分数具有误导性,模型可通过全面拒绝请求来虚增分数;不到2%的测试问题具有区分度,精简测试可大幅降低成本;并提出一种统计方法可检测模型在测试中故意表现得更谨慎的“沙袋效应”。该研究建议AI安全测试应达到与人
英伟达发布新研究,表明在长时程任务中,AI 的“支架”(harness)比底层模型更重要。通过定制支架并引入“监督者”组件,英伟达让 Claude Opus 5 在 ARC-AGI-3 基准上达到 100% 得分,而无支架时仅 30%。该研究强调开放支架系统对用户控制和安全性的重要性,并呼应了 OpenAI 和 Databricks 的相关发现。
NVIDIA 研究项目 AVO 在 ARC-AGI-3 基准测试中取得 100.00 分,完成全部 183 个关卡。AVO 是一种通用智能体架构,通过持久记忆和监督机制支持长时间自主运行,此前已在 GPU 内核优化中展现性能提升。该结果表明,智能体系统的整体架构对模型能力转化为实际进展至关重要。
这篇立场论文提出过渡复杂度剖面(TCP),用于量化游戏环境或数据集的过渡预测难度,包括单步分支、交互不确定性和依赖跨度。作者认为当前GWM和RL研究缺乏此类测量,呼吁将TCP作为标准基准元数据和必报统计量,以促进跨基准的可比性。
本文提出,随着AI智能体系统日益成为与动态环境交互的行为系统,现有评估方法仅关注性能结果而忽视行为过程,因此需要借鉴行为科学的方法,通过系统观察、扰动和解释来评估AI行为。作者建议开发严格的行为测试,包括从动作序列中恢复决策策略、构建隔离行为差异的环境以及探测多智能体系统中的涌现动态,并呼吁建立AI行为科学。
EPAM Systems 的研究者提出了一种正式的语义块模型和基于执行判断的基准,用于评估规范质量,独立于模型能力。该模型将规范表示为语义块、依赖关系、规则等结构,并定义了四个机器可检查的良构条件。在 Oracle 到 PostgreSQL 迁移规范上的实验表明,完整规范将干净加载输出从 72.0% 提升至 97.3%,但跨实现者一致性仅从 83.1% 变为
本文提出评估上下文协议(ECP),一个早期、供应商中立的框架,旨在为AI代理系统提供可移植的评估契约层。ECP定义了一个JSON-RPC接口,代理通过它暴露用户可见输出、工具调用和审计上下文,并支持跨框架和CI系统的统一程序化检查。论文还提供了包含LangChain、LlamaIndex、CrewAI和PydanticAI适配器的开源参考实现,并指出该协议是
浙江大学研究团队提出了Holtercare-Bench,一个用于评估长期动态心电图分析的多模态基准,并配套发布了包含788份临床Holter记录和22,980个问答对的Holtercare-23K数据集。该基准通过信号-视频-文本三模态对齐,评估模型在时间定位、临床诊断和全局总结方面的能力。零样本评估显示主流多模态大模型在处理超长病理序列时存在显著性能差距,
该论文提出“评估语义识别”概念,研究评估结论是否在声明的语义族内保持不变。通过217条轨迹的实证分析,发现冻结的对比处理在特定语义族内产生零效应,而联合处理则无法识别效应,表明排名依赖规范。作者将分歧归因于单侧终端删除,并提供了可复用的族索引审计方法。
THE DECODER 的 Frontier Radar 第四期指出,中国 AI 模型如 Kimi K3 和 GLM-5.3 已接近美国顶尖模型水平,西方实验室指责中国通过蒸馏和刷分追赶,但模型领先优势难以维持。西方在抽象测试、可靠性和前沿领域仍有优势,但整体领先已转向系统层面。文章还提到欧洲在 AI 竞赛中落后。
该论文提出了语义任务完成视频生成任务,要求生成视频既实现预期结果又具备语义基础。作者构建了包含六个领域的SemComp-Data数据集,并设计了基于视觉语言模型的SemComp-Bench评估协议,通过OA分数和GR分数分别衡量结果达成和生成可靠性。实验表明,现有视频生成模型在实现预期结果和保持语义基础方面仍面临挑战。
Engine-Transfer-Bench (ETB) 是一个用于文档编译引擎选择的新基准,包含 1,784 个开放文档和四个任务(可靠性、延迟、文本一致性、失败模式),并在 macOS、Ubuntu 和 Windows 上进行了跨平台测试。研究发现 Tectonic 的成功率稳定在 96.3-97.2%,而经典 TeX Live 引擎因发行版策略波动 12
乔治梅森大学的研究人员提出了一种测量框架,用于系统量化软件问题解决任务的结构属性如何影响AI代理的成功率。他们基于CoderForge-Preview数据集进行大规模实证研究,发现任务难度可从静态特征(如补丁碎片化和仓库规模)显著预测,提示难度编码于任务结构中,为构建难度可控的基准测试奠定基础。
华东师范大学、爱奇艺和腾讯的研究者提出了 LongNovel,一个用于长上下文小说摘要幻觉检测的多尺度中英双语基准。该基准包含 29 部中文小说和 BookSum 数据集的章节级数据,覆盖 16k 到 100k token 的四种长度场景,并设计了 8 种幻觉类型。通过多模型仲裁和实体引用幻觉生成相结合的方法,确保数据真实性和类别平衡,实验表明 LongNo
本研究针对组织文档敏感性分类中的标签泄漏问题,构建了包含16,000份外交电报的Strategic 16K基准数据集,并系统评估了六种模型架构。在清洁基准上,BERT表现最佳(准确率89.14%,F1 89.33%),而TF-IDF结合逻辑回归在较低计算成本下达到最强经典模型性能。该工作首次在明确泄漏控制条件下提供了可复现的敏感性分类基准。
FM-Bench 是一个用于评估大语言模型智能体在长期决策任务中表现的基准测试,模拟管理足球俱乐部20年的场景。研究发现,管理行为而非模型规模或计算资源决定性能,且所有模型均未能从拒绝的报价中学习市场隐藏价格。该基准提供了首个大规模智能体对抗评估,代码已开源。