返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 15 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

清华稳准智能发布LimiX-2,结构化数据基础模型登顶国际评测榜单

稳准智能联合清华大学计算机系崔鹏教授发布新一代结构化数据基础模型LimiX-2,参数规模提升至400M,在TabArena、BCCO、TALENT三个国际主流结构化数据Benchmark中Elo分数均位列第一,超过Google、SAP、Amazon等国际大厂同类模型。模型沿上下文机制网络CMNs、自动化合成数据生成引擎升级、参数Scaling三条技术路线推进

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
量子位模型发布

清华稳准智能联合发布LimiX-2,结构化数据基础模型登顶国际评测榜单

稳准智能联合清华大学计算机系崔鹏教授团队于9月16日发布新一代结构化数据基础模型LimiX-2,参数规模提升至400M。该模型在TabArena、BCCO、TALENT三个国际主流结构化数据评测基准上Elo分数均位列第一,超过Google、SAP、Amazon等国际大厂的同类模型。技术路线包括上下文机制网络CMNs、升级自动化合成数据生成引擎以及进一步Sca

正文结构化主题已通过公开置信门槛
量子位产品发布

B站AI无限竞技场上线,全球百大模型同场竞技

B站于9月16日正式上线「AI无限竞技场」,这是一个汇集UP主大模型测评的竞技广场,首期榜单同步公布。GPT-6 Astra在10个UP主测评中拿下榜首,前五名中国产大模型占据三席。该平台由各领域UP主对上百个大模型进行真实场景实测,涵盖代码、推理、协作、知识等主题,排名实时更新并持续开放报名。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10992:llama-bench 支持 --version 打印构建信息

llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

智能体式RAG中部分答案质量与效用的预测

该论文提出一种轨迹内探测框架,用于研究智能体式RAG(Agentic RAG)多跳问答中中间答案状态的变化。作者在每次检索-推理迭代后强制模型生成中间答案,定义“部分答案质量”和“部分效用”两个指标,并发现多数轨迹中仅一次迭代显著提升答案质量,后续迭代收益甚微。基于此,作者构建了部分答案质量预测与部分效用预测任务,实验显示质量预测更可预测(Pearson相关

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

ToMAS:从多智能体LLM失败中构建心智理论基准的试点

该论文提出 ToMAS,一个从多智能体 LLM 失败案例中构建心智理论(ToM)基准的试点流程。作者将 MAST-Data 中标注为 FC2(智能体间错位)的执行轨迹,按四条可转换性标准筛选,从 242 条合格训练轨迹中生成 39 个 Clean 条目,标注者间原始一致率为 94.4%。随后用 Qwen2.5-1.5B 做小规模 GRPO 可行性实验,但事后

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

评估大语言模型推荐中的品牌检索与排序

该研究提出一个评估大语言模型品牌推荐的新框架,将竞争品牌集合独立于模型输出定义,并通过重复采样估计推荐概率(BRP@)和平均倒数排名(MRR@)。作者对六个LLM在五个产品类别上测试发现,仅给类别查询时成熟品牌被大量遗漏,推荐突出度更多与搜索兴趣和在线品牌讨论等市场可见度信号相关,而非传统品牌知名度;基于需求的查询会改变被检索的品牌,诊断性定位提示可使原本被

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

Vibe Patenting:评估LLM裁判在专业专利撰写智能体中的表现

该研究提出 Vibe Patenting 测试平台,用于评估 LLM 裁判在专业专利撰写任务中的可靠性。研究发现,裁判引导的迭代修订能持续提升裁判评估的草稿质量,而无引导修订趋于饱和;迭代反馈还能让低推理能力智能体接近高推理能力智能体的表现。但将 LLM 裁判与专业专利律师的独立评估对比后发现,两者一致性高度依赖具体指标,存在系统性校准差异,说明自动裁判下的

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱

该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

少样本退化并非表示扭曲:12模型跨任务的行为与表示分析

该研究挑战了少样本提示导致模型性能下降的「表示扭曲假说」,指出少样本提示比零样本提示长5-8倍,长度差异本身就能解释40-79%的表示偏移。作者提出「随机文本对照」方法,用长度匹配的随机token替换示例,分离出由示例内容引起的「内容增量」。结果发现内容增量越大,少样本提示反而越有益,而退化最严重的Llama 3.3 70B其偏移几乎全部来自长度伪影,将其对

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

SceneBench:3D场景视觉语言理解的分层基准

研究者提出 SceneBench,一个面向 3D 场景视觉语言理解的分层基准,包含 966 个用 Gaussian Splatting 重建的逼真 3D 场景,并通过人机协同流程(约 1500 人工小时)标注了超过 18.3 万个带文本描述和 3D 边界框的层级语义节点。基准定义了存在性问答、空间智能问答和需跨语义层级多步推理的 Grounded QRA 三

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

MechReason:机械工程多图像多跳推理基准

研究者提出 MechReason,一个面向机械工程的多图像多跳推理基准,源自真实机械工程论文,包含 12k 问答对、21k 视觉材料和显式推理链标注,覆盖解释、预测、设计、诊断四个维度共八类任务。该基准采用四阶段构建流程,通过遮蔽后验验证信息来防止模型走捷径,并经过多模态质量验证。实验显示最先进的多模态大模型仅达到 62.89% 准确率,错误主要来自推理链缺

正文结构化主题已通过公开置信门槛
量子位研究

华为GTS推出NetCanvas,让Agent看着网络拓扑排障

华为GTS AI算法团队提出NetCanvas机制,通过「可交互视觉拓扑」为网络运维Agent提供外部工作记忆画布,解决纯文本Agent在复杂IP承载网排障中的「拓扑失忆」问题。在公开基准CTBench上,Agent综合通过率从30.3%提升至54.5%,双防火墙、ECMP等复杂子任务从约10%跃升至约90%,平均探查步数从159步降至113步,Token试

正文结构化主题已通过公开置信门槛
Latent Space研究

Good Start Labs 用游戏训练 AI 并测试技能迁移

Good Start Labs 联合创始人兼 CEO Alex Duffy 向 Latent Space 介绍,公司正把游戏转化为 AI 模型的训练材料,其灵感来自 2025 年 Twitch 上前沿模型玩《Diplomacy》的直播。公司用《1830: The Game of Railroads and Robber Barons》训练了一个 30B 模型

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

IBM 发布 Granite Time Series PatchTST-FM-r2 模型

IBM 发布 Granite Time Series PatchTST-FM-r2 时间序列基础模型,采用约 3.85 亿参数、Conformer 架构,支持零样本预测、概率预测和缺失值填补。截至 2026 年 9 月 8 日,该模型在 GIFT-Eval 基准的可复现零样本模型中排名第二,并且是同类中唯一采用 Apache 2.0 与 OpenMDW 1.

9月15日周二 · 5 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Grab 的 LLM-Kit 框架加速 AI Agent 生产部署

Grab 将其内部 LLM-Kit 框架标准化应用于 500 多个内部 agent 服务,该框架提供基础 agent 循环以及评估、追踪、密钥管理和工具服务器连接等预置能力。新 agent 服务接入生产环境的时间从两周以上缩短到约一小时,节省主要来自基础设施而非推理循环。agent 在运行时从 50 多个 MCP 服务器发现工具,并通过 OpenAI 兼容的

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Atria Dawn:智能体超级智能的黎明

研究团队发布 Atria Dawn Preview,一个通过可验证经验管线(Verifiable Experience Pipeline)训练的基础智能体语言模型,将工具交互与可执行环境及外部验证结果相连接。该模型在覆盖科研、工程和数字工作的 16 项基准测试中与前沿智能体相当,并在其中 5 项取得最高分。论文还以该模型研发过程为案例,分析 56 名参与者的

正文结构化主题已通过公开置信门槛
Latent Space政策

AEF-1 第三方评估标准出炉,xAI、OpenAI、Anthropic 共同签署

AI Evaluator Forum 发布 AEF-1 标准,为独立第三方 AI 评估提出基线要求,涵盖访问权限、利益冲突、资金关系、回避和透明度。Anthropic CEO Dario Amodei 发表个人博客,承诺让第三方评估者嵌入公司内部,提供办公桌、门禁卡和公司笔记本电脑等类似内部风险团队的访问权限。xAI、OpenAI 和 Anthropic 共

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

LLM还是朴素贝叶斯?旧方法在新场景下的对比研究

该研究对比了Complement Naive Bayes(CNB)与从27B到1T参数的多系列LLM在文本分类任务上的表现。结果显示LLM仅在无标注数据场景占优(Amazon Polarity上98.0%对88.2%),但存在数据污染风险;一旦有标注数据,CNB在AG News上达到89.1%,与零样本27B LLM持平并优于397B前沿模型,且CPU推理吞

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

PhysMent:面向LLM物理问题推理的交互式基准

研究者提出 PhysMent,一个基于 MuJoCo 物理模拟器的交互式基准,用于评估大语言模型通过多轮工具调用进行物理实验推理的能力。该基准包含 105 个经典力学场景,覆盖四种难度、三种场景模态和一个场景操控类别,并采用六维评分框架。结果显示,当前模型在定性单概念任务上可达 80% 准确率,但在需要精确多步实验的定量任务上大多低于 30%,七个模型整体准