返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月10日周四 · 15 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

智象未来 vivago R1 全球上线,国内版「够搭」升级发布

智象未来(HiDream.ai)于2026年9月8日全球上线内容创作智能体 vivago R1,国内版本「够搭」同步升级发布。R1 主打一次性稳定输出5分钟高质量视频并支持无限次多轮延长,通过主/子 Agent 协同完成脚本、分镜、角色、场景与音效,并依托自研 HD-AgentOS 将内容有效可用成功率提升至85%。产品采用 Chat-First 对话式创作

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

ECCV 2026 世界模型爆发:中国学者如何卡位

ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

规范驱动开发何时值得:AI 代码审查的治理基线研究

作者在 GAISS 2026 发表的研究中,围绕「人类对照规范基线审查 AI 生成代码」这一核心行为展开实验。结果显示,规范基线并未让审查者发现更多 bug,而是让已发现的 bug 变得可归因、可追溯,但代价是额外的时间和成本。作者指出,在简单任务上「先写规范」带来的显著收益很大程度上是推理效应的伪装,规范治理真正值得投入的场景是能力尚可但不完美的模型处理高

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源教程

美团发布Agent评测白皮书系列01:评测全览

美团技术团队发布《Agent 评测白皮书》系列第一篇《Agent 评测全览》,指出过去三年基座模型能力提升与 Agent 框架功能丰富使搭建 Agent 门槛持续降低,但绝大多数 Agent 项目因缺少可靠判断机制而失败。文章提出完备评测体系可概括为四个模块、三种能力、两条 Loop、一套资产,并强调评测应从答案评测走向行为评测,同时需通过 Case 挖掘与

正文结构化主题已通过公开置信门槛
DeepSeek API Changelog一手来源模型发布

DeepSeek-V4.1-Flash 发布并上线 API,价格下调

DeepSeek 正式发布 DeepSeek-V4.1-Flash 模型,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,并公布了 GPQA Diamond、HLE、Codeforces 等多项基准成绩。该模型已同步上线 DeepSeek API,调用模型名改为 deepseek-flash,旧版 V4 Flash 与 V4 Flash

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

该对 LLM 相关性评判者礼貌吗?语气作为严厉度操作点偏移

该研究在 TREC DL19/DL20 上测试了提示语气对 LLM 相关性评判的影响,覆盖 8 个评判模型、5 个经分类器校准的礼貌等级及每级 3 种改写。结果显示语气效应强烈依赖模型,且主要体现为评判者「严厉度操作点」的偏移,而非判断能力提升;语气对基于校准的绝对指标(如 Cohen's κ)影响远大于对排序质量(NDCG@10)的影响。作者据此提出操作点

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

仅凭分数不能证明发现:审计 AI 研究代理的发现认证协议

论文提出 Discovery Certification Protocol(DCP),用于审计 AI 研究代理的发现声明,将结果声明转化为可执行的恢复测试与反馈测试。DCP 包含 Gate 1 密封评估、Gate 2 匹配代理恢复测试和可选 Gate 3 反馈效应测量,核心要求零恢复见证和有限样本恢复概率上界。在 SQLite 优化和虚拟催化剂控制两个受控审

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

StochBench:面向 Lean 随机过程的领域专用基准

研究者发布 StochBench,一个基于 Lean 4 的随机过程领域基准,包含 450 道研究生水平的随机过程题目,每题配有自然语言原题。该基准覆盖马尔可夫链、鞅、布朗运动、随机微积分等 Mathlib 中覆盖不足的主题。基于 Opus 4.8 的智能体在每题 15 分钟限制下达到 34.9% 的证明率(157/450),表明该基准对先进证明器仍具挑战性

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源产品发布

OASIS:基于量规与大语言模型的多模态评估平台

UT Southwestern 等机构的研究者发布 OASIS,一个基于评分量规(rubric)的多模态评估平台,可用大语言模型对视频、音频和文本进行结构化打分。平台提供命令行工具与集成栈,支持托管 API 或通过 Ollama、vLLM 等自托管开源模型,并具备量规版本管理、执行溯源和人工复核状态。该系统自 2023 年秋季起在 UT Southweste

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SWORD:基于Wikidata的扰动揭示LLM跨语言事实错误拒绝不一致

研究者提出 SWORD 基准,通过系统扰动 Wikidata 三元组生成语法正确但事实错误的陈述,覆盖八种语言,用于评估大模型跨语言拒绝事实错误的能力。结果显示,模型在语义上更合理的扰动上准确率反而高于随机替换,说明其依赖分布熟悉度而非真正的事实核查;同时,在东亚语言上拒绝错误陈述的表现显著下降,跨语言差距最高达 28 个百分点(相对下降 49%),而这一差

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

智能体基准测试的双重测量混淆:去脚手架、真值评分与超越均值的可靠性

该论文指出LLM智能体基准测试存在双重测量混淆:执行关键决策由固定脚手架而非模型完成,评分器又基于输出形状而非任务正确性打分,两者相互掩盖。作者提出测量理论框架与BenchAudit审计修复协议,将执行决策转移给模型并用种子化真值评分,同时报告最坏情况和尾部风险等可靠性指标。在ComtradeBench上的实验将原本几乎无区分度的排行榜转变为能区分平均性能与

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

真实AI对话中的购买建议与可观察买家反应

该研究审计了Aiso数据库中317段真实AI助手对话,识别出67个与购买相关的对话片段,其中52段(77.6%)包含推荐选项、购买渠道或条件性偏好。但仅18段(26.9%)在同一购买任务中出现后续用户回复,且47条后续消息中没有任何明确的购买承诺、完成购买报告或放弃购买类别的陈述。论文的核心发现是一个测量局限:推荐内容远比买家的后续决策更易被观察到,因此现有

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

评估企业分析智能体:端到端、轨迹支撑的方法论

该论文提出了一套面向企业分析智能体的端到端、基于运行轨迹的评估方法,从语义理解、执行质量和可靠性三个维度对智能体行为进行评分,而非仅看最终答案或SQL正确性。作者在一个大型在线市场内部署的受控分析智能体上进行了案例研究,使用50个问题、两种匿名模型配置和三次随机重复,共获得300条轨迹。结果显示,能力更强的配置将早期拒绝率从73%降至0%,真实数据回答率从2

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

阿里国际站CoCreate洛杉矶开幕,Accio开源电商Agent基准测试

阿里国际站在洛杉矶举办CoCreate 2026海外买家大会,超15000家美国中小企业到场,规模较去年的3000人大幅增长。会上,阿里国际站旗下全球电商AI工作台Accio宣布在GitHub开源首个真实电商Agent基准测试,包含44个核心任务,token成本比通用Agent低50%。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

阿里国际站CoCreate:1.5万美国中小企业到场,提出B2B未来是A2A

9月9日,阿里国际站在洛杉矶举办CoCreate 2026海外买家大会,到场美国中小企业超15000家,较去年3000人显著增长。阿里国际站总裁张阔提出“B2B的未来是A2A(Agent对Agent)”,并披露海外买家AI多模态搜索流量增长超132%、Accio平台AI token消耗4个月增长6倍。Accio宣布在GitHub开源面向真实电商场景的Agen

9月9日周三 · 5 条
正文结构化主题已通过公开置信门槛
量子位模型发布

蚂蚁百灵发布金融增强模型Ling-3.0-flash-Fin,开源评测基准FinFIRST

蚂蚁集团百灵发布首个金融增强开放模型Ling-3.0-flash-Fin,该模型基于Ling-3.0-flash打造,具备124B总参数和256K长上下文,重点强化信息检索、研究推理、估值建模和研报撰写四项能力,旨在打通完整投研工作流。同时,蚂蚁百灵开源了金融搜索Agent评测基准FinFIRST,并开放模型权重和API体验。该模型在多个金融基准上表现优于部

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

MERIT:成本感知的长期记忆评估揭示工具型代理的记忆效用与风险

MERIT 基准测试评估了工具使用型 LLM 代理中长期记忆的边际效用,通过 23,440 个带成本核算的片段发现,记忆可将依赖任务的成功率从 0 提升至 0.55-1.00,但嵌入检索在更新事实时表现不稳定,而结构化事实存储和 LLM 摘要等更新时写入的记忆更稳健。研究还表明,记忆实现的选择可导致任务成功率相差 60 个百分点,且完整重放不经济。该基准、测

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

超越对错:评估大语言模型中的二阶社会推理

该研究提出了一种评估大语言模型(LLM)二阶社会推理(元规范)的新框架,涵盖情绪评估和行为反应两个维度,并发布了包含450个规范违反场景的多视角数据集NormReact。研究发现,当前LLM在预测社会制裁时比人类更严厉,过度预测负面制裁,且随社会距离增加与人类判断的一致性下降。这表明AI系统在规范敏感领域可能产生扭曲的社会调节图景,过度代表惩罚而低估现实中的

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

AhaBench:评估智能体能否从先前经验中持续学习的新基准

AhaBench 是一个用于评估语言代理在长时间跨度内能否从先前经验中持续学习的新基准,包含 Aha-Puzzle、Aha-Euler 和 Aha-Vending 三个组件。该基准通过初始分数、经验后分数和学习提升三个指标来区分模型的初始能力、利用显式支持的能力以及持久改进的能力。在八模型评测中,Claude Opus 4.6 在经验后总分上领先(64.3)

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

公平的代价:评估推荐系统中能源-公平-准确性权衡

该研究评估了推荐系统中公平性干预的能源成本,比较了训练阶段和后处理阶段方法在多个模型、数据集和硬件上的表现。结果显示,公平性的绿色成本并不统一,后处理方法将成本转移到重复服务阶段,而训练阶段方法避免了重排序开销但效果因环境而异。研究呼吁将公平感知推荐评估为准确性、公平性和计算成本之间的三方权衡。