返回主题地图

评测与基准

技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月23日周三 · 5 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布1

OpenAI 发布 GPT-6 Sol 与 Luna:价格减半,性能提升有限

OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,token 价格较 GPT-5.6 同系列减半,Sol 为每百万输入 2 美元、输出 10 美元,Luna 为输入 0.10 美元、输出 0.50 美元,同时将缓存输入 token 折扣提升至 90%。OpenAI 称降价源于缓存与推理优化,并将新模型定位为对标 Anthropic Claude

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布1

用 Strands Evals 与 Amazon Bedrock AgentCore 评估技能型智能体

AWS Machine Learning Blog 介绍了如何用 Strands Evals SDK 和 Amazon Bedrock AgentCore Evaluations 评估具备技能(Skill)的智能体。技能是遵循开放 Agent Skills 标准的模块化指令集,可让智能体按需加载领域流程。文章指出技能组合会带来两类通用指标难以发现的失败:选错

正文结构化主题已通过公开置信门槛
THE DECODER模型发布1

Anthropic 发布 Claude Opus 5.5:性能对标 Fable 5.1,成本降四成

Anthropic 发布新模型家族首款产品 Claude Opus 5.5,宣称在多数任务上达到 Claude Fable 5.1 的水平,但运行成本比 Opus 5 低约 40%,输出速度提升超 30%。该模型定价降至每百万输入 token 4 美元、输出 20 美元,缓存读取费用下降 60%,并首次配备与 Fable 5.1 同级的网络安全、生物和前沿

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

零令牌置信度:读取模型内部状态,0.06秒零令牌完成验证

VIDRAFT 发布零令牌置信度(ZTC)方法,通过读取模型内部隐藏状态而非生成令牌来评估答案可信度,单次前向传播即可输出校准概率,已在 Hugging Face 上线。在 2,018 项共享基准上,ZTC·Darwin-397B 以 0.7394 AUC 登顶,而模型自报置信度仅 0.5000(等同随机猜测)。在 539 项留出集上,读取内部状态比直接询问

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

JEV 生态评测:13 个答案验证器同台竞技

Hugging Face 博客发布了一项针对答案验证(answer verification)系统的独立评测,在 2,018 条统一标注的测试集上对比了 13 个系统,并公开了评分代码。结果显示仅三个系统 AUC 超过 0.70,最强的 ZTC (397B) 与 JEV 差距仅 0.0014,统计上无法区分;而仅依赖答案长度和格式的基线达到 0.7036,高

9月22日周二 · 15 条
正文结构化主题已通过公开置信门槛
量子位商业

WebArena作者Shuyan Zhou入职Meta超级智能实验室

哈工大校友、WebArena作者Shuyan Zhou宣布今年年初离开杜克大学教职,加入Meta超级智能实验室(MSL),核心工作是开发AI浏览器。她此前在CMU攻读博士期间主导了WebArena、VisualWebArena和OSWorld等网页与计算机智能体评测基准,谷歌学术引用达9569次。此次加入的MSL成立于2025年6月,已推出多模态推理模型Mu

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
量子位观点

基元律动韩凯:从多模型调度到反馈闭环探索Agent进化

基元律动联合创始人兼CTO韩凯在2026杭州云栖大会企业级Agent实践峰会上发表演讲《从Harness到RSI飞轮》,提出多模型异构并存与算力多元供给将是长期结构,Agent任务表现取决于模型选择、工具调用与上下文管理等系统能力。基元律动以开源项目OpenSquilla探索模型路由,称在特定测试配置下保留固定旗舰模型基线99.96%的任务质量并将成本降低8

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

对话 COBRA-Skills 一作:50 样本重构 Agent 技能降本路线

香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

用户画像如何影响LLM代码生成:偏见实证研究

该研究对LLM代码生成中的用户画像偏见进行了大规模实证分析,测试了Gemini 2.5 Pro和GPT-OSS-120B两个模型,使用覆盖国籍、性别和经验水平的18种人口统计画像,对比中性基线,分析了超过35,000个生成程序。结果显示,人口统计标记在高达65%的回复和70%的推理轨迹中出现,尽管与任务语义无关;在LiveCodeBench上,画像提示使Ge

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

ECP-Bench:用基础模型评测娱乐内容推广

索尼集团联合KAIST和密歇根大学提出ECP-Bench,用于评测基础模型在娱乐内容推广任务上的能力,并训练了ECP-4B和ECP-9B模型。评测覆盖游戏、电影、音乐等领域的推广技能,包括内容理解、市场预测和用户建模等。结果显示专用微调模型在整体准确率上优于GPT5.5、Gemma4-31B等前沿模型,并在领域泛化和未见任务泛化上表现更佳。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

身份还是提示噪声?LLM 代码生成的校准不变性审计

该研究对七个模型在 HumanEval+ 和 MBPP+ 上的 3073 万次 Python 代码生成进行了校准不变性审计,考察模型分配性别、国家和职业人设是否影响代码输出。经任务内随机化和 FDR 校正后,职业是最一致的结构性轴:CodeBLEU 离散度在 10/14 个模型-基准单元中超过可交换性零假设,但中位超额仅 0.141 分,且通过率离散度均不显

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

代码的 Token 签名:比较不同大语言模型的编码行为

Visa Research 提出 CLIC(Code Learning for Identification and Comparison),通过统计 LLM 生成代码中的 token 频率,将每个代码样本表示为特征向量,并训练可解释决策树来区分两个 LLM 的代码集合。研究定义了两个新指标:鲁棒性(逐步移除最具区分度 token 后两模型是否仍可区分)和集

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

跨引擎AI搜索引用差异显著:无引擎评分难以预测可见性

该研究通过2026年6月6日对ChatGPT、Microsoft Copilot、Google和Perplexity四个AI搜索界面的观测审计,用15个商业提示词收集了589条引用观测,发现同一提示词下跨引擎的URL重叠极低(平均Jaccard相似度仅0.0079,84.9%的引擎对无共享URL),96.4%的URL只出现在一个引擎中。研究指出,不依赖引擎的

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

参数化稠密-稀疏融合混合检索:在BEIR SciFact上基于Qdrant调优排名-分数混合

该论文研究了一种参数化混合检索排序器,将稠密嵌入列表与稀疏词法列表融合,包含稠密先验、分数-排名混合、RRF平滑、列表几何系数和路由边距等显式参数。作者在SciFact训练集(809查询)上网格搜索参数,冻结后在测试集(300查询)上评估,调优后的排名-分数混合达到0.753 nDCG@10和0.889 recall@10,优于稠密BGE(0.742/0.8

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Netflix 提出推荐系统反事实可观测性评估框架

Netflix 在 arXiv 发表论文,提出一套面向推荐系统的反事实可观测性评估框架,用于区分内容质量与模型行为。该框架以带探索日志的选择概率为基础,提供偏差削减、相对性和增量性三类测量方法,覆盖单阶段与级联推荐系统。论文称该框架已在 Netflix 多个生产系统部署,并通过模拟、与历史 A/B 测试对齐及一个发现标签归因错误的生产监控案例得到验证。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

通过注意力图拓扑特征检测大语言模型幻觉

该研究提出通过分析注意力图的拓扑结构来区分大语言模型的幻觉与非幻觉回答,利用Forman-Ricci曲率识别注意力图中的信息瓶颈。作者提出一组新的拓扑特征,使简单线性探针在两个幻觉检测基准上持续优于基于注意力和多响应基线,并在三种LLM家族上验证。分析发现幻觉回答与因果生成过程中token间上下文共享受损密切相关,尤其表现为过度依赖自注意力、上下文检索分散或

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

识别、模拟与拒绝:LLM 智能体经典心理效应的污染感知研究

研究者提出 PsyAgentBench 基准,在 LLM 智能体上重跑经典心理学实验,通过「命名/盲测」与「教科书/反事实」交叉设计区分模型是真正具有类人偏差、识别实验后表演、还是复现记忆中的响应统计。在五个范式、最多三个开源模型家族、41,904 次试验中,类人效应通过不同路径出现,且一句人格提示可消除、削弱或反转这些效应。作者据此主张标量偏差易感性评分掩

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

RRSI:智能体 harness 的正则化递归自我改进

Google Research 提出 RRSI(正则化递归自我改进)方法,用于自动优化 LLM 智能体的 harness(提示词、控制流、工具、记忆与上下文管理)。该方法通过时间退火预算约束候选编辑、并用 critic 与 pruner 筛选提案,以缓解递归进化对训练任务的过拟合。在涵盖编码、智能体工作区与工程设计等八项基准上,RRSI 在进化所用划分上最高

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

人工智能促进健康全球倡议2026年会在杭州召开,讯飞医疗分享基层医疗AI实践

人工智能促进健康全球倡议2026年会于9月16-18日在杭州举办,由世界卫生组织、国际电信联盟和世界知识产权组织主办,系该年会首次在中国举行。讯飞医疗副总裁刘洋在论坛上分享以星火医疗大模型为底座的基层医疗服务体系实践,研究院院长贺志阳参与医疗AI基准评测圆桌讨论。讯飞医疗的智医助理和AI居民健康画像系统此前已在世卫大会边会亮相,成为向全球输出的中国基层健康建