探针泛化作为子空间选择:面向OOD欺骗检测
该研究针对语言模型线性探针在分布外(OOD)数据上泛化失败的问题,提出通过主成分(PC)子空间选择来提升泛化能力。实验基于Llama-3.1-8B-Instruct,在欺骗检测任务上发现,仅使用训练激活分布中少量主成分投影即可实现接近目标分布训练的迁移性能。进一步利用LLM评判器对主成分进行解释和筛选,在Insider Trading Report和Sand
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该研究针对语言模型线性探针在分布外(OOD)数据上泛化失败的问题,提出通过主成分(PC)子空间选择来提升泛化能力。实验基于Llama-3.1-8B-Instruct,在欺骗检测任务上发现,仅使用训练激活分布中少量主成分投影即可实现接近目标分布训练的迁移性能。进一步利用LLM评判器对主成分进行解释和筛选,在Insider Trading Report和Sand
IDSpace 是一个用于生成合成身份文档的新框架,旨在可靠评估数字身份验证系统。它通过模型引导的贝叶斯优化、解耦用户元数据与自动控制参数,并支持扫描和移动拍摄文档,提升了评估一致性和训练准确性。实验表明,IDSpace 在少量真实样本下优于 CycleGAN 等基线,并发布了包含十种欧洲身份证件类型的高质量合成数据集。
OpenAI正式发布GPT-6 Astra和Astra Pro,称其为最智能、最协调的模型,并在发布会上宣布进入AGI时代。该模型在数学、编程、网络安全等基准测试中表现优异,支持Computer Use和Browser Use,能操作软件完成复杂任务。API定价为输入10美元/百万token,输出50美元/百万token。首批企业测试已开始,Astra将向C
另有 2 家信源报道
OpenAI 于2026年9月3日发布GPT-6 Astra,面向有限组织,随后向所有ChatGPT用户及API开放。该模型在ARC-AGI 3基准上得分99.9%(使用自定义Provider Adapter harness),在安全任务和长上下文处理上表现优异,但在Artificial Analysis的智能指数上仍低于Claude Fable 5.1。A
OpenAI 发布了其迄今最强大的模型 GPT-6 Astra,并宣称其可能已接近或达到 AGI 水平。该模型在逻辑推理、数学、软件工程等多项基准测试中大幅超越前代 GPT-5.6 Sol 及 Anthropic 的 Fable 系列。Astra 将首先通过 Daybreak 计划向特定组织开放,随后向 ChatGPT 付费用户及云平台提供。尽管 token
另有 2 家信源报道
Langfuse 发布了 v4.28.1 版本,包含多项更新:标记关闭 Gemini 3 Pro 和 3.1 Flash-Lite 预览版,改进 Web 界面(如时间线展开、评分列显示),增强实验评估功能(支持批量评估中的变量映射覆盖),并优化 ClickHouse 性能(启用文本索引缓存)及支持自定义集群迁移。此外,还修复了认证(密码重置绑定一次性代码)和
Langfuse 发布 v4.28.0 版本,主要新增了评估器(evals)的提示词元数据追踪、专用执行列、告警管理、观察过滤器构建器等功能,并优化了实验表格的搜索和过滤体验。修复了包括 ClickHouse 时间戳处理、S3 上传、Redis 重连抖动等多项问题。该版本还统一了评估器名称字段、重命名了观察 API 中的 providedModelName
MESSY STREETS 是一个用于评估地理编码器在真实网络地址上性能的基准测试,基于 Web Data Commons 数据构建,并通过 OpenAddresses 或 OpenStreetMap 验证参考位置。研究发现,商业地理编码器在召回率上比开源系统高出最多 49 个百分点,主要差距源于对非规范地址的候选返回率;非规范表面形式可导致最多 25 个百
研究人员推出MemeCULT-1K基准,包含1000个南亚多语言梗图(孟加拉语、英语、印地语),并附带文化背景注释和人工解释。评估13个视觉语言模型发现,提供文化上下文能显著提升解释质量,平均SBERT相似度从44.6升至56.4。错误分析显示闭源模型主要失败于实体和指代识别,开源模型受限于文化知识缺口,语言和音韵错误最难通过上下文修正。数据集和代码已公开。
EvalDetectBench是一个用于测量前沿大语言模型评估意识的开源基准和流水线,兼容任何Inspect兼容的评估。该基准发现现有文献中的两个方法论选择会引入系统性偏差:生成部署转录的模型身份占测量方差的11.25%并可重新排序模型排名,且为某一模型选择的高性能提示在其他模型上可能接近随机水平。EvalDetectBench通过逐模型探针校准和分层生成器
arXiv 论文提出 FairLens,一个用于评估视觉语言模型在高风险决策(招聘、法律、医疗)中公平性和有效性的基准框架。该框架结合真实人脸图像与封闭/开放问题,从四个视角评估八个 VLM,发现主要失败模式是无根据推断而非不平等对待,且法律和医疗领域问题最严重。研究强调仅靠差异指标不足,需结合合理性评估,并指出自由文本偏见与多项选择准确性关联松散。
VakyArth 是首个针对印度语言的语用基准,覆盖印地语、旁遮普语、泰米尔语和马拉雅拉姆语,评估模型在指示语、言语行为、含义、社会语用和连贯性五个方面的表现。研究发现多语言大模型在这些语言上普遍存在语用理解失败,且翻译性能不能可靠反映语用理解。该基准由母语者编写,包含多项选择、自然语言推理和翻译三种任务格式。
Hugging Face 博客介绍了一个用于在对话代理中安全替换 LLM 的回放管道,该管道在生产环境下重放已批准的合成交互,仅将模型作为变量。评估了 8 个模型,其中 3 个获批,3 个因幻觉率超标被拒,但逐轮重新计算显示部分拒绝是统计平局或结构性问题。文章强调安全标准应作为独立过滤器,而非加权平均的一部分。
Anthropic 发布了 Claude Fable 5.1 和 Mythos 5.1,定位为编码和知识工作的新旗舰模型,宣称在多项基准上达到 SOTA。缓存读取价格下调 75%,但输出 token 使用量增加约 1.7 倍,导致单任务成本上升 20%。社区分析认为两个模型可能共享权重,仅安全策略不同。
另有 1 家信源报道
GUI-CC 是一个用于评估 GUI 世界模型作为智能体环境时上下文一致性的基准测试。它包含离线轨迹和在线智能体循环两个轨道,基于 GUIOdyssey 构建了 500 个离线任务和 200 个在线任务。实验表明,当前模型在单步生成上表现合理,但在多步环境中难以保持任务相关上下文,导致智能体陷入看似合理但无效的状态。该基准强调了从单步预测到多步环境模拟评估的
本研究构建了一个确定性工具使用环境,通过脚本化 oracle 策略和故障注入器,对五种 LLM 裁判(包括仅看结果的裁判、步骤评分裁判等)在 400 条轨迹上的表现进行了评估。结果显示,仅看结果的裁判对静默故障的召回率仅为 45%,且会误报 33% 的正确轨迹;而步骤评分裁判在零误报的情况下达到了 77% 的静默召回率。研究还发现,自一致性集成成本增加三倍但
该研究提出“分布式隐性危害”(DIH)概念,指多模态大模型在视频审核中无法识别由看似无害的片段组合而成的有害内容。作者构建了包含9000多个视频的DIH数据集和基准,测试30多个MLLM后发现即使最强模型检测率也低于45%,真实视频中同样失败。通过两阶段后训练,检测准确率提升超60个百分点,表明该缺陷可通过针对性训练缓解。
MUSES 是一个面向前瞻性知识根源检索的百万级基准,基于 2.33M 篇论文语料,包含约 14 万测试实例,按熟悉度分为三层。配套的 CiteRoots 框架提供修辞层和作者认可层,其中作者认可层包含 753 篇焦点论文的 1518 对生成灵感对。实验表明,基于 SPECTER2 的多质心检索器表现最佳,但性能随难度下降,且修辞角色与作者认可存在差异。该基
Anthropic 发布了 Claude Fable 5.1 模型,声称在编码、知识工作和长期问题解决方面树立了新标准,并在新的 Terminal-Bench-Science 基准上取得 52.6% 的分数。作者 Simon Willison 测试了该模型生成鹈鹕骑自行车 SVG 的能力,发现低和中等推理级别下模型几乎不进行推理,而高和最高级别则产生更详细和
Langfuse 发布 v4.27.0 版本,新增多项功能,包括为追踪 IO 解析器添加功能开关、自托管 API 规范渲染器、缓存输入令牌和成本、MCP 评估器测试工具、多模态输入支持,以及为 Claude 在 OpenAI Responses 网关后添加提示缓存断点。同时修复了多个问题,如输出令牌截断、分析导出 URL 检查、提示版本指标维度等。