WROP:在世界模型中训练客体永久性
研究者提出 WROP(World Reasoning with Object Permanence)数据基础设施,包含 150 个受认知科学启发的手工设计任务,分为六个认知类别,并通过 Blender 生成器随机化速度、光照、相机角度等参数,每个任务可生成 1 万以上样本。团队发布了 150 万样本训练语料和 300 题评测集,在评测中评估了 14 个视频模
技术方向 · 模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化 · 共 472 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
研究者提出 WROP(World Reasoning with Object Permanence)数据基础设施,包含 150 个受认知科学启发的手工设计任务,分为六个认知类别,并通过 Blender 生成器随机化速度、光照、相机角度等参数,每个任务可生成 1 万以上样本。团队发布了 150 万样本训练语料和 300 题评测集,在评测中评估了 14 个视频模
预测研究机构FRI发布中期报告,指出顶尖AI专家和超级预测者普遍低估了AI领域的实际进展速度。报告显示,AI在2025年7月达到国际数学奥林匹克金牌水平,比专家预测中位数早五年;在病毒学、网络安全基准以及AI公司营收等指标上,专家预测也明显偏低。不过,在生物实验室任务和自动驾驶等现实影响指标上,专家预测并未系统性偏低,部分甚至偏高。FRI计划引入持续更新的L
物理智能公司Simate硅基伙伴成立三个月,利用其AutoResearch自动研究系统研发的通用物理快系统模型登顶物理AI评测榜单RoboDojo,并通过真机展示了长程任务执行、记忆与高精度操作能力。公司提出Physical RSI(物理智能递归自我改进)路线,让AI Agent参与机器人模型研发、实验与评测,并将真实机器人反馈纳入下一轮研究。AutoRes
Epoch AI 研究显示,在特定 AI 基准上达到固定性能水平的成本自 2023 年以来以每季度约 47%、每年约 13 倍的速度下降,快于以往任何变革性技术。MIT 研究者基于 Artificial Analysis 数据得出年降幅为 5 至 10 倍,剔除硬件降价和竞争压力后,纯算法效率提升约为每年 3 倍。研究同时指出,新推理模型因消耗更多测试时算力
研究者提出 SpeakerMem-R1,一种以说话人为中心的双轨记忆框架,用于多方对话中的长期记忆。其双轨记忆分别存储带说话人标注的逐字消息和派生状态,并按人物级与群组级视图组织,查询时按实体、事件和时间融合两轨证据。团队用 SpeakerLevenshtein 奖励和说话人条件 GRPO 训练 Writer-R1(基于 Qwen2.5-3B),在 Grou
文章探讨为何不能简单地将失控AI与互联网隔离(air gap)。研究者指出,严格气隙虽能提升测试安全性,却会降低真实性和实用性,因为现实评估常需访问外部API和服务。气隙成本高、拖慢研究,且无法消除模型内部潜在风险,还可能被USB等方式突破。专家主张采用分层隔离而非一刀切方案。
Langfuse 发布 v4.45.1 版本,包含三项改动:修复饼图配色使其与其他图表一致、调整评分测试中更新后评分的事件时间戳、为 TypeSafe 连接新增默认与自定义模型支持。该版本为常规维护性更新,主要影响使用 Langfuse 进行 LLM 可观测性与评估的开发者。
Langfuse 发布 v4.44.0 版本,主要新增 LLM 连接、AI 网关与评估相关功能:支持在 Vertex AI Gemini 请求中发送额外请求头,AI 网关可转发 Anthropic Messages 并采集用量遥测与完整内容,评估模块新增对话信号决策模型模板。同时修复了会话工具行展示、ClickHouse 写入关闭、仪表盘聚合错误等问题,并推
研究者提出 HappyWorld-Bench,一个用于评估世界模型在智能体交互、探索与修改下是否保持可靠的综合基准。该基准基于六项世界能力(W1-W6)的分层框架,覆盖视频、空间与具身三条评测赛道,包含 1,138 条视频提示、300 个空间场景和 254 个具身测试用例,并搭建 HappyWorld-Arena 进行人类 A/B 对比与 Elo 评分。评测
该研究提出利用多个LLM在标注同一数据时的分歧来定位代码本中的模糊或缺失规则,从而有针对性地引导专家投入。在数千条辅导会话转录文本上,研究者比较了三种专家反馈方式:代码本验证、问答和理由标注。结果显示,理由标注使LLM标注准确率达到64.9%,优于专家耗时六个月修订的代码本(57.8%),问答方式也达到60.5%。这表明LLM可帮助将代码本修订从数月缩短至数
该研究审计了多智能体审议中常见的「置信度路由」协议:让各智能体报告置信度,由最高分者发言。作者将审计拆分为路由(是否选对候选)、校准(置信度是否像概率)和承诺(被选智能体是否公开说出赢得回合的答案)三个可分别测量的维度。在 4,181 条 gpt-oss-120b 奥数轨迹上,置信度能区分对错(AUROC 0.72)但严重过度自信(79% 置信 vs 52%
这篇 arXiv 论文指出,推荐系统离线评测中当多个候选得分完全相同时,排序规则(tie-breaking)会成为评测协议的一部分。作者提出「行序不变性」概念,并在 Amazon Beauty & Personal Care 的 3 万行数据上验证:同一评分加权属性重叠分数在输入顺序打破平局时 NDCG@10 为 0.85,改用基于用户和物品 ID 的确定性
该论文基于冻结的 Terminal-Bench 3 / Frontier-Bench 0.1 生产记录(1,081 个 PR、639 个计分任务、28,801 次试验、约 10.6 万美元 agent 支出),研究全失败任务是否真正代表能力缺口。作者对 125 个无诚实通过的任务施加有序有效性筛查,仅 78 个被认证为「未解决候选」,其余包括 14 个 or
论文提出 SkillApt,一个检索后激活控制器,用于判断已检索到的 Skill 是否应在当前执行状态下真正加载。它通过匹配的 WITH/WITHOUT 执行构建每个 Skill 的反事实证据,并聚合相似历史状态的结果做出 LOAD/ABSTAIN 决策。在 SRA-Bench 上,SkillApt-E 保持与 BM25 Top-1 相同的准确率(0.838
研究团队发布了 ItColBERT,一个 135M 参数的意大利语专用后期交互检索器,基于 PyLate 并遵循 ColBERT-Zero 训练配方,在单张 RTX 3090 上约 14.5 GPU 小时完成训练。在四个意大利语检索基准上,它优于除 mLateOn 外的所有通用后期交互基线,且参数更少。主要发现是方法学上的:在 MLDR-it 上,对未改动检
该论文在真实生产流媒体推荐数据集上系统比较了四种语义用户画像策略,按表示类型(聚合式物品嵌入 vs. LLM生成的自然语言摘要)和时间处理(全历史 vs. 短期/长期注意力融合)进行2×2交叉实验。结果显示,LLM画像的优势具有用户分群条件性:对习惯型用户聚合方法更优,对探索型用户LLM方法能带来准确率提升。此外,LLM画像虽使单条推荐列表略更多样,却导致系
研究团队发布 AgroBench,一个可复现的多模态基准,用于弱监督作物产量学习。该基准将美国县级 USDA 作物产量统计与 Sentinel-2 光学影像、Sentinel-1 SAR、气候和地形数据结合,生成像素级作物时序,每个像素序列以县级产量作为弱监督信号。数据集包含 788,654 个作物像素、超 1300 万条观测,覆盖 2017–2024 八个
研究者提出 KITE 架构,用类型化行为内核(TypeSafe 的 Jev,jev-1.13.0)对每个唯一状态查询一次,再以表格化执行任意规模人群实验,并用稀疏旗舰模型锚点估计干预效应。在 Epstein 的 9,070 名参与者实验中,覆盖 1.7% 状态的锚点使效应误差降低 41%;在 37 个 SocSci210 实验中,0.5–1.5% 锚点覆盖率
该研究提出「主张校准」(claim calibration)方法,用于明确后续复现研究实际支持了原始论文主张的哪一部分,以及成立条件与未验证部分。作者分析了推荐系统领域的五对原始-复现论文,发现数值、方法排序、统计结果与总体结论之间并不总是一致,复现研究往往只支持原始主张的一部分。基于此,作者提出「主张证据档案」(Claim Evidence Profile
该论文提出 Spec2COBOLRot,一个基于智能体 AI 的流水线,用于生成具有真实感的 COBOL 程序语料。方法结合规范驱动的生成与迭代退化,退化过程由从真实生产代码中提取的模式和复杂度目标引导,其中真实性被定义为结构上对生产代码的保真度。在三个不同业务领域的程序上评估显示,该流水线能可靠生成语法有效的程序并提升结构复杂度,但并非总能保持业务行为,且