返回全部动态

未写下的基准:多模态机器学习在抽象感知推理中的新挑战

原标题:The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

arXiv cs.AI一手来源研究质量 85

AI 摘要

本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态融合存在悖论,即同时提供音频和视频反而会降低模型性能,表明当前模型在跨模态因果推理和微运动学理解方面存在根本性缺陷。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning Abstract Current multimodal models have demonstrated remarkable proficiency in recognizing static visual and auditory content. However, their capacity for abstract perceptual reasoning, inferring unseen information from dynamic, generative processes, remains a critical and underexplored frontier. In this paper, we introduce The Unwritten Benchmark, a new challenge designed to probe this abst


发布时间:2026-08-18 12:00
抓取时间:2026-08-18 12:00
来源机构:arXiv
阅读原文arxiv.org