未写下的基准:多模态机器学习在抽象感知推理中的新挑战
本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 776 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
本文提出了一个名为“The Unwritten Benchmark”的新基准,用于评估多模态模型在抽象感知推理中的能力。该基准要求模型仅通过笔划声音和手部运动视频来推断正在书写的单词,而无需可见的墨水痕迹。结果显示,人类参与者的有序字母准确率超过80%,而包括GPT-4o和Gemini 2.5-Pro在内的领先多模态模型准确率低于10%。此外,研究发现多模态
arXiv 论文提出 SELR 框架,通过多任务训练让单一模型同时进行高效潜在空间推理并生成可读的思维链解释,解决了潜在推理的不可解释性和监督缺失问题。实验表明 SELR 在 LLM 和 VLM 上相比基线提升了 token 效率和准确性,且无需外部解码器。
OpenBMB 发布了 MiniCPM-o 2.6 的 int4 量化版本,该版本通过 AutoGPTQ 量化技术将 GPU 内存占用降至约 9GB,使 GPT-4o 级别的多模态大模型(支持视觉、语音、实时语音对话等)能够在手机上运行。用户需从特定分支安装 AutoGPTQ 并使用 AutoGPTQForCausalLM 加载模型。
OpenBMB 发布了 MiniCPM-o 2.6,这是一个 8B 参数的多模态大模型,支持视觉、语音和实时多模态流式交互,在多个基准上超越 GPT-4o 等闭源模型。该模型基于 SigLip、Whisper、ChatTTS 和 Qwen2.5 构建,支持端侧部署,并已开放 ollama、int4、GGUF 等格式。
OpenBMB 发布了 MiniCPM-V 4.5 的 AWQ 量化版本,该模型基于 Qwen3-8B 和 SigLIP2-400M,总参数 8B,在视觉语言任务上超越 GPT-4o-latest 和 Gemini 2.0 Pro 等专有模型。模型支持高效视频理解、可控的快速/深度思考模式,以及高分辨率 OCR 和文档解析。量化版本支持多种推理框架和本地部署
阿里云在韩国第三座数据中心正式上线,并推出Agentic AI相关服务,以满足当地AI及云计算需求。本轮扩建后,阿里云全球基础设施覆盖30个地域、104个可用区,并计划拓展至巴西。阿里云在亚太云计算市场排名第一,Qwen模型家族全球下载量超20亿次,衍生模型超30万个。韩国AI公司Gendive和Naver旗下Zepeto已采用阿里云相关服务。
VibeWorlding 是一个用于基准测试和训练多模态智能体的统一框架,旨在从用户查询端到端构建交互式 3D 开放世界。该框架包含 VWE-BENCH 基准(含 2,616 个 3D 资产、323 个种子世界和 6,828 个查询)和 VibeWorlding-Gym 强化学习训练环境。实验表明,当前前沿多模态大模型(如 GPT-5.5 和 Qwen3.8
阿里巴巴于8月17日发布AI音乐生成模型HappyShrimp 1.0(快乐虾米),该模型支持自然语言理解,可端到端生成包含歌词、旋律、编曲和人声的完整歌曲。体验显示其能准确理解提示词并快速生成贴合主题的音乐。此举是阿里在AI内容生成领域的最新布局,同时公司正出售游戏资产,将资源向AI集中。
Google 发布了 TIPSv2 系列视觉-语言模型,其中 SO400m/14 变体拥有 4.12 亿视觉参数和 4.48 亿文本参数,通过对比学习生成空间丰富的图像特征,支持零样本分类和分割。该模型基于 ViT 架构,采用 Apache 2.0 许可,并提供了完整的代码示例和预训练权重。
Google DeepMind 发布了 TIPSv2 系列视觉语言模型,其中 L/14 变体拥有 303M 视觉参数和 184M 文本参数,通过对比学习生成空间丰富的图像特征,支持零样本分类和分割。该模型基于 ViT 架构,采用 Apache 2.0 许可证,并提供了 Hugging Face 集成代码示例。
Google 发布了 TIPSv2 B/14 DPT 模型,这是一个基于冻结的 TIPSv2 B/14 骨干网络的密集预测 Transformer 头,用于深度估计、表面法线预测和语义分割。该模型在 NYU Depth V2 和 ADE20K 数据集上训练,支持多任务推理,并已开源在 Hugging Face 上,采用 Apache 2.0 许可证。
美团LongCat团队构建了MineExplorer评测基准,用于系统评估多模态大模型在开放世界中的长程任务能力。该基准包含813个人工验证的实例,通过隐藏前置条件、知识解耦和多智能体数据合成等创新设计,揭示了当前顶级模型在动态世界中感知强于推理、多跳任务成功率骤降等能力断层。评测显示最强模型Claude-Opus-4.6整体成功率仅41分,导航失败是主要错
美团技术团队在KDD 2026上发表了8篇论文,涵盖推荐大模型、生成与奖励建模、智能体搜索、Transformer框架等,并荣获KDD Cup 2026 DataAgents赛道冠军和季军。论文介绍了MTFM、CDRRM、LocalSearchBench、JTransNet、UME、GRAD、HMAF、MTGenRec等创新技术,其中MTFM已用于统一推荐大
LocalAI 团队发布了 Gemma 4 26B-A4B Heretic(去审查版)的 APEX 量化 GGUF 模型,采用混合专家架构,支持视觉理解。该模型通过 Heretic 工具进行任意秩消融以减少拒绝行为,同时保持性能。APEX 量化策略针对 MoE 模型优化,提供多种精度配置以适应不同硬件。
LocalAI 团队发布了 Gemma 4 26B-A4B 的 APEX 量化 GGUF 模型,该模型基于 Google 的 Gemma 4 26B-A4B,采用 APEX 量化策略,提供多种精度配置文件,并包含视觉投影器。模型支持本地运行,通过 llama.cpp 构建,旨在优化 MoE 模型的推理效率。
LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX-MTP GGUF 量化版本,该模型基于 Qwen3.6-35B-A3B 架构,内置 MTP 多头预测头,支持自推测解码,无需单独草稿模型。提供了多种量化配置,包括 I-Balanced、I-Quality 等,并包含视觉投影器,支持图像理解。该发布旨在提升 MoE 模型
LocalAI 团队发布了 Qwopus3.6-35B-A3B-Coder 的 APEX 量化版本,该模型是基于 Qwen3.6-35B-A3B 的 MoE 编码模型,支持视觉。APEX 量化策略针对 MoE 模型按张量角色分类并应用分层精度梯度,提供多种量化配置以适应不同硬件。该模型还包含 MTP 头,支持自推测解码,并可通过 LocalAI 运行。
Mistral AI 于2026年8月4日发布Shieldstral,一款3B参数的多模态安全分类器,支持通过自然语言自定义审核规则,统一审核文本、图片及图文混合内容。该模型采用三层设计,将审核任务转化为Yes/No判断,通过对比式训练和合成数据提升规则匹配能力,在多个基准上超越更大参数模型。Shieldstral降低了部署门槛,展示了小模型在垂直场景中的潜
腾讯云AI团队发布了一篇教程,介绍如何通过CodeBuddy平台使用CLI Skill调用混元生图接口,实现一行命令生成图片。该Skill封装了API调用、JSON解析和Base64解码等步骤,支持交互式输入和直接附带Prompt,并输出文件路径、RequestId等信息。文章还提供了Prompt优化建议,并指出类似思路可扩展至OCR、ASR等其他AI能力。
腾讯云联合开发者社区发起AI Skills最佳实践有奖征集活动,面向开发者征集基于WorkBuddy、CodeBuddy、ADP等Agent平台的创新应用案例。腾讯云将OCR、语音、AIGC、安全等核心AI能力封装为标准化Skills,支持一键接入多个Agent平台。活动设有文章和视频两个赛道,投稿时间为7月24日至8月21日,优秀作品可获得丰厚奖励。