CrossModalQA:面向多模态检索增强生成的跨模态多跳基准
本文提出了 CrossModalQA,一个用于评估多模态检索增强生成(RAG)的开域基准,包含 1,863 个问答对,基于 4,987 篇维基百科文章和 4,431 张维基共享图片构建,覆盖五种跨模态推理路径,平均推理深度为 3.50 跳。实验表明现有多模态 RAG 系统难以恢复完整证据链,且不完整检索可能引入干扰,导致性能低于闭卷模型;完整跨模态检索比生成
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
本文提出了 CrossModalQA,一个用于评估多模态检索增强生成(RAG)的开域基准,包含 1,863 个问答对,基于 4,987 篇维基百科文章和 4,431 张维基共享图片构建,覆盖五种跨模态推理路径,平均推理深度为 3.50 跳。实验表明现有多模态 RAG 系统难以恢复完整证据链,且不完整检索可能引入干扰,导致性能低于闭卷模型;完整跨模态检索比生成
SkyProduction(天工工作台)宣布第二期限免活动,9月9日至14日期间,MiniMax H3模型限时免费无限使用,首日会员免费,后续新开会员或充值积分可获赠限免天数。该模型支持文生视频、多模态参考和原生音画生成,旨在降低短剧、广告等创作者的试错成本。活动由昆仑万维旗下平台推出,并整合了剧本生成、翻译、出海改编等创作工具。
OpenAI 发布了 Node SDK 的 v7.12.1 版本,该版本包含了此前未发布到 npm 的 GPT Image 2.5 模型支持。此版本新增了 GPT Image 2.5 模型及图像选项,并修复了 CI 流程中 Cloudflare 示例回归测试的时序问题。
OpenAI Java SDK 发布 v4.60.0 版本,新增了对 GPT Image 2.5 模型及图像选项的支持。该更新通过 API 扩展了图像生成能力,为 Java 开发者提供了新的模型调用选项。
OpenAI Python SDK 发布 v3.10.0 版本,新增 GPT Image 2.5 模型及图像选项支持,并添加服务账户 API 密钥过期字段。此次更新扩展了图像生成能力,并增强了密钥管理功能。
OpenAI 发布了 ChatGPT Images 2.5 图像生成模型,改进了多轮指令跟随能力、响应速度及参考照片中主体的保持。API 新增两个模型 ID:gpt-image-2.5-sunburst 和 gpt-image-2.5-flare,前者侧重编辑精度,后者侧重快速生成。Simon Willison 升级了其 CLI 工具以支持参考图像输入。
另有 2 家信源报道
OpenAI 于周二发布 ChatGPT Images 2.5,并新增 Sketch 功能,用户可在 ChatGPT 内绘制草图并基于此生成图像。该功能通过输入 @Sketch 激活,实测可将鼠标绘制的简笔画转换为逼真照片,并支持对图像局部添加修改意见。OpenAI 称新版本图像具有更自然的光照和更丰富的纹理,编辑指令遵循能力更强,延迟较 Images 2.
魔搭 ms-swift 发布 v4.5.3 版本,新增对 Qwen3.8-Flash-Next、DeepSeek-V4-Pro-0813、Ling-3.0 系列等模型的支持,并引入多项新特性,如 Megatron-SWIFT Muon 优化器支持不同学习率、OPD 蒸馏支持多模态、性能优化等。同时修复了训练、RL、Megatron 及多个模型相关的 bug。
Adobe 正在对其专业视频编辑软件 Premiere 进行重大更新,推出新的 Generative Media 工具,使编辑人员无需离开项目时间线即可生成视频、音效、音乐和音景。该工具支持在时间线内直接选择多种底层模型,包括 Adobe Firefly、Google Veo、Runway、Luma 和 Kling。此外,Premiere 还新增了 AI 音
Vontra 发布了基于 zai-org/GLM-5.3-Flash 的 MLX 4-bit 量化版本,支持 Apple Silicon,并保留了原生 MTP(多 token 预测)层。该模型采用 4-bit 仿射量化,组大小为 64,总下载大小约 181.7 GB,支持 1M 上下文,架构为 glm5 next 多模态稀疏 MoE。在 Apple M3 U
OpenAI的GPT-6 Astra因用户大量用于3D建模而额度耗尽,OpenAI高管Tibo宣布为所有付费订阅用户重置额度。用户展示了多种3D应用,包括从照片建模、生成城市模型、制作3D游戏和教育可视化,效果惊艳。此举被视为推动AI在3D创作领域应用的重要事件。
PydanticAI 发布 v2.41.0 版本,新增了 openai-codex 提供商以支持 ChatGPT/Codex 订阅认证,并引入了直接的图像生成 API(ImageGenerator)。同时,弃用了 ImageGeneration 和 XSearch 上的 fallback model,改为 fallback subagent model。此外
neureps 发布了 warmly-qwen35-08b-enko-gguf,这是一个基于 Qwen3.5-0.8B-enko 的 0.8B 端侧模型,采用剪枝和蒸馏技术,并以 GGUF 格式提供。该模型用于 Warmly 应用的小型设备部署,支持图像字幕和文本评论,总大小约 542MB。v3.1 版本包含蒸馏权重和 LoRA 人物适配器,通过 llama
vivo在创作者盛典上宣布新一代旗舰X500系列将于9月21日发布,并提前剧透影像升级,包括首发蓝图光御900传感器、4K 240帧慢动作、AI辅助摄影等功能。vivo与蔡司、联发科深度合作,旨在实现“拍照第一、视频唯一”的目标,并可能对苹果新旗舰构成竞争压力。
阿里巴巴研究部门发布了Qwen-Drive 1.0,这是一个将空间感知、交通问答和路线规划整合到单一AI模型中的驾驶系统。该模型基于Qwen3.5-4B,通过添加3D地图和路线规划模块,在模拟中将车辆偏离道路率从24%降至12%,但解释与驾驶决策有时不一致。模型已免费向研究社区开放。
字节跳动旗下Seed研究团队正式发布Seed2.1模型家族,该系列面向智能体场景,旨在提升真实生产力。Seed2.1在通用智能体能力、端到端编码和多模态基础能力上均有增强,并在多个基准测试中表现优异。目前,豆包和火山引擎用户已可开始使用Doubao Seed 2.1。
智象未来(HiDream.ai)发布了具身世界模型HiDream-O1-Embodied,该模型在RoboColiseum评测的扰动适应子榜单中以0.692分登顶。模型通过语言理解、多视角视觉感知和高容错机制提升物理交互能力,并采用“真实基座+生成增强”的数据生产范式。此次发布标志着智象完成从图像、视频到3D、动作的全模态技术闭环,构建统一世界模型基座。
MedProb 是一个轻量级线性探测框架,通过冻结视觉语言模型(VLM)的内部表示来预测医学视觉问答(Med-VQA)的多选题答案,无需自由文本生成。在 PATH-VQA、SLAKE 和 VQA-RAD 基准上,MedProb 比提示方法恢复了更多与答案相关的信号,并优于医学微调 VLM 和智能体系统。研究发现,生成式评估可能低估小型模型中的可恢复信号,且医
MURAL 是一个针对多模态推荐的统一框架,通过自适应边学习解决现有图神经网络的静态结构和语义脆弱性问题。它采用可微检索增强策略发现潜在物品关联,并利用不确定性感知融合模块动态降低噪声模态权重。实验表明,在 TikTok 和 Amazon 等基准上,MURAL 显著优于现有方法,并具备可解释性和鲁棒性。
Wayne State University的研究人员提出FailSAE框架,利用稀疏自编码器(SAE)对视觉语言模型(如CLIP)进行可解释的失败预测。该框架将失败预测建模为对SAE稀疏潜在激活的分类任务,并引入三阶段失败感知训练流程。实验表明,FailSAE在失败预测上优于现有基线,并揭示了失败时模型表示从类别特定概念转向模糊或风格相关概念。此外,该框架