Evidence-RL:面向证据密集型视觉推理的反事实证据解缠方法
Hugging Face Daily Papers 发布了一篇题为《Evidence-RL: Towards Evidence-intensive Visual Reasoning》的论文。论文提出了一种名为反事实证据解缠(CED)的训练时证据审计方法,用于增强视觉语言模型(VLM)的接地能力。CED 通过中和对象中心的证据区域并比较支持度下降,结合 GRP
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face Daily Papers 发布了一篇题为《Evidence-RL: Towards Evidence-intensive Visual Reasoning》的论文。论文提出了一种名为反事实证据解缠(CED)的训练时证据审计方法,用于增强视觉语言模型(VLM)的接地能力。CED 通过中和对象中心的证据区域并比较支持度下降,结合 GRP
北京大学、清华大学、北京航空航天大学、上海交通大学、中国科学技术大学联合发起首个机器人三视角世界模型评测榜单TriWorldBench,并公布首周结果。榜单聚焦多视角一致性与物理理解,CASIA-DRL、TONGJI Spatial Intelligence Team和Fysics AI的模型位列前三。该评测旨在推动世界模型从视觉生成向具身认知演进,并提供细
这篇综述论文探讨了“对抗性攻击用于善”的保护范式,即在视觉内容生命周期中,数据所有者、创作者、平台或审计者应用扰动和结构化信号来干扰未经授权的自动化或支持事后问责。论文识别了五个独立研究社区,分别针对隐私过滤、不可学习示例、生成式防护、对抗性验证码和溯源机制。评估发现大多数保护措施仍主要针对静态或弱自适应对手进行验证,缺乏受控基准之外的证据。
FATE是一种帧级音视频时间嵌入方法,旨在同时捕捉语义和时间对齐。与现有嵌入模型和同步模型不同,FATE保留帧级序列并在物理时间线上对齐,通过联合目标训练。在三个任务上,FATE在时间和语义检索上大幅超越最强基线,在零样本事件定位上匹配全监督方法,并作为生成评估指标与人类判断相关性最佳。源代码已公开。
Meta 发布了 Muse Glimmer,一个 30B 参数的开源多模态模型,包含 2B 视觉编码器和 28B 文本解码器,支持图像、视频和工具调用。该模型在 transformers、llama.cpp、vLLM 等库中获得首发支持,并采用混合注意力、门控分组查询注意力等架构优化。Muse Glimmer 还提供了可选的投机解码模块,以加速生成。
Ollama 在 v0.32.7 版本中宣布支持 Meta 最新开源模型 Muse Glimmer,这是 Meta Superintelligence Labs 发布的首个模型,为 30B 多模态模型,专为本地 agent 工作负载设计。目前该模型仅通过 Ollama 的 MLX 引擎在 Apple Silicon 上提供初始支持,NVIDIA、AMD 等平
Hugging Face Transformers 发布 v5.15.0 版本,新增多个模型支持,包括 Meta 的 Muse Glimmer(30B 参数多模态模型,专为智能体场景设计,Apache 2.0 许可)、IBM 的 GraniteSWA/GraniteMoeSWA、SKT 的 A.X-K1/K2 和 Cosmos3 Edge。该版本还包含多项破
OneEmo是一个统一的多模态情感推理模型,能够处理情感感知、理解和交互任务。研究团队构建了EmoWorld-130K数据集,通过人类参与的工作流程将专业知识转化为推理轨迹,并提出Emo-Chord强化学习策略来优化多任务学习。实验表明,OneEmo在多数基准上达到最先进性能,且参数远少于商业模型。
该研究重新审视了多模态智能体训练中环境规模扩展的常见范式,发现单纯增加环境数量并不总能提升性能,多模态环境尤其容易产生负迁移和优化冲突。为此,作者提出能力感知环境选择(AES)和分层难度课程(HDC)两种方法,分别从多样性和难度结构两个维度设计更有效的环境分布。实验表明,精心设计的环境分布能显著优于朴素的环境扩展,并带来更好的训练效果和泛化能力。
Hugging Face 每日论文介绍了一项名为 C4 的评估框架,用于测试多模态大语言模型(MLLMs)的跨概念创造力,该框架基于中文成语设计。研究构建了包含 184 个合成项目和 37 个人类创建项目的 C4-Eval 数据集,并在十个 MLLM 上进行了评估。结果显示,最强的闭源模型准确率约为 50%,而开源模型显著较低,揭示了当前 MLLMs 在解码
arXiv 论文提出 TransSLR,一种轻量级时间 Transformer 编码器,用于手语识别,针对中非手语(CASL)等低资源语言。TransSLR 在 CASL-W60 基准上达到 80.39% 的准确率,比之前最好成绩提升 10.46%,且计算开销低,适合资源受限环境。
该研究提出从失语症图片命名错误谱中逆向恢复大型语言模型(LLaVA-Vicuna 13B)的损伤参数(层索引、修改百分比、噪声sigma),并训练多任务神经网络实现映射。结果显示修改百分比和噪声sigma可恢复,层索引仅能近似恢复,但反事实验证中恢复参数能高保真复现目标行为(81.4%),表明Transformer层存在功能冗余。在278名中风幸存者的错误谱
arXiv 论文提出 InsertFuse,一个用于多类别参考引导图像插入的统一框架。其核心思想是将类别特定专家学习与跨类别能力整合解耦,通过插入在策略蒸馏(IOPD)将多个专家能力整合到单一学生模型中。此外,引入 Token 对齐几何条件(TAGC)和区域平衡流匹配以提升空间控制,以及参考 CFG 增强参考引导。在 AnyInsertion 基准和自建多类
StreamArena是一个用于小时级、交互式流媒体视频理解的基准测试,包含243个平均时长88.8分钟的视频和3646个开放式问答对,评估实时感知、历史回顾、主动交互和多模态工具使用能力。研究发现现有方法在连续交互和长时程多模态理解之间存在矛盾,为此提出StreamMind架构,通过前端工作者处理延迟关键任务、后端工作者构建持久多模态记忆,在四项能力上均优
Om AI联汇完成数亿元融资,并开源全球首款端侧原生模型VLX-Seek 1.5。该模型有3B和10B两个版本,采用流式多模态架构,在无人机视角、指代表达理解等任务上超越英伟达LocateAnything等更大模型。公司旨在通过端侧原生路线,推动物理AI在机器人、无人机等场景的规模化落地。
MiniMax 发布了通用全模态生成系统 MiniMax H3,支持文本、图像、视频和音频的统一理解,并能生成带原生立体声的 2K 分辨率、最长 15 秒的视频。该系统包含 H3-Context-IR、H3-Base 和 H3-Regenerate-2K 三个模块,支持多种输入模式,并提供 API 和在线应用。
百度飞桨发布 PaddleOCR-VL,一个基于 ERNIE-4.5-0.3B-Paddle 的 0.9B 超紧凑视觉语言模型,专注于多语言文档解析,支持 OCR、版面分析、表格、公式和图表识别。该模型以 Apache-2.0 许可证开源,并提供英文、中文和多语言支持,新版本为 PaddleOCR-VL-1.6。
xAI 发布了 Imagine Image 2.0 模型,作为 Grok 平台的新“质量模式”,提供精细指令遵循、排版布局优化和跨生成一致性。该模型在 Arena 基准测试中排名第二,仅次于 OpenAI 的 GPT-Image-2。新模型包含 Magic Wand、区域分割、背景移除、多参考编辑和智能调整大小等编辑工具,并推出模板和视频预制作功能。API
xAI 发布了 Imagine Image 2.0,作为 grok.com/imagine 及 iOS/Android 应用上的新质量模式,提供精确的图像生成和编辑功能。该模型在文本到图像生成和图像编辑方面排名世界第二,并引入了魔法棒、区域分割、背景移除和多参考编辑等工具。此外,xAI 还推出了针对常见工作流的模板,API 访问即将推出。
SGLang 发布 v0.5.17 版本,包含 582 个 PR,来自 194 位贡献者。主要亮点包括对 Kimi K3 和 MiniMax-H3 的 day-0 支持,以及新的 DCP 通信后端、DWDP 预填充策略、会话感知的 Radix Cache 等性能优化。此外,还新增了多个模型支持,并提升了引擎恢复速度和降低了主机开销。