返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月3日周一 · 16 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

面向黑暗环境的鲁棒3D感知RGB-NIR成像

本文提出了一种新的RGB-NIR低光成像方法,通过引入3D感知神经建模,在无需干净RGB监督的情况下,隐式融合极噪RGB观测与NIR线索,恢复干净RGB图像。该方法避免了干净RGB数据收集,并能泛化到不同噪声水平,在合成和真实数据上表现优越。代码已开源。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

水稻病害检测 Swin Transformer 微调模型发布

nqvii 在 Hugging Face 上发布了 swin-tiny-rice-disease 模型,这是基于微软 Swin Transformer 微调的水稻病害图像分类模型,在 rice disease 701515 数据集上达到 87.7% 的准确率和召回率。该模型使用 AdamW 优化器和余弦学习率调度器训练了 35 个 epoch,采用 Apac

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源模型发布

Meta 发布 TRIBE v2:首个预测人类大脑反应的 AI 模型

Meta AI 发布了 TRIBE v2,这是首个基于神经科学原理预测人类大脑对视觉、听觉和语言反应的 AI 模型。该模型利用超过 700 名健康志愿者的 fMRI 数据训练,能够高分辨率预测大脑活动,并支持对新对象、语言和任务的零样本预测。Meta 以 CC BY-NC 许可公开了研究论文、模型权重和代码,旨在加速神经科学研究并推动临床应用。

正文结构化主题已通过公开置信门槛
AI at Meta Blog一手来源模型发布

Meta 发布 Muse Spark 多模态推理模型,推动个人超级智能发展

Meta 推出 Muse Spark,这是 Meta Superintelligence Labs 开发的首个原生多模态推理模型,支持工具使用、视觉思维链和多智能体编排。该模型在 meta.ai 和 Meta AI 应用中可用,并开放了私有 API 预览。Muse Spark 在多项任务上表现强劲,其 Contemplating 模式通过并行多智能体推理,在

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里发布Qwen3.8-Max,性能直逼Claude且价格低廉

阿里巴巴发布新一代基座大模型Qwen3.8-Max,总参数量达2.4万亿,在编程、专业工作、长程任务和多模态分析等场景表现突出,在第三方榜单Arena中进入全球第一梯队,直逼Claude系列。该模型定价低廉,国内每百万Tokens输入12元、输出36元,隐式缓存命中仅1.5元,国际价格仅为Opus 5的40%和24%。实测显示其能端到端交付编程项目、进行长文

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

ZeroR@CHiPSAL 2026:两阶段视觉语言适配用于尼泊尔模因分类

本文介绍了ZeroR团队在CHiPSAL 2026共享任务中针对尼泊尔语模因的多模态仇恨言论和情感检测系统。该系统基于Qwen3-VL-8B-Instruct模型,采用两阶段训练流程,包括LoRA微调和对比学习,最终在仇恨言论检测中排名第二(F1: 0.797),在情感分析中排名第四(F1: 0.518)。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

CyberNeuro:面向队列级神经影像与临床数据隐私保护智能体工作台

arXiv 论文介绍了 CyberNeuro,一个用于大规模神经影像和临床数据分析的隐私保护智能体工作台。它通过四个专用智能体(Planner、Validator、Dispatcher、Reporter)和本地 LLM 模型 WandaMind,支持自然语言执行复杂工作流,同时保持临床级数据隐私。在 NeuroBench 基准上,CyberNeuro 将保留

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

DragonCrawl:基于意图的生成式移动端到端测试框架

DragonCrawl 是一个基于大语言模型的移动端端到端测试框架,从嵌入相似度匹配演进到生成式意图推理,利用 GPT-4o 的多模态能力在 CI/CD 中持续验证用户流程。该系统在 iOS 和 Android 上分别达到 91.6% 和 92.2% 的通过率,将测试接入时间从 96-120 小时缩短至 4 小时以内,并节省了约 27 人年的维护工作量。论文

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

不确定性感知的多视角结构学习深度伪造检测

该研究提出了一种基于多视角结构学习的不确定性感知深度伪造检测框架,通过视觉、语义和结构三个流整合互补证据,并引入分支间分歧校准(IBDC)机制将预测不确定性与证据冲突关联。在FaceForensics++训练集上的跨数据集实验表明,该方法在多个分布外基准上实现了最先进的泛化性能,同时改善了校准和选择性预测能力,为分布偏移下的可信深度伪造检测提供了稳健基础。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

ReLoop-UME:基于可学习检索寄存器的循环深度通用多模态嵌入

arXiv 上发表了一篇关于通用多模态嵌入(UME)的论文,提出 ReLoop-UME 模型。该模型通过循环复用参数共享的检索形成块,并引入可学习的检索寄存器,在不增加 token 工作区的情况下沿模型深度扩展计算。实验表明,ReLoop-UME 在 MMEB-V2 和 MRMR 基准上持续提升检索性能,且运行速度比 UME-R1 快 44.9 倍,比 PL

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

SeekBrain:加速神经科学发现的自主多智能体系统

arXiv 论文介绍了 SeekBrain,一个自主多智能体框架,旨在通过领域基础的层次规划和跨模态数据分析加速神经科学发现。该框架从代码-论文对中动态构建分析配方库,并耦合智能体规划与执行引擎,按需生成假设和分析流程。在 BrainArena 基准上的评估显示其性能优于现有智能体基线,并在斑马鱼和小鼠真实数据中揭示了神经表征结构。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

智象未来发布无限时长视频智能体vivago R1,实测土耳其风格短片表现惊艳

智象未来在2026年WAIC大会上发布全球首个无限时长多模态创作智能体vivago R1,并宣布完成C轮融资,近三个月累计融资超20亿元。该产品通过自研模型与聚合第三方模型(如Sora 2、可灵、Veo)结合,采用Agent编排实现长视频生成,实测显示其在叙事一致性、风格保持方面表现优异,但底层仍为分段拼接。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

N 0-VTLA:带潜在触觉令牌的视觉-触觉-语言-动作模型

N 0-VTLA 是一个视觉-触觉-语言-动作(VTLA)基础模型,通过触觉感知和反馈控制实现精细的接触丰富操作,并支持从部署数据中进行离线策略改进。该模型采用视觉-触觉预训练、分阶段触觉通路集成和优势条件离线强化学习(ALTER)的训练方案,在九个真实机器人任务中全部获胜,并在二十任务模拟套件中达到63.8%的平均成功率,显著优于最强基线。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

FLUX 3 发布:统一多模态流模型,支持图像视频音频与动作预测

Black Forest Labs 发布了 FLUX 3,这是一个统一的多模态流匹配基础模型,支持图像、视频、音频和动作预测。其核心创新是 Self-Flow 框架,通过自监督特征重建目标同时提升生成质量和表征质量,在机器人操作任务中成功率从 42% 提升至 71%。FLUX 3 支持长达 20 秒的同步音频视频生成,并计划后续开放 Dev 权重。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Kimi K2.7 Code 对比 Claude Fable 5:落地页成本降低 94%

Together AI 进行了一项实验,比较了开源模型 Kimi K2.7 Code 与专有模型 Claude Fable 5 在生成落地页方面的表现。结果显示,Kimi 的成本平均低 94%,且质量评分接近,尤其在通过自定义 MCP 服务器提供设计灵感后,Kimi 的输出质量显著提升。该实验表明,开源模型在成本效益上具有明显优势,且质量差距正在缩小。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源模型发布

Together AI 首日上线 Thinking Machines Lab 多模态模型 Inkling

Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。

8月2日周日 · 4 条
正文结构化主题已通过公开置信门槛
Interconnects AI研究

开放模型新动态:Inkling、Hy3、Kimi K3 等展示帕累托前沿价值

Interconnects AI 发布第23期开放模型盘点,指出开放模型生态持续繁荣,而非此前预测的行业整合。文章重点介绍了 Thinking Machines 的 Inkling、腾讯的 Hy3、Poolside 的 Laguna S2.1、DeepSeek-V4-Flash 和 Moonshot 的 Kimi K3 等模型,并讨论了开放模型的商业价值、许

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源开源

Together AI 发布开源视频翻译工具 Violin

Together AI 推出了完全开源的视频翻译工具 Violin,基于 Together API,结合语音识别、大语言模型和语音合成技术,实现高质量视频翻译。Violin 提供 Web 应用、CLI 和代理技能三种使用方式,并内置视频内容感知的聊天助手和自然语言语音选择器。该工具采用 MIT 许可证发布,旨在打破语言障碍,使视频内容更易于全球观众访问。

正文结构化主题已通过公开置信门槛
Mistral AI News一手来源模型发布

Mistral AI 发布 Pixtral 12B 多模态模型

Mistral AI 发布了 Pixtral 12B,这是一个原生多模态模型,基于 Mistral Nemo 架构,并新训练了 4 亿参数的视觉编码器,支持可变图像尺寸和 128K 长上下文。该模型在 MMMU 基准上达到 52.5%,在指令跟随和多模态任务上表现优异,同时保持文本性能不妥协。模型采用 Apache 2.0 许可证,可在 La Platefo

正文结构化主题已通过公开置信门槛
xAI News一手来源模型发布

xAI 发布多模态模型 Grok-1.5V 及 RealWorldQA 基准

xAI 发布了其首个多模态模型 Grok-1.5V,能够处理文档、图表、截图和照片等多种视觉信息。该模型在多个基准测试中表现优异,特别是在新的 RealWorldQA 基准上超越了 GPT-4V 和 Claude 3 等竞品。xAI 还开源了 RealWorldQA 数据集,包含 700 多张图像,旨在评估模型对真实世界的空间理解能力。