返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 777 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月4日周二 · 15 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

谷歌2026年7月AI新闻:新Gemini模型、机器人技术与创意工具

谷歌在2026年7月发布了一系列AI更新,包括推出三款新的Gemini模型(3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber)以提升代理工作流的效率,以及发布Gemini Robotics ER 2模型以增强机器人的具身推理能力。此外,谷歌还扩展了创意工具,如Lyria 3.5音乐生成模型和Google Vids的视频生成功能

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

商汤与NTU推出NEO-unify:原生统一多模态模型新范式

商汤科技与南洋理工大学联合推出NEO-unify(预览版),这是一种原生、统一、端到端的多模态模型范式,无需预训练编码器或VAE。该模型通过自建表示空间直接学习近无损输入,结合Mixture-of-Transformer架构和统一的文本与视觉生成学习。初步实验显示,NEO-unify(2B)在图像重建和编辑任务上表现良好,并展现出更好的数据扩展效率。团队计划

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

几何引导的视觉-语言混合专家负载均衡方法 ReBA

Hugging Face 每日论文发布了一篇关于视觉-语言混合专家模型负载均衡的研究。论文提出 ReBA 方法,通过分别平衡图像和文本的负载、以图像为单位进行路由决策,解决了标准辅助损失在混合负载下可能隐藏模态特定不平衡的问题。实验表明,ReBA 在四个视觉-语言 MoE 骨干网络上降低了负载不均衡,同时保持了任务准确率。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索

DeepVoyager-VL 是一个用于长时程多模态智能体的视觉在环搜索框架,通过构建多模态事件图驱动数据合成,设计主动视觉获取和按需图像加载的智能体框架,并在合成数据上微调模型,无需强化学习。在十个多模态搜索基准上的实验证明了其有效性,推动了多模态深度研究智能体的发展。

正文结构化主题已通过公开置信门槛
量子位商业

前海母基金数亿元押注Om AI联汇,开源VLX-Seek 1.5加速端侧物理AI落地

杭州联汇科技(Om AI联汇)完成数亿元融资,由前海母基金领投,杭州政府产业基金等参投。公司同时开源VLX-Seek 1.5端侧多模态模型,性能超越英伟达同类模型,资金将用于技术迭代和物理AI商业化。公司已与联想、苹果合作,并推出可穿戴AI产品服务视障用户。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

3DZip:面向3D问答的空间感知特征多样性引导令牌压缩

Hugging Face 每日论文发布了一篇题为《3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering》的研究论文。该论文提出了一种名为3DZip的三阶段令牌压缩框架,用于3D视觉语言模型,通过粗体素化、基于特征多样性的锚点选择以及空

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

UEmbed:统一稀疏与稠密的多模态嵌入模型

Hugging Face 每日论文介绍了 UEmbed,一种仅解码器的多模态嵌入模型,能在一次因果前向传播中同时生成稀疏词级和稠密表示。UEmbed 通过添加可学习特殊标记并将词汇表划分为不相交子集来实现稀疏预测,发布了 2B、4B 和 9B 三种规模,其中 9B 模型在 MMEB-v2 上达到 71.8(稠密)和 71.0(稀疏)的分数,优于现有公开数据训

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

PhysAgent:用于可靠远程心率估计的多智能体框架

PhysAgent是一个用于远程心率估计的多智能体框架,由arXiv论文提出。该框架利用多个基础估计器生成候选心率,并通过轻量级4B多模态大语言模型Qwen3-VL-4B驱动多智能体推理,结合确定性生理验证器进行融合,以提高心率估计的稳定性和可靠性。实验表明,PhysAgent在多个公共基准上优于直接预测和传统融合方法,代码即将发布。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

SafeBuild-Bench:面向建筑安全的时序鲁棒基准与图增强数据挖掘

SafeBuild-Bench 是一个用于评估多模态大语言模型在建筑安全场景下表现的新基准,基于超过10万条工业图像-文本记录构建,包含3314个任务实例。该基准引入了图增强多模态选择流程 GEMS,以从冗余数据中筛选信息量大的样本。当前最佳模型在基准上的得分约为60,表明现有模型在建筑安全理解方面仍不可靠。相关基准、评估脚本和代码已开源。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

重新思考专业设计数据的预训练:JONES-19 数据集的证据

arXiv 上发布了一篇关于设计数据预训练的研究论文,基于 JONES-19 文化设计数据集,比较了 ImageNet 预训练与从零开始训练 CNN 的性能。研究发现,虽然 ImageNet 预训练能提升判别性能,但通过多裁剪局部采样从零开始训练也能达到类似效果,表明在专业设计领域,精心策划的小型高质量数据集可能比大规模通用预训练更有效。

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

PHA-Net:基于原型的文本-视频检索分层对齐网络

本文提出了一种名为PHA-Net的原型分层对齐网络,用于文本-视频检索任务。该方法通过引入模态共享原型作为桥梁,并设计原型支持的令牌合并模块和原型对比损失,以高效优化跨模态对齐。在MSR-VTT、ActivityNet、VATEX和Charades四个基准上,PHA-Net在召回率总和上分别提升了8.8%、19.2%、0.7%和4.9%,验证了其有效性。

正文结构化主题已通过公开置信门槛
Latent Space模型发布

Qwen3.8-Max发布:2.4T参数开源模型,主打编码与多模态智能体

阿里巴巴发布Qwen3.8-Max,一个2.4T参数的MoE模型,专注于编码、长程智能体任务和多模态推理,并承诺下周开源权重。该模型在多个基准测试中表现优异,如Frontend Code Arena排名第四,并展示了自主编码、芯片设计和电商策略等能力。API定价为每百万输入token 2美元,输出6美元。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

StyleForge:基于超图反事实推理的室内家具风格搭配

StyleForge 是一个用于固定布局室内家具风格搭配的框架,它利用动态超图风格场和反事实推理来确保家具在形状、材质和颜色上的协调。该方法通过多模态大语言模型提取风格先验,并在推理时通过测试时训练优化候选选择。在 3D-FRONT 数据集上的实验表明,StyleForge 在家具检索和场景级风格一致性方面优于现有基线。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

VAD:多模态同策略蒸馏中的视觉证据归因目标重建

本文提出视觉归因蒸馏(VAD),一种用于多模态同策略蒸馏的反事实目标重建算法,通过评估教师模型在有/无视觉证据时的输出差异,估计纠正信号中由视觉证据支持的部分。在4B和9B规模的六个细粒度视觉基准上,VAD优于直接特权视图蒸馏和视觉优势加权方法。结果表明,反事实目标重建是源混合监督的有效替代方案。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

三星收缩中国手机业务;阿里发布Qwen3.8-Max;DeepSeek日处理8万亿Token

三星被曝收缩中国手机业务,将清退月销售额不足30万元的门店,以应对市场份额仅0.1%的困境。阿里巴巴发布Qwen3.8-Max模型,带动港股上涨,并推出千问办公产品。DeepSeek V4 Flash单日处理8万亿Token,OpenAI被迫降价。智元官网披露合伙人团队,蚂蚁灵波确认融资传闻,MiniMax H3开源获多芯片适配。

8月3日周一 · 5 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

MiniMax H3开源模型首次登顶AI视频排名

中国公司MiniMax发布了H3视频模型权重,成为首个在AI视频排名中登顶的开源模型。该模型拥有330亿参数,能处理文本、图像、视频和音频,生成4至15秒带立体声的片段。尽管2K分辨率模块和H3-Context-IR未开源,但开放权重允许微调,商业使用仅限年收入低于2000万美元的公司。同日,字节跳动发布了闭源的Seedance 2.5模型。

正文结构化主题已通过公开置信门槛
THE DECODER研究

Karpathy 用 Claude Opus 5 将《指环王》段落转化为 3D 场景,探索 AI 游戏生成潜力

OpenAI 联合创始人 Andrej Karpathy 在 Anthropic 工作期间,使用 Claude Opus 5 将《指环王》的一段文字转化为 3D 浏览器场景,生成了 5500 行代码,耗时约两小时,成本约 10 美元。他认为这展示了按需生成廉价定制游戏世界的潜力,但结果更像是一种'氛围测试'而非严格基准。Karpathy 指出模型无法观看自己

正文结构化主题已通过公开置信门槛
量子位模型发布

商汤开源4K直出轻量多模态模型SenseNova U1.5

商汤科技开源了轻量级多模态模型SenseNova U1.5-Lite-Preview,该模型支持4K图像直出、复杂指令理解和精准编辑,采用NEO-Unify架构,在多个评测基准上较上一代有显著提升。该模型旨在提升AI在内容创作和设计工作流中的实用性,正式版即将开源。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论开源

商汤开源SenseNova U1.5-Lite-Preview,原生统一多模态能力再进阶

商汤科技发布了SenseNova U1.5-Lite-Preview,这是基于NEO-Unify架构的原生统一多模态模型的预览版本,以8B-MoT轻量级规模支持4K图像生成、精细编辑和复杂视觉指令遵循。该模型在多个评测基准上显著超越前代U1,并已开源至GitHub、Hugging Face和魔搭社区。商汤表示,U1.5验证了统一架构能力的可持续扩展,并计划近

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
THE DECODER模型发布

阿里发布2.4万亿参数Qwen3.8-Max,主打长期自主任务

阿里巴巴发布了旗舰模型 Qwen3.8-Max,拥有 2.4 万亿参数,专注于自主完成长期复杂任务。在测试中,该模型自主构建软件、复现并改进研究论文结果、运行模拟电商业务,并在芯片设计中大幅优化电路。模型现已可用,权重将于下周发布。