返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月26日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google 搜索五大妙招,助你升级家居装饰

Google 发布了一篇关于如何利用 Google 搜索工具升级家居装饰的指南,介绍了五种方法,包括使用 AI Mode 可视化家具、Google Lens 购物、Circle to Search 发现装饰品、Search Live 指导 DIY 项目以及价格追踪功能。文章还提到了一些搜索趋势,如“home decor inspo”搜索量在过去一个月增长了

8月25日周二 · 11 条
正文结构化主题已通过公开置信门槛
TechCrunch AI商业

Gamma 收购 AI 设计初创公司 Lica 以扩展演示功能

Gamma 收购了由 Accel 支持的 AI 设计初创公司 Lica,以建立自己的设计研究实验室。Lica 的联合创始人将领导该实验室,专注于为不同受众定制 AI 模型的演示和沟通风格。此次收购旨在扩展 Gamma 的演示产品,探索多模态沟通形式。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp 0.3.0 发布:新增多模态模型与多项推理优化

llama.cpp 0.3.0 版本发布,新增 dots3-note 多模态模型及 DSA-ISWA KV 缓存,支持 GLM-4.5-Air 的 MTP 预测,并为 DeepSeek 4 添加张量分割模式和多序列回滚修复。ggml 升级至 v0.22.0,服务器新增调试参数,Web UI 支持标签页聊天导航。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-35B-A3B 无审查多模态模型 Genesis Hermes V10 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的无审查多模态 MoE 模型 Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V10-GGUF,该模型通过其自研的 Genesis 算法对 GGUF 格式的模型进行张量噪声修复,并融合了 Hermes 智能体微调数据。模型在保持无审查能力的同时,旨在提升稳

正文结构化主题已通过公开置信门槛
量子位模型发布

商汤开源8B生图模型SenseNova U1.5 Lite,比肩GPT-Image-2

商汤科技正式开源了8B参数的生图模型SenseNova U1.5 Lite,该模型支持4K直出、长指令遵循、原生图像编辑和复杂布局,在多个核心场景上比肩闭源GPT-Image-2。模型采用NEO-unify统一多模态架构,通过多教师在线策略蒸馏技术MOPD将专项能力融合回单一模型,强调稳定性、指令遵循和编辑精度,旨在进入真实创作流程。

正文结构化主题已通过公开置信门槛
量子位产品发布

紫东太初发布AutoProject,推动AI4S进入项目级自主科研时代

中科紫东太初旗下科研智能体ScienceClaw推出AutoProject项目级自主科研引擎,旨在将AI在科研中的工作单位从Task提升至Project。该系统通过Project2Task规划、TaskExecutor长程执行和EviGraph证据验证三层能力,实现从项目规划到成果沉淀的全流程自主科研。此举标志着AI4S从工具级能力向系统级能力跨越,行业竞争

正文结构化主题已通过公开置信门槛
量子位产品发布

人民教育音像数字出版社与小猿合作,中小学课本学习智能体首发上线

人民教育音像数字出版社与小猿合作研发的“中小学课本学习智能体”于2026年8月21日在小猿AI学习机首发上线,该智能体基于教材内容和猿力大模型,提供AI伴学和AI导学双模式。试点数据显示,使用该智能体的学生语文和英语知识点掌握量分别提升33.6%和24%,家长日均陪读时长减少20分钟。双方签署合作协议,未来将推动智能体规模化应用。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

协议引导的 AI 网站冗余审计:从主观判断到可审计标准

arXiv 论文提出 Cora(反事实可观察冗余审计)框架,用于可审计的网站冗余 AI 审计。Cora 将冗余分解为重复负载、正常使用税和故障域恢复储备三个维度,并通过版本化视觉语言模型提出注释,经类型化验证和发布检查后选择性发布分数。在透明机制测试台上,Cora 的分解表示优于标量负载基线,但两个小型视觉语言模型因未满足发布要求而被拒绝自动评分。该框架定位

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

SD-AgentFoundry:面向 LLM/VLM 智能体的极简本地模拟基础

arXiv 论文介绍了 SD-AgentFoundry-2D 和 SD-AgentFoundry-3D,两个极简的本地模拟框架,分别用于 LLM 驱动的二维多智能体社会模拟和 VLM 驱动的三维具身模拟。框架支持本地模型运行,跨平台,并强调可修改性,旨在为教育和快速原型设计提供基础。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Warmly 发布 Qwen3.5-2B 韩英 GGUF 生产模型

neureps 发布了 warmly-qwen35-2b-enko-gguf,这是离线 SNS 应用 Warmly 的生产模型仓库,基于 Qwen3.5-2B-enko 进行词汇剪枝和 GGUF 量化。仓库包含 base 版本和 distill-v1 版本,后者通过蒸馏提升了韩语自然性,并通过了官方门禁但尚未晋升。量化变体对比显示,IQ4 XS 结合领域 i

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA发布Cosmos3全模态世界模型系列

NVIDIA发布了Cosmos3系列全模态世界模型,包括Cosmos3-Edge、Nano、Super等多个版本,支持从文本、图像、视频和动作轨迹生成视频、图像、音频和动作输出,用于机器人、自动驾驶和智能空间等物理AI应用。该系列基于Mixture-of-Transformers架构,参数规模从4B到64B不等,并采用OpenMDW1.1许可证,可商用。

正文结构化主题已通过公开置信门槛
MCP Python SDK Releases一手来源产品发布

MCP Python SDK v2.1.0 发布:增强客户端与内容支持

MCP Python SDK 发布 v2.1.0 版本,主要更新包括:Client 可直接接受 StdioServerParameters 对象,提示消息支持图像和音频,并导出相关消息类。请求体大小限制扩展到 SSE 和 OAuth 端点。行为变更包括:处理程序异常不再向客户端暴露详细信息,而是记录日志并返回通用错误;内容块返回注解不再自动生成 output

8月24日周一 · 8 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

阿里发布Wan3.0视频生成模型,支持30秒多模态输入

阿里巴巴发布了视频生成模型 Wan3.0 的测试版,支持从文本、图片、PDF、网页和 PowerPoint 生成最长 30 秒的视频,长度是前代 Wan2.5 的两倍。该模型能同时处理文本、图像、视频和音频,并旨在减少 AI 生成视频中的视觉漂移和失真。Wan3.0 通过 wan.video 网站、阿里云 Model Studio 和 Qwen Cloud

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10608 发布:修复视频 moov atom 解析问题

llama.cpp 发布 b10608 版本,主要修复了视频处理中 moov atom 位于文件末尾时的解析问题,并处理了 SIGPIPE 信号及 Windows 下的管道中断情况。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYC

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Jina AI 发布多模态嵌入模型 v5-omni-nano

Jina AI 发布了 jina-embeddings-v5-omni-nano,一个约 1.04B 参数的多模态嵌入模型,支持文本、图像、视频和音频输入,并生成与文本模型对齐的共享向量空间。该模型支持检索、分类、聚类和文本匹配任务,可通过 Hugging Face 或 Elastic Inference Service 使用。它定义了开放权重全模态嵌入模型

正文结构化主题已通过公开置信门槛
量子位模型发布

阿里视频大模型Wan3.0正式上线,获评稳定真实有质感

阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,该模型在生成时长、文档输入、真实世界还原等方面全面升级,单次可生成30秒视频,并支持多种文档格式。行业评价其“稳定、真实、有质感”,已进入企业生产流程,用于短剧、影视、广告等场景。即日起用户可在多个平台体验,阿里云百炼和千问AI平台提供限时7折优惠。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

OmniAssistBench:全模态LLM助手式交互基准测试

OmniAssistBench是一个用于评估全模态大语言模型(Omni-LLMs)作为实时视频助手能力的基准测试。该基准通过逆向工程现有互联网视频构建多轮交互数据集,要求模型根据预定义路径引导用户。测试结果显示,专有模型Gemini-3-Pro得分66.4,开源模型Qwen3-Omni-Instruct得分51.2,当前模型普遍存在视觉提示理解、上下文保持和

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

多模态智能体框架的基础与前沿:技术与应用综述

该综述系统分析了多模态智能体框架中感知、推理、规划、记忆和行动等核心模块,并提出了按模态分类的架构分类法。文章回顾了从文本智能体到多模态框架的演变,以及委托、晚期融合和早期融合等集成方式,并评估了在机器人、GUI与网页导航、多媒体内容生成与编辑、长视频理解与检索等领域的应用。最后讨论了性能、效率与可扩展性之间的权衡,并指出了未来研究方向。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

OraRL:将标注作为轨迹的高效可扩展视频多模态强化学习

南开大学等机构提出 OraRL,一种面向视频多模态大模型的高效强化学习后训练方法。该方法将标注作为 oracle 轨迹加入策略组,并设计解耦优势估计器避免优势反转,显著提升训练效率与性能。OraRL 在多项视频感知基准上超越现有模型,且推理速度大幅提升。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

线性判别树集成的可解释多模态分类

该研究提出一种基于线性判别树集成(LDT、LDF、LDAB)的可解释多模态分类框架,通过编码各模态为令牌、提取概念聚类、路由融合并通过改进的特征重要性指标解释趋势,在IEMOCAP、CMU-MOSI和自定义数学数据集上,相比多模态Transformer和可解释多模态路由(IMR),在F1-mod上提升4.3%、准确率提升3.0%,且特征重要性的人类标注一致性