返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 774 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月11日周五 · 16 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10906:修复图像后推测解码位置传递问题

llama.cpp 发布 b10906 版本,修复了服务器端在图像输入后进行推测解码(speculation)时的位置传递问题:此前向 drafter 传递的是 token 数量而非实际位置,该问题影响所有 drafter 而不只是 DFlash。同时将 draft 参数 n past 重命名为 pos0,以明确其表示位置而非 token 数。该版本同步提供

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

zai-org 开源 GLM-OCR 多模态文档理解模型

zai-org 发布并开源了多模态 OCR 模型 GLM-OCR,基于 GLM-V 编码器-解码器架构,引入多令牌预测(MTP)损失和全任务强化学习,并集成 CogViT 视觉编码器与 GLM-0.5B 语言解码器。该模型在 OmniDocBench V1.5 上取得 94.62 分排名第一,参数量仅 0.9B,支持 vLLM、SGLang、Ollama 等

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

2026外滩大会首设AI艺术节:智能体导览、AI影像展映与AI歌手线下开唱

2026 Inclusion·外滩大会在上海开幕,首次设立AI艺术节,围绕AI概念艺术展、AI影像展映、AI音乐会三大单元展开。其中《纠缠,而后日以作夜》为国内首个以智能体导览的AI概念艺术展,展出包括1985年由AI系统AARON自主署名的作品;影像展映联合MiniMax、可灵AI等平台展映100余部AI影像作品;9月11日晚将举办国内首场AI虚拟偶像Yu

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

吴佳俊 ECCV 2026 演讲:用物理统一视觉听觉触觉多模态融合

斯坦福大学助理教授吴佳俊在 ECCV 2026 发表演讲,提出不依赖堆叠 Transformer 的多模态融合新范式:将视觉、听觉、触觉视为同一组物理属性(几何、材质、刚度)在不同感官通道上的投影,用统一物理底座建立跨模态共同坐标系。他介绍了 PhysDreamer(从视频扩散模型蒸馏物理属性)、WonderPlay(将仿真器输出作为生成模型条件)以及声音可

正文结构化主题已通过公开置信门槛
量子位产品发布

高德扫街榜全面AI化,发布3D原生城市世界模型ABot-Earth 0.7

高德于9月10日宣布扫街榜全面AI化,推出2026版,用AI算法理解导航到店行为评分权重。其背后核心技术是空间智能,核心引擎ABot-Earth 0.7被称为全球首个3D原生城市世界模型,仅需一张卫星图或一段文字即可在消费级GPU上10分钟生成真实街景3D城市,效率提升1000倍。高德还展示了渲染器、模拟器、规划器三位一体的空间智能架构,并已落地具身机器人、

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

外滩大会创新者舞台:科学家、超级个体与AI艺术家的三天试探

2026 Inclusion·外滩大会于9月10日至12日举办"创新者舞台",首日联合中国科学院科普品牌"格致论道",邀请8位来自复旦、北大、上海交大等机构的学者进行硬核科技科普分享;次日聚焦"超级个体",17位实践者分享一人公司、多智能体替代传统部门等实验;第三日举办AI艺术TALK,探讨AI完成99%生成后人类最后1%不可替代性的问题。活动整体呈现科技平

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

阿里云Token Plan个人版升级:加量不加价,新增12类Agent Harness工具

阿里云于9月11日升级Token Plan个人版,在价格和Credit额度不变的情况下,为Standard和Pro套餐新增Agent Harness工具权益,覆盖搜索、网页解析、图像生成、语音处理、代码执行等12项Agent开发能力,均通过MCP标准协议开放。同时新增视频生成、Managed Agent托管智能体、RAG知识库、Memory记忆库与Sandb

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

MHE-Former:基于熵最大化的多假设Transformer用于3D网格恢复

该论文提出 MHE-Former,一种基于熵最大化的多假设 Transformer 框架,用于单目 3D 手部和身体网格恢复。它采用探索-利用范式:探索阶段通过概率建模和熵最大化生成多样且合理的假设,利用阶段借助 VLM 的视觉理解与推理能力进行上下文感知的假设选择。实验表明该框架在多个数据集上取得准确性和多样性的最优表现,用户偏好研究也验证了假设选择流程的

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

先思后链:多语言实体链接中的稀有性、推理与检索

该论文研究多语言多模态实体链接中稀有实体的失败问题,指出传统基于流行度(如页面浏览量)的稀有度指标会遗漏许多知识图谱结构上稀疏的实体。作者提出用Wikidata结构指标刻画稀有度,并设计一个无需训练的框架,让具备推理能力的视觉语言模型迭代检索并推理Wikipedia证据。在MERLIN五语言基准上,最佳系统整体比SOTA提升6.9%,在稀有实体切片上最高提升

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

M3-Former:融合混合专家的多模态长期船舶轨迹预测

该论文提出 M3-Former,一个结合大语言模型与多模态 Transformer 的船舶轨迹预测框架,用于长期(1-4 小时)轨迹预测。方法将船舶静态属性与航行意图作为语义先验,通过预训练 LLM 编码并与动态轨迹特征对齐,同时引入双粒度混合专家(MoE)架构分别建模全局航线规划与局部机动行为,并设计转向加权交叉熵损失缓解稀疏转向样本的长尾问题。在丹麦真实

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

GRADE:视觉退化下的单帧生成式雷达深度估计

该论文提出GRADE方法,利用预训练生成先验与单帧毫米波雷达几何信息,在烟雾、雾霾和黑暗等视觉退化条件下估计高保真度量深度。GRADE先将原始4D雷达频谱映射为粗略度量深度,再用潜在扩散模型恢复结构细节,并通过像素空间适配器在可见时利用相机残差线索。在12栋建筑95K帧数据上训练评估,清晰场景MAE为0.303米,烟雾下为0.313米,优于现有基线。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

2026蚂蚁InTech奖揭晓:申报量增近4倍,三年投1亿扶持创业

2026蚂蚁InTech奖在外滩大会揭晓,10位青年科学家获科技奖(每人20万元),10位中国籍在读博士生获奖学金(每人5万元)。本届聚焦AGI、具身智能、数字医学、数据处理与安全隐私四大方向,申报量较首届增长近4倍。蚂蚁集团同时宣布未来三年投入1亿元扶持获奖者创业项目。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论观点

外滩大会论坛:世界模型如何走向物理世界

2026 Inclusion·外滩大会上,香港大学计算与数据科学学院主办“世界模型是AI走向物理世界的新大陆吗”见解论坛,马毅、王晓刚、骆怡航等高校与企业嘉宾围绕世界模型的能力边界、具身智能技术路径与商业化挑战展开讨论。王晓刚介绍大晓机器人ACE研发范式与开悟世界模型,骆怡航发布面向灵巧操作的通用世界模型Motus2,圆桌嘉宾就世界模型定义、风险、适用场景及

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock 知识库集成 Marengo 3.0 实现视频图像搜索

AWS 宣布 TwelveLabs Marengo Embed 3.0 作为嵌入模型在 Amazon Bedrock Knowledge Bases 中正式可用。该多模态嵌入模型可将视频、音频、图像和文本联合编码为 512 维向量,使视频和图像内容可通过自然语言进行语义搜索。Managed Knowledge Bases 自动完成分段、抽帧、转录和嵌入,用户

正文结构化主题已通过公开置信门槛
智东西模型发布

宇树发布60亿参数通用人形机器人基础模型UnifoLM-WLA-1.0

宇树公开新一代通用人形机器人基础模型UnifoLM-WLA-1.0,参数量60亿,使用约2500小时真机数据训练,一套模型可完成64项桌面与全身操作任务,并适配平行夹爪和两类灵巧手。模型引入具身推理、动态区域预测与动作学习体系,将末端执行器与下半身动作统一为离散Token。其具身推理模型UnifoLM-ER-1-4B在7项开源评测中取得最高成绩,部分空间理解

正文结构化主题已通过公开置信门槛
智东西模型发布

攀爬AGI的南北坡:语言模型之外,生数从世界模型出发

生数科技在外滩大会预告发布面向灵巧操作的自进化通用世界模型Motus2,将评估与反馈显式纳入统一模型,使机器人能预测动作后果并据此优化策略。文章以智谱(语言模型路线)与生数(世界模型路线)为对照,称二者为攀爬AGI的南北坡。生数已形成Vidu Q3生成世界、Vidu S1实时交互、Motubrain世界动作模型三类核心模型布局,创始人朱军团队在概率机器学习与

9月10日周四 · 4 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10896:修复 DFlash 视觉模型 mtmd chunk 解码失败

llama.cpp 发布 b10896 版本,修复了在使用 DFlash 推测解码与视觉模型(mtmd)配合时无法解码图像 chunk 的问题。修复方式是停止将图像 token 复制给 drafter,并将 M-RoPE 跳过逻辑限制为仅图像,允许音频正常通过。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制。

正文结构化主题已通过公开置信门槛
The Verge AI产品发布

Meta 推出 Muse AI 助手,实测能干活但隐私令人不安

Meta 推出其首个 AI 生产力助手 Muse,可连接 Gmail、Amazon 等账户,代用户处理邮件清理、购物下单、生成播客/图片/视频等任务。The Verge 记者实测发现 Muse 能完成低风险任务,但会从 Instagram API 读取比用户界面更详细的个人兴趣数据,甚至根据 Amazon 收货地址推断用户所在州,引发隐私担忧。Meta 称仅

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3-Flash 发布 EXL3/TR3 4bpw 量化检查点

开发者 brandonmusic 在 Hugging Face 发布了 GLM-5.3-Flash 的 EXL3/TR3 4bpw 量化检查点,基于 zai-org/GLM-5.3-Flash-BF16,面向 SM120 双 GPU 环境。该版本提供多模态 DFlash2、纯文本 DFlash2 和纯文本 MTP3 三种 vLLM 服务配置,并附带可复现的

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Qwen3.5-0.8B Cyber GGUF 量化模型发布

Hugging Face 用户 reaperdoesntknow 发布了基于 Qwen/Qwen3.5-0.8B 的 GGUF 量化模型仓库 Qwen3.5-0.8-Cyber-GGUF,提供从 BF16 到 Q2 K L 的多档量化版本,面向本地推理与资源受限场景。仓库还包含一个 BF16 mmproj 多模态投影文件,但作者明确表示未验证端到端多模态路径