返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 775 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月10日周四 · 20 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

智象未来 vivago R1 全球上线,国内版「够搭」升级发布

智象未来(HiDream.ai)于2026年9月8日全球上线内容创作智能体 vivago R1,国内版本「够搭」同步升级发布。R1 主打一次性稳定输出5分钟高质量视频并支持无限次多轮延长,通过主/子 Agent 协同完成脚本、分镜、角色、场景与音效,并依托自研 HD-AgentOS 将内容有效可用成功率提升至85%。产品采用 Chat-First 对话式创作

正文结构化主题已通过公开置信门槛
量子位研究

ECCV上钛动科技牵头MARS2,研究AI如何做生意的多模态推理

在ECCV 2026上,中国科技公司钛动科技牵头举办了唯一聚焦Agentic Commerce方向的MARS2 Workshop,牛津、MIT等机构学者参与分享多模态AI前沿研究。配套的MARS2多模态AI挑战赛设置三条赛道,基于3108支广告视频构建的M-CAR数据集,吸引64支全球团队提交超1060份方案,奖金池10万美元。结果显示模型整体理解广告内容尚

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

中国公司牵头ECCV Workshop,多模态推理挑战赛全球64队参赛

在ECCV 2026上,中国公司钛动科技牵头发起了MARS2 Workshop,这是本届大会唯一由中国科技公司牵头举办的Agentic Commerce方向Workshop。该Workshop同期举办多模态推理挑战赛,设置10万美元奖池,吸引全球64支团队提交超1060份方案,并开源了M-CAR基准数据集及代码库。赛事结果表明当前多模态模型在System 2

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

ECCV 2026 世界模型爆发:中国学者如何卡位

ECCV 2026 将于 2026 年 9 月在瑞典马尔默开幕,共接收 2883 篇论文(接收率 27.5%),86 个 workshop 中有 13 个直接以 World Models 或 Embodied AI 为主题,密度为 ECCV 历史之最,Yann LeCun、Jürgen Schmidhuber 等将作 keynote。文章认为这标志 AI 竞

正文结构化主题已通过公开置信门槛
Tencent Cloud AI Team一手来源产品发布

腾讯云文档智能推出作业批改 Agent 全流程方案

腾讯云 AI 团队在开发者社区介绍其文档智能教育产品线,将作业批改链路拆为切题、识别、批改、回显四步,并封装为试题批改 Agent 与作文批改 Agent,覆盖 K12 全学科及中英文手写作文,输出正误、得分、知识点与错误坐标等结果。作文批改走异步接口(SubmitMarkEssayAgentJob),默认并发限制 2 次/分钟,底座为千亿参数多模态大模型与

正文结构化主题已通过公开置信门槛
Tencent Cloud AI Team一手来源产品发布

腾讯云文档智能试卷切题能力解析:从坐标结构到模型选型

腾讯云文档智能推出试卷切题原子能力 QuestionSplitOCR,可将整页试卷按题目边界自动拆分,并输出题干、选项、答案、图形、表格五类带四角坐标的语义区域,同时直接返回切好的题目图片和 LaTeX 公式。接口提供默认模型与多模态推理模型两种选择,分别偏向结构化全面与坐标精准,并支持切边增强、弯曲矫正、PDF 解析等拍照预处理开关。该能力面向题库建设、在

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

IDC预测AI数据基础设施迈向万亿级市场,国产数据库迎新增长空间

IDC中国企业软件市场研究经理王楠在2026 Inclusion·外滩大会论坛上分享研究,预测中国AI数据基础设施市场2025年至2030年将以37.7%的复合增速增长,2030年规模达738亿美元,2035年有望达1548亿美元。报告将市场划分为AI数据平台、AI数据智能和AI数据服务三大领域,其中AI数据智能增速最快。文章指出AI瓶颈正从模型能力转向企业

正文结构化主题已通过公开置信门槛
量子位模型发布

OpenAI发布ChatGPT Images 2.5生图模型

OpenAI发布新一代生图模型ChatGPT Images 2.5,主打生成更快、细节更好、改图更可控。相比Images 2.0,生成延迟最多降低50%,新增xhigh和max质量档位,并支持在图片上直接批注修改、用草图作为参考图以及多轮编辑一致性。面向开发者同步推出GPT-Image-2.5 Flare和GPT-Image-2.5 Sunburst两个AP

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

GPT-6 Astra 通关 48 关验证码,CAPTCHA 防线转向机器身份

OpenAI Labs 成员 Sharif Shameem 展示 GPT-6 Astra 连续完成《I'm Not a Robot》全部 48 关,从图片识别到拖拽、停车、节奏控制等动态任务,形成视觉理解、GUI grounding、状态保持与动作执行的闭环。Astra 在 ScreenSpot-Pro 达 92.7%、OSWorld 2.0 达 72.6%

正文结构化主题已通过公开置信门槛
DeepSeek API Changelog一手来源模型发布

DeepSeek-V4.1-Flash 发布并上线 API,价格下调

DeepSeek 正式发布 DeepSeek-V4.1-Flash 模型,这是其全新模型结构系列中最小尺寸的模型,具备原生多模态视觉理解能力,并公布了 GPQA Diamond、HLE、Codeforces 等多项基准成绩。该模型已同步上线 DeepSeek API,调用模型名改为 deepseek-flash,旧版 V4 Flash 与 V4 Flash

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwopus3.8-27B-Flash:高效多模态微调模型发布

Qwopus3.8-27B-Flash 是基于 Qwen3.8-27B 微调的多模态模型,旨在降低推理成本与响应时间,提升智能体任务的效率。模型通过两阶段训练(SFT 和 NeMo-RL+GSPO 强化学习)实现 12.8% 的加速解码和 80.7% 的 MTP 接受率,但 MMLU-Pro 分数略低于基础模型。该模型支持视觉、工具调用和代码生成,已知问题为

正文结构化主题已通过公开置信门槛
Tencent Cloud AI Team一手来源教程

腾讯云 OCR 发票识别接口选型与实操指南

腾讯云 AI 团队发布一篇开发者社区文章,系统讲解腾讯云文字识别 OCR 的发票识别接口选型与实操。文章区分了通用票据识别、增值税发票识别、OFD 发票识别、增值税发票核验、银行回单识别、医疗票据识别等接口的适用场景,并给出 SDK 代码示例、QPS 限制、常见报错处理,以及专业 OCR 与大模型多模态识别在字段定位、结构化稳定性、成本上的对比。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

AgenticGen:奖励引导的智能体广告视频生成

字节跳动提出 AgenticGen,一个面向广告视频生成的奖励引导智能体框架,将生成过程拆解为策略选择与草稿生成两个可训练推理阶段。该方法从在线投放反馈中学习基于表现的奖励模型,并结合人工标注的评分标准奖励模型,先通过 DPO 对齐在线偏好,再用 GRPO 以过程与结果奖励进一步优化。在 TikTok 广告系统的在线 A/B 实验中,相比 SFT 基线,CT

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体推理用于说话人关系推断

该论文提出一种无需训练的多智能体推理框架,用于从口语对话中推断说话人之间的关系。框架包含两种设计:多角色多智能体辩论(MRMAD)为智能体分配互补角色或社会理论视角;多智能体竞争(MAC)通过成对裁决比较假设并淘汰较弱候选。在 Seamless Interaction 数据集上的实验表明,这些方法在多数情况下优于零样本和现有多智能体基线,但声学线索仍未被当前

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源产品发布

OASIS:基于量规与大语言模型的多模态评估平台

UT Southwestern 等机构的研究者发布 OASIS,一个基于评分量规(rubric)的多模态评估平台,可用大语言模型对视频、音频和文本进行结构化打分。平台提供命令行工具与集成栈,支持托管 API 或通过 Ollama、vLLM 等自托管开源模型,并具备量规版本管理、执行溯源和人工复核状态。该系统自 2023 年秋季起在 UT Southweste

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

M2LG-DG:跨站点抑郁症分类的多模态局部-全局域泛化框架

研究提出 M2LG-DG,一个仅用源域数据的多模态局部-全局域泛化框架,用于跨站点重性抑郁障碍(MDD)分类。该框架采用双流 rs-fMRI 编码器(全局自注意力与局部图约束聚合),将影像与非影像表征分解为共享与私有成分,并通过双向交叉注意力与模态门控融合,同时用跨站点监督对比目标构建正样本对。在四个留出的 REST-meta-MDD 站点上取得 69.48

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

融合单模态与视觉语言表征的胸部X光多标签分类

该研究提出一个融合框架,将RAD-DINO的单模态视觉表征与BioViL-T的视觉-语言表征在潜在空间中分别精炼后归一化并跨三分支融合,用于MIMIC-CXR-JPG数据集上14类胸部X光多标签分类。实验显示RAD-DINO单独使用时优于BioViL-T,而早期融合进一步提升结果,表明两种嵌入来源包含互补信息;混合融合在潜在空间精炼后相比早期融合有一致且统计

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Show-Harness:仅靠 VLM 智能体即可操控机器人

该论文提出 Show-Harness,一种通过离散语义动作单元将视觉语言模型(VLM)与机器人控制连接起来的具身接口,由特定于本体的解释器将语义动作确定性地映射为本地机器人动作。Show-Harness 证明了两点可行性:直接解锁闭源前沿 VLM 实现零样本机器人控制,以及仅用少量 GPU 小时微调小规模开源 VLM 实现低成本部署。作者还开发了 GUMI(

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

FuriosaAI 发布 Qwen3-VL-4B-Thinking 的 RNGD 运行包

FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-4B-Thinking 仓库,将 Qwen 的 40 亿参数稠密视觉语言模型 Qwen3-VL-4B-Thinking 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LL

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源产品发布

FuriosaAI 发布 RNGD 上的 Qwen3-VL-2B-Instruct 部署包

FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-VL-2B-Instruct 仓库,将 Qwen 的 2B 参数稠密视觉语言模型 Qwen3-VL-2B-Instruct 与 Furiosa 可执行包(FXB)打包,使其可在 FuriosaAI RNGD 加速卡上通过 Furiosa-LLM 运行。该模型支持图像/