返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

10月24日周五 · 1 条
正文结构化主题已通过公开置信门槛
Baidu Qianfan Changelog一手来源产品发布

百度千帆更新:新增视觉模型、RAG增强及工作流优化

百度千帆平台于2025年10月24日发布多项更新,包括支持InternVL3.5-14B模型导入部署,上线Qwen3-VL系列视觉理解模型,并增强deepseek-v3.2的FIM补全和前缀续写功能。同时,知识库检索API简化参数并支持知识图谱开关,新增法律法条解析模板,以及高中作文打分和AI绘本组件。此外,工作流对话接口超时限制延长至30分钟,并新增撤销/

10月15日周三 · 1 条
正文结构化主题已通过公开置信门槛
9月25日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini API 发布机器人模型及 Flash 预览版

Gemini API 于 2025 年 9 月 25 日发布 Gemini Robotics ER 1.5 模型预览版,用于机器人应用。同时推出 gemini-2.5-flash-preview-09-2025 和 gemini-2.5-flash-lite-preview-09-2025 两个预览模型。

9月23日周二 · 1 条
正文结构化主题已通过公开置信门槛
8月19日周二 · 1 条
正文结构化主题已通过公开置信门槛
Qwen Technical Blog一手来源模型发布

Qwen-Image-Edit:高质量高效率的图像编辑模型

阿里巴巴推出Qwen-Image-Edit,基于20B参数的Qwen-Image模型,结合Qwen2.5-VL和VAE编码器,实现语义和外观编辑,支持中英文精确文本编辑。在多个公开基准上达到SOTA性能,已在Qwen Chat上线。该模型可应用于IP创作、物体旋转、风格迁移、背景调整等场景,并通过链式编辑逐步修正图像细节。

7月17日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源产品发布

Gemini API 发布 Veo 3 预览版并提升 Imagen 4 速率限制

Gemini API 于 2025 年 7 月 17 日发布了 veo-3.0-generate-preview,这是 Veo 系列的最新更新,支持生成带音频的视频。同时,Imagen 4 Standard 和 Ultra 的速率限制已提高,更多详情可参考官方文档。

6月18日周三 · 1 条
正文结构化主题已通过公开置信门槛
GLM New Releases一手来源产品发布

GLM 平台接入 Vidu Q1 与 Vidu 2 视频生成模型

GLM 平台于 2025 年 6 月 18 日接入两个 Vidu 视频生成模型:Vidu Q1 和 Vidu 2。Vidu Q1 聚焦高质量视频创作,输出 5 秒 1080P 内容,优化画质和首尾帧转场;Vidu 2 平衡速度、质量与成本,支持图生视频和首尾帧功能,输出 4 秒 720P 内容,增强语义理解与多参考图一致性。这两个模型分别适用于影视、广告、动

5月20日周二 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源API 更新

Gemini API 发布多项更新及新模型

Gemini API 于 2025 年 5 月 20 日发布多项更新,包括支持自定义视频预处理、多工具使用、异步函数调用及实验性 URL 上下文工具。同时发布了多个新模型,如 gemini-2.5-flash-preview-05-20、TTS 模型、实时音乐生成模型、原生音频对话模型以及 Gemma 3n 预览版。这些更新增强了 API 的功能性和模型多样

3月12日周三 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源API 更新

Gemini API 更新:推出图像生成模型及 Gemma 3

Google 于 2025 年 3 月 12 日发布 Gemini API 更新,推出支持图像生成和编辑的实验性 Gemini 2.0 Flash 模型,并发布 Gemma 3 系列中的 gemma-3-27b-it 模型,可通过 AI Studio 和 Gemini API 使用。API 新增对 YouTube 链接和小于 20MB 内联视频的支持。

12月11日周三 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

谷歌发布 Gemini 2.0 Flash 实验版,速度翻倍并支持多模态

谷歌发布了 Gemini 2.0 Flash 实验版,该模型速度是 Gemini 1.5 Pro 的两倍,支持双向流式传输、多模态响应生成(文本、图像和语音)以及内置工具使用(如代码执行、搜索和函数调用)。此次发布标志着 Gemini 系列在性能和功能上的重大升级。

4月9日周二 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源API 更新

Gemini API 发布 1.5 Pro 预览版及多项新功能

Google 在 Gemini API 中发布了 Gemini 1.5 Pro 预览版,以及新的文本嵌入模型 text-embeddings-004,支持弹性嵌入尺寸。API 新增了 File API 用于临时存储媒体文件,并支持多模态提示、系统指令(测试版)、函数调用模式和 JSON 响应格式。这些更新增强了开发者的灵活性和功能。

12月13日周三 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源API 更新

Gemini API 发布新模型与多模态功能更新

Gemini API 于 2023 年 12 月 13 日发布更新,推出 gemini-pro、gemini-pro-vision、embedding-001 和 aqa 等新模型,并更新 API 版本和功能。新增 GenerateContent 统一端点、流式支持、多模态图像输入、函数调用和 AQA 等测试版功能,但暂不支持模型调优。

10月10日周二 · 1 条
正文结构化主题已通过公开置信门槛
Chip Huyen Blog研究

多模态与大型多模态模型(LMMs)全面解析

Chip Huyen 在其博客文章中深入探讨了多模态与大型多模态模型(LMMs)的概念,指出自然智能需要处理多种数据模态,并介绍了多模态系统的类型、基础训练方法(如 CLIP 和 Flamingo)以及当前的研究方向(如生成多模态输出和适配器)。文章强调了多模态在医疗、机器人等领域的必要性,并提及了 GPT-4V 等模型。