返回主题地图

多模态

技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

7月30日周四 · 2 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 发布机器人 ER 2 预览模型,旧版将于 8 月关闭

Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时

正文结构化主题已通过公开置信门槛
Google Gen AI JavaScript SDK Releases一手来源产品发布

Google Gen AI JS SDK v2.14.0 发布:新增音频转录与弃用警告

Google 发布了 Gen AI JavaScript SDK 的 v2.14.0 版本,新增了音频转录配置和语言代码字段,并支持企业模式下使用 API 密钥及项目/位置参数。同时,对 Imagen 的生成图像、编辑图像和生成视频功能添加了弃用警告,这些功能将在下一个主要版本中移除。

7月28日周二 · 3 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Gemini Robotics 2 发布:赋予机器人全身智能与协作能力

Google DeepMind 发布了 Gemini Robotics 2 系列模型,包括最先进的视觉-语言-动作模型(VLA)、具身推理模型(ER)和端侧模型,旨在赋予机器人全身控制、精细操作和多机器人协作能力。这些模型支持人形机器人完成复杂任务,并能在数小时内适应新机器人本体,同时支持本地运行。

正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google AI 搜索助力晚宴策划的 5 种方式

Google AI 发布文章,介绍如何利用 Google 搜索的 AI 功能(如 AI Mode 和 Nano Banana)来策划晚宴,包括可视化餐桌布置、发现菜单、推荐饮品搭配、创建播放列表和设计菜单。文章还提到晚宴相关搜索趋势上升,如“什么是渐进式晚宴”等。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布

ChatGPT 图像生成服务故障已恢复

OpenAI 报告 ChatGPT 中的图像生成服务出现故障,导致用户遇到错误。团队已实施缓解措施并监控恢复,目前所有受影响服务已完全恢复。

7月27日周一 · 1 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.26.0 发布:新增 Inkling 模型支持与 DeepSeek-V4 性能优化

vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和

7月25日周六 · 1 条
正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.16 发布:新增 DSpark 解码与 Inkling 模型支持

SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路

7月24日周五 · 1 条
正文结构化主题已通过公开置信门槛
Agno Releases一手来源产品发布

Agno v2.8.1 发布:新增视频嵌入与代理通信功能

Agno 发布了 v2.8.1 版本,新增了 TwelveLabsTools 对 Marengo 视频嵌入的支持,以及 Slack 的 respond to other agents 标志用于对等代理通信。改进包括学习存储的 extraction tool call limit 以防止无限循环,以及所有上下文提供者支持 stream sub agent ev

7月23日周四 · 1 条
正文结构化主题已通过公开置信门槛
7月22日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google在Galaxy Unpacked 2026发布三项Gemini更新

在2026年Galaxy Unpacked大会上,Google宣布了与三星合作的三项更新:Gemini Intelligence 1推出任务自动化功能,支持超过40个应用;Gemini Notebook(原NotebookLM)预装在新款折叠屏手机上,并提供Google AI Pro六个月试用;Gemini扩展到Galaxy Watch 9和智能眼镜,支持手

7月21日周二 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布 Gemini 3.6 Flash 等三款模型,提升代理效率与安全

Google DeepMind 发布了 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在提升 AI 代理的效率、速度和安全性。3.6 Flash 在编码和多模态任务上性能提升,输出 token 使用量减少 17%,价格更低;3.5 Flash-Lite 是系列中最快模型,输出速度达 350

7月17日周五 · 2 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google Vids 推出 Gemini Omni 和个性化头像功能

Google 宣布在 Google Vids 中推出两项新功能:Gemini Omni 和个性化头像。Gemini Omni 允许用户通过自然语言提示和图像参考生成和编辑高质量视频,支持逐步编辑;个性化头像则让用户通过上传自拍和语音录音创建数字分身,无需录制即可生成视频。这些功能面向 Google AI Pro 和 Ultra 订阅者及 Workspace

7月16日周四 · 1 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.14.0 发布:新增 Inkling 多模态模型及多项优化

Hugging Face Transformers 库发布 v5.14.0 版本,新增了 Thinking Machines 的 Inkling 多模态模型(975B 总参数,41B 激活)和 TIPSv2 系列模型,并进行了多项性能优化和错误修复。该版本还引入了多 token 预测解码支持、静态集成验证等生成改进,并修复了 GPTNeoX 和 GPTBig

7月15日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google AI一手来源产品发布

Google 庆祝视觉搜索 25 周年,推出新图像浏览与生成功能

Google 为庆祝 Google Images 上线 25 周年,推出了全新的可浏览式 Google Images 首页,并在 AI Overviews 中引入基于 Nano Banana 模型的图像生成功能。这些更新将逐步在桌面端和英语地区推出,旨在提升视觉搜索和创作体验。

7月13日周一 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源产品发布

Google DeepMind 推出 ATL Saathi,用 Gemini 赋能印度教育创新

Google DeepMind 宣布推出 ATL Saathi,利用 Gemini 模型(包括最新的 Gemini 3.5 Flash)为印度的 tinkering 实验室提供 AI 支持,生成课程相关的项目创意、教学材料和交互式测验。该计划将首先在 100 所试点学校推广,旨在减轻教师行政负担,提高教学效率,并激发学生创新。

7月7日周二 · 1 条
正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.31.2 发布:支持旧 GPU 闪存注意力并修复多项问题

Ollama 发布 v0.31.2 版本,主要更新包括:在旧款 NVIDIA GPU(计算能力 6.x)上启用 flash attention,iGPU 可卸载视觉模型以适配内存,修复了思考模型禁用思考时的结构化输出问题,并强化了 GGUF 模型创建。此外, ollama launch 为 Claude Code 默认禁用遥测,修复了非 UTF-8 路径加载

7月4日周六 · 1 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.13.0 发布:新增 Kimi、MiMo、Nemotron 等模型支持

Hugging Face Transformers 发布 v5.13.0,新增多个模型架构支持,包括 Kimi K2.5/2.6/2.7、小米 MiMo-V2-Flash、NVIDIA Nemotron 3.5 ASR 及 Nemotron ASR Streaming、阿里 Qwen3 ASR 和 Zyphra ZAYA1。这些模型覆盖多模态智能体、长上下文

7月1日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Google 发布 Nano Banana 2 Lite 与 Gemini Omni Flash 开发者版本

Google DeepMind 发布 Nano Banana 2 Lite 图像模型和 Gemini Omni Flash 视频模型。Nano Banana 2 Lite 主打高速低成本的图像生成,已上线 Google AI Studio、Gemini API 等平台;Gemini Omni Flash 支持视频生成与对话式编辑,首次向开发者开放。两者结合可

6月30日周二 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini Omni Flash 预览版发布,Nano Banana 2 Lite 全面上市

Gemini API 于 2026 年 6 月 30 日发布 Gemini Omni Flash 公开预览版,这是一个高性能多模态模型,支持通过 Interactions API 从文本或静态图像生成 3-10 秒 720p 视频,并可进行对话式编辑。同时,gemini-3.1-flash-lite-image(Nano Banana 2 Lite)正式全面