LlamaIndex v0.14.23 发布:增强多模态合成与查询引擎
LlamaIndex 发布了 v0.14.23 版本,主要更新包括核心模块的多模态合成功能、多模态查询引擎、工具调用模拟 LLM,以及多项 bug 修复和性能优化。此外,多个嵌入适配器(如 Cohere、Google GenAI)和回调模块也进行了依赖更新和兼容性调整。
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
LlamaIndex 发布了 v0.14.23 版本,主要更新包括核心模块的多模态合成功能、多模态查询引擎、工具调用模拟 LLM,以及多项 bug 修复和性能优化。此外,多个嵌入适配器(如 Cohere、Google GenAI)和回调模块也进行了依赖更新和兼容性调整。
Hugging Face Transformers 库发布 v5.12.0 版本,新增了 MiniMax-M3-VL 视觉语言模型、PP-OCRv6 轻量级 OCR 系统和 Parakeet-RNNT 语音识别模型。该版本还包含多项 bug 修复和 CI 改进,并感谢了社区贡献者。
Google DeepMind 发布了 Gemini 3.5 Live Translate,一款用于实时语音到语音翻译的新型音频模型,支持 70 多种语言,能保留说话者的语调、语速和音高,并实现连续流畅的翻译。该模型已通过 Gemini Live API、Google AI Studio 向开发者提供公开预览,并将在 Google Meet 和 Google
Google DeepMind 发布了 Gemma 4 12B,这是一款面向笔记本电脑的无编码器多模态模型,支持原生音频输入,性能接近其 26B MoE 模型,但内存占用更小。该模型采用统一架构,视觉和音频输入直接进入 LLM 主干,无需传统编码器,并支持多 token 预测以降低延迟。模型以 Apache 2.0 许可开源,可在 16GB 内存的设备上本地
Gemini API 于 2026 年 5 月 28 日发布 gemini-3.1-flash-image(Nano Banana 2)和 gemini-3-pro-image(Nano Banana Pro)的正式版(GA),这两个原生视觉模型支持视频转图像生成,用户可通过直接上传或 YouTube 链接提供视频,生成高质量缩略图、电影海报或信息图。该功能
Google DeepMind 宣布将世界模型 Genie 与 Google 街景图像结合,推出 Project Genie 的街景接地功能,允许用户基于美国真实地点生成互动虚拟世界,并支持多种风格。该功能现已向全球 Google AI Ultra 订阅用户开放,旨在为 AI 智能体和机器人提供更真实的虚拟训练环境。
Google DeepMind 推出 Gemini Omni 系列模型,首个模型 Gemini Omni Flash 已上线 Gemini 应用、Google Flow 和 YouTube Shorts。该模型支持视频生成与对话式编辑,结合 Gemini 的世界知识,并计划未来支持图像和音频输出。所有生成视频均带有 SynthID 水印,后续将向开发者和企业
Google DeepMind 宣布扩展其内容透明度和验证工具,覆盖 Search、Gemini、Chrome、Pixel 和 Cloud 平台。其 SynthID 水印技术已应用于超过 1000 亿张图片和视频及 6 万小时音频,并新增 C2PA Content Credentials 验证功能。公司还推出了新的 AI 内容检测 API,并与 OpenAI
Google DeepMind 发布 Gemini 3.5 系列模型,首推 3.5 Flash,主打智能体与编码能力,性能超越前代 Pro 模型,速度提升 4 倍。该模型已通过 Gemini 应用、Google 搜索 AI 模式、开发者平台及企业平台向全球用户开放,并计划下月推出 3.5 Pro。同时,新模型内置前沿安全防护,减少有害内容生成。
LlamaIndex 发布了 v0.14.22 版本,涉及多个子包的更新,包括 agentmesh、callbacks 系列、embeddings 系列等。主要变更包括依赖升级、bug 修复以及新增多模态合成功能。这些更新提升了框架的稳定性和功能,对开发者使用 LlamaIndex 构建 AI 应用有积极影响。
DeepSpeed 发布 v0.19.0 版本,包含多项修复和功能增强,如 ZeRO-3 碎片整理工具、序列并行对多模态模型的支持、Muon 优化器的 Gram 正交化,以及多个 bug 修复。该版本提升了稳定性、兼容性和性能,对使用 DeepSpeed 进行大规模模型训练的用户有积极影响。
Gemini API 于 2026 年 5 月 5 日更新了文件搜索功能,支持多模态搜索,用户可通过 gemini-embedding-2 模型原生嵌入和搜索图像。此外,接地元数据现在包含用于视觉引用的 media id 和指示信息来源位置的 page numbers。
Anthropic 在发布 Opus 4.7 的同时,推出了 Anthropic Labs 的新产品 Claude Design,用户可通过它与 Claude 协作创建设计、原型、幻灯片和单页文档等视觉输出。
Anthropic 发布了其最新模型 Claude Opus 4.7,现已全面可用。该模型在软件工程和复杂、长期运行的编码任务上有所改进,并提升了视觉能力,支持更高分辨率的图像识别。
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一款新一代文本转语音模型,提升了可控性、表现力和质量。该模型已通过 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 向开发者、企业和 Workspace 用户推出,支持 70 多种语言,并引入了音频标签功能,允许通过自
Gemini API 于 2026 年 4 月 14 日发布了更新版机器人模型 gemini-robotics-er-1.6-preview,新增仪表读取能力,并改进了空间和物理推理能力。同时,旧版 gemini-robotics-er-1.5-preview 模型将于 2026 年 4 月 30 日太平洋时间上午 9 点被关闭。
Google DeepMind 发布了 Gemini Robotics-ER 1.6,这是其具身推理模型的重大升级,旨在提升机器人在空间理解、多视角感知和任务规划方面的能力。该模型可通过原生调用工具(如 Google Search)和视觉-语言-动作模型(VLA)执行任务,并新增了仪表读数能力,与波士顿动力合作开发。该模型现已通过 Gemini API 和
Google DeepMind 发布了 Gemma 4 系列开放模型,包括 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,支持高级推理、智能体工作流、多模态(视觉、音频)和 140 多种语言,采用 Apache 2.0 许可。该系列模型在 Arena AI 文本排行榜上表现优异,31B 模型排名第三,26B 模型排名第六,并针对从移动设备
智谱AI于2026年4月2日上线了GLM-5V-Turbo多模态Coding基座模型,该模型在更小参数量下实现更优性能,增强了细粒度理解、几何感知与空间理解能力,并强化了GUI Agent和Coding Agent等复杂任务表现,同时扩展了多模态工具链,支持画框、截图、读网页等工具。
Google DeepMind 正在开发由 Gemini 驱动的 AI 指针,旨在让用户通过指向和语音与 AI 交互,无需将内容拖入 AI 窗口。该技术能理解用户指向的对象及其重要性,从而提供更直观的协作体验。公司已发布相关原理和实验演示,例如在 Google AI Studio 中通过指向和说话来编辑图片或查找地点。