Gemini 发布机器人 ER 2 预览模型,旧版将于 8 月关闭
Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Gemini API 于 2026 年 7 月 30 日发布了两款新的具身推理模型端点:gemini-robotics-er-2-preview 和 gemini-robotics-er-2-streaming-preview,分别支持高级空间推理、智能体代码执行、多步工具编排、视频时刻查找、进度分类、多机器人协调,以及通过 Live API 实现低延迟实时
Google 发布了 Gen AI JavaScript SDK 的 v2.14.0 版本,新增了音频转录配置和语言代码字段,并支持企业模式下使用 API 密钥及项目/位置参数。同时,对 Imagen 的生成图像、编辑图像和生成视频功能添加了弃用警告,这些功能将在下一个主要版本中移除。
Google DeepMind 发布了 Gemini Robotics 2 系列模型,包括最先进的视觉-语言-动作模型(VLA)、具身推理模型(ER)和端侧模型,旨在赋予机器人全身控制、精细操作和多机器人协作能力。这些模型支持人形机器人完成复杂任务,并能在数小时内适应新机器人本体,同时支持本地运行。
Google AI 发布文章,介绍如何利用 Google 搜索的 AI 功能(如 AI Mode 和 Nano Banana)来策划晚宴,包括可视化餐桌布置、发现菜单、推荐饮品搭配、创建播放列表和设计菜单。文章还提到晚宴相关搜索趋势上升,如“什么是渐进式晚宴”等。
OpenAI 报告 ChatGPT 中的图像生成服务出现故障,导致用户遇到错误。团队已实施缓解措施并监控恢复,目前所有受影响服务已完全恢复。
vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和
SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路
Agno 发布了 v2.8.1 版本,新增了 TwelveLabsTools 对 Marengo 视频嵌入的支持,以及 Slack 的 respond to other agents 标志用于对等代理通信。改进包括学习存储的 extraction tool call limit 以防止无限循环,以及所有上下文提供者支持 stream sub agent ev
Google Gen AI Python SDK 发布 v2.14.0 版本,新增音频转录配置支持,并为 Imagen 图像生成、视频生成等旧接口添加弃用警告,计划在下一大版本移除。
在2026年Galaxy Unpacked大会上,Google宣布了与三星合作的三项更新:Gemini Intelligence 1推出任务自动化功能,支持超过40个应用;Gemini Notebook(原NotebookLM)预装在新款折叠屏手机上,并提供Google AI Pro六个月试用;Gemini扩展到Galaxy Watch 9和智能眼镜,支持手
Google DeepMind 发布了 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型,旨在提升 AI 代理的效率、速度和安全性。3.6 Flash 在编码和多模态任务上性能提升,输出 token 使用量减少 17%,价格更低;3.5 Flash-Lite 是系列中最快模型,输出速度达 350
LangChain4j 发布 1.18.0 和 1.18.0-beta28 版本,引入 BDI 代理模式、支持 OpenAI 文本转语音、Mistral 批量 API 等新功能,并修复多项 bug。这些更新增强了代理系统的鲁棒性和多模态能力。
Google 宣布在 Google Vids 中推出两项新功能:Gemini Omni 和个性化头像。Gemini Omni 允许用户通过自然语言提示和图像参考生成和编辑高质量视频,支持逐步编辑;个性化头像则让用户通过上传自拍和语音录音创建数字分身,无需录制即可生成视频。这些功能面向 Google AI Pro 和 Ultra 订阅者及 Workspace
Hugging Face Transformers 库发布 v5.14.0 版本,新增了 Thinking Machines 的 Inkling 多模态模型(975B 总参数,41B 激活)和 TIPSv2 系列模型,并进行了多项性能优化和错误修复。该版本还引入了多 token 预测解码支持、静态集成验证等生成改进,并修复了 GPTNeoX 和 GPTBig
Google 为庆祝 Google Images 上线 25 周年,推出了全新的可浏览式 Google Images 首页,并在 AI Overviews 中引入基于 Nano Banana 模型的图像生成功能。这些更新将逐步在桌面端和英语地区推出,旨在提升视觉搜索和创作体验。
Google DeepMind 宣布推出 ATL Saathi,利用 Gemini 模型(包括最新的 Gemini 3.5 Flash)为印度的 tinkering 实验室提供 AI 支持,生成课程相关的项目创意、教学材料和交互式测验。该计划将首先在 100 所试点学校推广,旨在减轻教师行政负担,提高教学效率,并激发学生创新。
Ollama 发布 v0.31.2 版本,主要更新包括:在旧款 NVIDIA GPU(计算能力 6.x)上启用 flash attention,iGPU 可卸载视觉模型以适配内存,修复了思考模型禁用思考时的结构化输出问题,并强化了 GGUF 模型创建。此外, ollama launch 为 Claude Code 默认禁用遥测,修复了非 UTF-8 路径加载
Hugging Face Transformers 发布 v5.13.0,新增多个模型架构支持,包括 Kimi K2.5/2.6/2.7、小米 MiMo-V2-Flash、NVIDIA Nemotron 3.5 ASR 及 Nemotron ASR Streaming、阿里 Qwen3 ASR 和 Zyphra ZAYA1。这些模型覆盖多模态智能体、长上下文
Google DeepMind 发布 Nano Banana 2 Lite 图像模型和 Gemini Omni Flash 视频模型。Nano Banana 2 Lite 主打高速低成本的图像生成,已上线 Google AI Studio、Gemini API 等平台;Gemini Omni Flash 支持视频生成与对话式编辑,首次向开发者开放。两者结合可
Gemini API 于 2026 年 6 月 30 日发布 Gemini Omni Flash 公开预览版,这是一个高性能多模态模型,支持通过 Interactions API 从文本或静态图像生成 3-10 秒 720p 视频,并可进行对话式编辑。同时,gemini-3.1-flash-lite-image(Nano Banana 2 Lite)正式全面