Google DeepMind 推出 AI 联合临床医生,强化医疗 AI 安全与评估
Google DeepMind 发布了 AI co-clinician 项目,这是一种用于临床环境的 AI 系统,采用双智能体架构(Planner 和 Talker)以确保安全边界,并优先进行临床级证据的验证和引用检查。目前正与美国、印度、澳大利亚等地的学术和医疗机构合作进行分阶段评估,但现阶段不用于疾病诊断或治疗。
公司与模型 · Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与云平台
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 23:05
Google DeepMind 发布了 AI co-clinician 项目,这是一种用于临床环境的 AI 系统,采用双智能体架构(Planner 和 Talker)以确保安全边界,并优先进行临床级证据的验证和引用检查。目前正与美国、印度、澳大利亚等地的学术和医疗机构合作进行分阶段评估,但现阶段不用于疾病诊断或治疗。
Google 宣布与韩国科学技术信息通信部合作,在首尔设立 AI Campus,作为韩国学术界和研究机构与 Google AI 专家合作的中心。合作将利用 AlphaEvolve、AlphaGenome、AlphaFold、AI co-scientist 和 WeatherNext 等前沿 AI 模型,推动生命科学、能源、气候等领域的研究。此外,Google
Google DeepMind 推出了 Decoupled DiLoCo,一种新型分布式 AI 训练方法,通过将通信融入计算周期,避免同步阻塞,从而在跨区域网络上实现高效训练。他们成功使用 2-5 Gbps 的广域网在四个美国区域训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上。该方法还支持混合不同代际的硬件(如 TPU v6e 和 TPU v
Google DeepMind宣布与埃森哲、贝恩、BCG、德勤和麦肯锡等全球顶级咨询公司建立合作伙伴关系,旨在加速企业采用前沿AI技术。合作包括提供行业特定AI能力、早期获取Gemini等前沿模型,以及连接AI领导层与客户CEO。此举旨在弥合AI采用差距,推动各行业转型。
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一款新一代文本转语音模型,提升了可控性、表现力和质量。该模型已通过 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 向开发者、企业和 Workspace 用户推出,支持 70 多种语言,并引入了音频标签功能,允许通过自
Gemini API 于 2026 年 4 月 14 日发布了更新版机器人模型 gemini-robotics-er-1.6-preview,新增仪表读取能力,并改进了空间和物理推理能力。同时,旧版 gemini-robotics-er-1.5-preview 模型将于 2026 年 4 月 30 日太平洋时间上午 9 点被关闭。
Google DeepMind 发布了 Gemini Robotics-ER 1.6,这是其具身推理模型的重大升级,旨在提升机器人在空间理解、多视角感知和任务规划方面的能力。该模型可通过原生调用工具(如 Google Search)和视觉-语言-动作模型(VLA)执行任务,并新增了仪表读数能力,与波士顿动力合作开发。该模型现已通过 Gemini API 和
Google DeepMind 发布了 Gemma 4 系列开放模型,包括 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,支持高级推理、智能体工作流、多模态(视觉、音频)和 140 多种语言,采用 Apache 2.0 许可。该系列模型在 Arena AI 文本排行榜上表现优异,31B 模型排名第三,26B 模型排名第六,并针对从移动设备
Google DeepMind 正在开发由 Gemini 驱动的 AI 指针,旨在让用户通过指向和语音与 AI 交互,无需将内容拖入 AI 窗口。该技术能理解用户指向的对象及其重要性,从而提供更直观的协作体验。公司已发布相关原理和实验演示,例如在 Google AI Studio 中通过指向和说话来编辑图片或查找地点。
Google DeepMind 发布了 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提升实时对话能力。该模型通过 Gemini Live API、Gemini Enterprise 以及 Search Live 和 Gemini Live 等产品向开发者、企业和公众提供。在多个基准测试中表现领先,并改进了语调理解和多语言支
Google DeepMind发布了一项关于AI有害操纵风险的新研究,首次创建了经实证验证的工具包,用于在现实世界中测量AI操纵人类思想和行为的能力。研究涉及英国、美国和印度的超过1万名参与者,聚焦金融和健康等高危领域,发现AI在健康话题上的操纵效果最弱,且在不同领域的成功不具预测性。该工具包及方法已公开,旨在帮助保护人们并推动该领域发展。
Google DeepMind 发布了 Lyria 3 Pro,这是其高级音乐生成模型,支持生成最长 3 分钟的曲目,并增强了对音乐结构(如前奏、主歌、副歌)的理解。该模型已集成到 Vertex AI、Google AI Studio、Gemini API、Google Vids 和 Gemini 应用等产品中,并推出了协作工具 ProducerAI。Lyr
Google 于 2026 年 3 月 25 日发布 Lyria 3 音乐生成模型,包括 lyria-3-clip-preview(生成 30 秒片段)和 lyria-3-pro-preview(生成完整歌曲)。两个模型均支持文本和图像输入,可生成 48kHz 立体声的高质量音频,相关指南和代码示例已提供。
Google DeepMind 发布了一篇新论文,提出基于认知科学的框架来衡量 AI 系统的通用智能进展。该框架定义了 10 种关键认知能力,并提出了三阶段评估协议。同时,DeepMind 与 Kaggle 合作举办黑客马拉松,总奖金 20 万美元,邀请社区为其中五种认知能力设计评估方案。
Gemini API 于 2026 年 3 月 10 日发布了首个多模态嵌入模型 gemini-embedding-2-preview,支持文本、图像、视频、音频和 PDF 输入,并将所有模态映射到统一的嵌入空间。同时,Gemini 宣布 gemini-2.5-flash-lite-preview-09-2025 模型将于 2026 年 3 月 31 日关闭
Google DeepMind 在 AlphaGo 战胜人类十周年之际,回顾了其影响:AlphaGo 的技术启发了 AlphaFold 解决蛋白质折叠问题,并获诺贝尔化学奖;AlphaProof 和 AlphaGeometry 2 在数学推理上达到国际数学奥林匹克银牌水平;AlphaEvolve 发现更高效的矩阵乘法算法;AI 协同科学家在抗菌素耐药性研究中
Google DeepMind 发布了 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本效益最高的模型,专为大规模高吞吐量开发者工作负载设计。该模型定价为每百万输入 token 0.25 美元、每百万输出 token 1.5 美元,性能优于 2.5 Flash,输出速度提升 45%,首 token 时间快 2.5 倍。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的高级智能与 Flash 的高速结合,支持快速编辑、精确文本渲染、多主体一致性等功能。该模型即日起在 Gemini 应用、搜索、AI Studio、Google Cloud、Flow 和 Goo
Google DeepMind 发布了 Gemini 3.1 Pro,这是 Gemini 3 系列的核心推理升级版,旨在解决科学、研究和工程领域的复杂任务。该模型已在开发者产品(如 Gemini API、AI Studio、Antigravity)和企业产品(如 Vertex AI、Gemini Enterprise)以及消费者应用(如 Gemini 应用和
Google DeepMind 宣布其最新生成式音乐模型 Lyria 3 在 Gemini 应用中推出测试版,用户可通过文本或上传照片生成带歌词的 30 秒音乐片段,并支持风格、人声和节奏控制。Lyria 3 还集成到 YouTube Dream Track,用于增强 Shorts 配乐。所有生成音频均嵌入 SynthID 水印,并扩展了音频验证功能。该功能