百度千帆发布多模态营销工具及多个全新Agent
百度千帆平台于2025年12月12日发布多项更新,包括智能商品营销文案生成工具,以及多个全新Agent:深度研究Agent、浏览器使用Agent和代码解释器Agent。这些Agent分别支持多步骤研究、自主网页操作和Python代码执行,旨在提升AI解决方案的落地效率。
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
百度千帆平台于2025年12月12日发布多项更新,包括智能商品营销文案生成工具,以及多个全新Agent:深度研究Agent、浏览器使用Agent和代码解释器Agent。这些Agent分别支持多步骤研究、自主网页操作和Python代码执行,旨在提升AI解决方案的落地效率。
Gemini API 于 2025 年 12 月 10 日发布了文本转语音模型的增强功能,推出 Gemini 2.5 Flash TTS 预览版(针对低延迟优化)和 Gemini 2.5 Pro TTS 预览版(针对质量优化),增强了表现力、精确节奏和无缝对话能力。
智谱AI发布GLM-4.6V视觉推理模型,在20多个主流多模态评测基准上取得SOTA成绩。该模型原生支持工具调用,具备图文混排创作和识图购物等复杂视觉任务处理能力,视觉上下文窗口扩展至128k,可单次处理约150页文档、200页PPT或一小时视频。针对前端开发场景深度调优,支持截图即代码,提升GLM Coding Plan的开发调试效率。
百度千帆平台在2025年12月5日更新了多项模型服务,包括DeepSeek-V3.2等模型支持拆分TPM配额购买,DeepSeek-V3.2-Think等支持通过thinking budget控制思维链长度,并新增Qwen3-30B-A3B-Instruct-2507等模型导入部署。同时,工具广场新增AI纪要、视频AI笔记、题目解析MCP等多项服务,并更新了
百度千帆平台于2025年11月21日发布多项更新,包括上线支持Function Calling和内置工具(知识库搜索)的Response API,推出OCR模型DeepSeek-OCR,并为deepseek-v3.2-think增加thinking strategy参数。同时,工具广场新增百科星图、垂类热榜榜单(MCP版)、热榜榜单查询(MCP版)和Merm
Google 宣布在 Gemini 应用中推出基于 SynthID 的 AI 图像验证功能,用户可上传图片询问是否由 Google AI 生成或编辑。自 2023 年推出 SynthID 以来,已有超过 200 亿条 AI 生成内容被添加水印。未来将扩展至视频和音频,并支持 C2PA 内容凭证,同时与行业伙伴合作推动内容透明度标准。
Google DeepMind 发布了基于 Gemini 3 Pro 的高保真图像生成模型 Nano Banana Pro(Gemini 3 Pro Image),面向开发者提供付费预览,支持 2K/4K 分辨率、精确文本渲染、物理控制、多对象融合等功能,并集成 Google Search 接地和 SynthID 水印。该模型已在 Google AI Stu
Google DeepMind 发布了新一代图像生成与编辑模型 Nano Banana Pro(基于 Gemini 3 Pro),该模型具备更强的推理能力、多语言文本渲染和高级创意控制功能,支持最多 14 张图像融合和 5 人一致性保持。该模型已开始在 Gemini 应用、Google Ads、Workspace、Gemini API 等产品中向消费者、专业
Google DeepMind 发布了 Gemini 3 系列模型,其中 Gemini 3 Pro 在推理、编码和多模态理解上超越前代,并在 Terminal-Bench 2.0 等基准上取得领先成绩。该模型通过 Gemini API 提供预览,定价为每百万输入 token 2 美元、输出 token 12 美元,并集成于 Google Antigravit
Google 和 Alphabet CEO Sundar Pichai 及 Google DeepMind 团队宣布推出 Gemini 3,这是其最先进的 AI 模型,具备顶尖的多模态理解和推理能力,并同步在搜索、Gemini 应用、AI Studio 及新平台 Google Antigravity 中上线。Gemini 3 Pro 在多个基准测试中刷新纪录
Google 于 2025 年 11 月 18 日发布 Gemini 3 系列首个模型 gemini-3-pro-preview,该模型具备先进的推理、多模态理解、智能体及编程能力,并引入新的行为特性。开发者可通过 Gemini 3 开发者指南了解迁移、新功能和规格。
百度智能云千帆平台于2025年11月14日上线了文心5.0系列模型,包括ERNIE-5.0-Thinking-Preview预置服务,该模型为原生全模态大模型,支持文本、图像、音频、视频联合建模,并在多模态理解、指令遵循等能力上表现突出。同时,平台新增了Qwen3-VL-32B系列视觉理解模型,更新了DeepSeek-V3.2的输入输出长度限制,并上架了多个
Google DeepMind 的 SIMA 2 团队发布了一款能够在虚拟 3D 世界中游玩、推理并与用户共同学习的智能体。该研究得到了多个游戏开发商的合作支持,并使用了 Genie 3 模型。SIMA 2 旨在推动 AI 在交互式环境中的能力发展。
Google DeepMind 在《自然》杂志发表论文,分析 AI 视觉系统与人类在视觉组织方式上的差异,并提出一种对齐方法,使模型更符合人类认知,从而提升其鲁棒性和泛化能力。研究通过“找出异类”任务发现,AI 常依赖表面特征(如背景颜色)而非高层次概念,导致判断与人类不一致。该工作是构建更直观、可信 AI 的一步。
Gemini API 发布说明宣布,Gemini 2.5 Flash Image 的图像输入 token 数从 1290 降至 258,降低了图像编辑成本。同时,多个预览版模型将于 11 月 18 日、12 月 2 日和 12 月 9 日分三批停止服务,包括 gemini-2.5-flash-lite-preview 和 gemini-2.5-pro-pre
Google DeepMind 宣布推出 MedGemma 系列中的两个新开放模型:MedGemma 27B 多模态模型和 MedSigLIP 图像编码器。这些模型旨在支持医疗 AI 开发,可处理文本和图像输入,并能在单 GPU 上运行。它们基于 Gemma 3 构建,并经过医学数据优化,同时保留通用能力。开发者可下载、微调并部署到 Vertex AI,已有
Google DeepMind 正式发布 Gemma 3n,这是一款面向移动端和边缘设备的开源多模态模型,基于 MatFormer 架构,支持弹性推理和自定义模型尺寸。该模型引入了 Per-Layer Embeddings 和 KV Cache Sharing 等技术,以提升设备端性能和长输入处理效率。Gemma 3n 支持多种开发工具,并提供了预提取模型和
Google DeepMind 发布了 Gemini 2.5 Flash-Lite 的稳定版,这是 Gemini 2.5 系列中速度最快、成本最低的模型,输入每百万 token 0.10 美元,输出每百万 token 0.40 美元。该模型支持原生推理能力、100 万 token 上下文窗口,并已应用于 Satlyt、HeyGen 等客户场景。稳定版现已通过
Google DeepMind 与导演 Darren Aronofsky 的 Primordial Soup 合作,推出短片《ANCESTRA》,在 Tribeca 电影节首映。影片结合真人拍摄与 Veo 生成的视频,利用 Gemini 生成提示词、Imagen 生成概念艺术,并开发了 Veo 的新功能,如个性化视频生成、运动匹配和添加对象,以应对电影制作中
Google DeepMind 发布了 AlphaEarth Foundations,这是一种整合 PB 级地球观测数据的 AI 模型,生成统一的数据表示,以高精度刻画全球陆地和沿海水域。该模型通过 Google Earth Engine 发布年度嵌入数据集,已与 50 多个组织合作测试,帮助提升生态系统分类、农业和环境变化监测的准确性与速度。