Gemini 3.1 Flash Live 发布:更自然可靠的音频AI
Google DeepMind 发布了 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提升实时对话能力。该模型通过 Gemini Live API、Gemini Enterprise 以及 Search Live 和 Gemini Live 等产品向开发者、企业和公众提供。在多个基准测试中表现领先,并改进了语调理解和多语言支
技术方向 · 文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品 · 共 778 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 发布了 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提升实时对话能力。该模型通过 Gemini Live API、Gemini Enterprise 以及 Search Live 和 Gemini Live 等产品向开发者、企业和公众提供。在多个基准测试中表现领先,并改进了语调理解和多语言支
Google DeepMind 发布了 Lyria 3 Pro,这是其高级音乐生成模型,支持生成最长 3 分钟的曲目,并增强了对音乐结构(如前奏、主歌、副歌)的理解。该模型已集成到 Vertex AI、Google AI Studio、Gemini API、Google Vids 和 Gemini 应用等产品中,并推出了协作工具 ProducerAI。Lyr
Google 于 2026 年 3 月 25 日发布 Lyria 3 音乐生成模型,包括 lyria-3-clip-preview(生成 30 秒片段)和 lyria-3-pro-preview(生成完整歌曲)。两个模型均支持文本和图像输入,可生成 48kHz 立体声的高质量音频,相关指南和代码示例已提供。
百度千帆平台于2026年3月13日发布多项更新,包括新增多款Qwen3.5多模态模型、支持GLM-5和Kimi-K2.5的TPM配额购买,并升级Coding Plan至Kimi-K2.5且支持MiniMax-M2.5。同时,AI助手升级为智能调度模式,提供多模态问答能力,并新增百度热搜、百度搜索MCP版等工具。
LlamaIndex 发布 v0.14.16 版本,包含多个核心修复和新功能,如新增令牌桶和滑动窗口限流器、多模态 LLM 重排序器、扩展向量存储元数据过滤器,并修复了多个 bug 和安全问题(CWE-502)。同时更新了多个集成包,包括 OpenAI、Anthropic、Bedrock 等,新增对 gpt-5-chat 和 reasoning conten
Gemini API 于 2026 年 3 月 10 日发布了首个多模态嵌入模型 gemini-embedding-2-preview,支持文本、图像、视频、音频和 PDF 输入,并将所有模态映射到统一的嵌入空间。同时,Gemini 宣布 gemini-2.5-flash-lite-preview-09-2025 模型将于 2026 年 3 月 31 日关闭
Google DeepMind 发布了 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本效益最高的模型,专为大规模高吞吐量开发者工作负载设计。该模型定价为每百万输入 token 0.25 美元、每百万输出 token 1.5 美元,性能优于 2.5 Flash,输出速度提升 45%,首 token 时间快 2.5 倍。
Google DeepMind 发布最新图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),将 Nano Banana Pro 的高级智能与 Flash 的高速结合,支持快速编辑、精确文本渲染、多主体一致性等功能。该模型即日起在 Gemini 应用、搜索、AI Studio、Google Cloud、Flow 和 Goo
Gemini API 于 2026 年 2 月 26 日发布 Nano Banana 2 和 Gemini 3.1 Flash 图像预览版,后者为高效模型,针对速度和大量使用场景优化。同时宣布 Gemini 3 Pro 预览版将于 2026 年 3 月 9 日关闭。
本文回顾了2026年1月至2月期间发布的10个开源权重LLM,重点比较了它们的架构异同。主要发布包括Arcee AI的Trinity Large、Moonshot AI的Kimi K2.5、StepFun Step 3.5 Flash、Qwen3-Coder-Next、z.AI的GLM-5、MiniMax M2.5、Nanbeige 4.1 3B、Qwen
LlamaIndex 发布 v0.14.15 版本,核心库新增多模态类型支持、多模态提示模板及格式化功能,并引入 AgentMesh 信任层集成。同时,Anthropic 和 Bedrock Converse 新增 Claude Sonnet 4.6 支持,Mistral AI 集成 Azure SDK,OCI Data Science 支持流式端点。此外,
Google DeepMind 宣布其最新生成式音乐模型 Lyria 3 在 Gemini 应用中推出测试版,用户可通过文本或上传照片生成带歌词的 30 秒音乐片段,并支持风格、人声和节奏控制。Lyria 3 还集成到 YouTube Dream Track,用于增强 Shorts 配乐。所有生成音频均嵌入 SynthID 水印,并扩展了音频验证功能。该功能
Google DeepMind 发布了 Veo 3.1 的更新,增强了“Ingredients to Video”功能,支持原生竖屏输出和最高 4K 分辨率,提升了角色、背景和物体的一致性。该更新已在 Gemini 应用、YouTube、Flow、Google Vids、Gemini API 和 Vertex AI 中推出,并集成 SynthID 水印以验证
百度千帆平台在2026年1月9日更新了模型服务,包括Qwen3-30B-A3B-Instruct-2507支持混合TPM配额,DeepSeek-V3.2开启分段计费并支持前缀缓存(白名单内测),以及自定义接入点功能。同时,工具广场新增了智能商品搜索、商品生动化标题生成MCP和百度彩票走势MCP等工具。
Google DeepMind 发布 2025 年度回顾,总结其在 AI 和量子计算领域的研究突破。2025 年,Google 发布了 Gemini 2.5、Gemini 3 和 Gemini 3 Flash 等模型,提升了推理和多模态能力,并推出 Nano Banana、Veo 3.1 等生成式媒体工具。同时,Google 通过 Gemini 应用、Not
百度千帆平台于2025年12月19日发布多项更新,包括DeepSeek-R1模型支持前缀缓存,AI助手新增多模态功能(自动搜图、搜视频、音频和Markdown文件解析),工作流支持异步调用和导入导出,并推出百度天气和代码安全MCP服务。这些更新旨在提升开发效率和多模态知识复用能力。
Google DeepMind 发布 Gemini 3 Flash 模型,面向开发者和公众提供快速、低成本的推理能力。该模型在 GPQA Diamond 等基准上表现优异,价格低于 Pro 版本,并已集成至 Gemini API、Vertex AI 及 Gemini 应用。此举旨在扩大 Gemini 3 的覆盖范围,提升日常任务和智能体工作流的效率。
Google 于 2025 年 12 月 17 日发布 Gemini 3 Flash 预览版(gemini-3-flash-preview),该模型以较低成本提供接近前沿级别的性能,并增强了视觉与空间推理能力以及智能体编码功能。
Google DeepMind 发布了升级版 Gemini 2.5 Flash Native Audio 模型,用于实时语音代理,提升了函数调用、指令遵循和对话流畅性。该模型已在 Google AI Studio、Vertex AI 上线,并开始集成到 Gemini Live 和 Search Live。同时,Google 推出了实时语音翻译功能,支持 70
Gemini API 于 2025 年 12 月 12 日发布了新的原生音频模型 gemini-2.5-flash-native-audio-preview-12-2025,该模型用于 Live API,提升了处理复杂工作流的能力。用户可通过 Live API 指南和 Gemini 2.5 Flash Native Audio 文档了解更多信息。