Gemini 3.1 Flash TTS 发布:更自然、可控的 AI 语音生成
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一款新一代文本转语音模型,提升了可控性、表现力和质量。该模型已通过 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 向开发者、企业和 Workspace 用户推出,支持 70 多种语言,并引入了音频标签功能,允许通过自
技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 87 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Google DeepMind 发布了 Gemini 3.1 Flash TTS,这是一款新一代文本转语音模型,提升了可控性、表现力和质量。该模型已通过 Gemini API、Google AI Studio、Vertex AI 和 Google Vids 向开发者、企业和 Workspace 用户推出,支持 70 多种语言,并引入了音频标签功能,允许通过自
Google DeepMind 发布了 Gemini 3.1 Flash Live,这是其最高质量的音频和语音模型,旨在提升实时对话能力。该模型通过 Gemini Live API、Gemini Enterprise 以及 Search Live 和 Gemini Live 等产品向开发者、企业和公众提供。在多个基准测试中表现领先,并改进了语调理解和多语言支
Google DeepMind 发布了升级版 Gemini 2.5 Flash Native Audio 模型,用于实时语音代理,提升了函数调用、指令遵循和对话流畅性。该模型已在 Google AI Studio、Vertex AI 上线,并开始集成到 Gemini Live 和 Search Live。同时,Google 推出了实时语音翻译功能,支持 70
Gemini API 于 2025 年 12 月 12 日发布了新的原生音频模型 gemini-2.5-flash-native-audio-preview-12-2025,该模型用于 Live API,提升了处理复杂工作流的能力。用户可通过 Live API 指南和 Gemini 2.5 Flash Native Audio 文档了解更多信息。
智谱AI发布了GLM-TTS语音合成模型,采用两阶段生成架构,在自然度、情绪表达和语调连贯性上实现升级。该模型支持流式与非流式接口,首帧响应低于400ms,并通过强化学习优化降低了字错误率,在开源评测中取得SOTA情感表达表现。GLM-TTS支持灵活控制语速、音量和风格,适用于客服、阅读、文旅和智能硬件等多场景。
Gemini API 于 2025 年 5 月 20 日发布多项更新,包括支持自定义视频预处理、多工具使用、异步函数调用及实验性 URL 上下文工具。同时发布了多个新模型,如 gemini-2.5-flash-preview-05-20、TTS 模型、实时音乐生成模型、原生音频对话模型以及 Gemma 3n 预览版。这些更新增强了 API 的功能性和模型多样
智谱AI于2025年4月23日发布了新的语音识别模型GLM-ASR,该模型具备高识别精度和强抗噪能力,能够基于上下文理解将音频转录为符合语言习惯的文本,在噪音环境中表现优于现有模型,支持中文、英语及多种方言。目前该模型限时免费提供。