返回主题地图

语音与音频

技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 22

8月12日星期三 · 1
Hugging Face New and Trending Models一手来源模型发布39

deepdml 发布西班牙语微调 Whisper Tiny 语音识别模型

deepdml 团队基于 openai/whisper-tiny 微调了西班牙语语音识别模型 whisper-tiny-es-mix-norm,在 Common Voice 17.0 等数据集上训练,最终在评估集上取得 WER 21.67% 的成绩。该模型以 Apache-2.0 许可证发布,适用于西班牙语自动语音识别任务。

8月11日星期二 · 2
Hugging Face New and Trending Models一手来源开源13

audio.cpp 发布多语音模型 GGUF 量化包

audio.cpp 项目发布了多个语音模型的 GGUF 量化版本,涵盖 TTS、ASR、语音转换、源分离和说话人分离等任务。这些模型基于 ACE-Step、Qwen、NVIDIA 等多家机构的基础模型转换而来,支持 16-bit 和 Q8 量化格式,并提供了详细的测试状态和兼容性说明。该发布旨在通过 GGUF 格式提升语音模型在本地部署的效率和可移植性。

Hugging Face Blog一手来源模型发布15

NVIDIA 发布 Magpie 多语言 TTS:开源权重,低延迟部署

NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用

8月10日星期一 · 4
The Verge AI观点2

Bose CEO 谈转型:多品牌战略与音频技术授权

Bose CEO Lila Snyder 在访谈中介绍了公司转型:从单一品牌转向多品牌,收购了 McIntosh 和 Sonus faber 进入豪华音频市场,并新增了 B2B 的 Audio Tech 业务,将 Bose 技术授权给其他公司,如 Motorola、Xreal 和 Sena。她认为声音的重要性日益增加,并讨论了 AI 可穿戴设备对音频行业的潜

arXiv cs.IR一手来源研究4

从分类到推荐:音频嵌入模型在基于内容的音乐推荐中的实证分析

该研究系统评估了六种预训练音频编码器在三种音乐推荐系统(基于内容、序列和基于语义ID的生成式推荐系统)中的有效性。研究发现,音频-文本对齐和音乐领域的表示在直接使用预训练嵌入几何时通常更有效,而基于交互的序列训练会显著缩小编码器间的性能差异。此外,增加语义ID容量并不总能提升生成式推荐系统性能,甚至可能引入不稳定性。这些发现为现代音乐推荐系统选择音频编码器和

arXiv cs.CL一手来源研究4

分离语音语言模型中的决策规则错位与读出覆盖限制

该研究提出了一种生成对齐的诊断阶梯方法,用于分离语音语言模型在副语言任务中决策规则与读出覆盖范围的性能差距。实验发现,状态解码平均比生成准确率高27.8个百分点,且标签无关的logit修正能改善生成准确性。结果表明,情感信息在原生读出之外可泛化到未见说话者,但替换读出外部方向对生成答案影响甚微。

Hugging Face Blog一手来源研究6

阿拉伯语TTS排行榜方言偏差调查:并非刷榜,而是方言差异

Hugging Face 团队在收到社区关于阿拉伯语 TTS Arena 排行榜与用户体验不符的反馈后展开调查。他们最初怀疑存在刷榜行为,但通过逐条听取投票音频和检查提示词,发现异常投票其实是用户使用海湾方言进行真实评测的结果。进一步分析表明,不同阿拉伯语方言下最佳模型各不相同,单一排行榜掩盖了这种差异。最终,团队保留了所有投票,并为排行榜增加了方言筛选功能

8月8日星期六 · 1
llama.cpp Releases一手来源产品发布1

llama.cpp b10326 发布:TTS 计时改进及多平台支持

llama.cpp 发布 b10326 版本,主要更新是在 TTS 功能中,将声码器(vocoder)的波形生成时间计入计时行,使报告的总时长与音频处理比例更准确。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端。

8月7日星期五 · 1
量子位产品发布0

阿里发布国内首个AI语音平台CosyVoice Studio

阿里巴巴于8月7日推出国内首个一站式AI语音生产力平台CosyVoice Studio,基于自研语音模型Qwen-Audio,该模型在Artificial Analysis上获得ASR、实时交互和TTS三项全球第一。平台包含语音键盘、音频内容创作工具和语音智能体三大功能,面向企业和个人用户,支持语音转写、语义理解、声音复刻和智能体搭建。该平台将阿里的语音能力

8月4日星期二 · 2
量子位模型发布0

腾讯混元发布Hy ASR 3.0 preview,语音识别理解上下文

腾讯混元于8月4日发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度语音识别与语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度显著提升。该模型在开源和自建评测集上WER表现领先,已上线腾讯云提供API服务,并集成于腾讯元宝等产品。

arXiv cs.CL一手来源研究0

DLLM-TTS:用于语音合成的块离散扩散语言模型

DLLM-TTS 是一种将文本到语音合成(TTS)建模为基于 X-Codec2 神经音频编解码器令牌的条件块离散扩散的框架。该模型将序列分解为块,在块内应用掩码扩散,同时顺序处理块,以学习局部声学一致性和全局文本-语音对齐。在推理时,块内并行令牌预测实现了 0.15 的实时因子(RTF),一个在 20K 小时数据上训练的 0.6B 参数模型在 Seed-TT

7月30日星期四 · 2
Google Gen AI JavaScript SDK Releases一手来源产品发布0

Google Gen AI JS SDK v2.14.0 发布:新增音频转录与弃用警告

Google 发布了 Gen AI JavaScript SDK 的 v2.14.0 版本,新增了音频转录配置和语言代码字段,并支持企业模式下使用 API 密钥及项目/位置参数。同时,对 Imagen 的生成图像、编辑图像和生成视频功能添加了弃用警告,这些功能将在下一个主要版本中移除。

Google Gen AI Python SDK Releases一手来源产品发布0

Google Gen AI Python SDK v2.15.0 发布,新增音频转录配置

Google Gen AI Python SDK 发布 v2.15.0 版本,新增音频转录配置功能,包括在 GenerationConfig 中添加 audio_transcription_config 字段,以及 Part.audio_transcription 字段,并支持扁平化的 language_codes 字段。此外,企业模式现在允许同时使用 AP

6月12日星期五 · 1
5月20日星期三 · 1
RAGFlow Releases一手来源产品发布

RAGFlow v0.25.5 发布:性能优化与安全修复

RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。

8月2日星期日 · 5
Together AI Blog一手来源开源0

Together AI 发布开源视频翻译工具 Violin

Together AI 推出了完全开源的视频翻译工具 Violin,基于 Together API,结合语音识别、大语言模型和语音合成技术,实现高质量视频翻译。Violin 提供 Web 应用、CLI 和代理技能三种使用方式,并内置视频内容感知的聊天助手和自然语言语音选择器。该工具采用 MIT 许可证发布,旨在打破语言障碍,使视频内容更易于全球观众访问。

Cohere Blog一手来源模型发布0

Cohere 发布开源 ASR 模型 Transcribe,刷新语音识别准确率纪录

Cohere 发布了开源自动语音识别模型 Transcribe,基于 Conformer 架构,支持 14 种语言,在 HuggingFace Open ASR 排行榜上以 5.42% 的平均词错误率排名第一,超越 Whisper Large v3 等模型。该模型注重生产就绪性,提供高效推理和多种部署方式,并计划与 Cohere 的代理编排平台 North

Groq Blog一手来源产品发布0

GroqCloud上线Orpheus TTS新版本,新增沙特阿拉伯语声音

GroqCloud宣布Canopy Labs的Orpheus TTS模型新版本上线,包括改进的沙特阿拉伯语模型,新增Abdullah和Aisha两个声音,并作为PlayAI-TTS的替代品。该模型提供低延迟、字符计费,支持英语和沙特阿拉伯语,适用于语音代理、客户支持等场景。

GLM New Releases一手来源模型发布0

智谱AI发布GLM-5.2等系列模型及团队版编码计划

智谱AI发布GLM-5.2、GLM-5.1、GLM-5、GLM-4.7等多款新模型,覆盖旗舰、多模态、语音、视觉等,并推出GLM Coding Plan团队版。新模型在编码、长程任务、多模态理解等方面性能提升,部分模型对标Claude Opus系列,并集成DeepSeek Sparse Attention。

Mistral AI News一手来源模型发布0

Mistral AI 发布 Voxtral TTS 多语言语音生成模型

Mistral AI 发布了 Voxtral TTS,一个 4B 参数的多语言文本转语音模型,支持 9 种语言,具有低延迟和情感表达。该模型可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元,并支持零样本跨语言语音适应。

8月6日星期四 · 1
Hugging Face Blog一手来源模型发布0

Vaani-LID_v0:覆盖42种印度语言的语音识别前端

Hugging Face 与 ARTPARK-IISc 联合发布 Vaani-LID_v0,这是一个开源语音语言分类器,可识别印度 42 种语言,覆盖四个语系。该模型基于 Vaani 语料库预训练的 FastConformer 编码器,在冻结状态下跨域表现优于微调的 Whisper,并采用分层 softmax 提升泛化能力。研究还发现,对预训练编码器进行微调

8月3日星期一 · 1