deepdml 发布西班牙语微调 Whisper Tiny 语音识别模型
deepdml 团队基于 openai/whisper-tiny 微调了西班牙语语音识别模型 whisper-tiny-es-mix-norm,在 Common Voice 17.0 等数据集上训练,最终在评估集上取得 WER 21.67% 的成绩。该模型以 Apache-2.0 许可证发布,适用于西班牙语自动语音识别任务。
技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 22 条
deepdml 团队基于 openai/whisper-tiny 微调了西班牙语语音识别模型 whisper-tiny-es-mix-norm,在 Common Voice 17.0 等数据集上训练,最终在评估集上取得 WER 21.67% 的成绩。该模型以 Apache-2.0 许可证发布,适用于西班牙语自动语音识别任务。
audio.cpp 项目发布了多个语音模型的 GGUF 量化版本,涵盖 TTS、ASR、语音转换、源分离和说话人分离等任务。这些模型基于 ACE-Step、Qwen、NVIDIA 等多家机构的基础模型转换而来,支持 16-bit 和 Q8 量化格式,并提供了详细的测试状态和兼容性说明。该发布旨在通过 GGUF 格式提升语音模型在本地部署的效率和可移植性。
NVIDIA 发布 Magpie 多语言 TTS 模型,新增阿拉伯语、韩语和巴西葡萄牙语支持,共支持 12 种语言。该模型为 3.64 亿参数的开源权重模型,可通过 NVIDIA NIM 部署,在 B200 GPU 上实现 32 毫秒的首音频延迟和 320 倍实时吞吐。通过帧堆叠和局部 Transformer 架构优化,在保持语音质量的同时降低推理延迟,适用
Bose CEO Lila Snyder 在访谈中介绍了公司转型:从单一品牌转向多品牌,收购了 McIntosh 和 Sonus faber 进入豪华音频市场,并新增了 B2B 的 Audio Tech 业务,将 Bose 技术授权给其他公司,如 Motorola、Xreal 和 Sena。她认为声音的重要性日益增加,并讨论了 AI 可穿戴设备对音频行业的潜
该研究系统评估了六种预训练音频编码器在三种音乐推荐系统(基于内容、序列和基于语义ID的生成式推荐系统)中的有效性。研究发现,音频-文本对齐和音乐领域的表示在直接使用预训练嵌入几何时通常更有效,而基于交互的序列训练会显著缩小编码器间的性能差异。此外,增加语义ID容量并不总能提升生成式推荐系统性能,甚至可能引入不稳定性。这些发现为现代音乐推荐系统选择音频编码器和
该研究提出了一种生成对齐的诊断阶梯方法,用于分离语音语言模型在副语言任务中决策规则与读出覆盖范围的性能差距。实验发现,状态解码平均比生成准确率高27.8个百分点,且标签无关的logit修正能改善生成准确性。结果表明,情感信息在原生读出之外可泛化到未见说话者,但替换读出外部方向对生成答案影响甚微。
Hugging Face 团队在收到社区关于阿拉伯语 TTS Arena 排行榜与用户体验不符的反馈后展开调查。他们最初怀疑存在刷榜行为,但通过逐条听取投票音频和检查提示词,发现异常投票其实是用户使用海湾方言进行真实评测的结果。进一步分析表明,不同阿拉伯语方言下最佳模型各不相同,单一排行榜掩盖了这种差异。最终,团队保留了所有投票,并为排行榜增加了方言筛选功能
llama.cpp 发布 b10326 版本,主要更新是在 TTS 功能中,将声码器(vocoder)的波形生成时间计入计时行,使报告的总时长与音频处理比例更准确。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端。
阿里巴巴于8月7日推出国内首个一站式AI语音生产力平台CosyVoice Studio,基于自研语音模型Qwen-Audio,该模型在Artificial Analysis上获得ASR、实时交互和TTS三项全球第一。平台包含语音键盘、音频内容创作工具和语音智能体三大功能,面向企业和个人用户,支持语音转写、语义理解、声音复刻和智能体搭建。该平台将阿里的语音能力
腾讯混元于8月4日发布新一代语音识别模型Hy ASR 3.0 preview,基于大语言模型Hy3,融合高精度语音识别与语义理解,在通用识别、上下文感知、多场景鲁棒性及方言覆盖等维度显著提升。该模型在开源和自建评测集上WER表现领先,已上线腾讯云提供API服务,并集成于腾讯元宝等产品。
DLLM-TTS 是一种将文本到语音合成(TTS)建模为基于 X-Codec2 神经音频编解码器令牌的条件块离散扩散的框架。该模型将序列分解为块,在块内应用掩码扩散,同时顺序处理块,以学习局部声学一致性和全局文本-语音对齐。在推理时,块内并行令牌预测实现了 0.15 的实时因子(RTF),一个在 20K 小时数据上训练的 0.6B 参数模型在 Seed-TT
Google 发布了 Gen AI JavaScript SDK 的 v2.14.0 版本,新增了音频转录配置和语言代码字段,并支持企业模式下使用 API 密钥及项目/位置参数。同时,对 Imagen 的生成图像、编辑图像和生成视频功能添加了弃用警告,这些功能将在下一个主要版本中移除。
Google Gen AI Python SDK 发布 v2.15.0 版本,新增音频转录配置功能,包括在 GenerationConfig 中添加 audio_transcription_config 字段,以及 Part.audio_transcription 字段,并支持扁平化的 language_codes 字段。此外,企业模式现在允许同时使用 AP
Hugging Face Transformers 库发布 v5.12.0 版本,新增了 MiniMax-M3-VL 视觉语言模型、PP-OCRv6 轻量级 OCR 系统和 Parakeet-RNNT 语音识别模型。该版本还包含多项 bug 修复和 CI 改进,并感谢了社区贡献者。
RAGFlow 发布 v0.25.5 版本,新增本地与 SSH 数据源支持,并优化数据集搜索路径,延迟降低 50-100%。该版本还改进了元数据过滤、TTS 缓存、服务器启动速度等性能,并修复了多项安全与功能问题。
Together AI 推出了完全开源的视频翻译工具 Violin,基于 Together API,结合语音识别、大语言模型和语音合成技术,实现高质量视频翻译。Violin 提供 Web 应用、CLI 和代理技能三种使用方式,并内置视频内容感知的聊天助手和自然语言语音选择器。该工具采用 MIT 许可证发布,旨在打破语言障碍,使视频内容更易于全球观众访问。
Cohere 发布了开源自动语音识别模型 Transcribe,基于 Conformer 架构,支持 14 种语言,在 HuggingFace Open ASR 排行榜上以 5.42% 的平均词错误率排名第一,超越 Whisper Large v3 等模型。该模型注重生产就绪性,提供高效推理和多种部署方式,并计划与 Cohere 的代理编排平台 North
GroqCloud宣布Canopy Labs的Orpheus TTS模型新版本上线,包括改进的沙特阿拉伯语模型,新增Abdullah和Aisha两个声音,并作为PlayAI-TTS的替代品。该模型提供低延迟、字符计费,支持英语和沙特阿拉伯语,适用于语音代理、客户支持等场景。
智谱AI发布GLM-5.2、GLM-5.1、GLM-5、GLM-4.7等多款新模型,覆盖旗舰、多模态、语音、视觉等,并推出GLM Coding Plan团队版。新模型在编码、长程任务、多模态理解等方面性能提升,部分模型对标Claude Opus系列,并集成DeepSeek Sparse Attention。
Mistral AI 发布了 Voxtral TTS,一个 4B 参数的多语言文本转语音模型,支持 9 种语言,具有低延迟和情感表达。该模型可通过 API 和 Mistral Studio 使用,定价为每 1k 字符 0.016 美元,并支持零样本跨语言语音适应。
Hugging Face 与 ARTPARK-IISc 联合发布 Vaani-LID_v0,这是一个开源语音语言分类器,可识别印度 42 种语言,覆盖四个语系。该模型基于 Vaani 语料库预训练的 FastConformer 编码器,在冻结状态下跨域表现优于微调的 Whisper,并采用分层 softmax 提升泛化能力。研究还发现,对预训练编码器进行微调
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,包括采用 NVIDIA Dynamo 1.0 优化推理、通过 NVIDIA OpenShell 集成 NemoClaw、支持 NVIDIA Nemotron 3 Super 模型用于多智能体工作流,并在模型库中新增 NVIDIA Parakeet TDT 0.6B V3 语