返回主题地图

语音与音频

技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 87 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月11日周五 · 2 条
正文结构化主题已通过公开置信门槛
Xinference Releases一手来源开源

Xinference 发布 v3.4.0:新增 vLLM 多进程路由与 prefill/decode 分离

Xinference 发布 v3.4.0,新增 vLLM 原生多进程执行器路由、Gemma-4 Transformers 后端批处理支持、prefill/decode 分离、多 worker 副本扩缩容等特性,并加入 MonkeyOCR、dots OCR、Fish Audio S1-mini/S2-Pro、MiniCPM5-2B 等模型支持。该版本还增强了缓

正文结构化主题已通过公开置信门槛
THE DECODERAPI 更新

OpenAI 开放 GPT-Live-1 全双工语音 API

OpenAI 将 GPT-Live-1 语音模型以 API 形式开放给开发者,该模型支持全双工(同时听说),已在 ChatGPT 内部运行。开发者可将其与不同后端模型搭配,按任务匹配推理深度、速度与成本,定价为每分钟 0.05 美元。Yelp 已用其处理电话预订并报告通话处理改善。OpenAI 基准显示该模型在全双工交互、轮次延迟、工具调用准确率等指标上明显

9月10日周四 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

多智能体推理用于说话人关系推断

该论文提出一种无需训练的多智能体推理框架,用于从口语对话中推断说话人之间的关系。框架包含两种设计:多角色多智能体辩论(MRMAD)为智能体分配互补角色或社会理论视角;多智能体竞争(MAC)通过成对裁决比较假设并淘汰较弱候选。在 Seamless Interaction 数据集上的实验表明,这些方法在多数情况下优于零样本和现有多智能体基线,但声学线索仍未被当前

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布多语言 TTS 模型 MagpieTTS,支持 12 种语言

NVIDIA 发布了 MagpieTTS Multilingual 357M 模型,这是一个支持 12 种语言的多语言文本转语音(TTS)模型,采用编码器-解码器 Transformer 架构,拥有 364M 参数。该模型通过多码本预测和帧堆叠技术生成高保真语音,并支持批量合成和长文本生成。此次更新新增了阿拉伯语、韩语和葡萄牙语支持,移除了零样本语音克隆功能

9月9日周三 · 3 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.17.0 发布:新增 HYV4、VibeVoice 等模型支持

Hugging Face Transformers 库发布 v5.17.0 版本,新增多个模型支持,包括 HYV4、VibeVoice、NeoMME、Fun-ASR-Nano、KimiLinear 和 Canary。这些模型涵盖语言、语音、多模态等不同领域,并引入了多种创新架构。该版本扩展了 Transformers 的模型生态,为开发者提供了更多选择。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ZipFormer-30M 越南语语音识别模型发布

Hugging Face 上发布了越南语语音识别模型 ZipFormer-30M-RNNT-6000h,基于 ZipFormer 架构,仅 30M 参数,在 CPU 上转录 12 秒音频仅需 0.3 秒。该模型在 VLSP 2025 竞赛中获第一名,并在多个基准上优于更大模型。模型采用 RNN-T 损失,训练数据约 6000 小时,支持快速 CPU 推理,适

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.15 发布:增强 NumPy 2 兼容性与流式可靠性

阿里 FunASR 发布 v1.4.15 版本,主要改进包括 NumPy 2 兼容性、流式与训练可靠性修复,以及 MOSS 和部署文档更新。该版本还提供了与 llama.cpp 运行时配套的预编译二进制文件,支持多种平台。

9月8日周二 · 2 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

安克IFA品牌归一:端侧AI芯片与家庭中枢驱动场景整合

安克创新在柏林IFA前夕宣布将Anker、Anker SOLIX、eufy、eufyMake、soundcore五个品牌统一归于Anker品牌之下,并发布多款新品,包括搭载自研存算一体AI音频芯片Thus的耳机和OTC助听器,以及家庭AI数据中枢MindBase。此举旨在通过端侧AI和本地算力整合个人与家庭场景,推动品牌从多品类消费电子公司向全球化智能硬件科

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

Hugging Face 发布 Open Yap 1K:1,000 小时全双工自然对话数据集

Hugging Face 发布了 Open Yap 1K 数据集,包含 1,000 小时的双通道英语自然对话录音,采样率为 48kHz,免费供商业和研究使用。该数据集通过自建应用让朋友和家人自然通话录制,捕捉了真实对话中的打断、重叠、笑声等特征,旨在为全双工语音模型提供训练数据。相比 Fisher 和 Switchboard 等旧数据集,Open Yap 1

9月7日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

LETHE:一种自指涉的GAN启发式音频架构

LETHE 是一个在 SuperCollider 中实现的自指涉音频系统,采用 GAN 的正式词汇,但无需外部数据集或监督。它通过一个五特征线性判别器与随机扰动优化器交互,动态调整反馈延迟网络的参数,使音频演化。实验表明,主动生成器对参数演化是必要的,该系统将作曲家的参数空间与自适应闭环结合,延续了自指涉电子音乐的传统。

9月4日周五 · 2 条
正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节发布全双工语音大模型Seeduplex,已在豆包App上线

字节跳动旗下Seed研究团队正式推出Seeduplex,一款原生全双工语音大模型,基于全新的“边听边说”框架,支持同时聆听与说话,显著提升交互自然度与流畅度。相比半双工模型,其误响应率和误打断率降低一半,过早响应率降低40%,并已在豆包App全量上线,实现行业首次大规模部署。该模型在复杂声学环境中的干扰抑制和自适应端点检测方面取得突破,多维度评估显示其在对话

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.14 发布:修复源码包并更新部署指南

阿里 FunASR 发布 v1.4.14 版本,主要修复了 Git 归档和源码安装的便携源码包问题,并确保 MOSS-Transcribe-Diarize 在模型、部署和服务文档中保持可发现性。该版本还提供了最新的实时和工业部署指南,并附带经过验证的 runtime-llamacpp-v0.2.6 跨平台二进制文件。

9月3日周四 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

SpeakPay:LoRA微调Whisper实现尼泊尔语金融语音识别

SpeakPay项目针对尼泊尔语金融语音识别领域,构建了首个公开的NepFinSpeech-403数据集,并通过LoRA微调Whisper large-v2模型,将词错误率从129.95%降至42.58%,交易成功率从1.67%提升至33.33%。研究还发现100-300条领域特定语音即可获得大部分适应收益,并部署了公开的语音优先网页应用。

9月2日周三 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nemotron 3.5古兰经双头ASR模型v5

该模型基于NVIDIA Nemotron 3.5流式ASR(0.6B)微调,用于全古兰经诵读识别,支持Uthmani脚本及泰吉威德符号,并增加音素头用于错误检测。最佳检查点(step 78000)在留出集上达到CER 2.76%、WER 4.43%、变音符号F1 98.27%。训练数据包含179,376个片段(约868小时),模型参数全部可训练。

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.13 发布:修复与新增支持

阿里 FunASR 发布 v1.4.13 版本,主要修复了 ONNX 运行时错误、NumPy 2 ABI 不匹配等问题,并新增了对 n8n OpenAI 音频转录的支持以及 Qwen3-ASR 的离线 vLLM 示例。该版本还提供了多平台的 llama.cpp/GGUF 运行时预编译二进制文件,方便用户快速部署语音识别模型。

9月1日周二 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

参数化多模态用户记忆:存储字幕无法承载的感知信息

本文提出了一种参数化多模态用户记忆方法,将感知记忆(如声音、面部)以原生模态存储,通过VLM进行指代定位、专用编码器提取身份键,并利用AttMem记忆库以注意力令牌形式存储,无需外部检索。实验表明,该方法在跨年龄、多说话人等场景下显著优于基于文本描述的记忆系统,弥补了纯文本记忆的不足。

8月31日周一 · 3 条
正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.11 发布:修复与多平台运行时更新

阿里 FunASR 发布了 v1.4.11 版本,主要修复了 SentencePiece 词标记对齐问题,并自动附加 Python 包。该版本与 llama.cpp/GGUF 运行时 v0.2.6 配对,提供了多平台(Linux、macOS、Windows)的预编译二进制文件,支持 CUDA、Vulkan 等。用户可通过 PyPI 安装或下载对应平台的运行时

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR 1.4.10 发布:修复超长中文字幕边界问题

阿里 FunASR 发布 1.4.10 版本,修复了超长中文句子的可读字幕回退边界问题,通过平衡时长和长度并优先考虑 Jieba 词边界、标点、脚本转换和真实时间戳间隙,改善了字幕生成质量。在混合中韩样本上,84 个源片段生成了 133 个字幕,无时长或长度违规。该版本还包含已验证的 llama.cpp 运行时归档,支持多种平台和硬件变体。

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布首批音频模型及转录 API

Mistral 平台发布了首批音频模型,包括 Voxtral Small 和 Voxtral Mini,用于聊天场景,以及 Voxtral Mini Transcribe 用于转录,并通过 audio/transcriptions API 提供。这些模型标志着 Mistral 进入音频领域。

8月30日周日 · 1 条
正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.9 发布:修复多项问题并捆绑 llama.cpp 运行时

阿里 FunASR 发布 v1.4.9 版本,主要修复了字幕分割、自动模型、Paraformer 时间戳预测器及实时长尾保留等问题,并新增了 MOSS 说话人日志的 SGLang 路径文档。该版本还捆绑了 llama.cpp/GGUF 运行时 v0.2.6,提供多平台预编译二进制文件,支持 Linux、macOS 和 Windows 的多种硬件加速选项。