返回主题地图

语音与音频

技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 87 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月30日周日 · 1 条
正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR llama.cpp 运行时 v0.2.6 发布

阿里 FunASR 发布了 llama.cpp 运行时 v0.2.6,提供 SenseVoice、Paraformer 和 Fun-ASR-Nano 的预编译二进制文件,内置 FSMN-VAD。该版本支持 CPU、Vulkan 和 CUDA(包括 Blackwell)后端,并验证了资产完整性和 CUDA 依赖。用户可通过脚本下载量化模型并直接运行,无需 Py

8月28日周五 · 1 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 与 NVIDIA 合作:利用 MPS 将 ASR 推理成本降低 75%

AWS、NVIDIA 与 Heidi Health 合作,展示了使用 NVIDIA CUDA MPS 和 Triton 推理服务器在 Amazon EC2 上优化 ASR 推理成本的方法。通过 MPS 并发执行,GPU 利用率从 15-20% 提升,使 GPU 实例需求从 16 个减少到 4 个,成本降低 75%,同时保持亚秒级延迟。该方案结合 ONNX R

8月26日周三 · 2 条
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers v5.16.0 发布,新增 Qwen4-Exp 等模型支持

Hugging Face Transformers 库发布 v5.16.0,新增多个模型支持,包括 Qwen4-Exp、GraniteSpeech5、Step3p7、CohereCompass 以及 ESMC 和 ESMFold2。这些模型覆盖了混合架构、语音识别、视觉语言、蛋白质语言与折叠等领域,提升了 Transformers 对前沿模型的支持能力。

正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 3.5 Transcribe 模型全面上市,支持流式与非流式语音转文字

Gemini API 于 2026 年 8 月 26 日发布 Gemini 3.5 Transcribe 和 Gemini 3.5 Transcribe Live 两款语音转文字模型,均基于 Gemini 的音频理解能力。前者为非流式模型,支持 85+ 语言检测、说话人分离、词级时间戳和自定义词汇偏置;后者为低延迟双向流式模型,支持中间和最终转录事件、智能转

另有 1 家信源报道

8月25日周二 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

ArmBench-ASR:亚美尼亚语语音识别基准发布

Hugging Face 发布了 ArmBench-ASR v0.1,一个用于评估亚美尼亚语自动语音识别(ASR)模型的基准,包含近30个模型和约20.7小时的音频。Gemini 2.5 Pro 以14.31%的严格WER排名第一,而最强的开源模型是 NVIDIA 的 Armenian FastConformer,排名第9。基准显示模型性能高度依赖领域,电影

8月24日周一 · 1 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

构建并评估面向电信客服的合成孟加拉语语音资源

该论文介绍了一个面向电信客服场景的合成孟加拉语语音数据集,包含10,000个音频-文本对,约26.82小时,已在Hugging Face上以CC-BY-4.0许可发布。数据集使用OmniVoice的语音克隆模式生成,并提供了原始文本和归一化文本字段。通过微调的Whisper ASR模型评估,平均词错误率为2.54%,字符错误率为0.59%,表明文本-音频一致

8月23日周日 · 1 条
正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源产品发布

Vercel AI SDK 更新 Deepgram 集成:修复转录选项并增强语音合成

Vercel AI SDK 发布了 @ai-sdk/deepgram@3.1.0 版本,修复了转录选项被静默丢弃的问题,并新增了语音合成中的语音/语言组合、使用元数据、速度传递和错误解析等功能。该版本还改变了说话人分离(diarize)的默认行为,不再默认启用,以避免不必要的付费功能。

8月22日周六 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER产品发布

RayNeo 发布无摄像头 AI 眼镜,专注文本叠加

RayNeo 发布新款 AI 眼镜 RayNeo iO,无摄像头和扬声器,通过绿色波导显示屏在视野中叠加文字,透明度 97%,亮度约 1300 尼特。眼镜可监听对话、总结内容、提取行动项并建议日历条目,用户可通过点头确认,还支持提词器模式和 40 种语言的语音转文字翻译。设备内置四个麦克风和骨传导传感器,麦克风激活时 LED 亮起。出厂预装 RayNeo A

8月21日周五 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER产品发布

Adobe Firefly 推出 AI 音频工具并集成 Gemini Omni Flash

Adobe 在 Firefly 平台中全面推出三款 AI 音频工具,包括生成免版税音乐、将脚本转为配音以及生成音效,并声称这些工具可用于商业用途。此外,Firefly AI Assistant 新增每日免费生成次数,并集成了 Google 的 Gemini Omni Flash 模型,该模型支持视频、音频、图像和文本输入。

8月20日周四 · 2 条
正文结构化主题已通过公开置信门槛
Google Gen AI JavaScript SDK Releases一手来源API 更新

Google Gen AI JS SDK v2.18.0 发布:新增音频转录模式与强化学习参数

Google 发布了 Gen AI JavaScript SDK 的 2.18.0 版本,新增了音频转录配置中的模式枚举(VERBATIM、SMART),为 ToolParallelAiSearch 添加数据保留功能,为强化学习超参数添加步数计数,并新增 BidiGenerateContentSetup。此外,还添加了视频分辨率和扩展任务参数,更新了实时连接

正文结构化主题已通过公开置信门槛
Google Gen AI Python SDK Releases一手来源API 更新

Google Gen AI Python SDK v2.19.0 发布,新增多项配置与状态功能

Google 发布了 Gen AI Python SDK 的 v2.19.0 版本,新增了音频转录配置中的模式枚举、工具并行搜索的数据保留设置、强化学习超参数中的步数计数、实时连接状态中的 IDLE 状态,以及视频分辨率和扩展任务参数等功能。这些更新增强了 SDK 的功能性和灵活性。

8月19日周三 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Whisper Tiny es:西班牙语语音识别微调模型发布

deepdml 在 Hugging Face 上发布了 Whisper Tiny es,这是基于 OpenAI Whisper Tiny 微调的多语料西班牙语语音识别模型。该模型在 Common Voice 26.0 等数据集上训练,最佳检查点 WER 为 16.07%,CER 为 6.04%。模型采用 Apache 2.0 许可证,适用于自动语音识别任务。

8月18日周二 · 3 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniCPM-o 2.6:8B 参数端侧多模态模型发布

OpenBMB 发布了 MiniCPM-o 2.6,这是一个 8B 参数的多模态大模型,支持视觉、语音和实时多模态流式交互,在多个基准上超越 GPT-4o 等闭源模型。该模型基于 SigLip、Whisper、ChatTTS 和 Qwen2.5 构建,支持端侧部署,并已开放 ollama、int4、GGUF 等格式。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

OpenBMB 发布 VoxCPM-0.5B:无 tokenizer TTS 模型,支持上下文感知语音生成与声音克隆

OpenBMB 发布了 VoxCPM-0.5B,这是一个基于 MiniCPM4-0.5B 的无 tokenizer 文本转语音(TTS)模型,采用端到端扩散自回归架构,直接在连续空间中建模语音,支持上下文感知的语音生成和零样本声音克隆。该模型在 180 万小时的双语语料上训练,在 RTX 4090 上可实现低至 0.17 的实时率(RTF),支持流式合成。用

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

OpenBMB发布VoxCPM1.5:高质量零样本语音克隆TTS模型

OpenBMB发布了VoxCPM1.5,这是一个基于MiniCPM4-0.5B的无分词器文本转语音(TTS)模型,支持上下文感知语音生成和零样本语音克隆。VoxCPM1.5将音频采样率提升至44.1kHz,并将LM token率降至6.25Hz,提高了音频质量和效率,同时支持SFT和LoRA微调。该模型在RTX 4090上可实现低至0.17的实时因子(RTF

8月17日周一 · 2 条
正文结构化主题已通过公开置信门槛
量子位模型发布

HelixWorld 1.0发布:实时可交互音视频世界模型,将完全开源

Noiz AI联合香港科技大学、清华大学、CMU、Google DeepMind等机构的研究员发布了实时可交互音视频世界模型HelixWorld 1.0,支持24 FPS画面和48kHz立体声实时生成,画面与声音由原生Transformer架构统一生成。该模型通过四步技术路线实现声画同步响应动作,并将在未来几周完全开源。团队认为这补上了世界模型在声音方面的短

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节跳动发布 Seed Audio 1.0 场景级音频生成模型

字节跳动旗下 Seed Research 团队发布了 Seed Audio 1.0 音频生成模型,该模型能在统一框架内生成语音、音效、环境音等场景级音频元素,支持 20 多种语言、最长两分钟的单次生成,并具备 100 毫秒级别的对话时序控制能力。该模型旨在帮助创作者从拼接音频片段转向导演式的声音场景创作,提升叙事音频、视频配音、游戏本地化等场景的制作效率。

8月14日周五 · 2 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

低频输入引发模型故障:LALMs中的安全风险研究

研究人员提出了一种名为ILL的黑盒红队方法,利用听不见的低频波形暴露音频语言模型的漏洞,并设计了DRG防御机制来检测分布偏移并恢复准确性。实验表明,ILL可使模型准确率最多降低67个百分点,而DRG能将受攻击后的平均准确率从28.5%提升至46.1%。该研究揭示了LALMs中此前被忽视的安全风险。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF 量化版发布,支持 ComfyUI 运行

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本,支持在 ComfyUI 中运行,并提供 fl2va 和 ref2va 两种模型。该版本解决了 ComfyUI-GGUF 的架构识别问题,并提供了多种量化选项以适应不同显存。此外,还提供了剪枝版本的替代方案,并解释了 K-quants 不可用的原因。

8月13日周四 · 1 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布流式说话人日志模型 Streaming Sortformer 4spk v2

NVIDIA 发布了 Streaming Sortformer Diarizer 4spk v2 模型,这是一个用于说话人日志的流式端到端神经模型,基于 FastConformer-Transformer 架构,参数量为 117M。该模型在 DIHARD III 和 CALLHOME 等基准测试上取得了较低的 DER 值,并支持 NeMo Voice Age