返回全部动态
NVIDIA 发布流式说话人日志模型 Streaming Sortformer 4spk v2
原标题:nvidia/diar_streaming_sortformer_4spk-v2
AI 摘要
NVIDIA 发布了 Streaming Sortformer Diarizer 4spk v2 模型,这是一个用于说话人日志的流式端到端神经模型,基于 FastConformer-Transformer 架构,参数量为 117M。该模型在 DIHARD III 和 CALLHOME 等基准测试上取得了较低的 DER 值,并支持 NeMo Voice Agent 进行对话中的说话人识别。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
--- license: cc-by-4.0 library_name: nemo datasets: - fisher_english - NIST_SRE_2004-2010 - librispeech - ami_meeting_corpus - voxconverse_v0.3 - icsi - aishell4 - dihard_challenge-3-dev - NIST_SRE_2000-Disc8_split1 - Alimeeting-train - DiPCo thumbnail: null tags: - speaker-diarization - speaker-recognition - speech - audio - Transformer - FastConformer - Conformer - NEST - pytorch - NeMo widget: - example_title: Librispeech sample 1 src: https://cdn-media.huggingface.co/speech_samples/sample1
发布时间:2026-08-13 01:02
抓取时间:2026-08-13 01:04
来源机构:Hugging Face