返回主题地图

语音与音频

技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 87 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月26日周六 · 2 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源9

llama.cpp b11190 修复 LFM2 音频 mel 预处理器

llama.cpp 发布 b11190 版本,修复了 LFM2 音频模型(lfm2a)的 mel 预处理器。原实现导致英语测试语句 4.5%、日语 6.5% 的贪心转录结果与参考实现不一致,日语中部分差异甚至改变整个词。修复采用 log(x + 2^-24) 替代对数下限截断、对称 Hann 窗,并将归一化 epsilon 加到标准差而非平方根内,仅 lfm

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源开源8

Xinference 发布 v3.5.0:新增多模型支持与请求日志可观测性

Xinference 发布 v3.5.0,新增 AuK、Irodori TTS、YuE2、Spark-X2.5、Qwen-Image-2.1、MinerU2.5 等多种音频、图像与 LLM 模型支持,并加入模型请求日志、审计与可观测性功能。性能方面优化了 embedding/rerank 的 vLLM 批处理与 API 启动开销,同时修复了流式工具调用、客户

9月25日周五 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源产品发布6

Google DeepMind 推出带 Live Avatar 的 Gemini 3.8 Live

Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型基础上加入近实时视频生成能力,实现带口型同步、自然表情和流畅轮次切换的视觉化虚拟形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,并可通过参考图定制品牌形象,即日起在 Gemini Enterprise 上线。所有输出均嵌入

另有 1 家信源报道

9月24日周四 · 7 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

Kyutai 发布 Pocket TTS:100M 参数 CPU 端轻量语音合成模型

Kyutai 发布 Pocket TTS,一个仅 100M 参数、可在 CPU 上高效运行的轻量级文本转语音模型,支持流式音频、约 200ms 首块延迟、约 6 倍实时速度,并仅需 2 个 CPU 核心。该模型支持英语、法语、德语、葡萄牙语、意大利语和西班牙语,提供 Python API 与 CLI,并可在浏览器端运行。模型采用 cc-by-4.0 许可,明

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布3

F5-TTS 掸语干净词表模型发布

Hugging Face 上出现了一个名为 innkl24/f5-shan-tts-model 的模型,基于 F5TTS v1 Base 构建,采用 cc-by-nc-4.0 许可,面向掸语(Shan/Tai-Yai)。该模型使用仅含掸语的干净词表(75 个字符),并已扩展 embedding,便于后续微调。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布2

Meta 发布无摄像头 AI 眼镜 Ray-Ban Meta Audio

Meta 在 Connect 2026 大会上发布首款无摄像头 AI 眼镜 Ray-Ban Meta Audio,仅支持音频功能,起售价 349 美元,10 月 13 日开启预售。该产品旨在回应外界对 AI 眼镜被用于未经同意拍摄的批评,同时对标苹果 Siri 驱动的 AirPods。Meta 还发布了带摄像头的 Ray-Ban Meta(Gen 3),并预

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
The Verge AI产品发布2

Meta 发布无摄像头智能眼镜,起售价 349 美元

Meta 在 Meta Connect 2026 上发布无摄像头的 Ray-Ban Meta Audio Glasses,仅支持 Meta AI 交互、通话和音频播放,起售价 349 美元,续航约 12 小时。同时推出 Ray-Ban Meta Gen 3,增加第六个麦克风、Dolby Atmos 空间音频,续航提升至 9 小时,起售价涨至 449 美元。M

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源API 更新2

Vercel AI SDK 7.0.113 修复多项问题并新增 Gemini 3.8 TTS 支持

Vercel AI SDK 发布 ai@7.0.113 补丁版本,修复了流式工具输入回调、工具审批恢复、视频模型回退保留等多个问题,并修复 Google embedMany 在超过 100 个值时的批处理对齐问题。此外新增 Gemini 3.8 TTS 支持,包含结构化语音元数据、每轮说话人与风格控制,以及 WAV、PCM、mu-law、A-law 等音频格

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布2

Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新

Hugging Face 博客发布 Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新。Optimum Intel 2.2 扩展了模型导出支持,新增 Mistral 3、DeepSeek-OCR-2、Gemma 4、Qwen-Image、LTX-2、Fun-ASR 等模型,并支持 DFlash 与 MTP 投机

正文结构化主题已通过公开置信门槛
THE DECODER模型发布1

Google 发布 Flash TTS 系列模型,支持文本描述设计音色

Google 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持 100 多种语言。Flash TTS 可通过文本描述从零设计音色,并支持用 30 秒音频样本进行声音克隆,Flash-Lite TTS 面向低成本大规模语音生成。两款模型均支持逐行舞台指示、双人对话和非语言音效,通过 Gemini API

9月23日周三 · 1 条
正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布1

YouTube Music 推出 Ask Music 等对话式 AI 新功能

YouTube 在 Made On YouTube 活动上宣布为 YouTube Music 推出两项 AI 新功能:对话式工具 Ask Music 和个性化播客推荐 Your Podcast Lineup。Ask Music 允许用户用日常语言描述想听的内容,覆盖超 3 亿首歌曲,可生成定制播放队列并解答音乐创作细节;Your Podcast Lineup

9月22日周二 · 3 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Google Gen AI JavaScript SDK Releases一手来源API 更新

Google Gen AI JavaScript SDK 发布 v2.24.0,新增 Voices API

Google 发布 Gen AI JavaScript SDK v2.24.0,新增 Voices API 资源与 Voice 相关能力,包括在 GAOS SDK 中加入 sample audio、将 voice 接入 SDK,并公开 SpeechMetadata、VoiceConfig.voice 和 SpeechAnnotation。此外支持 map a

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

SheetSage2:音乐音频转可编辑乐谱模型发布

Hugging Face 上发布了 m-a-p/SheetSage2 模型,可将音乐录音转写为可编辑的乐谱(ABC 格式)和带时间标注的 MIDI。该模型基于 MERT-v2-FullSong 构建,支持旋律、和弦、节拍、调性和结构提取,并可导出嵌入与 token 预测。用户可将转写结果传入 YuE2 用于翻唱生成,模型采用 cc-by-nc-4.0 许可。

9月20日周日 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER研究

腾讯 Gander:边对话边后台处理任务的实时智能体模型

腾讯混元语音团队与多所大学研究者提出 Gander 模型,可在后台处理复杂任务的同时保持实时对话,同时处理语音、图像和文本,用户可随时打断。该模型采用「小脑」负责逐秒对话、「大脑」负责复杂智能体任务的可替换架构,大脑可换成 Codex 或 Claude Code 等系统而无需重训对话模型。测试中 Gander 在 Full-Duplex-Bench v3 上

9月19日周六 · 1 条
正文结构化主题已通过公开置信门槛
智东西产品发布

实测Wildcat Lake轻薄本:Agent办事、AI修图、语音操控电脑

英特尔推出第三代酷睿处理器Wildcat Lake,采用Intel 18A制程和双芯片封装,内置17TOPS算力的NPU,首次将AI功能下放到4000 6000元价位段轻薄本。英特尔同时展示Firefly萤火虫计划参考设计,通过拥抱手机产业链、优化零部件和标准化集成来降低成本。作者在搭载该处理器的机械革命无界14 S上实测了WorkBuddy、像素蛋糕、Ow

9月16日周三 · 1 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Google 发布 Gemini 3.8 Live,以低价对标 OpenAI GPT-Live-1

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended

另有 2 家信源报道

9月15日周二 · 1 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阶跃发布 StepAudio 3 系列语音大模型,多款登顶 Artificial Analysis 全球榜单

阶跃于9月15日发布新一代语音大模型 StepAudio 3 系列,一次性推出 Realtime、ASR、TTS、Gen 和 Music 五款模型,覆盖实时语音交互、语音识别、语音生成和音乐创作等场景。多款模型在 Artificial Analysis 榜单中位列全球第一,其中 Realtime 在 Conversational Dynamics 榜单以 9

9月14日周一 · 2 条
正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

古兰经背诵转录中的背诵事件标注:什么算错误?

该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Argmax 发布 SpeakerKit Core ML 说话人分离模型

Argmax 在 Hugging Face 上发布了 SpeakerKit Core ML 模型,这是一个基于 pyannote 的说话人分离(diarization)模型,采用 Core ML 格式并经过量化,配套 WhisperKit 使用。该模型与 Swift 框架 SpeakerKit 配合,相关架构和基准测试发表在 Interspeech 2025