llama.cpp b11190 修复 LFM2 音频 mel 预处理器
llama.cpp 发布 b11190 版本,修复了 LFM2 音频模型(lfm2a)的 mel 预处理器。原实现导致英语测试语句 4.5%、日语 6.5% 的贪心转录结果与参考实现不一致,日语中部分差异甚至改变整个词。修复采用 log(x + 2^-24) 替代对数下限截断、对称 Hann 窗,并将归一化 epsilon 加到标准差而非平方根内,仅 lfm
技术方向 · 语音合成、实时对话、音乐生成与音频理解 · 共 87 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b11190 版本,修复了 LFM2 音频模型(lfm2a)的 mel 预处理器。原实现导致英语测试语句 4.5%、日语 6.5% 的贪心转录结果与参考实现不一致,日语中部分差异甚至改变整个词。修复采用 log(x + 2^-24) 替代对数下限截断、对称 Hann 窗,并将归一化 epsilon 加到标准差而非平方根内,仅 lfm
Xinference 发布 v3.5.0,新增 AuK、Irodori TTS、YuE2、Spark-X2.5、Qwen-Image-2.1、MinerU2.5 等多种音频、图像与 LLM 模型支持,并加入模型请求日志、审计与可观测性功能。性能方面优化了 embedding/rerank 的 vLLM 批处理与 API 启动开销,同时修复了流式工具调用、客户
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在原生实时对话模型基础上加入近实时视频生成能力,实现带口型同步、自然表情和流畅轮次切换的视觉化虚拟形象。该功能支持异步工具调用、97 种语言的原生语音到语音同步,并可通过参考图定制品牌形象,即日起在 Gemini Enterprise 上线。所有输出均嵌入
另有 1 家信源报道
Kyutai 发布 Pocket TTS,一个仅 100M 参数、可在 CPU 上高效运行的轻量级文本转语音模型,支持流式音频、约 200ms 首块延迟、约 6 倍实时速度,并仅需 2 个 CPU 核心。该模型支持英语、法语、德语、葡萄牙语、意大利语和西班牙语,提供 Python API 与 CLI,并可在浏览器端运行。模型采用 cc-by-4.0 许可,明
Hugging Face 上出现了一个名为 innkl24/f5-shan-tts-model 的模型,基于 F5TTS v1 Base 构建,采用 cc-by-nc-4.0 许可,面向掸语(Shan/Tai-Yai)。该模型使用仅含掸语的干净词表(75 个字符),并已扩展 embedding,便于后续微调。
Meta 在 Connect 2026 大会上发布首款无摄像头 AI 眼镜 Ray-Ban Meta Audio,仅支持音频功能,起售价 349 美元,10 月 13 日开启预售。该产品旨在回应外界对 AI 眼镜被用于未经同意拍摄的批评,同时对标苹果 Siri 驱动的 AirPods。Meta 还发布了带摄像头的 Ray-Ban Meta(Gen 3),并预
另有 1 家信源报道
Meta 在 Meta Connect 2026 上发布无摄像头的 Ray-Ban Meta Audio Glasses,仅支持 Meta AI 交互、通话和音频播放,起售价 349 美元,续航约 12 小时。同时推出 Ray-Ban Meta Gen 3,增加第六个麦克风、Dolby Atmos 空间音频,续航提升至 9 小时,起售价涨至 449 美元。M
另有 1 家信源报道
Vercel AI SDK 发布 ai@7.0.113 补丁版本,修复了流式工具输入回调、工具审批恢复、视频模型回退保留等多个问题,并修复 Google embedMany 在超过 100 个值时的批处理对齐问题。此外新增 Gemini 3.8 TTS 支持,包含结构化语音元数据、每轮说话人与风格控制,以及 WAV、PCM、mu-law、A-law 等音频格
Hugging Face 博客发布 Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新。Optimum Intel 2.2 扩展了模型导出支持,新增 Mistral 3、DeepSeek-OCR-2、Gemma 4、Qwen-Image、LTX-2、Fun-ASR 等模型,并支持 DFlash 与 MTP 投机
Google 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,支持 100 多种语言。Flash TTS 可通过文本描述从零设计音色,并支持用 30 秒音频样本进行声音克隆,Flash-Lite TTS 面向低成本大规模语音生成。两款模型均支持逐行舞台指示、双人对话和非语言音效,通过 Gemini API
YouTube 在 Made On YouTube 活动上宣布为 YouTube Music 推出两项 AI 新功能:对话式工具 Ask Music 和个性化播客推荐 Your Podcast Lineup。Ask Music 允许用户用日常语言描述想听的内容,覆盖超 3 亿首歌曲,可生成定制播放队列并解答音乐创作细节;Your Podcast Lineup
在2026云栖大会上,阿里云集中发布全模态模型矩阵,包括Qwen3.8-Max、Qwen3.8-Flash、Qwen3.8-Omni、Qwen-Image-3.1、Happy Shrimp 1.1、HappyOyster 2.0 Preview、Qwen-Audio-3.1、Qwen3.8-LiveTranslate等,并预告下一代视频模型将于11月发布。导
Google 发布 Gen AI JavaScript SDK v2.24.0,新增 Voices API 资源与 Voice 相关能力,包括在 GAOS SDK 中加入 sample audio、将 voice 接入 SDK,并公开 SpeechMetadata、VoiceConfig.voice 和 SpeechAnnotation。此外支持 map a
Hugging Face 上发布了 m-a-p/SheetSage2 模型,可将音乐录音转写为可编辑的乐谱(ABC 格式)和带时间标注的 MIDI。该模型基于 MERT-v2-FullSong 构建,支持旋律、和弦、节拍、调性和结构提取,并可导出嵌入与 token 预测。用户可将转写结果传入 YuE2 用于翻唱生成,模型采用 cc-by-nc-4.0 许可。
腾讯混元语音团队与多所大学研究者提出 Gander 模型,可在后台处理复杂任务的同时保持实时对话,同时处理语音、图像和文本,用户可随时打断。该模型采用「小脑」负责逐秒对话、「大脑」负责复杂智能体任务的可替换架构,大脑可换成 Codex 或 Claude Code 等系统而无需重训对话模型。测试中 Gander 在 Full-Duplex-Bench v3 上
英特尔推出第三代酷睿处理器Wildcat Lake,采用Intel 18A制程和双芯片封装,内置17TOPS算力的NPU,首次将AI功能下放到4000 6000元价位段轻薄本。英特尔同时展示Firefly萤火虫计划参考设计,通过拥抱手机产业链、优化零部件和标准化集成来降低成本。作者在搭载该处理器的机械革命无界14 S上实测了WorkBuddy、像素蛋糕、Ow
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended
另有 2 家信源报道
阶跃于9月15日发布新一代语音大模型 StepAudio 3 系列,一次性推出 Realtime、ASR、TTS、Gen 和 Music 五款模型,覆盖实时语音交互、语音识别、语音生成和音乐创作等场景。多款模型在 Artificial Analysis 榜单中位列全球第一,其中 Realtime 在 Conversational Dynamics 榜单以 9
该论文针对古兰经背诵场景,提出将ASR转录文本与参考文本的差异标注为类型化、定位化的事件,而非简单视为错误。作者完成了100个生产录音案例的人工标注,包含348个评分单元和162个定位事件,并定义了十种组合标签。实验显示,普通diff的标签感知F1为0.525,而编码智能体在初步试点中表现差异巨大(F1从0.143到0.892),主要剩余挑战在于标注约定而非
Argmax 在 Hugging Face 上发布了 SpeakerKit Core ML 模型,这是一个基于 pyannote 的说话人分离(diarization)模型,采用 Core ML 格式并经过量化,配套 WhisperKit 使用。该模型与 Swift 框架 SpeakerKit 配合,相关架构和基准测试发表在 Interspeech 2025