audio.cpp 发布多款语音模型 GGUF 量化包
Hugging Face 上发布了 audio.cpp 项目维护的 GGUF 模型包仓库,将大量语音模型(涵盖 TTS、ASR、语音转换、音频生成、声源分离、说话人分离等任务)转换为 audio.cpp 原生 GGUF 格式并提供量化版本。仓库列出了各模型对应的 GGUF 精度(如 BF16、Q8、Q4、F16、F32)及原始许可证,并提示量化包虽经自动化指
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Hugging Face 上发布了 audio.cpp 项目维护的 GGUF 模型包仓库,将大量语音模型(涵盖 TTS、ASR、语音转换、音频生成、声源分离、说话人分离等任务)转换为 audio.cpp 原生 GGUF 格式并提供量化版本。仓库列出了各模型对应的 GGUF 精度(如 BF16、Q8、Q4、F16、F32)及原始许可证,并提示量化包虽经自动化指
llama.cpp 发布 b11205 版本,主要变更是 CUDA 后端支持 Nemotron 3 的 Puzzle state size 96,用于 SSM scan。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b11202 版本,主要修复了 Windows 平台上 server 的 wake fd 警告问题,由 Adrien Gallouët 提交。该版本同时提供 macOS、Linux、Windows、Android 等多平台及多种后端(CUDA、Vulkan、ROCm、SYCL、OpenVINO 等)的预编译二进制包。
Hugging Face 上发布了 audio-cpp/Yue2-3B-GGUF 仓库,提供适配 audio.cpp 推理框架的 Yue2-3B 音乐生成模型 GGUF 权重,包含 BF16、Q8 0、Q4 0 三种量化版本及配套 VAE 权重。该仓库在 0.8.1 版本中加入 LoRA 支持,并附带多种条件生成(直接生成、完整规划、旋律条件、乐谱条件)的示
llama.cpp 发布 b11201 版本,主要变更是回滚了此前合并的 PR #28849(统一 KV 缓存下自动适配最大上下文长度的改动),恢复原提交 b04d4e5 之前的行为。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVIN
Hugging Face 上出现一个名为 ComfyPod-Models 的镜像仓库,由 AiAngelGallery 发布,用于托管免费 AI Angel ComfyPod RunPod 模板所下载的模型文件,按 ComfyUI 的 models/ 目录结构组织。仓库声明所有文件与上游源逐字节一致(SHA-256 校验),目的是防止上游仓库移动或删除文件导
Mallika Rao 在 InfoQ 演讲中分享构建自适应推荐系统的实践经验,指出真正的难点不在模型本身,而在于端到端系统设计。她强调推荐系统本质上是持续学习、适应和演进的反馈系统与分布式系统,需在延迟、成本、可观测性、实验、合规等现实约束下运行,并认为评估比建模更难,是必须作为一等公民对待的关键环节。
英伟达研究人员提出 SoL-Pi 系统,通过自动优化编码智能体的控制层(harness)来降低 token 消耗。该系统让一个研究智能体观察另一个智能体的执行轨迹、提出修改并在预设环境中测试,在 535 个可执行环境中探索了 152 个方向,生成超 3000 次运行。在 EdgeBench 的 51 个公开任务上,SoL-Pi 性能与原始 Pi harnes
llama.cpp 发布 b11199 版本,主要修复了 jinja 模板相关的编译错误(PR #29468)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
Hugging Face 用户 LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Final-GGUF 模型,基于 HauhauCS 的无审查版本进行后训练数据再生与校准。作者提出名为 Genesis 的算法,利用 Marchenko–Pastur 分布和自定义 SVD 修复 GGUF 模型张量中的训练噪声
开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率
llama.cpp 发布 b11195 版本,为 ggml-cpu 后端引入针对 k-quants 的 tiled mul mat 实现。该方法将量化权重解包为最大 256x256 的 int8 分块,再通过微内核计算 16x16 分块后写出结果,在大矩阵乘法上带来 3-6 倍加速,但在 GEMV 场景下性能下降约 80%。同时包含 ARM/Windows
vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消
清华大学深圳国际研究生院等机构提出 SpaFactor,一种轻量级低秩形态-程序-基因分解框架,用于从常规 H&E 染色图像推断空间转录组基因表达。该方法融合中心位点视觉表征与多尺度邻域上下文,用残差 MLP 学习组织微环境到低维潜在基因程序的非线性映射,再通过共享基因载荷解码多基因表达。在五个公开队列上取得最佳综合性能,对空间可变基因提升尤为明显,并能更忠
Hugging Face 用户 handwoven8588 发布了 CodeRankEmbed-flash-attn,这是对 nomic-ai/CodeRankEmbed 的 bf16 量化版本,权重未重新训练。该仓库在自定义 modeling 文件中内置三层注意力调度(torch varlen、flash attn、eager),用 O(N) 非填充路径替
llama.cpp 发布 b11193 版本,主要变更是为 Hexagon 后端引入通过二进制检查工具查找软件除法调用的脚本,并修复了表格对齐问题。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash-VL 的 GGUF 量化版本,基于 llama.cpp 运行。该模型为 124B 总参数、每 token 仅激活 5.5B 的 MoE 多模态模型,支持图像和视频输入,原生 128K 上下文,可通过 YaRN 扩展至 256K。llama.cp
Vercel AI SDK 发布 @ai-sdk/openai@4.0.78 补丁版本,为 GPT-6 Sol 和 Luna 模型新增对 reasoningEffortUpdate: 'none' 的支持,覆盖请求级选项和定位系统消息。该版本还会根据模型支持的努力级别校验更新值,对不支持的请求级更新发出警告并忽略,对不支持的历史更新则直接拒绝。
llama.cpp 发布 b11192 版本,主要变更是将内置的 cpp-httplib 依赖更新至 0.58.0(PR #29407)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。
OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾了 OpenRouter 从 Llama、Alpaca、Mistral 等早期开源模型浪潮中起步,成长为服务超 1000 万开发者的中立模型路由层的过程。节目讨论了模型实验室在分发上的困境、Mistral 价