返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月27日周日 · 6 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源23

audio.cpp 发布多款语音模型 GGUF 量化包

Hugging Face 上发布了 audio.cpp 项目维护的 GGUF 模型包仓库,将大量语音模型(涵盖 TTS、ASR、语音转换、音频生成、声源分离、说话人分离等任务)转换为 audio.cpp 原生 GGUF 格式并提供量化版本。仓库列出了各模型对应的 GGUF 精度(如 BF16、Q8、Q4、F16、F32)及原始许可证,并提示量化包虽经自动化指

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源23

llama.cpp b11205:CUDA 支持 Nemotron 3 SSM scan

llama.cpp 发布 b11205 版本,主要变更是 CUDA 后端支持 Nemotron 3 的 Puzzle state size 96,用于 SSM scan。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源21

llama.cpp 发布 b11202:修复 Windows 下 wake fd 警告

llama.cpp 发布 b11202 版本,主要修复了 Windows 平台上 server 的 wake fd 警告问题,由 Adrien Gallouët 提交。该版本同时提供 macOS、Linux、Windows、Android 等多平台及多种后端(CUDA、Vulkan、ROCm、SYCL、OpenVINO 等)的预编译二进制包。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源22

Yue2-3B 音乐生成模型 GGUF 权重发布,适配 audio.cpp

Hugging Face 上发布了 audio-cpp/Yue2-3B-GGUF 仓库,提供适配 audio.cpp 推理框架的 Yue2-3B 音乐生成模型 GGUF 权重,包含 BF16、Q8 0、Q4 0 三种量化版本及配套 VAE 权重。该仓库在 0.8.1 版本中加入 LoRA 支持,并附带多种条件生成(直接生成、完整规划、旋律条件、乐谱条件)的示

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源19

llama.cpp 发布 b11201:回滚统一 KV 自动适配上下文长度改动

llama.cpp 发布 b11201 版本,主要变更是回滚了此前合并的 PR #28849(统一 KV 缓存下自动适配最大上下文长度的改动),恢复原提交 b04d4e5 之前的行为。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVIN

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源18

ComfyPod-Models:ComfyUI 模型文件镜像仓库

Hugging Face 上出现一个名为 ComfyPod-Models 的镜像仓库,由 AiAngelGallery 发布,用于托管免费 AI Angel ComfyPod RunPod 模板所下载的模型文件,按 ComfyUI 的 models/ 目录结构组织。仓库声明所有文件与上游源逐字节一致(SHA-256 校验),目的是防止上游仓库移动或删除文件导

9月26日周六 · 14 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点3

实战中的自适应推荐系统:推理、评估与系统设计

Mallika Rao 在 InfoQ 演讲中分享构建自适应推荐系统的实践经验,指出真正的难点不在模型本身,而在于端到端系统设计。她强调推荐系统本质上是持续学习、适应和演进的反馈系统与分布式系统,需在延迟、成本、可观测性、实验、合规等现实约束下运行,并认为评估比建模更难,是必须作为一等公民对待的关键环节。

正文结构化主题已通过公开置信门槛
THE DECODER研究7

英伟达 SoL-Pi 通过优化 harness 将编码智能体 token 用量减半

英伟达研究人员提出 SoL-Pi 系统,通过自动优化编码智能体的控制层(harness)来降低 token 消耗。该系统让一个研究智能体观察另一个智能体的执行轨迹、提出修改并在预设环境中测试,在 535 个可执行环境中探索了 152 个方向,生成超 3000 次运行。在 EdgeBench 的 51 个公开任务上,SoL-Pi 性能与原始 Pi harnes

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源14

llama.cpp 发布 b11199:修复 jinja 编译错误

llama.cpp 发布 b11199 版本,主要修复了 jinja 模板相关的编译错误(PR #29468)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布23

Qwen3.6-35B无审查Genesis版GGUF发布

Hugging Face 用户 LuffyTheFox 发布了 Qwen3.6-35B-A3B-Uncensored-Genesis-Final-GGUF 模型,基于 HauhauCS 的无审查版本进行后训练数据再生与校准。作者提出名为 Genesis 的算法,利用 Marchenko–Pastur 分布和自定义 SVD 修复 GGUF 模型张量中的训练噪声

正文结构化主题已通过公开置信门槛
量子位开源9

笔记本无GPU跑7000亿参数GLM:SSD当显存的分层推理框架Colibrì

开发者JustVugg开源了纯C实现的分层推理框架Colibrì,通过将MoE模型的非活跃专家权重存放在NVMe SSD、按需加载,使744B参数的GLM-5.2可在最低16GB RAM的笔记本上无GPU运行。项目已支持9个模型家族,包括975B的Inkling和2.8T参数的Kimi K3,GitHub已获32k Star。其核心是LRU缓存、专家使用频率

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源15

llama.cpp b11195:为 k-quants 引入分块 mul mat 加速

llama.cpp 发布 b11195 版本,为 ggml-cpu 后端引入针对 k-quants 的 tiled mul mat 实现。该方法将量化权重解包为最大 256x256 的 int8 分块,再通过微内核计算 16x16 分块后写出结果,在大矩阵乘法上带来 3-6 倍加速,但在 GEMV 场景下性能下降约 80%。同时包含 ARM/Windows

正文结构化主题已通过公开置信门槛
量子位研究6

谷歌TPU跑Kimi比英伟达GPU快57%,用的还是DeepSeek推理框架

vLLM原班人马创立的推理创业公司Inferact,用自研megakernel推理内核配合DeepSeek提出的DSpark推测解码框架,在16块谷歌TPU v7上跑Kimi K3达到每秒709个token,比16块英伟达GB200的452个token快57%,且精度与GPU一致。megakernel将原本数百个独立kernel合并为单个Pallas程序,消

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究9

SpaFactor:轻量级空间上下文基因程序建模用于组织学-转录组推断

清华大学深圳国际研究生院等机构提出 SpaFactor,一种轻量级低秩形态-程序-基因分解框架,用于从常规 H&E 染色图像推断空间转录组基因表达。该方法融合中心位点视觉表征与多尺度邻域上下文,用残差 MLP 学习组织微环境到低维潜在基因程序的非线性映射,再通过共享基因载荷解码多基因表达。在五个公开队列上取得最佳综合性能,对空间可变基因提升尤为明显,并能更忠

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源12

CodeRankEmbed 的 bf16 量化版内置三层注意力调度

Hugging Face 用户 handwoven8588 发布了 CodeRankEmbed-flash-attn,这是对 nomic-ai/CodeRankEmbed 的 bf16 量化版本,权重未重新训练。该仓库在自定义 modeling 文件中内置三层注意力调度(torch varlen、flash attn、eager),用 O(N) 非填充路径替

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源11

llama.cpp 发布 b11193:Hexagon 后端用二进制检查查找软件除法调用

llama.cpp 发布 b11193 版本,主要变更是为 Hexagon 后端引入通过二进制检查工具查找软件除法调用的脚本,并修复了表格对齐问题。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源12

Ling-3.0-flash-VL 多模态模型 GGUF 量化版发布

Hugging Face 用户 bloomer010 发布了 inclusionAI/Ling-3.0-flash-VL 的 GGUF 量化版本,基于 llama.cpp 运行。该模型为 124B 总参数、每 token 仅激活 5.5B 的 MoE 多模态模型,支持图像和视频输入,原生 128K 上下文,可通过 YaRN 扩展至 256K。llama.cp

正文结构化主题已通过公开置信门槛
Vercel AI SDK Releases一手来源API 更新15

Vercel AI SDK 为 GPT-6 Sol/Luna 支持 reasoningEffortUpdate: none

Vercel AI SDK 发布 @ai-sdk/openai@4.0.78 补丁版本,为 GPT-6 Sol 和 Luna 模型新增对 reasoningEffortUpdate: 'none' 的支持,覆盖请求级选项和定位系统消息。该版本还会根据模型支持的努力级别校验更新值,对不支持的请求级更新发出警告并忽略,对不支持的历史更新则直接拒绝。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源10

llama.cpp 发布 b11192:更新 cpp-httplib 至 0.58.0

llama.cpp 发布 b11192 版本,主要变更是将内置的 cpp-httplib 依赖更新至 0.58.0(PR #29407)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,包含 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
Latent Space商业7

OpenRouter 从种子轮到 Stripe:中立路由层与 token 经济安全

OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在 Latent Space 播客中回顾了 OpenRouter 从 Llama、Alpaca、Mistral 等早期开源模型浪潮中起步,成长为服务超 1000 万开发者的中立模型路由层的过程。节目讨论了模型实验室在分发上的困境、Mistral 价