返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月31日周一 · 2 条
正文结构化主题已通过公开置信门槛
DeepSeek API Changelog一手来源模型发布

DeepSeek 发布 V3.1 混合推理模型,提升 Agent 能力

DeepSeek 将 deepseek-chat 和 deepseek-reasoner 升级为 DeepSeek-V3.1,分别对应非思考模式和思考模式。新模型采用混合推理架构,支持两种模式,思考效率较 R1-0528 提升,并通过后训练优化增强了 Agent 能力,在 SWE-bench 等基准上表现优异。

正文结构化主题已通过公开置信门槛
DeepSeek API Changelog一手来源API 更新

DeepSeek 非正式发布 V3.2-Speciale API,限时支持思考模式

DeepSeek 非正式部署了 DeepSeek-V3.2-Speciale 的 API 服务,用户可通过特定 base url 访问。该模型 API 价格不变,仅支持思考模式对话,不支持工具调用,最大输出长度 128K,服务截止至 2025 年 12 月 15 日。

8月30日周日 · 18 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10698 发布:修复 Apple RDMA 错误输出

llama.cpp 发布 b10698 版本,主要修复了 Apple RDMA 在 teardown 时的错误输出问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR v1.4.9 发布:修复多项问题并捆绑 llama.cpp 运行时

阿里 FunASR 发布 v1.4.9 版本,主要修复了字幕分割、自动模型、Paraformer 时间戳预测器及实时长尾保留等问题,并新增了 MOSS 说话人日志的 SGLang 路径文档。该版本还捆绑了 llama.cpp/GGUF 运行时 v0.2.6,提供多平台预编译二进制文件,支持 Linux、macOS 和 Windows 的多种硬件加速选项。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10696 发布:为 M3 Pro 添加 fa-vec 调优

llama.cpp 发布 b10696 版本,主要更新是为 Apple M3 Pro 芯片添加 fa-vec 调优,以解决相关性能问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10695 发布:更新 cpp-httplib 依赖

llama.cpp 发布 b10695 版本,主要更新了 cpp-httplib 依赖至 0.54.0 和 0.54.1。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3-Flash NVFP4 量化版发布:体积缩减70%

LibertAI 发布了 GLM-5.3-Flash 的 NVFP4 量化版本,将模型从 598.5 GiB 压缩至 181 GiB,体积减少 70%,余弦相似度达 0.99665。该量化仅针对路由专家 FFN,保留注意力、视觉塔等关键部分为 BF16,确保多模态行为与原始模型一致。模型支持 vLLM 和 SGLang,但需要特定配置,且已修复 GB10 上

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10693 发布:支持 Hexagon 设备发现与按需会话

llama.cpp 发布 b10693 版本,主要新增对 Hexagon 设备发现和按需创建会话的支持,包括运行时发现可用 NPU 核心、延迟会话分配及清理设备接口,并提前拒绝不存在的设备。该版本同时提供多平台预编译二进制文件,涵盖 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源产品发布

Xinference v3.3.0 发布:新增多模型支持与路由功能

Xinference 发布 v3.3.0 版本,新增了对多个模型的支持,包括 Qwen3.8、DeepSeek V4 Flash、GLM-Image、Kimi-K3 等,并引入了 token 感知的虚拟模型路由、Anthropic Messages 协议适配器、世界模型生成等新功能。此外,该版本还增强了音频、图像、视频等多模态能力,并修复了若干 bug。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10692 发布:优化 SYCL TOP K 性能

llama.cpp 发布 b10692 版本,主要更新为在 SYCL 后端中拆分 TOP K 操作的长行,以优化性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10691 发布:修复 Metal F16 矩阵乘法崩溃

llama.cpp 发布 b10691 版本,主要修复了 Metal 后端中 F16 源矩阵乘法(mul mat/mul mat id)的空管线崩溃问题,通过失败关闭和空管线检查确保稳定性。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种后端(如 Vulkan、CUDA、ROCm、OpenVIN

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF 量化版本发布,支持视频生成

leejet 发布了 MiniMax-H3 模型的 GGUF 量化版本,支持文本到视频和图像到视频生成。该版本通过 stable-diffusion.cpp 转换,可在 stable-diffusion.cpp 和 ComfyUI 中使用,并提供了示例工作流。量化文件的许可证遵循原始模型 MiniMax-H3 的许可证。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10690 发布:修复上下文切换崩溃并更新多平台支持

llama.cpp 发布 b10690 版本,修复了在未量化 K 缓存上下文切换时因 Hadamard 矩阵未复制到 k rot 张量而导致的崩溃问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ornith-1.5-35B-A3B Abliterated 多量化等级 GGUF 发布

gbuzhf 发布了 Ornith-1.5-35B-A3B 模型的 abliterated 版本,并提供了九个不同量化等级的 GGUF 文件,每个都嵌入了 MTP 头。测量显示 abliteration 对模型的影响(KLD 0.0151)小于 Q6 K 量化(KLD 0.0222),且 abliteration 与量化损伤近似正交,不会使模型恢复拒绝行为。

正文结构化主题已通过公开置信门槛
阿里 FunASR Releases一手来源产品发布

FunASR llama.cpp 运行时 v0.2.6 发布

阿里 FunASR 发布了 llama.cpp 运行时 v0.2.6,提供 SenseVoice、Paraformer 和 Fun-ASR-Nano 的预编译二进制文件,内置 FSMN-VAD。该版本支持 CPU、Vulkan 和 CUDA(包括 Blackwell)后端,并验证了资产完整性和 CUDA 依赖。用户可通过脚本下载量化模型并直接运行,无需 Py

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B INT4 量化模型发布:体积减半,速度提升58%

devan-carlin 发布了基于 Qwen3.8-27B 的 INT4 量化模型,使用 Intel AutoRound 方法,模型大小从约 52GB 减至 18GB。在 4 块 Intel Arc Pro B70 GPU 上通过 vLLM 张量并行运行,生成速度达 47.8 tok/s,比 BF16 快 58%,且保持质量一致。该模型支持多模态和 256

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Surge 发布 AriannaV4:基于 Gemma 4 的多模态本地助手

Surge 发布了 AriannaV4,一个基于 google/gemma-4-12B 与 Aria v4 权重合并的多模态本地助手模型。该模型采用核心权重加侧车架构,支持文本、推理、视觉、音频和视频理解,并提供 GGUF 量化版本供 llama.cpp、Ollama 和 LM Studio 使用。模型遵循 CC-BY-NC-SA 4.0 许可证。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10688 发布:为 M2 添加 fa-vec 调优

llama.cpp 发布 b10688 版本,主要更新是为 Apple M2 芯片添加了 fa-vec 调优(PR #27940),以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

腾讯发布Hy4 Preview:770B参数开源模型,推理强度可调

腾讯今日发布开源权重文本输入模型Hy4 Preview,总参数量770B,激活参数49B,上下文窗口1M token,Hugging Face上体积1.56TB,相比7月的Hy3大幅提升。模型支持两种推理强度:默认'high'和'no think'(禁用推理)。作者通过SVG生成测试展示了其推理轨迹,并指出推理文本使用截断英文以节省token。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10687 优化 Adreno GPU 矩阵乘法,提升 prefill 性能

llama.cpp 发布 b10687 版本,针对 Adreno GPU 优化了 OpenCL 矩阵乘法路径。在 X2E 上默认启用 xmem F16xF32 GEMM,使 gpt-oss-20b 的 prefill 性能提升约 25%;在 A7X 上绕过 tiled f32 GEMM,使 gemma-3n-E4B 的 prefill 性能提升约 9%。这些