返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月13日周日 · 14 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

大模型牌桌上,蚂蚁如何出牌?

雷峰网通过2026外滩大会观察蚂蚁集团的AI布局:底层为已迭代至Ling 3.0的百灵模型(含flash、tiny及多模态、金融版本),上层面向用户推出阿福(用户1.5亿、日均健康咨询约2000万次)和阿宝,面向企业由蚂蚁数科推出升级为商业智能体超级工厂的Agentar,并延伸至具身智能的灵波通用大脑。蚂蚁数科CEO赵闻飙披露AI To B业务增速达三位数。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

MiniCPM5-1B 去审查变体发布:拒绝率从93降至3

开发者 saidutta69 在 Hugging Face 发布了 MiniCPM5-1B-Claude-Opus-Fable5-V2-Thinking-heretic,这是对 GnLOLot 的 MiniCPM5-1B 微调版使用 Heretic v1.4.0 进行定向消融(abliteration)得到的去审查变体。该方法通过编辑注意力输出和 MLP 下

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

LFM2.5-2.6B 编码代理去审查版发布

开发者 saidutta69 在 Hugging Face 发布了 LFM2.5-2.6B-Fable5-Coding-Agent-heretic,这是对 AyoubChLin/lfm2.5-2.6b-fable5-coding-agent(基于 LiquidAI/LFM2.5-2.6B 全参数 SFT)的「去审查」变体,使用 Heretic v1.4.0

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10938:Vulkan 队列提交驱动 bug 临时修复

llama.cpp 发布 b10938 版本,主要修复 Vulkan 后端的一个驱动 bug:当同一 VkDevice 上的两个队列同时提交时,会破坏内部同步。在驱动修复前,项目在 queuesubmit 周围加互斥锁作为临时方案。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

GitHub 推出 HydraFusion:Copilot 多模型路由实现前沿级性能

GitHub 推出 Project HydraFusion 研究预览,为 GitHub Copilot 提供运行时多模型编排能力,通过 Single、Cascade、Critique 三种执行模式动态路由请求。该系统在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点任务质量并降低 67% 预估成本,在内部 Ch

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

bartowski 发布 Qwen3.8-27B GGUF 量化版

bartowski 发布了 Qwen3.8-27B 的 GGUF 量化版本,使用 llama.cpp b10896 进行 imatrix 量化,支持文本与图像输入(需 mmproj 文件)以及 MTP 推测解码。该版本于 2026-11-09 更新,采用新的 tensor-layout 重新上传,并提供了各量化档位的文件大小、bpw、PPL 与 KLD 等指

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10937:OpenCL 行对齐规则扩展至 q4 K/q5 K/q8 0

llama.cpp 发布 b10937 版本,主要变更是将 OpenCL 后端的 noshuffle 行对齐规则从仅适用于 q6 K 扩展到 q4 K、q5 K 和 q8 0 量化类型(PR #28575)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

rahul7star 发布 gemma-gguf 量化模型合集

Hugging Face 用户 rahul7star 发布了一个名为 gemma-gguf 的 GGUF 量化模型合集,基于 google/gemma-4-E2B-it、gemma-4-12B-it 和 ornith-ai/Ornith-1.5-9B 等基础模型,主要以 Q6 K 量化为主,并提供了 Gradio 在线演示空间。该合集包含多个面向编码 Age

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10936:改进 qwen3-coder 复杂类型解析

llama.cpp 发布 b10936 版本,主要改进 qwen3-coder 聊天解析器对复杂类型的支持,并清理了相关语法。该版本同时提供覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10935:新增 LOG JSON 结构化日志宏

llama.cpp 发布 b10935 版本,主要变更是为 common 模块新增 LOG JSON 宏,用于记录结构化数据,并在 fit 中加入了演示用法。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10934:为 JSON schema 引入 common schema 内部表示

llama.cpp 发布 b10934 版本,核心变更是为 JSON schema 引入 common schema 内部表示,并实现 JSON schema 优化器,将 json-schema-to-grammar 重构为基于 common schema 与 common trie。该改动统一了类型/kind 解析、移除 common chat tool

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10933:jinja 支持点属性整数常量

llama.cpp 发布 b10933 版本,主要变更是 jinja 模板支持点属性整数常量(PR #28817)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10932:修复 clang 预编译头时间戳构建问题

llama.cpp 发布 b10932 版本,主要修复了 CMake 构建中 clang 预编译头(PCH)因时间戳不一致导致构建失败的问题,该选项覆盖 ccache 视为 MSVC 但底层为 clang 的编译器,包括 clang-cl 和 Intel LLVM 驱动。同时该版本提供了覆盖 macOS/iOS、Linux、Android、Windows 及

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

ACE-Step 1.5 推出 GGUF 量化模型与 C++ 推理实现

开发者 Serveurperso 在 Hugging Face 发布了 ACE-Step 1.5 的预量化 GGUF 模型,配套其独立实现的 C++17 推理项目 acestep.cpp。该实现基于 GGML,可在 CPU、CUDA、Metal、Vulkan 上运行,输入文本与歌词即可输出 48kHz 立体声音频。模型涵盖 Qwen3 文本编码器、0.6B/

9月12日周六 · 6 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10931:UI 新增缓存功能

llama.cpp 发布 b10931 版本,主要变更是为 UI 添加缓存功能(PR #28802),由 Adrien Gallouët 提交。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10930:修复 server 模型上限下载问题

llama.cpp 发布 b10930 版本,主要修复了 server 在模型数量达到上限时仍允许下载模型的问题(对应 issue #26809,PR #28530)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10929 发布:为 AMD GCN 添加 HIP 配置表

llama.cpp 发布 b10929 版本,主要变更是为 ggml-cuda 后端添加针对 AMD GCN 架构的 HIP 专用配置表(PR #27841)。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,包含 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。此次更新提升了 AM

正文结构化主题已通过公开置信门槛
量子位产品发布

太初元碁超智融合计算系统入选算力中国年度卓越成就

太初(杭州)集成电路有限公司(太初元碁)的新一代超智融合计算系统元碁HyperIntelliX在2026中国算力大会上入选“算力中国·年度卓越成就”。该公司同时首次线下展出20英尺标准化集装箱算力产品,提供32至256卡可调的分布式算力解决方案,并展示新一代国产AI异构芯片T2Ultra、国产AI4S计算平台及桌面级AI产品元碁Mini Station。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Mesh LLM 发布 GLM-5.3-Flash 分层 GGUF 分布式推理包

Mesh LLM 在 Hugging Face 发布了 GLM-5.3-Flash-UD-Q4 K XL 的分层 GGUF 推理包,将 unsloth 的原始 GGUF 拆分为 46 个逐层工件,用于跨本地多机集群的分布式推理。该包总大小约 188.5 GB,支持 OpenAI 兼容的 /v1/chat/completions 接口,采用 MIT 许可。其意

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10927:更新 cpp-httplib 至 0.56.0

llama.cpp 发布 b10927 版本,主要变更是将内置的 cpp-httplib 依赖更新至 0.56.0(PR #28787)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。