返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月14日周五 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10426 发布:wasi 强制单线程

llama.cpp 发布 b10426 版本,主要更新为在 wasi 上强制单线程执行(PR #25686)。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持 Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 KleidiAI、ROCm 等)被禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10425 发布:SYCL 融合优化提升推理性能

llama.cpp 发布 b10425 版本,主要更新为在 SYCL 后端融合了 gated-delta-net 状态写回操作,提升了 Arc Pro B70 上 Qwen 3.6 27B 模型的推理性能,文本生成速度提升约 1.2%。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

AutoPrune:利用 LLM 自动设计视觉令牌剪枝策略的 AI4AI 框架

AutoPrune 是一个由 Hugging Face 论文提出的 AI4AI 框架,利用大型语言模型自动设计视觉令牌剪枝策略,通过领域特定语言和残差搜索公式实现高效剪枝。实验表明,在移除 94.4% 视觉令牌时,AutoPrune 保留了超过 99% 的全令牌性能,同时将 FLOPs 减少 9.9 倍,预填充延迟降低 6.4 倍。该框架在 14 个多模态基

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10424 发布:改进 DFlash 日志输出

llama.cpp 发布 b10424 版本,主要改进了 DFlash 架构中 target layer ids 的日志输出格式,使其更清晰易读。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
Latent Space模型发布

Gemini 3.7 Flash 发布,Google 重回前沿

Latent Space 报道称,Google 发布 Gemini 3.7 Flash 模型,使其在性能上重新回到前沿。文章指出,此前 3.5 和 3.6 Flash 版本已落后于 Claude 4.8+ 和 GPT 5.5+ 系列模型,而新版本通过更新缩小了差距。该更新对 Google 在 AI 模型竞争中的地位具有积极影响。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering模型发布

Meta 开源 Muse Glimmer:30B 本地代理模型,优化设备端执行

Meta AI Research 开源了 Muse Glimmer,一个 300 亿参数、Apache 2.0 许可的模型,专为本地设备上的自主代理、工具调用和编码任务设计。该模型通过动态量化和 DFlash 投机解码优化,可在消费级 GPU 上运行,内存占用降至 17-20 GB。Muse Glimmer 在多个基准测试中表现优于同类模型,并支持多种本地框

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

LLMRouter:用于开发、评估和部署 LLM 路由器的统一基础设施

LLMRouter 论文提出了一个统一的 LLM 路由基础设施,将路由形式化为包含五个组件的顺序决策过程,并构建了覆盖多种任务的 xRouteBench 基准。该框架包含 16 种以上的路由方法,实验表明学习型路由器比最强固定模型基线相对提升 14.6%,并支持从训练到部署的端到端流程。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

量化MoE中路由翻转检测易但修复判断难

本研究针对量化混合专家模型(MoE)中的路由翻转问题,提出了一种因果分析框架,并发现检测路由翻转比判断其是否需要修复更容易。实验表明,在4位KV缓存量化下,约三分之一的性能损失由路由中介引起,但现有推理可观测的统计量无法预测翻转的损失符号,存在经验性的收益检测障碍。研究还发现参考保真度的修复效果因架构而异,且门控归一化约定仅影响损伤幅度而非路由可恢复性。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

基于因果推断发现高效可解释的LLM多智能体通信拓扑

arXiv 上发布了一篇关于基于大语言模型的多智能体系统通信拓扑的研究论文。论文提出 E2-Explainer 框架,通过因果推断识别通信拓扑中的关键子图,以解释协作成功的原因并剪除冗余边。实验表明,该框架能有效降低通信成本并保持任务性能。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

全带宽 Transformer:通过潜在反馈提升推理效率

Hugging Face 每日论文发布了一篇关于全带宽 Transformer 的研究,该研究通过引入潜在反馈机制,将解码步骤中顶层隐藏状态与采样 token 嵌入融合后反馈回网络底部,以拓宽垂直反馈通道,从而在不改变核心架构、KV 缓存和语言建模目标的前提下提升推理能力和效率。实验表明,在 1B 参数规模、400B token 的训练下,全带宽 Trans

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布

英特尔实现Muse Glimmer在Intel平台上的Day-0支持

英特尔宣布其Muse Glimmer模型在Intel GPU和Xeon CPU上通过上游vLLM和Hugging Face Transformers实现Day-0支持,覆盖从工作站到云实例的广泛硬件。该支持得益于英特尔的“Upstream First”承诺、对开源社区的持续贡献以及与Meta的紧密合作。用户可通过vLLM的HTTP服务器(兼容OpenAI A

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

AX-Ray 诊断工具揭示两个公开模型的因果泄漏缺陷

VIDRAFT 推出了 AX-Ray,一个用于 AI 和 AX 部署的安全诊断层,基于 FINAL-Bench Diagnostics 构建。AX-Ray 在公开诊断中识别出 Zyphra/Zamba2-1.2B 和 nvidia/Nemotron-H-8B-Base-8K 两个模型存在因果泄漏缺陷,即前缀行为依赖未来 token,属于结构性正确性失败。该缺

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

ReRound:利用重建舍入解决免校准 LLM 量化中的中点歧义

ReRound 是一种无需校准的后训练量化方法,通过条件扩散模型生成低比特权重的连续重建,以解决标准舍入到最近方案在量化区间中点附近的歧义问题。该方法利用容差度量选择候选量化矩阵,并通过匹配前导奇异值确定最优容差,在 3-bit 和 4-bit 权重量化中优于标准 RTN,且不增加推理开销。ReRound 对小规模 LLM 特别有效,其性能优于多种免校准方法

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10423 发布:统一 CPU 参数应用

llama.cpp 发布 b10423 版本,主要更新为在所有工具中应用 CPU 参数(PR #27026)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 KleidiAI、ROCm 7.14

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10419:OpenVINO 后端优化与 Qwen3.5 支持

llama.cpp 发布 b10419 版本,主要针对 OpenVINO 后端进行了多项优化和修复。新增了对 Qwen3.5、GPT-OSS MoE 和 MXFP4 的支持,并修复了 NEOX RoPE 在 GPU 状态模式下的精度问题。此外,通过引入 GGML OPENVINO RELEASE WEIGHTS 选项和流式权重重量化,显著降低了 GPU 推理

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10418 发布:支持 SYCL 主机固定内存提升性能

llama.cpp 发布 b10418 版本,主要更新是支持 SYCL 主机固定内存以提升主机到设备的访问性能,并修复了线程安全问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10415 发布:自动检测 MTP 草稿模型类型

llama.cpp 发布 b10415 版本,主要更新为自动检测 MTP 草稿模型类型(PR #27005)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 macOS KleidiAI、Ubu

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 速度提升 14 倍

OpenAI 推出了名为 Ultrafast 的新模式,使最新模型 GPT-5.6 Sol 的处理速度提升至标准处理的 14 倍,每秒可生成多达 750 个输出 token。该模式由 OpenAI 与芯片制造商 Cerebras 合作提供支持,目前仅向少数客户开放预览,未来将扩大访问范围。OpenAI 表示,Ultrafast 可应用于事件响应、客户服务、金

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

bartowski 发布 Muse-Glimmer-30B 多模态模型 GGUF 量化版

bartowski 发布了 Muse-Glimmer-30B 模型的 GGUF 量化版本,该模型由 meta-models 开发,支持文本和图像输入,并具备 MTP 和 imatrix 功能。量化版本使用 llama.cpp 生成,提供从 bf16 到 IQ3 XXS 的多种量化格式,以适应不同硬件和性能需求。推荐用户选择 Q4 K M 版本作为性能与大小的