返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1719 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月4日周五 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10797 发布:修复 s390x 架构 q5 1 量化问题

llama.cpp 发布 b10797 版本,主要修复了 ggml-cpu 在 s390x 架构上 q5 1 量化中未初始化 v acc 的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

英伟达发布 PAIR 路由器,将家庭网络变为本地 AI 数据中心

Nvidia 发布了开源工具 PAIR(个人 AI 路由器),可自动将本地 AI 请求分发到家庭网络中的多台设备,以缩短并行代理任务的等待时间。该工具兼容多种硬件,并在演示中将任务完成时间从单台笔记本的 18 分钟缩短至三设备集群的不到 9 分钟。PAIR 的发布是 Nvidia 将开放 AI 与其硬件更紧密结合的战略的一部分,该公司还以 129 亿美元收购

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 推出 W8A8 INT8 量化版,性能超越官方 FP8

Freaksterz 发布了 Qwen3.8-27B 的 W8A8 INT8 量化版本,采用 SmoothQuant 和激活感知 GPTQ 技术,在保持低 KL 散度的同时实现比 W8A16 更快的预填充速度。该模型兼容 DFlash2 投机解码,并提供了详细的评估数据和部署指南。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

inclusionAI 发布 Ling-3.0-flash:124B 总参混合推理模型,激活仅 5.1B

inclusionAI 发布了 Ling-3.0-flash,一款原生混合推理模型,总参数 124B,激活参数仅 5.1B,采用混合线性注意力架构(KDA 与 MLA 交替)和稀疏 MoE。该模型在代码、智能体、通用知识等基准上匹配或超越前代旗舰,并集成 SGLang HiCache 与 Mooncake 分层缓存,将长输入场景的 TTFT 降低 60% 至

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10796 发布:新增 n expert used max 函数支持异构 MoE

llama.cpp 发布 b10796 版本,新增 n expert used max 函数以支持每层具有不同专家数量的 MoE 模型,修复了模型加载时的错误检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10795 发布:SYCL 后端融合优化

llama.cpp 发布 b10795 版本,主要更新是在 SYCL 后端启用融合优化,将 RMS NORM+MUL+ADD 和 ADD+ADD 残差链融合,以减少内核启动开销。该融合支持多种数据类型和广播/非连续场景,不支持的组合会回退到两次 add 调用。同时发布了适用于多个平台和硬件的二进制文件。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

无知几何:LLM如何调节贝叶斯先验

该研究揭示了大型语言模型(LLM)在不确定时如何依赖训练语料的词频先验:其输出嵌入矩阵中存在一个单一方向,编码了语料库的unigram分布,称为“无知方向”。该方向在Llama、Qwen、Gemma和Pythia等模型家族中普遍存在,且通过线性最小二乘拟合即可恢复。研究发现,将最终预测状态投影到该方向可分解为tempered Bayesian更新,其中先验加

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

DoPR:可复用压缩文档前缀实现高效 LLM 重排序

arXiv 论文提出 DoPR 框架,通过离线压缩文档前缀并在在线重排序中复用,减少 LLM 点式重排序的冗余计算。在 TREC DL、BEIR 和 BRIGHT 基准上,使用 Qwen3 模型(0.6B 至 8B)测试,实现了最高 8.0 倍的在线文档侧内存减少和 8.04 倍延迟加速,同时保留全文档重排序器平均 NDCG@10 的 97.1%-99.5%

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

激活监控在智能体知晓监控时仍有效:多智能体共谋检测研究

该研究探讨了在多智能体系统中,当智能体知晓其内部激活被监控并收到监控反馈时,基于激活的监控探针是否仍然有效。实验在四人二十一点和两人西蒙斯囚徒游戏中进行,使用Qwen3-32B-AWQ和GPT-OSS-20B模型,发现告知智能体监控存在并不会降低探针的检测准确性,智能体仍会继续共谋。这表明激活监控在智能体具有评估意识时仍具鲁棒性。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10794 发布:SYCL 后端重构 MKL 标志为全局变量

llama.cpp 发布 b10794 版本,主要重构了 SYCL 后端中 GGML SYCL ENABLE MKL FA 为全局变量。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Gated DeltaNet 可承受 4-bit 量化:混合 27B 模型的 NVFP4 W4A4 方案

Minima AI 团队发布论文,提出对混合大模型 Qwen3.8-27B 的全部 496 个线性层(包括 Gated DeltaNet 循环层)进行 NVFP4 W4A4 4-bit 量化,仅用 PTQ 校准,无需 QAT 或蒸馏。实验表明,该量化模型在 MMLU-Pro、GSM8K、AIME'25 等基准上与 BF16 基线性能相当,模型大小降至 17.

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.101.0-dev.2 发布:镜像签名验证与多项修复

LiteLLM 发布 v1.101.0-dev.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和功能更新,如 MCP 工具列表分页支持、Azure 工具模式扁平化、Bedrock 流式响应统一防护、Slack 用户支出阈值告警、Prometheus 速率限制指标等。

正文结构化主题已通过公开置信门槛
ByteDance Seed Research一手来源模型发布

字节跳动发布Seed2.0系列模型,强化多模态与复杂推理能力

字节跳动旗下 Seed 研究团队正式发布 Seed2.0 系列模型,针对大规模生产部署和多模态理解进行了系统优化,提升了视觉感知、复杂指令执行和推理能力,并提供 Pro、Lite、Mini 及代码模型等多种规格。Seed2.0 在多项公开基准上取得领先成绩,其 Pro 和代码模型已在豆包和 TRAE 上线,API 已通过火山引擎开放。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10793 发布:修复全量重编译问题

llama.cpp 发布 b10793 版本,主要修复了每次新提交都会导致整个源代码重新编译的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Latent Space产品发布

GPT-6 Astra:每小时不到6美元的自动化AI工程师

OpenAI 发布了 GPT-6 Astra,这是首个 Stargate 模型,在 FrontierMath 和 ARC-AGI-3 等基准测试中表现优异。作者通过早期访问测试发现,Astra 能够以低于每小时 6 美元的成本执行 AI 工程师任务,包括模型训练、数据标注、系统部署和子代理管理。作者利用 Astra 构建了多个工具,并认为它能够自动化大部分

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10791:OpenCL 性能优化与多平台发布

llama.cpp 发布 b10791 版本,主要针对 OpenCL 后端进行优化,包括量化 lm head、解码 GEMV 及中批量 GEMM 的优化,以提升推测解码和多 token 预测性能。该版本还修复了多个内核问题,并提供了多平台二进制文件。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

Shopify 推出 Gisting:将 LLM 系统提示压缩为学习令牌

Shopify 工程团队推出了一种名为 Gisting 的新技术,可将长 LLM 系统提示压缩为少量学习的“要点”令牌,从而提高吞吐量并降低推理成本。在 Sidekick GraphQL 代理中,系统提示从约 6000 个令牌减少到 1500 个要点令牌,预测质量不变,中位首令牌时间从 438ms 降至 354ms,端到端延迟从 6.8s 降至 4.2s,吞

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10790 发布:优化 SM87 量化切换

llama.cpp 发布 b10790 版本,主要调整了 SM87 架构中 MMVQ 到 MMQ 的交叉切换逻辑。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B GPTQ W4A16 量化版发布:支持 vLLM 与视觉

pearsonkyle 发布了 Qwen3.8-27B 的 GPTQ W4A16 量化版本,基于 Qwen/Qwen3.8-27B,使用 32K 上下文校准,支持 vLLM 直接服务。该模型将 90.5% 参数量化为 int4,但嵌入和输出头保持 bf16,文件大小 18.1 GiB。模型内置 MTP 草稿头实现 1.71 倍解码加速,并保留视觉塔支持图像输

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.28.1 发布:多项改进与修复

Langfuse 发布了 v4.28.1 版本,包含多项更新:标记关闭 Gemini 3 Pro 和 3.1 Flash-Lite 预览版,改进 Web 界面(如时间线展开、评分列显示),增强实验评估功能(支持批量评估中的变量映射覆盖),并优化 ClickHouse 性能(启用文本索引缓存)及支持自定义集群迁移。此外,还修复了认证(密码重置绑定一次性代码)和