返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月30日周日 · 1 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10686 发布:Metal 共享内存断言更新

llama.cpp 发布 b10686 版本,主要更新为在 Metal 后端添加共享内存填充的断言检查,以增强稳定性。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端支持。

8月29日周六 · 19 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10684 发布:改进 SYCL 显存适配算法

llama.cpp 发布 b10684 版本,改进了 SYCL 后端中 --fit 算法对 --fit-target 的遵循,更准确地计算给定上下文大小所需的峰值显存,避免 OOM 并减少过度保留。在 Arc b70 上测试,使用 unsloth 的 qwen3.8(Q4 K XL)模型,配合 q8 0 KV 和 MTP,在 --fit-target 1 下

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10683 发布:Vulkan 后端优化与多平台二进制更新

llama.cpp 发布 b10683 版本,主要更新为 Vulkan 后端中重复的 fastdiv 函数被合并,并重命名了优化小除数除法的函数。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10682 发布:为 M1 Max 添加 fa-vec 调优

llama.cpp 发布 b10682 版本,主要更新为针对 M1 Max 芯片添加 fa-vec 调优(PR #27932)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10681 发布:修复 Vulkan mul mat id 填充问题

llama.cpp 发布 b10681 版本,主要修复了 Vulkan 后端中 mul mat id 操作的填充问题,将填充从 N 改为 K,以避免越界访问。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、ROCm、Vulkan、OpenVINO 等。

正文结构化主题已通过公开置信门槛
量子位研究

本地部署AI不如官方版原因找到:推理栈微小差异致输出偏差

Level1Techs论坛用户thr3e通过实验发现,AI模型本地部署性能不如官方版的原因在于推理软件栈的微小差异,如注意力后端、KV缓存量化、权重量化方案等,这些差异会导致浮点运算产生数值偏移,进而改变输出token。实验显示,切换注意力后端或使用INT4 KV缓存会导致工具调用失败,而英伟达NVFP4权重量化表现最差。thr3e正在打包测试工具供其他用户

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Unsloth 发布 GLM-5.3-Flash GGUF 量化版

Unsloth 发布了 GLM-5.3-Flash 的 GGUF 量化版本,支持通过 llama.cpp 或 Unsloth Desktop 运行。GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,总参数 320B,激活参数 18B,采用混合架构和 mHC 技术,性能超越 GLM-5.2 且成本更低。

正文结构化主题已通过公开置信门槛
Latent Space商业

OpenAI 切断 Cursor 合作,开源模型与推理系统迎来密集更新

OpenAI 在 SpaceX 收购 Cursor 后,以马斯克旗下公司违反合同为由切断了与 Cursor 的合作,此举被视为对 Anthropic 此前类似行动的效仿。Cursor 回应称 OpenAI 仅占其流量的 5%,并暗示决定尚未最终。同时,本周开源模型密集发布,包括 GLM-5.3、Hy4-preview 和 Qwen3.8-Flash,vLLM

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

FreeToken:消费级硬件上的动态 MoE 推理引擎

UC Berkeley 和 MIT 的研究人员发布了 FreeToken,这是一个开源推理引擎,旨在通过动态协同执行,在消费级硬件上运行前沿 MoE 模型。FreeToken 采用 q 策略动态分配 CPU 和 GPU 计算,并引入语义锚点检查点,显著提升解码和预填充速度。基准测试显示,FreeToken 在 RTX 4060 笔记本上运行 Qwen3.6-

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 未审查版 GGUF 量化模型发布

JonathanColetti 发布了 Qwen3.8-27B 的未审查版 GGUF 量化模型,通过 Heretic 工具移除拒绝方向,显著减少拒绝行为但未完全消除。模型保留多 token 预测头,提供多种量化版本和视觉投影器,并附有困惑度测量数据。该模型基于 Apache-2.0 许可,支持中英文,适用于文本生成任务。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布 Kimi-K2-Thinking NVFP4 量化模型

NVIDIA 发布了 Kimi-K2-Thinking-NVFP4,这是 Moonshot AI 的 Kimi-K2-Thinking 模型的量化版本,采用 TensorRT Model Optimizer 进行 NVFP4 量化,支持 vLLM、SGLang 和 TensorRT-LLM 推理,专为 NVIDIA Blackwell 硬件优化。该模型拥有

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Whittle MoE 27B:从 Qwen3.8 切分出的路由器修复型混合专家模型

Hugging Face 上发布了新模型 logic65/Qwen3.8-Whittle-MoE-27B-A17.8B,这是一个从 Qwen3.8-27B 中通过后验方式切分出的混合专家模型,总参数 27B,激活参数 17.8B。该模型通过仅训练路由器(冻结专家)恢复了性能,并新增了停止信号以解决推理中止问题。v2.2.1 修复了推理中止缺陷,但 GGUF

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

RadixArk 发布 Qwen3.8-27B-DSpark 投机解码草稿模型

RadixArk 发布了 Qwen3.8-27B-DSpark,这是一个为 Qwen3.8-27B 目标模型设计的投机解码草稿模型,使用 SpecForge 训练并由 SGLang 提供服务。该模型在 17 个工作负载上平均接受长度提升 26.45%,吞吐量最高提升 3.16 倍,相比 EAGLE 和自回归基线有显著性能提升。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-Whittle-MoE-27B 发布 GGUF 量化版,修复推理中止问题

logic65 发布了 Qwen3.8-Whittle-MoE-27B-A17.8B 的 GGUF 量化版本,这是一个从 Qwen3.8-27B 中提取的混合专家模型,专注于改善停止生成行为。v2.2 版本修复了推理中止问题,但 GGUF 文件仍存在缺陷,建议关闭推理或使用 safetensors 版本。该模型提供多种量化等级,包括动态 DQ 系列,并支持

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

AMD 发布 Qwen3.8-27B AWQ INT4 量化模型

AMD 发布了基于 Qwen3.8-27B 的 INT4 权重量化模型 Qwen3.8-27B-Quark-AWQ-INT4-W4A16,采用 AWQ 算法和 AMD Quark 工具链。该模型在 GSM8K 和 BFCL 等基准测试中性能接近 BF16 基础模型,恢复率达 95% 以上。模型支持 vLLM 推理,并提供了详细的评估和量化命令。

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

AI云公司Lambda获10亿美元债务融资购买芯片租给微软

AI云公司Lambda通过摩根大通安排,获得10亿美元私人短期债务融资,用于购买英伟达AI芯片并租赁给微软。这是Lambda近期一系列债务融资的最新一笔,此前已获得10亿美元担保信贷额度和9.26亿美元贷款用于购买英伟达GB300 GPU。该公司还据报道在洽谈30亿美元的IPO前融资轮。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10679 发布,新增张量延迟读取基准选项

llama.cpp 发布 b10679 版本,新增 bench 工具的 --tensor-read-lazy 选项,用于延迟读取张量,并重命名相关模式为 LLAMA LAZY MODE 。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制包,支持多种硬件后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10678 发布:优化 qwen4exp 图分割

llama.cpp 发布 b10678 版本,主要更新为减少 qwen4exp 模型的图分割数量(PR #27880)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10677 修复 Vulkan 视图别名依赖问题

llama.cpp 发布 b10677 版本,修复了 Vulkan 后端在 ggml vk graph optimize 中缺失视图别名依赖的问题。该问题导致在 AMD 和 NVIDIA Vulkan 上运行 Qwen3.8 等模型时,出现贪婪解码输出错误、每次服务器启动结果不同以及投机解码接受无效等异常。修复通过比较视图源基址并排除无操作节点来确保依赖正确

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

开源AI公司成硅谷收购热点:英伟达、Stripe等巨头纷纷出手

据传英伟达将以130亿美元收购开源AI模型平台Hugging Face,此前英伟达已与Poolside达成60亿美元协议,Stripe也以70多亿美元收购了OpenRouter。这些交易表明,科技巨头正通过收购开源AI公司来对冲对前沿实验室的依赖,并应对推理成本上升和自研芯片趋势。开源模型目前使用率较低,但因其成本效益和可定制性,未来可能被更多企业采用。