返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月23日周日 · 3 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10587 为 Vulkan 后端新增 PAD REFLECT 1D 操作

llama.cpp 发布 b10587 版本,为 Vulkan 后端新增了 PAD REFLECT 1D 操作,通过 GLSL 计算着色器实现反射逻辑,并注册了 SPIR-V 编译、更新了相关代码。该操作在 Intel Iris Xe 上通过了正确性和性能测试,性能数据已公布。同时发布了适用于多个平台和硬件加速器的二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Mistral-Nemo-Instruct-heretic:去审查版12B模型发布

Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但

正文结构化主题已通过公开置信门槛
智东西商业

2026全球AI芯片峰会嘉宾阵容公布,聚焦KV Cache与AI芯片前沿

2026全球AI芯片峰会(GACS 2026)将于9月20-21日在上海举行,由智东西发起,智猩猩主办,芯东西协办。峰会以“芯路求索 聚力致远”为主题,将举办开幕式、高峰论坛及多场技术研讨会,包括大模型KV Cache、超节点、异构混训混推等。目前已公布31位演讲嘉宾,涵盖华为、腾讯混元、上海AI实验室等机构专家,聚焦AI芯片加速大模型、Agent与具身智能

8月22日周六 · 17 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10585 发布:新增 JSON 抽象层并修复崩溃

llama.cpp 发布 b10585 版本,主要新增 common/json.h 抽象层,并迁移了 common、jinja、server 及测试代码,修复了服务器崩溃问题。该版本为各平台提供了预编译二进制包,包括 macOS、Linux、Windows、Android 和 iOS。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10584 发布:修复 draft 上下文并优化内存适配

llama.cpp 发布 b10584 版本,主要修复了 draft 模型上下文大小与目标上下文不匹配的问题,并优化了内存适配逻辑。该版本还引入了可选的第二模型支持,使 draft 或 MTP 上下文的内存测量更精确,同时移除了服务器中的预留块。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 推出 16GB 显存适配的 GGUF 量化版

cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik llama.cpp 项目的 IQ4 KS 和 IQ4 KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4 0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10582 发布:恢复 ROCm 构建并优化缓存

llama.cpp 发布 b10582 版本,主要恢复了 Ubuntu 上的 ROCm CI 构建,并调整了 ccache 配置以提升缓存命中率。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

DoorDash 构建 SafeChat:实时市场中的 AI 安全系统

DoorDash 软件工程师 Bruna Pereira 在演讲中介绍了 SafeChat 系统,该系统用于实时市场平台中的 AI 安全检测。他们先收集数据训练小型分类器,快速过滤明显安全的消息,仅对少数消息调用 LLM 进行多维度评分,以平衡延迟和成本。该系统每天处理数百万条消息,确保平台安全。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10581 发布,支持 DSpark 与 bailingmoe3

llama.cpp 发布 b10581 版本,新增对 DSpark 的支持,用于 bailingmoe3 模型。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10580 发布:支持 dots3-note 视觉与音频

llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、Ope

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen-3.8-27B 去审查版 8 位 MLX 量化发布

junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10578 发布:优化 concat 操作并更新多平台支持

llama.cpp 发布 b10578 版本,主要优化了 ggml 库中的 concat 操作,将逐元素 memcpy 替换为行级 memcpy,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,并支持 Vulkan、CUDA、ROCm、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10577 发布:修复 draft-mtp 与 embeddings 兼容性

llama.cpp 发布 b10577 版本,主要修复了 draft-mtp 与 embeddings 的兼容性问题。该版本提供了覆盖 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10576 发布:重新引入 SYCL Q2 K 内核

llama.cpp 发布 b10576 版本,重新引入了 SYCL 后端针对 Q2 K 量化格式的重排序 MMVQ 和 ESIMD 内核,并添加了门控参数。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
THE DECODER研究

Netflix测试语言模型推荐系统GenRec,性能超越传统方法

Netflix开发了基于语言模型的推荐系统GenRec,将用户行为转换为纯文本,通过微调开源权重模型进行推荐排序。离线测试和在线A/B实验显示,其推荐质量优于现有系统,且所需标注数据减少约40倍。Netflix认为这是从定制架构向通用语言模型转变的一部分,但尚未完全替代现有系统。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

SenseNova-U1-8B-MoT-Merger-gguf 模型发布,支持 ComfyUI 8G 显存

Hugging Face 上发布了 SenseNova-U1-8B-MoT-Merger-gguf 模型,该模型基于 SenseNova-U1-8B-MoT,支持在 ComfyUI 中运行,并针对 8GB 显存进行了优化。模型提供 Q4 和 Q6 量化版本,并展示了文本到图像生成的测试效果。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.3 无审查版 v1.4 发布:融合 NSFW 与蒸馏 LoRA

ChrisColeTech 发布了 LTX-2.3-uncensored-v1.4-fp8 模型,基于 Lightricks 的 LTX-2.3 并融合了 Eros10 极端 NSFW LoRA 和 DMD 蒸馏 LoRA,支持文本到视频、图像到视频等多种模式,并提供了 GGUF 和 FP8 量化版本。该模型宣称可在 4-8 步内生成高质量视频,并支持长达

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.8 冷融合微调模型,大幅减少思考 token

DavidAU 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF,采用 COLD FUSION(GAIN+Unsloth)训练方法,将思考 token 减少至原来的 1/2 到 1/10,同时保持或提升推理能力。该模型在 4bit 和 8bit

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.18 发布:新增多模型支持与性能优化

SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓

正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.33.0 发布:修复 MLX 兼容性并新增 Claude 桌面应用支持

Ollama 发布了 v0.33.0 版本,主要修复了 MLX 在 Linux/Windows 上的兼容性问题,并更新了 MLX 相关组件。同时,应用新增了对 Claude 桌面应用的支持,改进了模型管理功能,并优化了引导布局。此外,启动时增加了对 DeepSeek Harness 的 npx 回退方案,并增强了 MLX 运行器的前缀缓存恢复能力。