返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月11日周二 · 3 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升

vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 量化版发布,支持 ComfyUI 原生运行

AX1Y2JP 发布了 MiniMax-H3 的量化版本,基于 Comfy-Org/MiniMax-H3,采用 W4A8 量化,并支持 ComfyUI 原生运行。该模型在 4070Ti 上展示了示例结果,用户需使用最新版 ComfyUI 和 comfy-kitchen,并重新下载更新后的模型。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10344 发布:新增 Nemotron MTP 支持

llama.cpp 发布 b10344 版本,主要新增了对 Nemotron 模型的多 token 预测(MTP)支持,并引入了 mtp flags 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,方便用户部署。

8月10日周一 · 17 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10343 发布:更新 cpp-httplib 至 0.53.0

llama.cpp 发布了 b10343 版本,主要更新是将 cpp-httplib 库升级至 0.53.0。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8 0 到 IQ2 XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4 K M 在质量与体积间达到最佳平

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源模型发布

Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流

Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

硬提示压缩中的指称悬空:范式级失败模式

该研究识别了硬提示压缩中的一种结构性失败模式——指称悬空,即独立选择可能拆分依赖证据对,保留答案但删除解释所需的实体。在0.30压缩比下,Beaver在三个多跳问答数据集上的悬空率为34-54%,所有六种测试压缩器在HotpotQA上均表现出高达60%的悬空率。重新插入缺失的支持段落可将准确率提高29-34个百分点,而自动恢复探针在压缩比仅增加0.01的情况

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 新增 Granite-Switch 架构,支持逐 token LoRA 切换

llama.cpp 新增 Granite-Switch 架构后端,支持带多个 LoRA 适配器的模型,通过控制 token 实现逐 token 切换。该实现采用路由注意力机制在图中恢复适配器索引,解决了并发序列隔离问题,但存在单序列内无法回退的已知限制。目前支持 CPU 和 Mac (Metal) 构建,并已通过相关测试。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DeepSeek-V4-Flash 0731 推出 92GB GGUF 量化版,支持 GB10 全量运行

twaggs88 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,这是一个 284B 参数的 MoE 模型,通过 IQ2 XXS MMQ、MXFP4 和 MXFP8 等量化技术压缩至 92GB,可在 NVIDIA GB10 设备上全量运行。该版本包含完整的 256 个专家,并集成了 DSpark 投机解码草稿模型,支持长上下文和

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10338 修复 MoE 模型保存加载 bug

llama.cpp 发布 b10338 版本,修复了模型保存时共享专家 FFN 长度键被覆盖的 bug,该问题导致 MoE 模型(如 qwen2moe、granite-moe 等)在保存后无法重新加载。修复后,共享专家和分块 FFN 长度均能正确保存,并添加了相应测试。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DreamFast 发布 Gemma 3 12B Heretic v2:去审查量化模型

DreamFast 发布了基于 Google Gemma 3 12B IT 的 abliterated 版本 Heretic v2,通过 Heretic v1.3.0 减少模型拒绝行为,同时保持质量,并针对视频生成模型 LTX-2 优化。该模型提供 FP8、INT8 (ConvRot)、NVFP4、MXFP8 和 GGUF 等多种量化格式,支持从 Ada 到

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10336 发布:重构 WebGPU WGSL 并简化 flash attn

llama.cpp 发布 b10336 版本,主要重构了多个 WebGPU 的 WGSL 文件并简化了 flash attn 的 WGSL 实现。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源商业

OpenAI 修复 ChatGPT 部分用户错误问题

OpenAI 报告部分 ChatGPT 用户遇到错误增加,已确认问题并实施缓解措施,目前所有受影响服务已完全恢复,正在监控恢复情况。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

TEXAS:面向下游 MoE 大模型适配的任务专家感知监督方法

arXiv 论文提出 TEXAS 方法,用于混合专家(MoE)大语言模型的下游适配。该方法通过对比成功与失败实例上的专家激活,识别任务相关专家,并在微调时对失败实例中激活这些专家的答案 token 赋予更高权重。在三个 MoE 模型和六个基准上,TEXAS 在 18 个设置中的 17 个达到最佳或并列最佳,平均比最强基线提升 1.3-1.5 分。

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

LivePlan:编程代理的在线监控与纠正引导

本文提出LivePlan框架,用于实时监控和纠正编程代理在解决GitHub问题时的行为低效和偏离。LivePlan将判断与建议解耦,使用确定性规则监控器检测问题,仅在检测到问题时才调用顾问LLM进行下一步纠正。在SWE-bench Verified和SWE-bench Pro上,LivePlan将问题解决率提升最高15.2%,平均提升9.9%,额外成本仅每实

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

HD-Rec:分层量化与域自适应稀疏路由的生成式跨域推荐

arXiv 发表了一项关于生成式跨域推荐的研究,提出了 HD-Rec 框架。该框架采用分层域感知量化器,结合全局共享的粗粒度码本和自适应路由的细粒度码本,并引入域自适应稀疏专家混合模块,以提升跨域推荐性能。实验表明,HD-Rec 在三个公开基准上优于现有基线。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Jina AI 发布 jina-reranker-v3:0.6B 多语言重排序模型,BEIR 达 SOTA

Jina AI 发布了 jina-reranker-v3,一个基于 Qwen3-0.6B 的 0.6B 参数多语言文档重排序模型,采用新颖的 last but not late interaction 架构,在 131K token 上下文中可同时处理多达 64 个文档。该模型在 BEIR 基准上达到 61.94 nDCG@10 的 SOTA 性能,比生成式

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Modular TTT:将测试时训练重构为可组合模块

Modular TTT 提出了一种将测试时训练(TTT)表示为可组合模块的框架,通过有向无环图表示内部学习器,并将快速权重网络、损失函数、学习率、权重衰减和归一化作为显式设计维度。系统消融发现,小的学习率初始化、权重衰减和单层非线性可提升性能,而更深的快速权重网络和归一化会因激活值过大而损害性能。基于这些发现训练的 410M 和 1.45B 参数模型在 10

正文结构化主题已通过公开置信门槛
量子位商业

墨芯成立稀疏计算产学研联盟,推动AI算力效能提升

墨芯人工智能成立稀疏计算产学研联盟,联合高校与产业伙伴推动稀疏计算产业化。联盟将基于6S技术架构,从能效突破、研发转化、生态赋能三方面推进,以应对AI Token经济带来的算力挑战。此举旨在将稀疏计算从‘小众先锋’推向‘主流选择’,降低算力成本。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Deepwen 3.6:融合 DeepSeek 推理的 3D 生成微调模型

Deepwen 3.6 是基于 Qwen3.6-35B-A3B 的微调模型,融合了 DeepSeek-V4-Flash-0731 的推理能力,专注于 AAA 游戏开发、3D 生成和 Web 图形。该模型提供了多种 MoQ 量化版本,并附带多模态投影器。其改进包括程序化生成、硬表面建模、Blender 工作流等,且保留了 Qwen 的原始能力。