返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月19日周三 · 20 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10502 发布:新增签名工件证明

llama.cpp 发布 b10502 版本,主要更新为 CI 添加了签名发布工件的证明(attestation),以增强软件供应链安全。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

揭秘代理技能:为何有效直至失效

该论文通过受控实验和轨迹分析,研究了技能(Skills)增强LLM代理的机制。研究发现,技能主要通过程序锚定(procedural anchoring)稳定执行,而非注入缺失知识,程序锚定占技能案例的65.7%,而显式知识注入仅占4.5%。检索是独立瓶颈,当技能池从5增至100时,实际使用精度从29.6%降至3.3%。技能在脆弱假设、不兼容上下文或适应不足时

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ling-3.0-tiny 去审查 APEX 量化版发布

SC117 发布了 inclusionAI/Ling-3.0-tiny 模型的 abliterated APEX GGUF 量化版本,通过 abliterix 技术移除拒绝方向,将拒绝率从 98% 降至 15%,同时使用 APEX 混合精度量化技术,在更小体积下达到甚至超越 Q8 0 的困惑度。该模型为 7.9B 总参数、1.3B 激活参数的混合推理 MoE

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B EXL3 量化版:更小下载、更快启动、更高保真

malaiwah 发布了 Qwen3.8-27B 的 EXL3 量化版本,其中注意力权重在磁盘上以 K6 精度序列化,相比 BF16 注意力版本,下载体积减少 29%,冷启动速度提升 5.4 倍,且与 BF16 的 KL 散度更低。该模型需要特定的 Gilded Gnosis vLLM 分支才能运行,属于实验性研究产物。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.14.0 发布:新增图表视图与时间线渲染优化

Langfuse 发布 v4.14.0 版本,新增了分数表图表视图、时间线密集渲染器等功能,并修复了 RBAC、OTel 映射、Stripe 计量事件等问题。该版本还进行了后台执行重构,将运行时所有权移至 worker,并更新了 Docker 镜像源。

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Transformers Releases一手来源产品发布

Transformers 发布补丁 v5.15.1 修复多项问题

Hugging Face Transformers 发布了补丁版本 v5.15.1,主要修复了 DFlash 和 MTP 候选生成器的问题,以及在使用 Lanczos 滤波器时图像在加速器上无法处理的问题。该版本包含多个提交,涉及设备不匹配、logit 分布对齐、配置缺失和图像处理回退等修复。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

挑战1比特:ETH学者秦浩桐提出极限量化方法压缩大模型

在IJCAI 2026大会上,苏黎世联邦理工学院博士后秦浩桐介绍了其团队在极低比特量化领域的两项工作BiLLM和SqueezeLLM,分别实现了1比特和2比特的后训练量化,显著压缩大模型体积并保持可用性。他同时指出了低比特量化面临的三大挑战,包括复杂任务性能折损、硬件支持不足以及激活值和KV Cache的量化难题。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

以GLM-5为例:九章智算云如何落地训推一致的强化学习系统

本文以GLM-5为例,探讨九章智算云如何通过强化学习系统实现训推一致。文章指出,随着预训练边际收益递减,模型能力Scaling正转向后训练强化学习,RL成为模型能力持续提升的关键。九章智算云通过将Generator、Environment和Trainer纳入统一工作流,实现动态调度和状态资源化,提升有效Token产出率,并与模型厂商形成算法与基础设施双向RL

正文结构化主题已通过公开置信门槛
LMDeploy Releases一手来源产品发布

LMDeploy v0.16.0 发布:支持新模型并优化性能

LMDeploy 发布 v0.16.0 版本,新增对 InternS2 Mobius、GLM-5.2 等模型的支持,并引入 MoE gate v2、CP attention 修复、TurboMind ViT 支持以及 FP8 优化等特性。同时改进了服务端 API 拆分、缓存报告和性能优化,并修复了多个 bug。该版本还升级至 CUDA 13.0,并扩展了 C

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

FreeToken:带宽自适应执行的边缘原生 MoE 推理系统

FreeToken 是一个面向边缘设备的 MoE 推理服务系统,将个人电脑视为统一的弹性推理平台,动态地将计算和模型状态映射到异构本地硬件上。该系统支持超过 20 个 MoE 模型,能在 8GB 笔记本电脑 GPU 上运行 35B 模型,在游戏台式机上运行 284B 模型,在单工作站 GPU 上运行 753B 的 GLM-5.2 模型。FreeToken 通

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.99.0-dev.1 发布:镜像签名验证与多项修复

LiteLLM 发布 v1.99.0-dev.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及代理、Bedrock 批量处理、Azure 内容安全、MCP 工具、UI 改进等。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

DumpsterCluster:用 60 美元 GPU 服务 LLaMA-70B 的二手硬件集群研究

本文介绍了一个名为 DumpsterCluster 的 128-GPU 集群,完全由二手组件构建,用于服务 LLaMA-70B 等现代 LLM 推理。该集群成本仅为 2.2 万美元,远低于 8-GPU B200 系统的 60 万美元,并通过流水线并行优化实现了有竞争力的吞吐量。然而,研究发现二手 GPU 的能效较低,总拥有成本仅在电价低廉的地区有利,且碳排放

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

思考的代价:推理努力作为模型特定API合同条款

该研究通过注册的配对对比实验,考察了Sonnet 5模型在显式高推理努力与省略该参数两种API合同下的成本与准确性差异。结果显示,显式高努力合同使每次调用成本平均增加0.01031美元,但未检测到准确性的显著差异。研究还发现,推理努力的省略语义在不同模型间甚至同一供应商内存在差异,强调了API合同条款对成本与结果的重要性。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

机构特定LLM提示可恢复去标识化系统遗漏的PHI

贝勒医学院等机构的研究者在 arXiv 发表论文,评估了大型语言模型(LLM)在电子健康记录去标识化中识别机构特定受保护健康信息(PHI)的能力。研究对 100 份儿科肿瘤学笔记进行基准测试,发现 LLM(最佳 F1=0.918)优于专用系统(TiDE F1=0.779),且通过命名缺失类别和防止过度编辑的提示,可恢复 79% 的遗漏 PHI,并提升精确率。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

YCWTG 发布 gemma-4-31B-it 的 NVFP4A16 量化版

YCWTG 发布了基于 google/gemma-4-31B-it 的 NVFP4A16 量化版本模型,使用 llm-compressor 生成,模型大小从 62.6GB 降至 20.5GB,同时保持接近原版的推理性能(HLE 得分 18.1 vs 19.5)。该模型支持指令模式和思考模式,并针对视觉塔和 lm head 层保留了 16 位精度以减少多模态性

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

DeepSeek V4 Pro 与 GPT-5.6 Sol 对比:级联策略以更低成本提升编码准确率

Together AI 在 DeepSWE 基准上对比了 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol,发现 Sol 在单次尝试中准确率更高(72.7% vs 62.8%),但 Pro 成本仅为 Sol 的 1/35,且在多次尝试后覆盖率反超。通过先运行 Pro、失败时升级到 Sol 的级联策略,可解决 83.0% 的任务,每任务成本

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

StateM 通过运行时扩展在 Terminal-Bench 2.1 上实现 95.3% 准确率

StateM 是一个通过持久状态、可恢复运行手册和程序化控制来提升长时程智能体执行能力的运行时系统,无需修改模型权重。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 的准确率从 83.1% 提升至 92.1%,并将 GPT-5.6 Sol xhigh 提升至 95.3%,同时将 DeepSeek-V4 Flash

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ThinkingCap-Qwen3.6-27B 推出 GGUF 量化版本

mradermacher 发布了 ThinkingCap-Qwen3.6-27B 模型的 GGUF 量化版本,该模型基于 bottlecapai 的 ThinkingCap-Qwen3.6-27B,支持多模态。提供了从 Q2 K 到 Q8 0 的多种量化格式,并附有使用说明和量化质量对比。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ThinkingCap-Qwen3.6-27B 推出多款 GGUF 量化版本

mradermacher 发布了 ThinkingCap-Qwen3.6-27B 模型的 GGUF 量化版本,该模型基于 bottlecapai 的 ThinkingCap-Qwen3.6-27B,是一个视觉模型。此版本提供了多种 imatrix 量化格式(如 i1-Q2 K、i1-Q4 K M 等),并附有详细的大小和质量说明,方便用户根据需求选择。