返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月24日周四 · 20 条
正文结构化主题已通过公开置信门槛
n8n Releases一手来源产品发布3

n8n 发布 2.41.2:修复 OpenTelemetry 与实例报告问题

n8n 发布 2.41.2 版本,主要修复了核心模块中 OpenTelemetry 在启用 Sentry 后重启仍能正常导出、n8n Assistant 实时测试运行记录为验证证据、以及跨 UTC 午夜边界的实例报告重试问题。同时新增使用许可证证书对实例报告进行身份验证的功能。

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布3

Mastra 将分类器列为一等原语并新增策略执行与后台工具

Mastra 发布更新,将分类器(classifiers)作为核心一等原语,支持在 Mastra 实例上注册并通过管理 API 操作,还可作为类型化工作流步骤实现分支控制流。新增 ClassifierProcessor 对 agent 输入、输出和流式内容执行类型化策略,默认失败即中止(fail closed)。此外引入 context.background

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源2

llama.cpp b11154 发布:测试工具新增逐模型结果表格

llama.cpp 发布 b11154 版本,主要更新了 test-save-load-state 测试工具:在 --models 模式下改为输出每个模型的逐项测试结果表格,用彩色 PASS/FAIL/SKIP 单元格替代原先冗长的日志输出,并在 -h 帮助中增加示例用法。该改动仅影响测试工具的输出格式,单模型模式输出与退出码保持不变,同时提供覆盖 macO

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究1

开放 PACS-AI 平台部署医学影像 AI 的经验总结

蒙特利尔心脏研究所等机构的研究者在 arXiv 发表评论文章,总结在开放 PACS-AI 平台上部署医学影像 AI 的经验。该平台基于 OHIF 与 Cornerstone 构建,并已在放射、神经放射、儿科肌骨超声和放疗等多个临床场景中开展前瞻性评估,同时配套开源了完整框架及一个可让智能体自动迁移模型的技能。文章还讨论了隐私影响评估与数据治理问题。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究1

CoMed:多LLM推理中路由与协作之间的选择性升级

论文提出 CoMed,一种多 LLM 推理中的选择性协作控制器,位于路由与密集协作之间。作者发现跨模型协作具有非单调性:同伴既能挽救单模型无法解决的错误,也可能破坏原本正确的答案。CoMed 通过锚点自一致性、路由边际和轻量同伴探测,决定接受、验证或升级协作,在 16 个开源权重设置中均优于固定或路由锚点,MedQA 最高提升 10.7 个百分点,并在 HL

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究1

KITE:用稀疏旗舰校准扩展 Jev 人群实验

研究者提出 KITE 架构,用类型化行为内核(TypeSafe 的 Jev,jev-1.13.0)对每个唯一状态查询一次,再以表格化执行任意规模人群实验,并用稀疏旗舰模型锚点估计干预效应。在 Epstein 的 9,070 名参与者实验中,覆盖 1.7% 状态的锚点使效应误差降低 41%;在 37 个 SocSci210 实验中,0.5–1.5% 锚点覆盖率

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源2

DeepSeek-V4.1-Flash 多精度 GGUF 量化版发布

开发者 smalinin 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 GGUF 量化版本,包含 Q2 K、IQ2 XXS、IQ3 XS、MXFP4 等多种混合精度方案,模型体积从 335GB 到 508GB 不等。这些文件需要配套的 llama.cpp 自定义分支 my build deepseek41 才能运行,且仅支

正文结构化主题已通过公开置信门槛
量子位商业1

成立九年,中科类脑把积累装进Token工厂

中科类脑成立九年来深耕算力调度与电力智能化,提出“算电协同型Token工厂”概念,通过BitaHub彼塔云平台统一纳管异构芯片、模型与电力资源,以“1+3”架构(决策大脑+算力、Token、电力子系统)实现跨域调度。公司完成跨上海、芜湖、乌鲁木齐三地调度测试,控制响应200秒内、跨域迁移成功率100%、能耗预测精度98%,并在世界制造大会上推出算电词元一体化

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布1

高通发布第六代骁龙8超级至尊版,为智能体AI重造SoC

在2026骁龙峰会上,高通发布第六代骁龙8超级至尊版与第六代骁龙8至尊版两款2nm移动旗舰平台,总裁兼CEO安蒙提出从以手机为中心转向以智能体为中心。超级至尊版搭载最高5GHz的Oryon CPU、首次加入Matrix Cores的Adreno GPU,以及可端侧运行300亿参数MoE模型的Hexagon NPU,并与阶跃、无量火、江波龙合作完成StepEd

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11149:test-llama-archs 新增后端选项

llama.cpp 发布 b11149 版本,主要变更是为 test-llama-archs 测试工具新增 -b/--backend 选项,用于针对特定后端进行测试。该改动由社区贡献者提交并合并。同时该版本照例提供覆盖 macOS、Linux、Windows、Android 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源1

IsValorum 发布 Qwen3.8-35B MoE 定制 GGUF 量化版

IsValorum 在 Hugging Face 发布了 Qwen3.8-35B-A3B-Distill-MTP-APEX-I-MiniPlus-V2.1 的 GGUF 量化版本,基于 empero-ai/Qwen3.8-35B-A3B-Distill 模型。该版本针对 13-14GB 显存/内存上限优化,采用逐张量定制量化策略,保留 F32 路由门、Q6

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11147:OpenCL 新增 A8 Q6 K dp4a 内核

llama.cpp 发布 b11147 版本,主要变更为在 OpenCL 后端新增 A8 Q6 K 非 MoE 的 dp4a 二值化内核(PR #29057)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SY

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp 发布 b11146,版本号升至 0.5.0

llama.cpp 发布 b11146 版本,将版本号提升至 0.5.0(PR #29333)。该版本为 macOS/iOS、Linux、Android、Windows 及 openEuler 等多个平台提供预编译二进制包,覆盖 CPU、CUDA 12/13、Vulkan、ROCm、OpenVINO、SYCL 等多种后端,并附带 UI 包。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源产品发布2

Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新

Hugging Face 博客发布 Optimum-Intel v2.2.0 与 OpenVINO GenAI 2026.4.0 更新。Optimum Intel 2.2 扩展了模型导出支持,新增 Mistral 3、DeepSeek-OCR-2、Gemma 4、Qwen-Image、LTX-2、Fun-ASR 等模型,并支持 DFlash 与 MTP 投机

正文结构化主题已通过公开置信门槛
LangGraph Releases一手来源产品发布2

LangGraph CLI 0.4.32 发布:新增自托管部署与镜像参数

LangGraph 发布 langgraph-cli 0.4.32 版本。本次更新新增自托管部署监听器、--image-uri 标志,并调整 deploy 命令使用 agent id 与环境参数,同时澄清 agent 标志并支持环境变量默认值。此外还修复了示例锁文件中的 AnyIO 漏洞并升级了多项依赖。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11140:CUDA 稀疏注意力优化加速 dsv4 预填充

llama.cpp 发布 b11140 版本,主要针对 CUDA 后端优化 DeepSeek-V4(dsv4)预填充阶段的 sparse-fa(稀疏 FlashAttention)。改动包括将 sparse mask 扫描的查询循环按 ncols1 模板化以在编译期确定循环边界,并把越界检查提升到主机端代码,使 49k 列稀疏解码形状下的扫描耗时从 46us

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源教程1

Jev AI 模型使用指南:从实验到服务端 API 集成

Hugging Face 博客发布了一篇面向开发者的 Jev AI 使用指南,介绍该模型如何作为软件团队的“决策层”,将状态(state)与问题(questions)转化为可分支的结构化答案。指南涵盖三种问题类型(Choice、Score、Noul)、状态输入格式、Playground 验证流程,以及通过 POST https://thejevai.com/

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源1

llama.cpp b11139 发布:修复休眠时 token 计数 API 崩溃

llama.cpp 发布 b11139 版本,主要修复了 server 端在 sleep 状态下 token counting API 崩溃的问题,并改进了休眠服务器的唤醒逻辑。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 等多平台及 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端的预编译二进制

正文结构化主题已通过公开置信门槛
Microsoft Research Blog一手来源研究1

微软研究:物理AI推理卸载至边缘或云端可提升性能与续航

微软研究院挑战了机器人 AI 推理必须完全在机载 GPU 上运行的核心假设,通过对移动操作任务的系统性研究,发现将推理卸载到边缘或云端 GPU 可显著提升任务成功率、支持更大模型并改善动态环境响应能力。研究还显示,用轻量级硬件(如 Raspberry Pi-5)替代高功耗机载 GPU 可大幅延长电池续航,例如 Jetson Thor 曾使电池消耗增加高达 1

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源研究1

SWE-Serve 揭示本地测试与实时服务之间的差距

NVIDIA 技术博客介绍 SWE-Serve,一个与 SGLang 团队合作开发的基准,用 53 个来自 SGLang 已合并 PR 的任务评估 AI 编码代理对推理服务软件的修改。在 19 个含实时服务检查的任务中,同一批补丁排除实时检查时通过率为 69.4%,加入完整验证器后降至 45.9%,约三分之一补丁在真实服务器加载模型后失败。该基准还显示跨多个