返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1722 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月21日周五 · 19 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10541 发布:新增多模态投影器设备参数

llama.cpp 发布 b10541 版本,新增 --mmproj-device 参数及 MTMD BACKEND DEVICE 环境变量,用于指定多模态投影器的后端设备,并支持 -mmdev 短标志。该版本提供多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10538 发布:Metal 大 batch KV 缓存反量化优化

llama.cpp 发布 b10538 版本,主要更新为在 Metal 后端中仅对大 batch 进行 KV 缓存反量化(PR #27438),以优化性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10537 发布:Windows CI 改用 LLVM OpenMP

llama.cpp 发布 b10537 版本,主要改进是在 Windows CI 中使用 LLVM 的 OpenMP 替代微软的非再分发调试版本,并打包了相应的许可证。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10536 发布:延迟加载启动模型并更新多平台支持

llama.cpp 发布 b10536 版本,主要更新为 server 端路由器在主设置完成后延迟加载启动模型。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10534 发布:CUDA 解码交叉点优化

llama.cpp 发布 b10534 版本,主要更新为 CUDA 后端新增按硬件和量化类型调整的切换点,用于优化 mvq 到 MMQ 解码的交叉点。该更新引入了运行时环境变量 GGML CUDA MMVQ MAX 来调整批量大小阈值,并针对 Blackwell、Ada 等硬件进行了调优,在 RTX 5090 上 Q4 K 密集解码在 B=8 时性能提升 2

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10533 发布:改进 JSON schema 正则支持

llama.cpp 发布 b10533 版本,主要改进是在 JSON schema 中优雅降级处理不支持的 regex 模式。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10532:Metal 后端 KV 反量化优化 Flash Attention

llama.cpp 发布 b10532 版本,在 Metal 后端为 flash attention 新增 KV 缓存反量化预处理,将 Q8 0、Q4 0、Q4 1、Q5 0、Q5 1 等量化 KV 反量化为 F16 后运行注意力内核,并优化了 MLA 模型中 V 为 K 视图时的冗余反量化。该版本在 M2 Ultra 上通过全部 4798 项测试,Qwen

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10531 发布:回滚 tensor-split 修复并更新多平台二进制

llama.cpp 发布 b10531 版本,主要变更包括回滚了 tensor-split meta 后端的修复提交。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS KleidiAI、U

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock推出OpenAI GPT-5.6跨区域推理支持

AWS宣布OpenAI GPT-5.6模型现已在Amazon Bedrock上支持跨区域推理,覆盖超过25个AWS区域。该功能通过地理和全球推理配置文件实现,允许请求在多个区域间路由,以提高吞吐量和性能。GPT-5.6系列包括Sol、Terra和Luna三个变体,支持文本和图像输入,具有100万token上下文窗口,并支持推理模式、工具调用和提示缓存。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ektome-Qwen3.8-27B:无审查模型发布,能力保持且支持长上下文

Zynerji 发布了基于 Qwen3.8-27B 的未审查模型 Ektome-Qwen3.8-27B-PristinelyUncensored,采用 Ektomē 技术去除拒绝行为,同时保持甚至略微提升模型能力(MMLU-val 从 0.812 升至 0.818,有害请求拒绝率从 100% 降至 0%)。该模型保留了完整的 MTP 头和视觉塔,并提供了多种

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10520 发布:修复 ARM FP16 编译问题

llama.cpp 发布 b10520 版本,主要修复了 ggml-cpu 中 fp16 类型在 32 位 ARM 平台上的编译问题,通过检查 ARM FP16 FORMAT IEEE 宏来确保类型可用性,并调整了 NEON+FMA 代码块的编译条件。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

ThinkingCap-Qwen3.6-27B 发布 MagicQuant 量化版 GGUF

lmcoleman 发布了 ThinkingCap-Qwen3.6-27B 的 GGUF 量化版本,使用 MagicQuant 混合进化逐张量搜索方法,提供 Q4、Q5、Q6 等不同量化档位,并推荐 Q5 档位以平衡质量与大小。该模型基于 bottlecapai 的 ThinkingCap-Qwen3.6-27B,支持文本生成和视觉输入,可在 LM Stud

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10519 发布:重构睡眠处理并支持睡眠期间访问指标

llama.cpp 发布 b10519 版本,主要重构了服务器端的睡眠处理逻辑,允许在睡眠期间访问 /metrics 端点,并添加了缓存响应、拆分指标与槽位任务等改进。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Muse-Glimmer-30B 无审查量化版发布:27 种 GGUF 覆盖多硬件

0bserverx 发布了 Muse-Glimmer-30B-Heretic-Uncensored-GGUF,这是基于 Meta 的 Muse-Glimmer-30B 模型,通过 Heretic v1.4.0 进行 abliteration 处理,并提供了 27 种 GGUF 量化版本,内存占用从 6.53 GB 到 55.73 GB 不等。该模型支持视觉-

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Anthropic 多个 Claude 模型请求错误率升高已解决

Anthropic 报告称,多个 Claude 模型(包括 claude.ai、Claude API、Claude Code 和 Claude Cowork)出现错误率升高的问题。目前该问题已解决,团队正在调查原因并会尽快提供更新。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10517 发布:Vulkan 后端优化与多平台支持

llama.cpp 发布 b10517 版本,主要针对 Vulkan 后端进行优化,包括在 coopmat1 中一次性反量化 q8 0 KV 缓存,并改进了 Flash Attention 路径的容错与布局检查。该版本还提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Liquid AI 发布 LFM2.5 Q4 0 量化感知蒸馏检查点

Liquid AI 发布了 LFM2.5 系列模型的 Q4 0 量化检查点,采用量化感知蒸馏(QAD)技术,将高精度教师模型蒸馏为量化学生模型,恢复了 BF16 精度损失的 97%。这些检查点在保持 Q4 0 低内存和高吞吐的同时,质量接近或超过 Q5 K M 和 Q4 K M,并已在 Hugging Face 上开放下载。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

Ramp 推出 AI 模型路由服务 Router

企业支出管理平台 Ramp 推出了自己的 AI 模型路由服务 Router,允许用户和公司通过 API 使用和切换多种大语言模型。该服务目前仅在美国可用,2026 年剩余时间内免费,并提供 26 美元信用额度。Router 提供来自 OpenAI、Anthropic、DeepSeek 等多家公司的模型,并支持多种路由策略和仪表盘监控。此举旨在进入 AI 推理

正文结构化主题已通过公开置信门槛
Microsoft Research Blog一手来源模型发布

微软发布Skala 1.1:提升DFT精度并集成主流化学软件

微软研究院发布了深度学习密度泛函(DFT)模型 Skala 1.1,该版本训练数据量是前版的2.5倍,在热化学、反应动力学和分子结构预测等关键模拟任务上精度显著提升。Skala 现已集成到 CP2K,并正在整合到 Psi4、FHI-aims、ORCA 和 VASP 等主流电子结构软件中,同时推出实时基准以跟踪性能。这些进展旨在使计算化学模拟更具预测性,并广泛

8月20日周四 · 1 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

使用 Amazon Bedrock 为医疗 API 构建智能安全

AWS 博客介绍了如何使用 Amazon Bedrock 为 FHIR 医疗 API 构建智能安全监控。该方案通过异步分析访问模式、自动分类数据敏感度并生成自然语言合规报告,在不影响 API 延迟的前提下增强安全性。它使用 AWS Lambda、API Gateway、HealthLake 等组件,并包含 CloudFormation 模板和代码示例。