返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1723 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月16日周日 · 6 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10446 发布:更新 BoringSSL 并发布多平台二进制

llama.cpp 发布 b10446 版本,主要更新为将 BoringSSL 升级至 0.20260813.0。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台的构建(如 KleidiAI、ROCm 等

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10444 发布:支持 MTP 辅助模型加载

llama.cpp 发布 b10444 版本,主要新增 --models-dir 选项以支持加载 MTP 辅助模型,并优化了预设检查逻辑。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,但部分平台构建(如 KleidiAI、ROCm、openEuler)被暂时禁用。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.6-35B-A3B 未审查多模态模型 Genesis Hermes V7 发布

LuffyTheFox 发布了基于 Qwen3.6-35B-A3B 的未审查多模态 MoE 模型 GGUF 版本,名为 Genesis Hermes V7。该模型通过其自研的 Genesis 算法对张量进行噪声修复,并融合了 Hermes 微调数据,旨在提升模型稳定性和指令遵循能力。模型支持多语言和视觉任务,并提供了量化脚本和推荐配置。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10443 发布:修复 GGUF 数组类型检查

llama.cpp 发布 b10443 版本,主要修复了读取 GGUF 数组类型前未检查类型的问题,并更新了相关技能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 macOS KleidiAI、Ub

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

txtai 推出 LEMUR 与均值中心化,提升晚期交互检索效率

txtai 引入了 LEMUR(Learned Multi-Vector Retrieval)和可配置的均值中心化,以改进晚期交互检索。LEMUR 学习多向量表示的固定维度编码,使晚期交互模型能使用标准向量索引;均值中心化解决了 token 向量各向异性问题。在 BEIR 数据集上,LEMUR 在相同向量维度下相比 MUVERA 显著提升 NDCG@10,但

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源模型发布

Nesso-1:加速开源结合亲和力预测

Valence 和 Recursion 团队发布了 Nesso-1,一个开源粗粒度共折叠模型,用于蛋白质-配体结合亲和力预测。相比 Boltz-2,Nesso-1 速度快一个数量级以上,在多个公共和专有数据集上达到或超越其准确性,且单 GPU 预测仅需 1 秒。该模型旨在解决封闭源码瓶颈、计算成本高、人类与 AI 归纳偏差以及公共基准泄漏等问题,并支持大规模

8月15日周六 · 14 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10442 发布:优化 Intel Xe Vulkan 性能

llama.cpp 发布 b10442 版本,主要针对 Vulkan 后端在 Intel Xe 显卡上的 coopmat mul mm 操作添加了 SHMEM STRIDE PAD 和 APPLY SLM A RESHAPE 优化,并修复了共享内存估算和越界读取问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

MiniMax H3 量化权重集合发布,支持消费级 GPU 本地运行

Hugging Face 上出现了一个社区整理的 MiniMax H3 量化与剪枝权重集合,支持 INT4、INT8、混合精度及 NVFP4 格式,旨在让消费级 GPU(16-24GB 显存)用户通过 ComfyUI 本地运行 MiniMax H3 的多模态视频生成模型。该集合提供了针对不同显卡的下载指南,并包含文本编码器和 VAE 文件。MiniMax H

正文结构化主题已通过公开置信门槛
Ahead of AI教程

从零构建AI文本检测器:端到端项目教程

本文介绍了一个从零构建AI文本检测器的端到端项目,包括数据集构建、模型训练、本地部署和RLVR。作者以Substack的AI检测功能为灵感,旨在通过构建简单的检测器来教育读者理解AI检测器的工作原理,并探讨其局限性。项目最终产出一个AI检测API和用户友好的UI,并展示了如何利用检测器作为验证器来训练小语言模型生成难以被检测的文本。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10441 发布:统一 --load-mode 参数

llama.cpp 发布 b10441 版本,将废弃的 --mmap、--no-mmap、--mlock 和 --direct-io 标志统一迁移为 --load-mode 参数,并更新了相关脚本、示例和文档。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,但部分平台(如 macOS KleidiAI

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Cloudflare 推出 Agent Tracing,带截断限制和不均匀的负载默认值

Cloudflare 推出了 agent tracing,这是 Cloudflare Agents 的首个组件,用于在统一仪表板中收集部署的 agent 会话。该功能在现有 Workers tracing 基础上增加了 agent 级 span,并附带定价日期:测试期间免费,自 2026 年 10 月 1 日起纳入 Workers Observability

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源产品发布

Xinference v3.2.0 发布:新增多模型支持与副本扩展功能

Xinference 发布 v3.2.0 版本,新增多项功能,包括在 /v1/chat/completions 中支持 logprobs、支持部署 R3-embedding-0.6b 和 R3-rerank-0.6b 模型、支持 jina-reranker-v3.5 的 listwise API、OCR API 支持 PDF 输入、新增 DeepDoc OC

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10437 发布:新增 MiniMax-Text-01 和 M1 模型支持

llama.cpp 发布 b10437 版本,新增对 MiniMax-Text-01 和 MiniMax-M1 模型的支持,包括模型转换、推理优化和 Jinja 模板。该版本通过 token 抑制替代 logits mask 解决零嵌入问题,并优化了循环状态管理。同时提供了多平台二进制下载,但部分平台构建被禁用。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Blackfrost 发布 Muse Glimmer 30B 去拒绝 GGUF 量化版

Blackfrost-AI 发布了 Muse-Glimmer-30B-Abliterated-GGUF,这是基于 Meta 的 Muse Glimmer 30B 模型去除拒绝行为后的 GGUF 量化版本,支持本地运行。该模型提供从 Q2 K 到 Q8 0 的完整量化阶梯,并包含视觉投影器和 DFlash 投机解码器,在 RTX PRO 6000 上可实现约

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10436 发布:修复 mtmd 与 common 问题

llama.cpp 发布 b10436 版本,主要修复了 mtmd 和 common 模块中的多个问题,并回退了一个 GGUF 修复。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台构建(如 macOS Kle

正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Fable 5 错误率升高已解决

Anthropic 报告 Claude Fable 5 出现错误率升高的问题,影响 claude.ai 服务。问题于 2026 年 8 月 14 日 20:00 UTC 开始,至 8 月 15 日 00:11 UTC 解决。团队已确定原因并修复。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Gambit:思想级束搜索提升推理模型效率

Gambit是一种新的推理算法,通过思想级束搜索在固定硬件预算下动态分配计算资源到有前景的推理轨迹。在多个模型和基准测试中,Gambit相比现有基线在HMMT-24上取得+6.7%的绝对准确率提升,在AIME-25上提升+3.3%,同时将总token消耗减少高达68.5%。该方法通过轻量级评分器探测隐藏状态,定期剪枝无望轨迹并立即从高质量前缀分支,保持高硬件

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10435 发布:修复 Jinja 性能问题

llama.cpp 发布 b10435 版本,主要修复了 Jinja 模板中 gather string parts 函数的二次方复杂度问题,提升了性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布

OpenAI 报告 GPT-5.6 Terra 意外响应问题

OpenAI 报告其 GPT-5.6 Terra 模型出现意外响应问题,部分客户的请求可能间歇性返回不完整或格式错误的响应,或包含意外内容。OpenAI 已确认该问题并正在实施缓解措施,但尚未提供修复时间表。

正文结构化主题已通过公开置信门槛
Anthropic Newsroom一手来源研究

Anthropic 详解 Claude 文本水印技术:符合欧盟 AI 法案,不影响输出质量

Anthropic 宣布未来 Claude 模型将内置文本水印,以符合欧盟 AI 法案要求。该水印基于 Google DeepMind 的 SynthID-Text 方法,通过改变模型选择词语时的随机性来源来嵌入模式,不影响输出质量、可读性或成本,且不携带个人或组织信息。Anthropic 表示,水印对读者不可见,但可通过密钥检测文本是否由 Claude 生

另有 2 家信源报道