返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月9日周三 · 1 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

HPE Zerto 基于 Amazon Bedrock 构建代理式故障排查系统

AWS 与 HPE Zerto 合作,在 Amazon Bedrock 上构建了一个代理式故障排查系统,部署于本地环境,通过自然语言交互帮助用户快速诊断和解决数据保护与灾难恢复问题。系统采用 Strands Agents 框架、MCP 服务器和 Bedrock Knowledge Bases 等技术,并利用 Guardrails 确保安全。该系统旨在减少停机

9月8日周二 · 19 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10865 发布:回滚 HIP 集成属性修复

llama.cpp 发布 b10865 版本,主要变更包括回滚了 HIP 构建中恢复 prop.integrated 的提交。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10864 发布:修复 checkpoint 驱逐逻辑

llama.cpp 发布 b10864 版本,修复了 server 中 checkpoint 管理的一个问题:当 checkpoint 列表未满时,不再应用 min-step 驱逐规则,避免短提示词场景下错误删除恢复所需的 checkpoint,从而减少混合/循环模型的重复预填充。该版本同时提供了多平台二进制下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10863 发布:修复 Metal 内核空闲线程问题

llama.cpp 发布 b10863 版本,主要修复了 Metal 后端中 mul mv iq3 xxs 内核在 ne00 < 1024 时存在的空闲线程问题。该修复通过引入函数常量来选择行分割方式,避免了为小矩阵单独启动内核,同时保持宽矩阵的原有性能。此版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件

正文结构化主题已通过公开置信门槛
魔搭 ms-swift Releases一手来源产品发布

ms-swift v4.5.3 发布:新增多模型支持与性能优化

魔搭 ms-swift 发布 v4.5.3 版本,新增对 Qwen3.8-Flash-Next、DeepSeek-V4-Pro-0813、Ling-3.0 系列等模型的支持,并引入多项新特性,如 Megatron-SWIFT Muon 优化器支持不同学习率、OPD 蒸馏支持多模态、性能优化等。同时修复了训练、RL、Megatron 及多个模型相关的 bug。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.32.0 发布:新增预览警报与数据新鲜度指标

Langfuse 发布了 v4.32.0 版本,主要新增了当标记的预览未服务时发出警报的功能,以及导出数据新鲜度滞后分布的功能。同时修复了启用预览时数据集指标读取的问题,并升级了 undici 依赖至 7.29.1。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10859 发布:修复编译错误并更新多平台二进制

llama.cpp 发布 b10859 版本,主要修复了多个编译错误,通过添加缺失的头文件解决。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的预编译二进制文件,支持多种硬件后端如 CPU、Vulkan、CUDA、ROCm、OpenVINO 和 SYCL。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp Vulkan 后端实现一元激活与乘法融合优化

llama.cpp 的 Vulkan 后端在 b10858 版本中实现了将 GELU、SIGMOID、SILU、SOFTPLUS 等一元激活函数与 MUL 操作融合的优化,通过专门的着色器变体和图优化来提升性能。该融合支持广播、非相邻节点(如 view 等零计算节点)以及操作数在 B 侧的情况,并修复了相关回归。此优化主要针对 Vulkan 后端,可提升 p

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.31.0 发布:改进实验 UI 与消息渲染

Langfuse 发布 v4.31.0 版本,主要包含多项功能改进和错误修复。新功能包括对重建的实验 UI 进行埋点、在 trace 中显示成本来源、引入改进的消息渲染功能,并移除了不稳定的评估 API 端点。此外,还修复了认证、CI、定价等多个问题,并优化了代理相关功能。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10857 发布:修复 32 位 Vulkan 句柄问题

llama.cpp 发布 b10857 版本,修复了 Vulkan-Hpp 在 32 位平台上的句柄使用问题,包括为 vk::Buffer 添加 operator<< 以及直接传递 vk::Buffer 给 copyBuffer API。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Vontra 发布 Qwen3.8-Flash-Next MLX 4-bit 量化版

Vontra 发布了 Qwen3.8-Flash-Next 的 MLX 4-bit 量化版本,基于官方 BF16 检查点转换,适用于 Apple Silicon。该模型采用 qwen4 exp 架构,支持视觉语言任务,配置上下文长度达 262,144 tokens。在 M3 Studio 上测试,oMLX 服务器生成速度约 24-26 tokens/s,独立

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3-Flash MLX 4-bit 量化版发布,支持 Apple Silicon 与原生 MTP

Vontra 发布了基于 zai-org/GLM-5.3-Flash 的 MLX 4-bit 量化版本,支持 Apple Silicon,并保留了原生 MTP(多 token 预测)层。该模型采用 4-bit 仿射量化,组大小为 64,总下载大小约 181.7 GB,支持 1M 上下文,架构为 glm5 next 多模态稀疏 MoE。在 Apple M3 U

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8 Flash Next MLX oQ4 量化版发布,支持原生 MTP

Vontra 发布了 Qwen3.8-Flash-Next 的 MLX oQ4 混合精度量化版本,保留了原生 MTP 草稿块,专为 Apple Silicon 优化。该转换基于官方 BF16 检查点,包含 232 个保护模块,总权重 113.33 GB,支持 262,144 token 上下文。在 Apple M3 Studio 上测试,原生 MTP 启用时

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10856 发布:拆分模板解析器并优化构建

llama.cpp 发布 b10856 版本,将 14 个专用模板解析器从 chat.cpp 拆分到 common/parsers 目录,使 chat.cpp 代码行数从 3915 降至 1513,并改为显式枚举解析器源文件以避免 CMake 增量构建问题。该重构无功能变化,并提供了多平台二进制下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10855 发布:修复 OpenCL conv2d 非连续输入问题

llama.cpp 发布 b10855 版本,主要修复了 OpenCL 后端中 conv2d 操作对非连续输入的处理问题,确保正确计算步长。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Uno:扩散增强LLM实现无损加速推理

Hugging Face 论文页面介绍了一种名为 Uno 的新型扩散增强自回归语言模型,通过扩散蒸馏和 Ψ-Spec 采样器实现无损并行解码,无需草稿模型即可加速推理。Uno 在多个基准上超越现有扩散模型,最高可提升 3 倍速度,并已发布代码和检查点。社区讨论中,作者回应了与 Orthrus 等方法的相似性争议,强调架构差异。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

基元律动发布NeoHorse模型,探索Harness驱动的递归自我改进路径

基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布Agent-Native模型NeoHorse-1,包含4B和9B两个版本,基于Qwen3.5后训练,利用Routing Harness系统OpenSquilla产生的执行轨迹作为训练语料,通过路由信号、Agent执行监督和在策略蒸馏等方法提升模型能力。评测显示NeoHorse 4B在11项基准中未加

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10853 发布:支持 Kimi-K3 循环状态回滚

llama.cpp 发布 b10853 版本,主要新增对 Kimi-K3 模型循环状态回滚的支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
量子位模型发布

王云鹤创业后首发Agent-Native模型NeoHorse

华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8 27B 多阶段微调模型发布,性能超越基础版

DavidAU 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF,这是一个基于 Qwen3.8 27B 的多阶段微调模型,采用 COLD FUSION 和 Fable Fusion 711 训练方法,显著减少思考 token 数量