HPE Zerto 基于 Amazon Bedrock 构建代理式故障排查系统
AWS 与 HPE Zerto 合作,在 Amazon Bedrock 上构建了一个代理式故障排查系统,部署于本地环境,通过自然语言交互帮助用户快速诊断和解决数据保护与灾难恢复问题。系统采用 Strands Agents 框架、MCP 服务器和 Bedrock Knowledge Bases 等技术,并利用 Guardrails 确保安全。该系统旨在减少停机
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
AWS 与 HPE Zerto 合作,在 Amazon Bedrock 上构建了一个代理式故障排查系统,部署于本地环境,通过自然语言交互帮助用户快速诊断和解决数据保护与灾难恢复问题。系统采用 Strands Agents 框架、MCP 服务器和 Bedrock Knowledge Bases 等技术,并利用 Guardrails 确保安全。该系统旨在减少停机
llama.cpp 发布 b10865 版本,主要变更包括回滚了 HIP 构建中恢复 prop.integrated 的提交。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
llama.cpp 发布 b10864 版本,修复了 server 中 checkpoint 管理的一个问题:当 checkpoint 列表未满时,不再应用 min-step 驱逐规则,避免短提示词场景下错误删除恢复所需的 checkpoint,从而减少混合/循环模型的重复预填充。该版本同时提供了多平台二进制下载。
llama.cpp 发布 b10863 版本,主要修复了 Metal 后端中 mul mv iq3 xxs 内核在 ne00 < 1024 时存在的空闲线程问题。该修复通过引入函数常量来选择行分割方式,避免了为小矩阵单独启动内核,同时保持宽矩阵的原有性能。此版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件
魔搭 ms-swift 发布 v4.5.3 版本,新增对 Qwen3.8-Flash-Next、DeepSeek-V4-Pro-0813、Ling-3.0 系列等模型的支持,并引入多项新特性,如 Megatron-SWIFT Muon 优化器支持不同学习率、OPD 蒸馏支持多模态、性能优化等。同时修复了训练、RL、Megatron 及多个模型相关的 bug。
Langfuse 发布了 v4.32.0 版本,主要新增了当标记的预览未服务时发出警报的功能,以及导出数据新鲜度滞后分布的功能。同时修复了启用预览时数据集指标读取的问题,并升级了 undici 依赖至 7.29.1。
llama.cpp 发布 b10859 版本,主要修复了多个编译错误,通过添加缺失的头文件解决。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的预编译二进制文件,支持多种硬件后端如 CPU、Vulkan、CUDA、ROCm、OpenVINO 和 SYCL。
llama.cpp 的 Vulkan 后端在 b10858 版本中实现了将 GELU、SIGMOID、SILU、SOFTPLUS 等一元激活函数与 MUL 操作融合的优化,通过专门的着色器变体和图优化来提升性能。该融合支持广播、非相邻节点(如 view 等零计算节点)以及操作数在 B 侧的情况,并修复了相关回归。此优化主要针对 Vulkan 后端,可提升 p
Langfuse 发布 v4.31.0 版本,主要包含多项功能改进和错误修复。新功能包括对重建的实验 UI 进行埋点、在 trace 中显示成本来源、引入改进的消息渲染功能,并移除了不稳定的评估 API 端点。此外,还修复了认证、CI、定价等多个问题,并优化了代理相关功能。
llama.cpp 发布 b10857 版本,修复了 Vulkan-Hpp 在 32 位平台上的句柄使用问题,包括为 vk::Buffer 添加 operator<< 以及直接传递 vk::Buffer 给 copyBuffer API。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
Vontra 发布了 Qwen3.8-Flash-Next 的 MLX 4-bit 量化版本,基于官方 BF16 检查点转换,适用于 Apple Silicon。该模型采用 qwen4 exp 架构,支持视觉语言任务,配置上下文长度达 262,144 tokens。在 M3 Studio 上测试,oMLX 服务器生成速度约 24-26 tokens/s,独立
Vontra 发布了基于 zai-org/GLM-5.3-Flash 的 MLX 4-bit 量化版本,支持 Apple Silicon,并保留了原生 MTP(多 token 预测)层。该模型采用 4-bit 仿射量化,组大小为 64,总下载大小约 181.7 GB,支持 1M 上下文,架构为 glm5 next 多模态稀疏 MoE。在 Apple M3 U
Vontra 发布了 Qwen3.8-Flash-Next 的 MLX oQ4 混合精度量化版本,保留了原生 MTP 草稿块,专为 Apple Silicon 优化。该转换基于官方 BF16 检查点,包含 232 个保护模块,总权重 113.33 GB,支持 262,144 token 上下文。在 Apple M3 Studio 上测试,原生 MTP 启用时
llama.cpp 发布 b10856 版本,将 14 个专用模板解析器从 chat.cpp 拆分到 common/parsers 目录,使 chat.cpp 代码行数从 3915 降至 1513,并改为显式枚举解析器源文件以避免 CMake 增量构建问题。该重构无功能变化,并提供了多平台二进制下载。
llama.cpp 发布 b10855 版本,主要修复了 OpenCL 后端中 conv2d 操作对非连续输入的处理问题,确保正确计算步长。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
Hugging Face 论文页面介绍了一种名为 Uno 的新型扩散增强自回归语言模型,通过扩散蒸馏和 Ψ-Spec 采样器实现无损并行解码,无需草稿模型即可加速推理。Uno 在多个基准上超越现有扩散模型,最高可提升 3 倍速度,并已发布代码和检查点。社区讨论中,作者回应了与 Orthrus 等方法的相似性争议,强调架构差异。
基元律动联合无问芯穹、清华大学、北京大学、阿里巴巴等机构发布Agent-Native模型NeoHorse-1,包含4B和9B两个版本,基于Qwen3.5后训练,利用Routing Harness系统OpenSquilla产生的执行轨迹作为训练语料,通过路由信号、Agent执行监督和在策略蒸馏等方法提升模型能力。评测显示NeoHorse 4B在11项基准中未加
llama.cpp 发布 b10853 版本,主要新增对 Kimi-K3 模型循环状态回滚的支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动公司发布了首个Agent-Native模型NeoHorse,包含4B和9B两个版本。该模型利用其Routing Harness系统积累的多模型执行轨迹数据进行后训练,在Agent相关评测中4B模型表现达到或略超9B基础模型。公司旨在通过将执行经验转化为模型能力,构建从模型路由到训练改进的闭环,并探
DavidAU 发布了 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NEO-CODER-MAX-MTP-GGUF,这是一个基于 Qwen3.8 27B 的多阶段微调模型,采用 COLD FUSION 和 Fable Fusion 711 训练方法,显著减少思考 token 数量