返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1723 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月15日周六 · 5 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10434 发布:支持 reasoning effort 传递

llama.cpp 发布 b10434 版本,主要更新是在聊天功能中传递 reasoning effort 参数,并将其存储到 common chat templates inputs 中,供 Jinja 模板使用,同时支持模型特定的翻译。该版本还修复了服务器端从请求体读取 reasoning effort 的问题,并提供了多平台(macOS、Linux、W

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Wan2.2 自定义 GGUF 模型发布:针对 T4 优化

geceff 在 Hugging Face 上发布了 Wan2.2 自定义 GGUF 模型仓库,针对 NVIDIA Tesla T4 等显存受限环境优化,提供量化模型、LoRA、文本编码器和 VAE。仓库包含高/低噪声量化模型及集成 SVI 和一致人脸功能的 FP8 模型,并给出了 ComfyUI 推荐参数和不同硬件的使用建议。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10433 发布:同步 ggml 并更新多平台二进制

llama.cpp 发布 b10433 版本,主要同步了 ggml 底层代码。该版本提供了涵盖 macOS、Linux、Windows、Android 及 openEuler 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。部分平台构建(如 macOS KleidiAI、Ubuntu RO

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10431 发布:ggml ssm scan 支持循环状态回滚

llama.cpp 发布 b10431 版本,主要更新为 ggml ssm scan 支持循环状态回滚(recurrent state rollback),并支持 K 1 的情况,覆盖 CPU 和 CUDA 后端。该功能有助于提升状态空间模型(如 Nemotron)在推理时的效率。

正文结构化主题已通过公开置信门槛
魔搭 ms-swift Releases一手来源产品发布

ms-swift v4.5.0 发布:支持 Qwen3.8、Nemotron 3.5 等新模型

魔搭 ms-swift 发布 v4.5.0 版本,新增对 Qwen3.8、NVIDIA Nemotron 3.5 Lightning 和 Meta Muse Glimmer 等模型的支持,并改进推理、训练和 RLHF 功能。该版本还修复了多个 bug,并支持 OpenAI 和 Anthropic 消息处理器。

8月14日周五 · 15 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

AWS 展示 SageMaker AI 与 Bedrock AgentCore 构建多智能体工作流

AWS 展示了如何将 SageMaker AI 上的 OpenAI 兼容端点与 Bedrock AgentCore 运行时结合,构建多智能体工作流。该架构通过 Bedrock AgentCore 容器连接编排器(Claude Haiku 4.5)、预算智能体(Claude Sonnet 4.6)和财务分析智能体(Qwen 3.5 9B),实现成本优化、数据驻

正文结构化主题已通过公开置信门槛
量子位模型发布

Qwen3.8-27B开源:家用显卡可跑,Apache 2.0免费商用

阿里巴巴正式开源Qwen3.8-27B模型,该模型为原生多模态稠密模型,支持262K原生上下文,可通过YaRN技术扩展至1M tokens,在编程和办公场景性能大幅提升,并新增reasoning effort功能。模型以Apache 2.0协议开放权重,所有人可免费下载、部署和商用。目前千问已累计开源460余个模型,全球下载量超30亿次。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阿里开源Qwen3.8系列,千问模型全球下载超30亿次

阿里千问于8月14日晚正式开源Qwen3.8系列模型,其中Qwen3.8-27B为原生多模态稠密模型,仅270亿参数,性能超越Qwen3.7-Plus,在编程和办公场景表现出色,支持消费级显卡量化部署,采用Apache2.0协议。此前旗舰模型Qwen3.8-Max也已开源权重。阿里累计开源460余个模型,Qwen全球下载量超30亿次,衍生模型超30万个,稳居

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

法国初创Kog通过软件优化提升GPU推理速度

法国初创公司Kog致力于通过软件优化在现有数据中心GPU上实现更快的AI推理速度,其技术预览在Hacker News上引起关注,并获得了200个商业线索。Kog计划在9月前将首个大型模型推理速度提升10倍,以吸引投资并推动业务发展。

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

OpenAI 推出 Ultrafast 模式,GPT-5.6 Sol 速度提升 14 倍

OpenAI 推出 GPT-5.6 Sol 的“Ultrafast”模式预览,通过 Cerebras 硬件实现每秒 750 个输出 token,速度提升 14 倍。该服务初期仅通过 API 向特定客户提供,并计划逐步扩大。OpenAI 旨在将小模型的速度与大模型的推理能力结合,应用于事件响应、金融、客服、电商和研究等场景,同时通过分层定价将速度作为盈利杠杆。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Unsloth 发布 MiniMax-H3 的 GGUF 量化版,支持本地视频生成

Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,支持本地运行,兼容 stablediffusion.cpp 和 Unsloth 平台。该模型能生成带原生立体声音频的视频,最长 15 秒、24 FPS、32 kHz 音频。提供两种去噪器变体(fl2va 和 ref2va)及多种量化等级,并附有使用示例和许可证说明。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10430 发布:支持虚拟 iGPU 设备

llama.cpp 发布 b10430 版本,主要更新是允许虚拟 iGPU 设备(PR #26953)。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。部分平台(如 macOS KleidiAI、Ubuntu R

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10429 发布:支持解码期间访问指标和槽位

llama.cpp 发布 b10429 版本,主要更新是允许在 llama decode() 期间访问 /metrics 和 /slots 端点,通过重构 server queue 的 worker 逻辑,在 yield to queue 中调用 llama decode 并处理 process mtmd chunk。该版本提供了多平台预编译二进制文件,包括

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF curve 版发布:体积缩减40%并适配24GB显存

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本(curve 形式),基于 MiniMax 的剪枝检查点构建,体积比原版小约 40%,Q8 0 版本可适配 24GB 显存。该版本通过分解 adaln 调制矩阵实现压缩,在 ComfyUI 0.30.0 及以上版本中运行,并提供了与原始版本的渲染对比数据。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

MiniMax-H3 GGUF 量化版发布,支持 ComfyUI 运行

joeygambino 发布了 MiniMax-H3 的 GGUF 量化版本,支持在 ComfyUI 中运行,并提供 fl2va 和 ref2va 两种模型。该版本解决了 ComfyUI-GGUF 的架构识别问题,并提供了多种量化选项以适应不同显存。此外,还提供了剪枝版本的替代方案,并解释了 K-quants 不可用的原因。

正文结构化主题已通过公开置信门槛
量子位商业

太初元碁承办AI+教育大赛,加速卡模型适配赛道招募开启

太初元碁承办国家级“AI+教育”大赛中的“AI+加速卡模型适配赛道”,面向全国开发者招募,提供免费国产算力资源和算子开发Agent工具,要求参赛者完成模型在自研加速卡上的适配优化。该赛道旨在推动国产算力生态落地和AI人才培养,报名截止至2026年10月15日。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10428 发布:清理路径并更新多平台构建

llama.cpp 发布 b10428 版本,主要更新是清理了示例文档和测试中的个人主目录路径,替换为通用占位符。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。部分平台构建(如 KleidiAI、ROCm、openEuler)被标记为禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10427 发布:SYCL 融合优化提升推理速度

llama.cpp 发布 b10427 版本,主要更新为在 SYCL 后端融合了 q4 K 密集 FFN 的 mul mat(gate)、mul mat(up) 和 GLU 操作。在 Arc Pro B70 上,qwen2.5-3B 和 gemma-2-2b 的推理速度分别提升 2.8% 和 2.0%,批处理场景下最高提升 12.4%。该版本同时提供了多平台

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.11.0 发布:增强迁移体验与多项修复

Langfuse 发布 v4.11.0 版本,包含多项功能改进和修复。主要新增功能包括:在 trace 中如实展示超过加载上限的观测数据、暴露迁移观测证据、为应用内代理增加后台会话活动提示和 toast 卡片、为通过第三方提供商集成的旧 SDK 项目引入强制 v3 体验、使 Markdown 渲染字符限制可配置、在会话中显示现有标注计数,并在 v4 迁移侧边