返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月24日周一 · 7 条
正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论模型发布

阿里视频大模型Wan3.0正式上线,主打稳定真实有质感

阿里巴巴于8月24日正式上线视频生成大模型Wan3.0,支持单次生成30秒视频及多种文档格式输入,在生成时长、真实世界还原等维度升级。企业用户反馈其表现稳定、真实、有质感,已进入短剧、影视、广告等生产流程。即日起可通过阿里云百炼等平台体验,并推出限时7折优惠。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog商业

Anthropic最强模型因成本高企难获青睐,OpenAI收入增长35%

据FT报道,Anthropic的7月年化收入达650亿美元,预计Q3盈利,拥有6000个年消费10万美元以上的客户。但其最强模型Fable 5因成本高昂,在Ramp AI指数中仅占8.0%的模型支出份额,低于Opus 4.8的28.0%。OpenAI年化收入季度内增长35%,突破400亿美元,得益于GPT 5.6的发布。

正文结构化主题已通过公开置信门槛
TechCrunch AI产品发布

神秘AI模型Ox Alpha引发猜测:背后开发者是谁?

一个名为 Ox Alpha 的神秘新 AI 模型在 OpenRouter 上发布,引发互联网对其背后开发者的广泛猜测。该模型被描述为专为编码、持续代理工作和生产负载设计的推理模型,Stripe CEO Patrick Collison 对其表示赞赏。目前其开发者身份匿名,外界猜测涉及中国公司 Z.ai 的 GLM 模型或微软未发布的 MAI 模型,但尚无定论

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10603 发布:支持 GLM-4.5-Air 多 token 预测

llama.cpp 发布 b10603 版本,新增对 GLM-4.5-Air 模型的多 token 预测(MTP)支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering开源

谷歌发布 HEIR 编译器,推动同态加密推理一键化

谷歌推出开源编译器工具链 HEIR,旨在简化同态加密(HE)的部署,使预训练 AI 模型能够直接处理加密数据。HEIR 已用于隐私内容推荐、信用卡欺诈检测、网络入侵识别和音频热词识别等场景。目前编译过程尚未完全自动化,且性能开销仍是一个挑战,但部分评论认为对于某些应用场景是可接受的。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源产品发布

UmeAiRT 发布 ComfyUI 自动安装器资源库

UmeAiRT 在 Hugging Face 上发布了 ComfyUI-Auto-Installer-Assets 资源库,这是一个纯资产存储库,通过 Git LFS 提供多种扩散模型(如 FLUX、WAN、QWEN、HiDream、LTX-2 等)的预打包模型文件、文本编码器、二进制文件和 Python 包,支持多种精度(如 fp16、fp8、GGUF 量

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10598 发布:改进图像缩放算法并优化速度

llama.cpp 发布 b10598 版本,主要更新为 mtmd 模块使用更精确的 Pillow 图像缩放算法,并修正了所有模型的 resize algo 参数,同时进行了速度优化。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO

8月23日周日 · 13 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10594 发布:修复 CUDA 显存浪费问题

llama.cpp 发布 b10594 版本,主要修复了设备信息循环在非 TRACE 日志级别下仍会创建 GPU 上下文并导致 CUDA 后端分配 550 MB 显存的问题。该修复通过检查日志详细级别,在无输出时跳过设备循环,避免不必要的 GPU 资源占用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10593 发布:修复 DeepseekV4 多序列回滚问题

llama.cpp 发布 b10593 版本,主要修复了 DeepseekV4 在多序列场景下的回滚问题,并进行了模型加载修复、缓存清理优化和图拓扑静态化等改进。该版本提供了覆盖 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
THE DECODER研究

AI 成为自身最大客户:OpenRouter 代理 token 使用量激增 14 倍

OpenRouter 分析师 Peter Walker 指出,2026 年 2 月 6 日可能是人类消耗 token 量最后一次超过 AI 代理的日子。此后,代理 token 使用量增长了 14 倍,而人类使用量仅增长 2.8 倍。尽管代理消耗的 token 中近 70% 来自缓存提示,实际成本增速低于原始数据,但 AI 已成为 AI 最大的客户。OpenR

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Ornith-1.5-9B MTP GGUF 发布:内置推测解码头,多档量化优化

protoLabsAI 发布了 Ornith-1.5-9B 模型的 GGUF 量化版本,内置蒸馏 MTP 草稿头,支持 llama.cpp 的无损多 token 自推测解码,无需单独草稿模型。该版本针对不同硬件提供多种量化档位,其中 NVFP4 在 Blackwell 上速度最快(299 tok/s),IQ4 XS 适合 6GB 显存,但 IQ2 M 在长文

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10590 发布:更新 subprocess.h 并支持多平台

llama.cpp 发布了 b10590 版本,主要更新是更新了 subprocess.h 依赖。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10589 发布:新增 CUDA POOL 1D 支持

llama.cpp 发布 b10589 版本,主要新增 CUDA 后端对 POOL 1D 操作的支持,并修复了 editorconfig 兼容性问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,涵盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Comfy-Org 发布 MiniMax-H3 ComfyUI 重打包模型

Comfy-Org 发布了 MiniMax-H3 模型的 ComfyUI 重打包版本,包含多种量化格式的扩散模型、文本编码器、LoRA、VAE 和嵌入文件,并提供了 I2V、T2V、R2V 工作流模板及文档。该版本旨在简化 MiniMax-H3 在 ComfyUI 中的使用,并支持非 Blackwell GPU 运行。

正文结构化主题已通过公开置信门槛
Ray Releases一手来源产品发布

Ray 2.58.0 发布:KV 缓存路由、Delta Lake 集成与 TPU 支持

Ray 2.58.0 发布,重点包括 Ray Serve LLM 完成 KV 缓存和 token 感知路由,Ray Core 支持任务事件卸载,Ray Data 新增 Databricks Delta Lake 集成和 shuffle v2 后端,并推出实验性 Ray Sandbox 和 TPU 支持。这些改进提升了推理性能、数据处理效率和资源调度能力。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

KernelBench-RLVR-120b 模型发布 GGUF 量化版本

mradermacher 发布了 KernelBench-RLVR-120b 模型的 GGUF 量化版本,该模型基于 Jarrodbarnes 的 KernelBench-RLVR-120b,专注于 GPU 内核代码生成,并通过 GRPO 强化学习在 KernelBench 数据集上训练。量化版本提供了多种精度的 GGUF 文件,方便用户在本地部署。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

DavidAU 发布 Qwen3.6 40B 无审查 GGUF 模型

DavidAU 发布了 Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF 模型,这是一个基于 Qwen3.6 扩展的 40B 参数稠密模型,通过多阶段训练(包括 Heretic 去审查、Deckard 数据集和 Claude

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.98.0 发布:镜像签名验证与多项功能更新

LiteLLM 发布 v1.98.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于提交哈希和发布标签的验证方法。该版本包含多项修复和新功能,如支持 Claude Sonnet 5 的 toolSpec.strict 移除、GLM 5 和 DeepSeek V3.2 的原生结构化输出、PTU 平摊成本配置、可配置的估计输出 token

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.99.0-rc.1 发布:镜像签名验证与多项修复

LiteLLM 发布 v1.99.0-rc.1 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能更新,涉及 SCIM 组匹配、流式消息成本计算、Bedrock 响应头转发、spend 日志哈希、预算跟踪、路由响应体增强、guardrails 策略执行、Redis 集群超时处理等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10588 发布:修复 json.h 编译问题

llama.cpp 发布 b10588 版本,主要修复了 json.h 在 clang LTO 下的编译问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。