返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1723 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月17日周一 · 11 条
正文结构化主题已通过公开置信门槛
量子位产品发布

智谱GLM-5.3发布,范式PhanRouter同日上线开放调用

智谱AI于8月14日发布新一代开源模型GLM-5.3,总参数量7430亿,能力提升源自后训练强化学习,编程能力提升50%,在多个基准测试中位列开源模型第一。同日,范式旗下统一模型调用平台PhanRouter完成适配并开放调用,成为首批支持该模型的平台之一,用户无需更换API地址即可直接调用。PhanRouter提供统一API、智能路由和缓存优化,兼容多款国产

正文结构化主题已通过公开置信门槛
Alibaba Cloud Official AI Blog一手来源研究

阿里云Tair KVCache仿真分析:高精度计算与缓存模拟设计

阿里云官方AI博客发布了一篇关于Tair KVCache仿真分析的技术文章,详细介绍了LLM推理性能模拟系统的设计与实现。文章分析了推理引擎的架构、调度策略及计算模型,并提出了高精度模拟远端KVCache配置对推理性能影响的方案。该方案旨在通过CPU平台快速预测不同配置下的TTFT、TPOT等关键指标,为推理系统优化提供决策依据。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10456 发布:SYCL 量化拷贝性能大幅提升

llama.cpp 发布 b10456 版本,修复了 SYCL 后端量化拷贝内核中的线程/块计数问题,使其与量化大小成比例,从而减少过订阅或欠订阅。在 Arc 70 上,q4 0 到 f32 路径的吞吐量从 20.21 GB/s 提升至 158.19 GB/s,其他量化类型性能提升不明显。该版本提供了多平台预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10455 发布:新增 SYCL 优化步骤支持

llama.cpp 发布 b10455 版本,主要新增 SYCL 后端对 OPT STEP ADAMW 和 OPT STEP SGD 优化步骤的支持。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并包含多种后端(如 Vulkan、CUDA、ROCm、OpenVINO 等)的构建。部分平台构建(如 Kle

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

L-FNO:用于随机事件动态的洛伦兹傅里叶神经算子

L-FNO 是一种结合 FNO 风格协变量路径、洛伦兹谱核和基于似然的训练目标的新型随机神经算子,用于建模随机事件动态。它在八个合成点过程基准和三个真实数据集上优于回归和基于似然的神经算子基线,改善了事件似然、校准诊断和罕见事件检测。研究表明,结构化谱记忆和基于似然的学习为神经算子模型提供了有效的归纳偏置。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

LLM服务一年追踪:工作负载演变、缓存与负载均衡

该研究基于公司X一年的生产追踪数据,对LLM服务负载进行了纵向分析,覆盖多个模型和用户,揭示了工作负载演变、缓存和负载均衡等特征。研究将发布完整追踪数据以支持后续研究,弥补现有研究在时间跨度和用户-模型交互方面的不足。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

Intern-S2-Mobius:解耦知识与推理的基础模型

Hugging Face 论文页面介绍了 Mobius-v0 架构,该架构将全局共享的 FFN 内存与多个自注意力推理器分离,以提升知识压缩和推理效率。基于此架构,7B 模型仅用基线 62.6% 的训练数据即达到相似性能,而 Intern-S2-Mobius 在持续预训练后实现了近 4 倍的端到端推理加速。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

BatiAI 发布 Qwen3.6-27B GGUF 量化版,主打端侧智能体编码

BatiAI 发布了 Qwen3.6-27B 的 GGUF 量化版本,该模型基于阿里巴巴 2026 年 4 月 22 日开源的 Qwen3.6-27B 稠密模型,支持多语言、多模态和 262K 上下文。量化版本针对苹果芯片优化,提供多种量化等级,可在 Ollama 上运行,并宣称在智能体编码基准上媲美或超越 Qwen 3.5-397B-A17B MoE 模型

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

AtomicChat 发布 Qwen3.8-27B GGUF 量化模型

AtomicChat 发布了 Qwen3.8-27B 的 GGUF 量化版本,基于 Qwen 原始权重并使用自己的重要性矩阵进行量化。该模型支持文本生成和多模态(图像)输入,提供了多种量化级别,并附有详细的量化分析、运行指南和速度测试。用户可通过 llama.cpp 或 Atomic Chat 应用本地运行该模型。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nail-Qwen3.6-35B-A3B-GGUF:高效量化模型,提升推理速度与对话质量

peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF,这是基于 Qwen3.6-35B-A3B 的 4-bit 量化模型,采用改进的聊天模板和强制系统提示,旨在减少过度思考、工具调用失败和冗长输出。在基准测试中,Nail 在响应速度和多轮对话质量上优于 Qwen3.6-27b 及其微调版本,但在长上下文任务中,其密集版

正文结构化主题已通过公开置信门槛
Mastra Releases一手来源产品发布

Mastra 发布更新:TokenCostControl 重命名及多项新功能

Mastra 发布了 2026 年 8 月 14 日的更新,主要亮点包括将 CostGuardProcessor 重命名为 TokenCostControl,并新增了更丰富的预算选项(如 warnAtPercent、按请求的 maxCost 函数、新的成本范围等)。同时,为 agent 和 controller 增加了活动运行检查 API,并修复了可观测性、

8月16日周日 · 9 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10453 发布:移除部分 ggml concat 代码

llama.cpp 发布 b10453 版本,主要更新是移除了部分 ggml concat 代码,由 Hugging Face 的 Xuan Son Nguyen 共同贡献。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台的构建(如 ma

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10452 发布:重构聊天内容处理逻辑

llama.cpp 发布 b10452 版本,主要重构了聊天功能中 supports string content 和 supports typed content 的处理逻辑,并新增了测试用例。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,但部分平台(如 macOS KleidiAI、Ubuntu

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10451 发布:修复 LoRA 张量越界检查

llama.cpp 发布 b10451 版本,主要修复了 LoRA 张量数据越界检查问题,确保 LoRA 张量数据在文件边界内。该版本提供了适用于 macOS、Linux、Android、Windows 等多个平台的预编译二进制文件,并包含 UI 组件。

正文结构化主题已通过公开置信门槛
量子位商业

Anthropic营收暴涨1400%,估值2万亿美元冲刺IPO

Anthropic第二季度营收超过115亿美元,同比增长逾14倍,调整后营业利润首次转正。投资人押注其以超过2万亿美元估值冲刺IPO,若成行将超越SpaceX成为史上估值最高的IPO。但分析指出,营收增长可能受Tokenmaxxing短期透支影响,且高额算力合同成本仍是盈利挑战。

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.97.0 发布:镜像签名验证与多项功能更新

LiteLLM 发布 v1.97.0 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证签名的方法。该版本包含多项功能更新和修复,如支持 Cursor 模型名称后缀解析、团队回调日志停止、JWT 认证用户邮箱回填、非流式响应切换、默认组织设置、缓存客户端连接回收、Rubrik 护栏的提示词审核与响应文本阻止、自定

正文结构化主题已通过公开置信门槛
FastGPT Releases一手来源产品发布

FastGPT v4.16.0 发布:沙盒架构调整与数据迁移指南

FastGPT 发布 v4.16.0 版本,主要更新包括 Agent Sandbox 架构调整、新增环境变量、移除 E2B 支持,并引入多项数据迁移脚本。该版本要求用户按指南更新代理和沙盒配置,执行系统模型配置清洗、HTTP 工具数据迁移及 Agent Sandbox 数据迁移,以兼容新版本。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Krea 2 Turbo Edit GGUF 量化版发布,支持身份保持编辑

ChrisColeTech 在 Hugging Face 发布了 Krea 2 Turbo Edit 的 GGUF 量化版本,支持文本到图像、图像到图像和身份保持编辑,8 步推理,在 RTX 5090 上生成 1024² 图像约需 35 秒。该版本包含三个量化等级和 FP8 缩放构建,并集成了 Qwen3-VL-4B 文本编码器和 Qwen-Image VA

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源模型发布

llama.cpp 新增 Kimi-K3 模型支持,实现混合注意力与 MXFP4 优化

llama.cpp 发布 b10448 版本,新增对 Kimi-K3 文本模型的支持,包括混合 KDA 线性注意力和 MLA 全注意力架构,以及跨层残差注意力、潜在 MoE、situ 激活、MLA 输出门和全秩 KDA 门等特性。该版本还实现了 MXFP4 量化权重的无损重打包,并添加了 Kimi K3 的聊天格式支持,包括推理提取和工具调用解析。验证显示与

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10447 发布:重构 server 线程模型

llama.cpp 发布 b10447 版本,主要重构了 server 的 yield to queue 线程模型,将 speculative 处理移至 worker 线程,并交换了 worker 与主线程的设计。该版本提供了多平台二进制文件,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 Vulkan、CUDA、ROCm