返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1731 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

6月5日周五 · 1 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.22.1 发布:新增 Mellum v2 支持与 Zen CPU 优化

vLLM 发布 v0.22.1 补丁版本,包含 8 个提交,来自 6 位贡献者。该版本新增对 JetBrains Mellum v2 模型的支持,并在 AMD Zen CPU 上通过 zentorch 加速量化线性推理,同时修复了多节点 Ray 数据并行服务、DeepSeek-V4 初始化等问题。

5月29日周五 · 1 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.22.0 发布:DeepSeek V4 成熟化与性能大幅提升

vLLM 发布 v0.22.0 版本,包含 459 个提交,来自 230 位贡献者。该版本重点提升了 DeepSeek V4 的成熟度,包括新增 NVFP4 融合 MoE 支持、CUDA 图优化和 MTP 投机解码。同时,Model Runner V2 成为 Qwen3 稠密模型的默认选项,并引入了实验性的 Rust 前端。性能方面,批量不变推理通过 Cut

5月28日周四 · 1 条
正文结构化主题已通过公开置信门槛
DSPy Releases一手来源产品发布

DSPy 3.3.0b1 发布:ReActV2 与类型化 LM 系统

DSPy 发布 3.3.0b1 测试版,引入新模块 ReActV2 和类型化的 BaseLM 系统,并更新 GEPA 至 0.1.1,同时减少框架依赖。ReActV2 支持原生工具调用和并行工具调用,可降低最高 50% 的成本;BaseLM 提供类型化的 LMRequest/LMResponse 接口,为未来 LiteLLM 解耦做准备。此外,numpy 变

5月27日周三 · 1 条
正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.12.post1 发布:修复 DeepSeek V4 多项稳定性问题

SGLang 发布 v0.5.12.post1 稳定性补丁,包含 12 个修复,主要针对 DeepSeek V4 系列问题,如 B200/B300 上的解码乱码、EAGLE/MTP 崩溃、NSA 预填充调度器崩溃等,并修复了 PD 分离、HiSparse 精度等问题。性能方面优化了冷启动延迟和 JIT 编译成本。

5月19日周二 · 1 条
正文结构化主题已通过公开置信门槛
Dify Releases一手来源产品发布

Dify v1.14.2 发布:安全加固与工作流可靠性提升

Dify 发布 v1.14.2 补丁版本,重点进行安全加固、工作流可靠性提升、知识库稳定性修复以及部署和运行时调优。该版本加强了租户隔离和工具凭证安全,修复了工作流执行、RAG 管道和知识库的多个问题,并升级了插件守护进程和依赖。这些改进增强了 Dify 平台的安全性和稳定性,为后续的 Agent 功能奠定基础。

5月17日周日 · 1 条
正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.12 发布:全面支持 DeepSeek V4 并新增多项优化

SGLang v0.5.12 发布,重点支持 DeepSeek V4 的完整推理路径,包括多种并行策略、硬件适配、预填充-解码分离、HiSparse 和 HiCache 等特性,并新增多个模型支持如 Intern-S2-Preview、MiniCPM-V 4.6 等。此外,还集成了 TokenSpeed MLA 注意力后端,优化了 FP4 低延迟性能,并迁移

5月16日周六 · 1 条
正文结构化主题已通过公开置信门槛
Ahead of AI研究

LLM架构新进展:KV共享、mHC与压缩注意力降低长上下文成本

本文回顾了近期开源大语言模型在长上下文效率方面的架构创新,重点分析了Gemma 4的KV共享与逐层嵌入、Laguna XS.2的逐层注意力预算、ZAYA1的压缩卷积注意力以及DeepSeek V4的mHC与压缩注意力。这些设计旨在减少KV缓存大小和内存开销,以支持更长的上下文和推理模型。文章指出,这些改动虽看似微小,但涉及Transformer块、残差流和注

5月15日周五 · 1 条
正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.21.0 发布:弃用 transformers v4,新增多项性能优化

vLLM 发布 v0.21.0 版本,包含 367 个提交,来自 202 位贡献者。该版本正式弃用 transformers v4,要求 C++20 编译器,并引入 KV 卸载与混合内存分配器集成、推理预算感知的投机解码、Blackwell 上的 TOKENSPEED MLA 后端等新特性。同时新增多种模型架构支持,并在性能、硬件支持(如 AMD ROCm、

5月8日周五 · 1 条
正文结构化主题已通过公开置信门槛
Berkeley AI Research Blog一手来源研究

自适应并行推理:高效推理扩展的新范式

Berkeley AI Research Blog 发表文章,探讨自适应并行推理作为高效推理扩展的新范式。文章指出,现有并行推理方法(如自一致性、树搜索等)的并行结构由外部决定,而自适应方法让模型自主决定何时分解任务、并行线程数及协调方式。文章分析了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,并强调不同问

5月7日周四 · 1 条
正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 3.1 Flash-Lite 正式版发布,预览版即将弃用

Gemini API 于 2026 年 5 月 7 日发布 gemini-3.1-flash-lite 的正式版(GA),该模型针对速度、规模和成本效率进行了优化。同时,官方宣布 gemini-3.1-flash-lite-preview 预览版将于 2026 年 5 月 11 日弃用,并于 2026 年 5 月 25 日关闭。

5月6日周三 · 2 条
正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
DSPy Releases一手来源产品发布

DSPy 3.2.1 发布:修复异步流式调用与缓存问题

DSPy 发布了 3.2.1 版本,主要移除了对 litellm 的上限限制,并修复了异步流式调用和 Embedder 缓存问题。同时更新了文档和 CI 流程,包括部署文档调整和 TestPyPI 发布验证强化。该版本还更新了多个依赖,并新增了两位贡献者的首次贡献。

3月15日周日 · 1 条
正文结构化主题已通过公开置信门槛
GLM New Releases一手来源模型发布

智谱发布GLM-5-Turbo基座模型,优化龙虾场景任务执行

智谱AI于2026年3月15日发布了GLM-5-Turbo基座模型,该模型针对OpenClaw龙虾场景进行了深度优化,强化了外部工具调用和多步任务稳定性,提升了复杂指令拆解、多智能体协同、时间理解及长任务执行效率。该模型旨在提升数据吞吐量大、逻辑链条长的任务处理能力。

3月13日周五 · 1 条
正文结构化主题已通过公开置信门槛
Baidu Qianfan Changelog一手来源产品发布

百度千帆更新:新增Qwen3.5多模态模型及多项服务升级

百度千帆平台于2026年3月13日发布多项更新,包括新增多款Qwen3.5多模态模型、支持GLM-5和Kimi-K2.5的TPM配额购买,并升级Coding Plan至Kimi-K2.5且支持MiniMax-M2.5。同时,AI助手升级为智能调度模式,提供多模态问答能力,并新增百度热搜、百度搜索MCP版等工具。

3月12日周四 · 1 条
正文结构化主题已通过公开置信门槛
MLX Releases一手来源产品发布

MLX v0.31.1 发布:CUDA 优化与混合分片支持

MLX 发布了 v0.31.1 补丁版本,包含多项 CUDA 内核优化(如量化 GEMV、Hadamard 变换、SegmentedMM)、混合分片(Hybrid sharding)支持、bug 修复及文档改进。该版本提升了 GPU 上的计算性能与稳定性,并新增了 bartlett 函数。

3月11日周三 · 1 条
正文结构化主题已通过公开置信门槛
LlamaIndex Releases一手来源产品发布

LlamaIndex v0.14.16 发布:新增限流器与多模态重排序器

LlamaIndex 发布 v0.14.16 版本,包含多个核心修复和新功能,如新增令牌桶和滑动窗口限流器、多模态 LLM 重排序器、扩展向量存储元数据过滤器,并修复了多个 bug 和安全问题(CWE-502)。同时更新了多个集成包,包括 OpenAI、Anthropic、Bedrock 等,新增对 gpt-5-chat 和 reasoning conten

3月4日周三 · 1 条
正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

谷歌发布 Gemini 3.1 Flash-Lite:高性价比低延迟模型

Google DeepMind 发布了 Gemini 3.1 Flash-Lite,这是 Gemini 3 系列中速度最快、成本效益最高的模型,专为大规模高吞吐量开发者工作负载设计。该模型定价为每百万输入 token 0.25 美元、每百万输出 token 1.5 美元,性能优于 2.5 Flash,输出速度提升 45%,首 token 时间快 2.5 倍。

2月26日周四 · 1 条
正文结构化主题已通过公开置信门槛
2月13日周五 · 1 条
正文结构化主题已通过公开置信门槛
Baidu Qianfan Changelog一手来源产品发布

百度千帆更新:新增多款模型及Agent发布功能

百度千帆平台在2026年2月13日更新,新增GLM-5、Kimi-K2.5、MiniMax-M2.1深度思考模型,并支持自主规划Agent一键发布为秒哒插件,同时上线OpenClaw快速体验页面,新用户部署成功可获200元代金券。此外,工具广场推出AI论文功能,由百度文库、网盘与千帆团队联合打造,可一键将大纲扩展为高质量正文,提效50%以上。

2月7日周六 · 1 条
正文结构化主题已通过公开置信门槛
MLX Releases一手来源产品发布

MLX v0.30.6 发布:提升 JACCL 带宽并修复多项问题

MLX 发布了 v0.30.6 版本,主要亮点是在 macOS 26.3 及以上版本中通过 JACCL 实现了更快的带宽。此外,该版本修复了多个问题,包括 WSL 中的托管内存、非 simd f16 构建、M2 以下芯片的 2pass sdpa、小 N 的 qmv impl 以及多设备 CUDA 的补丁。