返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1730 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月2日周日 · 1 条
正文结构化主题已通过公开置信门槛
Claude Platform Release Notes一手来源产品发布

Claude 平台更新:发布 Opus 5 并增强托管代理功能

Anthropic 发布了 Claude Opus 5 模型,支持 1M token 上下文窗口和 128k 最大输出 token,定价与 Opus 4.8 相同,并已上线多个云平台。Claude Managed Agents 新增了会话预算、顾问模型、推理地理位置控制、GitHub 技能加载和初始事件种子等功能。推理钩子功能在 Claude Enterpr

7月31日周五 · 2 条
正文结构化主题已通过公开置信门槛
LMDeploy Releases一手来源产品发布

LMDeploy v0.15.0 发布:支持 DeepSeek V4 并优化推理性能

LMDeploy 发布 v0.15.0 版本,新增对 DeepSeek V4 的支持,并引入长上下文和 MTP 前缀缓存命中、推测解码的引导解码、内存分配器与调度器集成等特性。同时优化了 TTFT、流式响应解析、FP8 MoE 等性能,并修复了多项 bug,包括前缀缓存、Triton FP8 通信、多模态工具消息解析等。

正文结构化主题已通过公开置信门槛
Xinference Releases一手来源产品发布

Xinference v3.1.0 发布:新增 SSO、推测解码及 MiniMax-M3 支持

Xinference 发布 v3.1.0 版本,新增 SSO/OIDC 登录、模型 worker 多选、Qwen3-ASR 批量转录、推测解码等功能,并支持 MiniMax-M3 模型。同时修复了 Slow HTTP DoS 漏洞、多副本启动错误、虚拟环境依赖等问题,并优化了 Docker 构建和模型 JSON 更新。

7月30日周四 · 3 条
正文结构化主题已通过公开置信门槛
Anthropic Status History一手来源产品发布

Claude Opus 4.8 性能降级已解决

Anthropic 报告 Claude Opus 4.8 出现性能降级,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前该事件已解决,团队正在调查原因。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v3.224.4 发布:修复仪表盘与 API 问题

Langfuse 发布了 v3.224.4 版本,主要包含三项修复:移除 v3 维护分支上的最新标记、根据部署写入模式推导仪表盘小部件的最低版本、以及更新不存在的仪表盘时返回 404 而非 500。这些修复均为 v3 分支的后向移植,旨在提升 API 和仪表盘的稳定性。

正文结构化主题已通过公开置信门槛
Ars Technica AI研究

Anthropic AI 模型发现漏洞,致后量子算法 HAWK 出局

Anthropic 的 AI 安全模型 Mythos 在 NIST 第三轮后量子密码算法筛选中发现了 HAWK 数字签名方案的漏洞,导致该算法被淘汰。HAWK 开发者随后宣布撤回该算法。Mythos 还发现了 AES 密码的弱点,但这些发现是渐进式的,并未破坏当前使用的加密系统。

7月29日周三 · 1 条
正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.20.0 发布:支持 Claude Opus 5 与 OpenAI 推理上下文

PydanticAI 发布 v2.20.0 版本,新增对 Claude Opus 5 模型的支持,并为 OpenAI Responses API 的 gpt-5.4/5.5/5.6 系列添加 reasoning.context 支持。同时修复了多个 bug,包括保留任意 RequestUsage 字段、捕获 Anthropic 思考令牌、修复嵌入请求守卫等。

7月28日周二 · 3 条
正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering产品发布

Grafana Assistant 扩展至超30个数据源,推动统一可观测性

Grafana Labs 扩展了其 AI 可观测性助手 Grafana Assistant,使其能够通过自然语言查询和关联超过 30 个数据源,旨在实现“统一可观测性”。该助手可帮助运维人员、开发者和 SRE 调查事件、生成查询并排查复杂分布式系统,而无需在多个监控工具之间切换。此次更新新增了对 Snowflake、Oracle、Elasticsearch、

正文结构化主题已通过公开置信门槛
OpenAI Agents JavaScript Releases一手来源产品发布

OpenAI Agents JS SDK v0.14.0 发布:程序化工具调用与安全增强

OpenAI Agents JavaScript SDK 发布 v0.14.0 版本,新增程序化工具调用支持,允许模型生成托管 JavaScript 来协调工具并减少中间结果。默认禁用敏感模型和工具数据日志,并默认启用任务和回合追踪。取消信号现在传播到函数和 MCP 工具,同时支持 AI SDK 7 和 Vercel S3 桶挂载。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源商业

OpenAI 修复 gpt 5.1 mini 和 gpt 4.1 mini 性能问题

OpenAI 报告其 gpt 5.1 mini 和 gpt 4.1 mini 模型出现延迟升高、超时和流式传输中断的性能问题,影响相关 API 服务。问题于 2026 年 7 月 27 日下午开始调查,并在约两小时后解决,所有受影响服务已完全恢复。

7月27日周一 · 3 条
正文结构化主题已通过公开置信门槛
Agno Releases一手来源产品发布

Agno v2.8.5 发布:新增 AgentOS 工具、Moonshot 支持 kimi-k3 并修复安全漏洞

Agno 发布 v2.8.5 版本,新增 AgentOSTools 工具用于报告 AgentOS 的使用情况、延迟、失败、调度、评估、组件和待批准事项。改进包括为 PostgresDb 和 SqliteDb 添加按代理、团队、工作流或端点分组的延迟和错误统计,以及工具和模型调用统计。Moonshot 默认模型改为 kimi-k3,新增 thinking 模式

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering研究

Netflix 详解内部 LLM 服务平台:Triton 与 vLLM 集成实践

Netflix 详细介绍了其内部 LLM 服务平台的架构,该平台基于 JVM 服务层,使用 Triton 进行模型管理和调度,并选择 vLLM 作为 GPU 推理引擎。平台面临模型大小、硬件需求和推理引擎快速演变的挑战,通过版本固定、扩展点和部署策略解决兼容性问题。Netflix 的经验表明,通用服务接口虽能抽象底层差异,但打包、兼容性控制和约束解码等工程工

正文结构化主题已通过公开置信门槛
vLLM Releases一手来源产品发布

vLLM v0.26.0 发布:新增 Inkling 模型支持与 DeepSeek-V4 性能优化

vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和

7月26日周日 · 1 条
正文结构化主题已通过公开置信门槛
Berkeley AI Research Blog一手来源研究

ABBEL:通过信念评分提升 LLM 长时程交互效率

Berkeley AI Research 博客介绍了 ABBEL 框架,用于提升 LLM 在长时程交互中的信念更新效率。该框架通过将摘要视为信念状态并引入信念评分(如重建评分)来监督摘要内容,在 CollabBench 协作编码任务中,相比传统递归摘要,将性能差距缩小约 50%,并减少 50% 的训练步数。在 Combination Lock 任务中,结合领

7月25日周六 · 3 条
正文结构化主题已通过公开置信门槛
Ollama Releases一手来源产品发布

Ollama v0.32.4 发布:支持 Apple GPU 并优化 Qwen3 MoE 性能

Ollama 发布 v0.32.4 版本,新增对 Apple GPU 上 Laguna 模型的支持(通过 MLX 引擎),并优化了推测解码草稿模型的量化处理。同时修复了 Qwen3 MoE 模型中不同量化专家解码的问题,并提升了打包门控/上投影的速度(在 M5 Max 上提升约 4-9%)。

正文结构化主题已通过公开置信门槛
SGLang Releases一手来源产品发布

SGLang v0.5.16 发布:新增 DSpark 解码与 Inkling 模型支持

SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源产品发布

LiteLLM v1.95.0-dev.2 发布:镜像签名验证与多项修复

LiteLLM 发布了 v1.95.0-dev.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能改进,如为 Bedrock Nova Sonic 添加实时会话事件、为 guardrails 增加增量扫描选项、修复 SCIM 组成员同步问题,以及 UI 迁移到 shadcn

7月24日周五 · 3 条
正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.0.0-rc.2 发布:新增代理支持与移动端优化

Langfuse 发布 v4.0.0-rc.2 候选版本,包含多项新功能、修复和重构。新功能包括为代理后台执行添加数据库列、异步虚拟化 JSON 渲染器、移动端布局优化等。修复了消息和工具调用顺序、API 日志记录等问题,并移除了过时的 Postgres 和 ClickHouse 表。

正文结构化主题已通过公开置信门槛
PydanticAI Releases一手来源产品发布

PydanticAI v2.17.0 发布:性能优化与 Model Armor 修复

PydanticAI 发布 v2.17.0 版本,主要新增功能包括:RequestUsage 和 RunUsage 支持任意字段,为即将推出的 genai-prices 做准备;缓存每条消息的 OTel 序列化,避免 O(n²) 的插桩开销。同时修复了 Model Armor 响应块中 ContentFilterError 的识别问题,并记录了审核 wire

正文结构化主题已通过公开置信门槛
One Useful Thing观点

2026年夏季AI使用指南:选择最佳模型与代理系统

该指南比较了当前主流AI助手,指出ChatGPT和Claude是执行实际工作的最佳选择,而GPT-5.6 Sol和Claude的Opus/Fable模型在复杂任务中错误率更低。文章介绍了通过虚拟计算机使用代理系统的方法,并强调了权限设置和提示注入风险的重要性。