Claude 平台更新:发布 Opus 5 并增强托管代理功能
Anthropic 发布了 Claude Opus 5 模型,支持 1M token 上下文窗口和 128k 最大输出 token,定价与 Opus 4.8 相同,并已上线多个云平台。Claude Managed Agents 新增了会话预算、顾问模型、推理地理位置控制、GitHub 技能加载和初始事件种子等功能。推理钩子功能在 Claude Enterpr
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1730 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Anthropic 发布了 Claude Opus 5 模型,支持 1M token 上下文窗口和 128k 最大输出 token,定价与 Opus 4.8 相同,并已上线多个云平台。Claude Managed Agents 新增了会话预算、顾问模型、推理地理位置控制、GitHub 技能加载和初始事件种子等功能。推理钩子功能在 Claude Enterpr
LMDeploy 发布 v0.15.0 版本,新增对 DeepSeek V4 的支持,并引入长上下文和 MTP 前缀缓存命中、推测解码的引导解码、内存分配器与调度器集成等特性。同时优化了 TTFT、流式响应解析、FP8 MoE 等性能,并修复了多项 bug,包括前缀缓存、Triton FP8 通信、多模态工具消息解析等。
Xinference 发布 v3.1.0 版本,新增 SSO/OIDC 登录、模型 worker 多选、Qwen3-ASR 批量转录、推测解码等功能,并支持 MiniMax-M3 模型。同时修复了 Slow HTTP DoS 漏洞、多副本启动错误、虚拟环境依赖等问题,并优化了 Docker 构建和模型 JSON 更新。
Anthropic 报告 Claude Opus 4.8 出现性能降级,影响 claude.ai、Claude API、Claude Code 和 Claude Cowork。目前该事件已解决,团队正在调查原因。
Langfuse 发布了 v3.224.4 版本,主要包含三项修复:移除 v3 维护分支上的最新标记、根据部署写入模式推导仪表盘小部件的最低版本、以及更新不存在的仪表盘时返回 404 而非 500。这些修复均为 v3 分支的后向移植,旨在提升 API 和仪表盘的稳定性。
Anthropic 的 AI 安全模型 Mythos 在 NIST 第三轮后量子密码算法筛选中发现了 HAWK 数字签名方案的漏洞,导致该算法被淘汰。HAWK 开发者随后宣布撤回该算法。Mythos 还发现了 AES 密码的弱点,但这些发现是渐进式的,并未破坏当前使用的加密系统。
PydanticAI 发布 v2.20.0 版本,新增对 Claude Opus 5 模型的支持,并为 OpenAI Responses API 的 gpt-5.4/5.5/5.6 系列添加 reasoning.context 支持。同时修复了多个 bug,包括保留任意 RequestUsage 字段、捕获 Anthropic 思考令牌、修复嵌入请求守卫等。
Grafana Labs 扩展了其 AI 可观测性助手 Grafana Assistant,使其能够通过自然语言查询和关联超过 30 个数据源,旨在实现“统一可观测性”。该助手可帮助运维人员、开发者和 SRE 调查事件、生成查询并排查复杂分布式系统,而无需在多个监控工具之间切换。此次更新新增了对 Snowflake、Oracle、Elasticsearch、
OpenAI Agents JavaScript SDK 发布 v0.14.0 版本,新增程序化工具调用支持,允许模型生成托管 JavaScript 来协调工具并减少中间结果。默认禁用敏感模型和工具数据日志,并默认启用任务和回合追踪。取消信号现在传播到函数和 MCP 工具,同时支持 AI SDK 7 和 Vercel S3 桶挂载。
OpenAI 报告其 gpt 5.1 mini 和 gpt 4.1 mini 模型出现延迟升高、超时和流式传输中断的性能问题,影响相关 API 服务。问题于 2026 年 7 月 27 日下午开始调查,并在约两小时后解决,所有受影响服务已完全恢复。
Agno 发布 v2.8.5 版本,新增 AgentOSTools 工具用于报告 AgentOS 的使用情况、延迟、失败、调度、评估、组件和待批准事项。改进包括为 PostgresDb 和 SqliteDb 添加按代理、团队、工作流或端点分组的延迟和错误统计,以及工具和模型调用统计。Moonshot 默认模型改为 kimi-k3,新增 thinking 模式
Netflix 详细介绍了其内部 LLM 服务平台的架构,该平台基于 JVM 服务层,使用 Triton 进行模型管理和调度,并选择 vLLM 作为 GPU 推理引擎。平台面临模型大小、硬件需求和推理引擎快速演变的挑战,通过版本固定、扩展点和部署策略解决兼容性问题。Netflix 的经验表明,通用服务接口虽能抽象底层差异,但打包、兼容性控制和约束解码等工程工
vLLM 发布 v0.26.0 版本,包含 411 个提交,来自 212 位贡献者。新版本支持 Inkling 模型系列,并针对 DeepSeek-V4 进行了性能优化,包括专用路由内核和 fused topk bias 等。此外,引入了 fp32 lm head 选项、灵活的注意力后端选择,并增强了 KV 卸载和分层存储功能。Rust 前端新增多模态视频和
Berkeley AI Research 博客介绍了 ABBEL 框架,用于提升 LLM 在长时程交互中的信念更新效率。该框架通过将摘要视为信念状态并引入信念评分(如重建评分)来监督摘要内容,在 CollabBench 协作编码任务中,相比传统递归摘要,将性能差距缩小约 50%,并减少 50% 的训练步数。在 Combination Lock 任务中,结合领
Ollama 发布 v0.32.4 版本,新增对 Apple GPU 上 Laguna 模型的支持(通过 MLX 引擎),并优化了推测解码草稿模型的量化处理。同时修复了 Qwen3 MoE 模型中不同量化专家解码的问题,并提升了打包门控/上投影的速度(在 M5 Max 上提升约 4-9%)。
SGLang 发布 v0.5.16,包含 574 个 PR,来自 169 位贡献者。新特性包括 DSpark 置信度驱动的投机解码算法,在 DeepSeek-V4-Pro 上达到 383.7 tok/s;支持 975B 参数的 Inkling 多模态 MoE 模型;以及多项性能优化和模型支持。同时移除了实验性的 QServe 和 FBGEMM FP8 量化路
LiteLLM 发布了 v1.95.0-dev.2 版本,所有 Docker 镜像均使用 cosign 签名,并提供了通过固定提交哈希或发布标签验证签名的方法。该版本包含多项修复和功能改进,如为 Bedrock Nova Sonic 添加实时会话事件、为 guardrails 增加增量扫描选项、修复 SCIM 组成员同步问题,以及 UI 迁移到 shadcn
Langfuse 发布 v4.0.0-rc.2 候选版本,包含多项新功能、修复和重构。新功能包括为代理后台执行添加数据库列、异步虚拟化 JSON 渲染器、移动端布局优化等。修复了消息和工具调用顺序、API 日志记录等问题,并移除了过时的 Postgres 和 ClickHouse 表。
PydanticAI 发布 v2.17.0 版本,主要新增功能包括:RequestUsage 和 RunUsage 支持任意字段,为即将推出的 genai-prices 做准备;缓存每条消息的 OTel 序列化,避免 O(n²) 的插桩开销。同时修复了 Model Armor 响应块中 ContentFilterError 的识别问题,并记录了审核 wire
该指南比较了当前主流AI助手,指出ChatGPT和Claude是执行实际工作的最佳选择,而GPT-5.6 Sol和Claude的Opus/Fable模型在复杂任务中错误率更低。文章介绍了通过虚拟计算机使用代理系统的方法,并强调了权限设置和提示注入风险的重要性。