PydanticAI v2.16.0 发布:新增 Mistral 缓存与 Gemini 模型支持
PydanticAI 发布 v2.16.0 版本,新增 Mistral 提示缓存键、ToolFailed 错误类型、可选 run id 参数,并支持 Google Model Armor 及新的 Gemini 模型。同时修复了多个 bug,包括 ctx.enqueue() 错误一致性和工具重试计数问题。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1731 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
PydanticAI 发布 v2.16.0 版本,新增 Mistral 提示缓存键、ToolFailed 错误类型、可选 run id 参数,并支持 Google Model Armor 及新的 Gemini 模型。同时修复了多个 bug,包括 ctx.enqueue() 错误一致性和工具重试计数问题。
DeepSpeed 发布了 v0.19.3 补丁版本,包含多项修复和功能改进。主要修复了 ZeRO-3 中的数据类型处理问题、文件描述符泄漏、CUDA 上下文初始化等 bug,并新增了 AutoEP 与 AutoTP 并行折叠、EXAONE 4.5 模型推理支持、混合引擎用于在线策略蒸馏等功能。此外,还改进了 CI 流程、类型提示和文档。
Ollama 发布 v0.32.3 版本,修复了模型下载停滞、GLM 工具调用丢失等问题,并改进了 Claude Code 通道和 Anthropic 思考流等集成。该版本扩展了 GPU 支持,包括 Windows ARM64 上的 CUDA、通过 CUDA 12 支持 B200,并降低了 Linux 上 CUDA/ROCm iGPU 的内存使用。此外,为
Gemini API 于 2026 年 7 月 21 日发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 的正式版(GA)。Gemini 3.6 Flash 提升了 token 效率,增强了代码与智能体规划能力,价格低于 3.5 Flash,并解决了输出冗长的问题;Gemini 3.5 Flash-Lite 则作为低延迟
Haystack 3.0 发布,重点提升生产级 Agent 构建能力,新增钩子系统、技能支持、异步工具和内置可观测性。Pipeline 统一同步/异步接口,移除旧版生成器,组件迁移至独立包,并加强反序列化安全。
本文探讨了如何控制大语言模型(LLM)的推理努力程度,使其具备低、中、高多种推理模式。文章回顾了推理模型的发展,如OpenAI的o1和DeepSeek-R1,并介绍了通过强化学习(RLVR)训练推理模型的方法,以及推理时计算扩展的概念。作者还提到了GPT-5.6系列模型提供多种推理努力设置,并计划深入讲解多努力模式模型的开发方法。
Ray 发布 2.56.1 版本,主要修复了 Ray Data 中 to pandas 的回归问题、Ray Core 中系统内存压力检测、Ray Serve 的 protobuf 7 兼容性及 LLM 直接流式路由问题,并升级了 RLlib 的 ONNX 示例。这些修复提升了数据转换稳定性、内存管理和 LLM 推理性能。
NVIDIA 发布博客,强调后训练(post-training)是代理式 AI 时代的关键工作负载,并提出“每美元智能”(intelligence per dollar)作为核心指标。文章介绍了 NVIDIA 的 Vera Rubin 平台和 Nemotron 3 Ultra 模型,旨在通过降低推理成本来提升智能收益,并列举了 Prime Intellect
Agno 发布 v2.7.4 版本,新增 SuperserveTools、PlivoTools 和 The Context Company 可观测性集成,并改进了 agno create 命令、Telegram、Tavily、Google 等工具。同时修复了多个 bug,包括团队会话、工作流、Slack 会话隔离等问题。
Hugging Face Transformers 发布了补丁版本 v5.14.1,修复了集成 Inkling 模型时出现的多个问题,包括影响使用 EncoderDecoderCache 的模型在辅助生成(assisted generation)过程中的问题,以及 Inkling 模型在 prefill 阶段使用 StaticCache 和 sdpa 且无
Ollama 发布 v0.32.1 版本,改进了 Gemma 4 的工具调用和多轮推理能力,修复了 MLX 模型缓存泄漏问题,并优化了缓存快照性能。此外,该版本还支持在 MLX 文本模型加载时遵守 OLLAMA LOAD TIMEOUT 设置,并增强了代理的 Web 搜索和获取功能,提示用户进行身份验证。
Hugging Face Transformers 库发布 v5.14.0 版本,新增了 Thinking Machines 的 Inkling 多模态模型(975B 总参数,41B 激活)和 TIPSv2 系列模型,并进行了多项性能优化和错误修复。该版本还引入了多 token 预测解码支持、静态集成验证等生成改进,并修复了 GPTNeoX 和 GPTBig
vLLM 发布 v0.25.1 补丁版本,包含两项关键修复:一是避免在系统缺少 FFmpeg 时因 TorchCodec 导入错误而阻塞模型启动;二是修复混合精度下 allreduce 与 RMSNorm 量化融合可能导致的输出损坏问题。该版本由两位贡献者提交,其中一位为首次贡献。
SGLang 发布了 v0.5.15.post1 补丁版本,主要针对 GLM 5.2 模型进行修复。修复内容包括 DSA 模型在非 CUDA/HIP 设备上的启动问题、flashinfer 在 CUDA 12 镜像上的依赖问题、长输入下 FP4 MoE 内核导致的 NaN 输出,以及 GLM 5.2 在 PD 分离和上下文并行设置下的 IndexShare
vLLM 发布 v0.25.0 版本,包含 558 个提交,来自 232 位贡献者。该版本将 Model Runner V2 设为所有稠密模型的默认执行路径,并移除了 PagedAttention 遗留实现。新模型支持包括 LLaVA-OneVision-2、GLM-5、DeepSeek-V3.2 等,并引入了新的流式解析引擎和通用投机解码。性能优化涵盖 G
Transformers 发布了补丁版本 v5.13.1,主要目的是支持最新版本的 vllm。该补丁包含三项修复:对自定义模型的 remap legacy layer types 进行更防御性处理、修复不了解新线性层类型名称的自定义代码、修复 LazyAutoMapping.register 接收字符串键的情况。这些修复由 hmellor 贡献。
LangGraph CLI 发布 0.4.31 版本,主要更新包括允许 langgraph-api 版本最高至 1.0.0,支持为 langgraph deploy 使用预构建镜像,并更新了多个依赖(如 starlette、langsmith、cryptography 等)。这些改动提升了部署灵活性和安全性。
OpenAI Agents JavaScript 库发布 v0.13.1 版本,新增对 GPT-5.6 模型系列的兼容默认设置,并支持 OpenAI 6.46.0 的使用类型。同时更新了文档和开发依赖。
OpenAI 发布了 agents-python 库的 v0.18.1 版本,主要新增了 GPT-5.6 模型默认配置并迁移了示例,同时修复了多个问题,包括缓存写入兼容性、会话清理、嵌套工具状态恢复、流式日志概率累积等。该版本还改进了文档,并新增了两位贡献者。
Mastra 发布 2026 年 7 月 6 日更新,推出 @mastra/livekit 包,可将 Mastra 代理转为实时语音代理,由 LiveKit 处理音频循环,Mastra 驱动回复、工具和记忆。同时新增文件系统路由的 Mastra 原语(storage、observability、workflows 等)和零样板启动,统一了调度 API(心跳改