DSPy 3.1.3 发布:修复 RLMs 与 GEPA 问题
斯坦福大学 NLP 团队发布了 DSPy 3.1.3 版本,主要修复了 RLMs 和 GEPA 的多个问题,包括代码解释器、代码围栏解析、变量注入、工具序列化等,并更新了 GEPA 依赖以支持缓存评估和 Python 3.14。此外,该版本还稳定了真实 LM 测试,并处理了 ColBERTv2 服务器的错误响应。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1731 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
斯坦福大学 NLP 团队发布了 DSPy 3.1.3 版本,主要修复了 RLMs 和 GEPA 的多个问题,包括代码解释器、代码围栏解析、变量注入、工具序列化等,并更新了 GEPA 依赖以支持缓存评估和 Python 3.14。此外,该版本还稳定了真实 LM 测试,并处理了 ColBERTv2 服务器的错误响应。
MLX 发布了 v0.30.5 版本,包含多项修复和优化,如 CUDA 事件回退、B200/H100 图形大小调整、Metal splitk GEMM 调优、ALiBi 斜率修复等。该版本还改进了分布式示例文档和错误提示,并修复了 Windows 测试问题。
百度飞桨框架发布3.3.0版本,重点提升大模型训练效率、开发体验和国产硬件适配。新版本升级了FlashMaskV3稀疏注意力内核,性能超越FlexAttention,并推出FlexCheckpoint参数自动切分重组系统,权重转换性能比Megatron-LM快1.2倍以上。同时引入虚拟内存动态碎片整理技术,将MoE模型显存碎片率从10%降至3%。此外,新版本
百度千帆平台在2026年1月23日更新了模型服务,deepseek-v3.2-think支持交错思考,Anthropic API支持通过safety参数调整安全等级。在Agent开发方面,RAG功能新增支持Qwen-Embedding-4B模型,优化了文本解析与检索效果,并新增研报底稿功能及生成模式选择(性能优先与效果优先)。
DSPy 发布了 3.1.2 维护版本,主要修复了 RAG 教程中的下载问题、改进了 JSON 解析(移除了初始正则提取),并更新了设置保存/加载方法。此外,Parallel 组件新增了 timeout 和 straggler limit 参数,CI 流程也进行了调整。该版本包含来自新贡献者的代码,提升了库的稳定性和可用性。
Hugging Face 发布 smolagents v1.24.0,包含多项修复和改进:为已弃用的 HfApiModel 添加向后兼容性,支持向 apply chat template 传递额外参数,实现 Python 执行的稳健超时机制,并兼容 Gradio 6。此外,更新了无停止序列模型列表以支持 gpt-5.2 ,并修复了多个 bug。
百度千帆平台在2026年1月9日更新了模型服务,包括Qwen3-30B-A3B-Instruct-2507支持混合TPM配额,DeepSeek-V3.2开启分段计费并支持前缀缓存(白名单内测),以及自定义接入点功能。同时,工具广场新增了智能商品搜索、商品生动化标题生成MCP和百度彩票走势MCP等工具。
Ray 发布了 2.53.0 版本,宣布将在 2.56.0 版本中停止支持 Pydantic V1,并新增了 Kafka 数据源和 Iceberg 支持。Ray Data 引入了基于利用率的集群自动缩放器、数据集摘要 API 和多项性能优化。Ray Serve 增加了部署拓扑可见性、外部自动缩放器集成和自定义批处理大小函数等功能。
Hugging Face 发布了文本生成推理库 Text Generation Inference 的 v3.3.7 版本。该版本新增了 max image fetch size 参数以限制图像获取大小,修复了当 NVIDIA VISIBLE DEVICES 为 'all' 或 'void' 时设备数量自动计算的问题,并引入了维护模式。这些更新旨在提升推理服
Gemini API 在 v1beta 版本中对 Interactions API 进行了破坏性变更,将 total reasoning tokens 字段重命名为 total thought tokens,以更好地与思考模型中的“thoughts”概念对齐。
Gemini API 于 2025 年 12 月 10 日发布了文本转语音模型的增强功能,推出 Gemini 2.5 Flash TTS 预览版(针对低延迟优化)和 Gemini 2.5 Pro TTS 预览版(针对质量优化),增强了表现力、精确节奏和无缝对话能力。
Google DeepMind 与 Google Research 联合发布了最先进的天气预报模型 WeatherNext 2,其生成预报的速度比之前快 8 倍,分辨率可达每小时。该模型采用新的功能生成网络(FGN)方法,能够从单一输入预测数百种可能的天气情景,并在 99.9% 的变量和预测时效上超越前代模型。WeatherNext 2 的预报数据现已通过
Hugging Face 发布了 smolagents v1.23.0,新增了对话模式 CLI、Blaxel 远程代码执行支持、指数退避重试、自定义 Python 执行器等功能,并修复了多个 bug。该版本还改进了文档翻译,并将默认推理模型改为 Qwen3-Next-80B-A3B-Thinking。
Google DeepMind 发布了 T5Gemma,这是一系列通过模型适配技术将预训练的仅解码器模型转换为编码器-解码器架构的模型,基于 Gemma 2 框架,包括适配的 2B 和 9B 模型以及新训练的 T5 规模模型。实验表明,T5Gemma 在多个基准上达到或超过仅解码器对应模型的性能,并在推理效率上具有优势,例如 T5Gemma 9B-2B 在
Google DeepMind 发布了 Gemini 2.5 Flash-Lite 的稳定版,这是 Gemini 2.5 系列中速度最快、成本最低的模型,输入每百万 token 0.10 美元,输出每百万 token 0.40 美元。该模型支持原生推理能力、100 万 token 上下文窗口,并已应用于 Satlyt、HeyGen 等客户场景。稳定版现已通过
微软发布了 AutoGen Python 库的 v0.7.5 版本,包含多项修复和改进。主要更新包括:修复 Bedrock、Azure AI 和 OpenAI 客户端的流式响应问题,为 Anthropic 客户端添加思考模式支持,修复 Redis 缓存和内存问题,改进 JSON schema 转换,并默认使用 DockerCommandLineCodeExe
Hugging Face 发布了文本生成推理(TGI)库的 v3.3.6 补丁版本,主要修复了缺失的反斜杠、FlashInfer 的 mask 传递问题,并移除了 Azure 相关代码,同时回滚了依赖版本更新。该版本还更新了流式演示的 iframe 源,并引入了两位新贡献者。
Hugging Face 发布了文本生成推理库 Text Generation Inference 的 v3.3.5 版本。该版本主要针对 Gaudi 硬件进行了多项优化,包括改进 rope 内存管理、支持 Gemma3 滑动窗口、Deepseek v2 MLA 等,并增加了 XPU 的 LoRA 支持、更新了 Optimum Neuron 依赖,同时修复了
腾讯开源了 Hunyuan-A13B 大语言模型,采用细粒度 MoE 架构,总参数 800 亿,激活参数 130 亿,支持 256K 上下文和混合推理模式。该模型在数学、科学和智能体等基准测试中表现优异,并提供了技术报告和训练推理手册。
微软发布了 AutoGen Python 库 v0.6.2 版本,引入了流式工具支持,更新了 AgentTool 和 TeamTool 以支持 run json stream,并新增了 tool choice 参数、AssistantAgent 内部工具调用循环、OpenTelemetry GenAI 追踪、Mem0 内存扩展等多项功能。这些更新增强了 Au