LangChain 1.3.15 发布:新增 trace_policy 与 reasoning_effort 支持
LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace_policy、为 wrap_tool_call 添加 state_schema 参数、在 init_chat_model 中支持 LangSmith provider,以及将 reasoning_effort 作为标
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 40 条
LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace_policy、为 wrap_tool_call 添加 state_schema 参数、在 init_chat_model 中支持 LangSmith provider,以及将 reasoning_effort 作为标
NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。
Vercel AI SDK 发布 ai@6.0.249 版本,主要修复了取消操作后聊天流未正确停止以及恢复流时可能应用过期更新的问题。同时更新了 @ai-sdk/gateway 依赖至 3.0.169。
NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可
llama.cpp 发布 b10361 版本,修复了 EXAONE 4.5 模型滑动窗口注意力(SWA)未启用的问题,该问题源于 hparams 加载顺序错误,导致 MTP 头模型被误判。同时修复了元数据加载路径中 TENSOR_SKIP 张量处理问题,并添加了相关测试。该版本提供了多平台二进制下载。
Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并
另有 1 家信源报道
Pixieset 通过 Amazon Bedrock 开发了 AI 图像替代文本生成功能,解决了摄影师为大量图片手动编写 alt text 的痛点。该功能在 4 个月内从概念到上线,首周为超过 75 万张照片生成了替代文本,并实现了 35% 的用户采用率。Pixieset 采用逐步信任的设计,让用户逐张审核 AI 生成的描述,并利用 Bedrock 的跨区域
Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务
Langfuse 发布了 v4.9.0 版本,主要修复了在 trace 聊天视图中渲染 OpenAI Responses API 请求输入的问题,并新增了自托管实例切换器功能。该版本还迎来了新贡献者 DavidTraina 的首次贡献。
llama.cpp 发布 b10360 版本,主要修复了 common/peg 模块中不完整的转义序列问题。该版本提供了适用于 macOS、Linux、Android、Windows 及 openEuler 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr
另有 1 家信源报道
NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单
Langfuse 发布 v4.8.0 版本,主要新增了应用内代理功能,允许用户在一次对话中批准一次工具使用。同时修复了 OpenTelemetry 中 Anthropic 缓存令牌别名映射和评估过滤器选项加载的问题,并更新了依赖库版本。
llama.cpp 发布 b10359 版本,主要修复了 ggml-webgpu 的 CI 错误,并添加了 i32 支持到 cpy 操作。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。
在InfoQ的演讲中,Doubleword公司的Meryem Arik指出多数公司在推理上超支2到5倍,甚至一个数量级,因为未优化推理栈。她介绍了如何从零设计推理系统以最低成本生成token,强调非实时、高token量用例(如离线代理、数据生成)的增长,并对比了Cerebras等低延迟但高成本方案与低成本高延迟方案的权衡。
谷歌创始人布林紧急接管Gemini团队,但据SemiAnalysis分析,Gemini 3.5 Pro已被悄悄取消,谷歌面临旗舰模型缺失的困境。同时,谷歌内部发生重大人事变动,包括哈萨比斯卸任DeepMind CEO、Jeff Dean等元老离职,以及算力分配问题(如向Anthropic提供TPU)引发战略争议。布林重新深度参与Gemini战略,但谷歌在AI
llama.cpp 发布 b10358 版本,主要修复了 PR 25532 的评审意见。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Langfuse 发布 v4.7.0 版本,包含多项新功能与修复。新功能包括新的会话头部、自动化 webhook 操作改进、应用内代理工具审批跟踪、OTel 流量自动直写、PostHog 和 Mixpanel 集成等。修复涉及代理会话取消、仪表板成本显示、MCP 工具模式验证、正则回溯 DoS 防护、Datadog 追踪中移除用户邮箱等。此外,还进行了多项性
llama.cpp 发布 b10357 版本,主要更新为在 OpenCL 的 FA prefill 内核中于本地内存转置 K 矩阵,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
geceff 在 Hugging Face 上发布了 Wan2.2 自定义 GGUF 模型仓库,针对 NVIDIA Tesla T4 等显存受限环境优化,提供量化模型、LoRA、文本编码器和 VAE。仓库包含高/低噪声量化模型及集成 SVI 和一致人脸功能的 FP8 模型,并给出了 ComfyUI 推荐参数和不同硬件的使用建议。
audio.cpp 项目发布了多个语音模型的 GGUF 量化版本,涵盖 TTS、ASR、语音转换、源分离和说话人分离等任务。这些模型基于 ACE-Step、Qwen、NVIDIA 等多家机构的基础模型转换而来,支持 16-bit 和 Q8 量化格式,并提供了详细的测试状态和兼容性说明。该发布旨在通过 GGUF 格式提升语音模型在本地部署的效率和可移植性。
llama.cpp 发布 b10356 版本,主要将 ROCm 构建目标从 7.2.1 升级到 7.14,这是首个采用 TheRock 构建系统的生产版本,并调整了 Linux 和 Windows 的 ROCm 相关 CI 配置。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,支持多种后端如 CUDA、V
Ray 2.57.0 发布,主要更新包括 Ray Data 默认启用 DataSourceV2,引入基于任务的 Hash Shuffle V2 以优化内存使用,并支持 join 操作;Ray Serve 将 HAProxy 作为独立 PyPI 包分发,新增 gRPC 支持,并为 LLM 提供实验性的 KV 缓存感知路由;Ray Core 新增嵌入式 Rock
本期资讯涵盖多个AI相关动态:DeepSeek回应了用户被取外号的争议,解释为临时对话标签;千问办公助理推出收费服务;DeepSeek-V4-Flash正式版周调用量全球第一;英伟达计划筹集5000亿美元用于AI基建;扎克伯格呼吁美国放宽开源AI限制。此外,还包括携程反垄断罚单、苹果测试长鑫存储芯片、宇树科技IPO等商业新闻。
llama.cpp 发布 b10355 版本,主要支持多输出后端采样功能,并修复了 CPU 与 GPU 之间的采样差异及 Vulkan 测试问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10354 版本,主要修复了 Android 上 CPU 亲和性掩码被忽略的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。
llama.cpp 发布 b10353 版本,修复了 CUDA 和 Metal 后端中 ggml_roll 操作对非连续输入产生错误结果的问题。该修复要求 src 张量连续,并添加了相应的测试用例。同时提供了多个平台的预编译二进制文件。
vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和
AX1Y2JP 发布了 MiniMax-H3 的量化版本,基于 Comfy-Org/MiniMax-H3,采用 W4A8 量化,并支持 ComfyUI 原生运行。该模型在 4070Ti 上展示了示例结果,用户需使用最新版 ComfyUI 和 comfy-kitchen,并重新下载更新后的模型。
DeepSpeed 发布了 v0.19.5 补丁版本,包含多项修复和改进。主要修复了 ZeRO++ 小参数二次分片复制、ZeRO-3 异步梯度卸载与固定卸载缓冲区、AutoEP 在 ZeRO-1/2 下的通用转换问题,以及 torch 2.12+ 的编译错误。此外,新增了独立的 pin_memory 操作,并支持 ZeRO 卸载下的非托管梯度累积。
llama.cpp 发布 b10344 版本,主要新增了对 Nemotron 模型的多 token 预测(MTP)支持,并引入了 mtp_flags 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,方便用户部署。
llama.cpp 发布了 b10343 版本,主要更新是将 cpp-httplib 库升级至 0.53.0。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平
Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090
llama.cpp 新增 Granite-Switch 架构后端,支持带多个 LoRA 适配器的模型,通过控制 token 实现逐 token 切换。该实现采用路由注意力机制在图中恢复适配器索引,解决了并发序列隔离问题,但存在单序列内无法回退的已知限制。目前支持 CPU 和 Mac (Metal) 构建,并已通过相关测试。
本期 Import AI 468 报道了 IFP 智库提出的 23 项应对 AI 研发自动化(RSI)风险的政策建议,涵盖透明度、风险管理和国际合作等七类。MIT 和哥伦比亚大学的研究《Racing to Ruin》通过博弈论分析指出,信任与透明度是 AI 企业实现协调减速的关键变量。此外,还包含一篇关于未来 AI 交互的科幻短篇故事。
初创公司Discovered Materials利用AI代理群寻找新型半导体材料,以解决芯片过热问题,并已获得900万美元种子轮融资。该公司结合Anthropic模型和自训练的物理模型进行材料筛选,已发现多种与现有芯片材料性能匹配的新材料,但尚未公开细节。其创始人认为,AI加速了材料发现过程,但实际合成仍是瓶颈。
twaggs88 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,这是一个 284B 参数的 MoE 模型,通过 IQ2_XXS_MMQ、MXFP4 和 MXFP8 等量化技术压缩至 92GB,可在 NVIDIA GB10 设备上全量运行。该版本包含完整的 256 个专家,并集成了 DSpark 投机解码草稿模型,支持长上下文和
llama.cpp 发布 b10338 版本,修复了模型保存时共享专家 FFN 长度键被覆盖的 bug,该问题导致 MoE 模型(如 qwen2moe、granite-moe 等)在保存后无法重新加载。修复后,共享专家和分块 FFN 长度均能正确保存,并添加了相应测试。
DreamFast 发布了基于 Google Gemma 3 12B IT 的 abliterated 版本 Heretic v2,通过 Heretic v1.3.0 减少模型拒绝行为,同时保持质量,并针对视频生成模型 LTX-2 优化。该模型提供 FP8、INT8 (ConvRot)、NVFP4、MXFP8 和 GGUF 等多种量化格式,支持从 Ada 到