返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 40

8月12日星期三 · 7
LangChain Releases一手来源产品发布36

LangChain 1.3.15 发布:新增 trace_policy 与 reasoning_effort 支持

LangChain 发布了 1.3.15 版本,包含多项功能更新和错误修复。新增功能包括在 AgentMiddleware 中暴露 trace_policy、为 wrap_tool_call 添加 state_schema 参数、在 init_chat_model 中支持 LangSmith provider,以及将 reasoning_effort 作为标

NVIDIA Technical Blog一手来源产品发布37

NVIDIA JetPack 7.2.1 新增 Agentic 视频技能与 PyNvVideoCodec 支持

NVIDIA 发布 JetPack 7.2.1,首次在 Jetson 平台支持 PyNvVideoCodec 2.2,提供硬件加速视频编解码的 Python 接口,并引入基于 agent 的视频技能,帮助开发者自动配置、验证和基准测试编解码流程。该版本旨在加速 Jetson 上的 AI 应用开发,提升视频处理管线的效率和可复现性。

Hugging Face New and Trending Models一手来源模型发布39

NVIDIA 发布 Nemotron 3.5 Lightning 30B 混合架构模型

NVIDIA 发布了 Nemotron-3.5-Lightning-30B-A3B-NVFP4 模型,采用 MoE 架构,总参数 30B,激活参数 3B,支持长达 1M 的上下文,并针对单 GPU 部署优化。该模型支持多种硬件,并提供了 DSpark 等投机解码方法以加速生成。基准测试显示其在编码和智能体任务上表现良好,模型采用 OpenMDW-1.1 许可

llama.cpp Releases一手来源产品发布34

llama.cpp b10361 修复 EXAONE 4.5 SWA 启用问题

llama.cpp 发布 b10361 版本,修复了 EXAONE 4.5 模型滑动窗口注意力(SWA)未启用的问题,该问题源于 hparams 加载顺序错误,导致 MTP 头模型被误判。同时修复了元数据加载路径中 TENSOR_SKIP 张量处理问题,并添加了相关测试。该版本提供了多平台二进制下载。

Google Research Blog一手来源研究23

Google 推进 AMIE 实现专家级视听临床咨询

Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并

另有 1 家信源报道

AWS Machine Learning Blog一手来源产品发布33

Pixieset 借助 Amazon Bedrock 实现 35% AI 功能采用率

Pixieset 通过 Amazon Bedrock 开发了 AI 图像替代文本生成功能,解决了摄影师为大量图片手动编写 alt text 的痛点。该功能在 4 个月内从概念到上线,首周为超过 75 万张照片生成了替代文本,并实现了 35% 的用户采用率。Pixieset 采用逐步信任的设计,让用户逐张审核 AI 生成的描述,并利用 Bedrock 的跨区域

8月11日星期二 · 24
THE DECODER模型发布20

Nvidia发布Nemotron 3.5 Lightning:小参数高速度,性能对标GPT-oss-120b

Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务

llama.cpp Releases一手来源产品发布27

llama.cpp b10360 发布:修复转义序列问题

llama.cpp 发布 b10360 版本,主要修复了 common/peg 模块中不完整的转义序列问题。该版本提供了适用于 macOS、Linux、Android、Windows 及 openEuler 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

NVIDIA Technical Blog一手来源模型发布44

NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr

另有 1 家信源报道

NVIDIA Technical Blog一手来源产品发布29

NVIDIA NeMo Switchyard:跨模型路由 AI 代理工作负载

NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单

Langfuse Releases一手来源产品发布27

Langfuse v4.8.0 发布:新增代理工具审批与多项修复

Langfuse 发布 v4.8.0 版本,主要新增了应用内代理功能,允许用户在一次对话中批准一次工具使用。同时修复了 OpenTelemetry 中 Anthropic 缓存令牌别名映射和评估过滤器选项加载的问题,并更新了依赖库版本。

llama.cpp Releases一手来源产品发布25

llama.cpp b10359 发布:修复 WebGPU CI 错误并支持多平台

llama.cpp 发布 b10359 版本,主要修复了 ggml-webgpu 的 CI 错误,并添加了 i32 支持到 cpy 操作。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

InfoQ AI ML and Data Engineering观点4

生产全球最便宜Token的实用指南

在InfoQ的演讲中,Doubleword公司的Meryem Arik指出多数公司在推理上超支2到5倍,甚至一个数量级,因为未优化推理栈。她介绍了如何从零设计推理系统以最低成本生成token,强调非实时、高token量用例(如离线代理、数据生成)的增长,并对比了Cerebras等低延迟但高成本方案与低成本高延迟方案的权衡。

量子位商业8

谷歌创始人布林紧急接管Gemini团队,Gemini 3.5 Pro被取消

谷歌创始人布林紧急接管Gemini团队,但据SemiAnalysis分析,Gemini 3.5 Pro已被悄悄取消,谷歌面临旗舰模型缺失的困境。同时,谷歌内部发生重大人事变动,包括哈萨比斯卸任DeepMind CEO、Jeff Dean等元老离职,以及算力分配问题(如向Anthropic提供TPU)引发战略争议。布林重新深度参与Gemini战略,但谷歌在AI

llama.cpp Releases一手来源产品发布23

llama.cpp b10358 发布:修复评审意见并更新多平台构建

llama.cpp 发布 b10358 版本,主要修复了 PR 25532 的评审意见。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

Langfuse Releases一手来源产品发布22

Langfuse v4.7.0 发布:新增代理工具审批跟踪与多项修复

Langfuse 发布 v4.7.0 版本,包含多项新功能与修复。新功能包括新的会话头部、自动化 webhook 操作改进、应用内代理工具审批跟踪、OTel 流量自动直写、PostHog 和 Mixpanel 集成等。修复涉及代理会话取消、仪表板成本显示、MCP 工具模式验证、正则回溯 DoS 防护、Datadog 追踪中移除用户邮箱等。此外,还进行了多项性

llama.cpp Releases一手来源产品发布21

llama.cpp b10357 发布:OpenCL FA prefill 内核优化

llama.cpp 发布 b10357 版本,主要更新为在 OpenCL 的 FA prefill 内核中于本地内存转置 K 矩阵,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

Hugging Face New and Trending Models一手来源模型发布21

Wan2.2 自定义 GGUF 模型发布:针对 T4 优化

geceff 在 Hugging Face 上发布了 Wan2.2 自定义 GGUF 模型仓库,针对 NVIDIA Tesla T4 等显存受限环境优化,提供量化模型、LoRA、文本编码器和 VAE。仓库包含高/低噪声量化模型及集成 SVI 和一致人脸功能的 FP8 模型,并给出了 ComfyUI 推荐参数和不同硬件的使用建议。

Hugging Face New and Trending Models一手来源开源13

audio.cpp 发布多语音模型 GGUF 量化包

audio.cpp 项目发布了多个语音模型的 GGUF 量化版本,涵盖 TTS、ASR、语音转换、源分离和说话人分离等任务。这些模型基于 ACE-Step、Qwen、NVIDIA 等多家机构的基础模型转换而来,支持 16-bit 和 Q8 量化格式,并提供了详细的测试状态和兼容性说明。该发布旨在通过 GGUF 格式提升语音模型在本地部署的效率和可移植性。

llama.cpp Releases一手来源产品发布19

llama.cpp b10356 发布:ROCm 升级至 7.14

llama.cpp 发布 b10356 版本,主要将 ROCm 构建目标从 7.2.1 升级到 7.14,这是首个采用 TheRock 构建系统的生产版本,并调整了 Linux 和 Windows 的 ROCm 相关 CI 配置。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,支持多种后端如 CUDA、V

Ray Releases一手来源产品发布18

Ray 2.57.0 发布:数据、Serve 与 Core 多项增强

Ray 2.57.0 发布,主要更新包括 Ray Data 默认启用 DataSourceV2,引入基于任务的 Hash Shuffle V2 以优化内存使用,并支持 join 操作;Ray Serve 将 HAProxy 作为独立 PyPI 包分发,新增 gRPC 支持,并为 LLM 提供实验性的 KV 缓存感知路由;Ray Core 新增嵌入式 Rock

雷峰网 AI科技评论商业5

DeepSeek回应取外号争议,千问办公助理收费,英伟达筹5000亿美元建AI基建

本期资讯涵盖多个AI相关动态:DeepSeek回应了用户被取外号的争议,解释为临时对话标签;千问办公助理推出收费服务;DeepSeek-V4-Flash正式版周调用量全球第一;英伟达计划筹集5000亿美元用于AI基建;扎克伯格呼吁美国放宽开源AI限制。此外,还包括携程反垄断罚单、苹果测试长鑫存储芯片、宇树科技IPO等商业新闻。

llama.cpp Releases一手来源产品发布17

llama.cpp b10355 发布:支持多输出后端采样

llama.cpp 发布 b10355 版本,主要支持多输出后端采样功能,并修复了 CPU 与 GPU 之间的采样差异及 Vulkan 测试问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

llama.cpp Releases一手来源产品发布16

llama.cpp b10354 发布:修复 Android CPU 亲和性掩码问题

llama.cpp 发布 b10354 版本,主要修复了 Android 上 CPU 亲和性掩码被忽略的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

llama.cpp Releases一手来源产品发布16

llama.cpp b10353 发布:修复 CUDA/Metal 的 ROLL 操作

llama.cpp 发布 b10353 版本,修复了 CUDA 和 Metal 后端中 ggml_roll 操作对非连续输入产生错误结果的问题。该修复要求 src 张量连续,并添加了相应的测试用例。同时提供了多个平台的预编译二进制文件。

vLLM Releases一手来源产品发布16

vLLM v0.27.0 发布:支持 Kimi K3、Qwen3.5,性能大幅提升

vLLM 发布 v0.27.0 版本,包含 561 个提交,来自 242 位贡献者。该版本新增对 Kimi K3、Qwen3.5、K-EXAONE-2.0 等模型的支持,并升级至 PyTorch 2.13.0,深化 FlashAttention 4 集成,优化 DeepSeek-V4 性能,扩展 Model Runner V2 至非生成任务,并引入容错框架和

Hugging Face New and Trending Models一手来源模型发布17

MiniMax-H3 量化版发布,支持 ComfyUI 原生运行

AX1Y2JP 发布了 MiniMax-H3 的量化版本,基于 Comfy-Org/MiniMax-H3,采用 W4A8 量化,并支持 ComfyUI 原生运行。该模型在 4070Ti 上展示了示例结果,用户需使用最新版 ComfyUI 和 comfy-kitchen,并重新下载更新后的模型。

DeepSpeed Releases一手来源产品发布15

DeepSpeed v0.19.5 补丁发布:修复 ZeRO++ 与编译问题

DeepSpeed 发布了 v0.19.5 补丁版本,包含多项修复和改进。主要修复了 ZeRO++ 小参数二次分片复制、ZeRO-3 异步梯度卸载与固定卸载缓冲区、AutoEP 在 ZeRO-1/2 下的通用转换问题,以及 torch 2.12+ 的编译错误。此外,新增了独立的 pin_memory 操作,并支持 ZeRO 卸载下的非托管梯度累积。

llama.cpp Releases一手来源产品发布13

llama.cpp b10344 发布:新增 Nemotron MTP 支持

llama.cpp 发布 b10344 版本,主要新增了对 Nemotron 模型的多 token 预测(MTP)支持,并引入了 mtp_flags 配置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,方便用户部署。

8月10日星期一 · 9
llama.cpp Releases一手来源产品发布12

llama.cpp b10343 发布:更新 cpp-httplib 至 0.53.0

llama.cpp 发布了 b10343 版本,主要更新是将 cpp-httplib 库升级至 0.53.0。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

Hugging Face New and Trending Models一手来源模型发布13

Nanbeige4.2-3B GGUF 量化版本发布

gkraker04 发布了 Nanbeige4.2-3B 模型的 GGUF 量化版本,该模型基于 Looped Transformer 架构,专为 buun-llama-cpp 运行时设计。量化使用重要性矩阵引导,提供从 Q8_0 到 IQ2_XS 的多种精度,并附有 MMLU-Pro 和 MuSR 基准测试结果,显示 Q4_K_M 在质量与体积间达到最佳平

NVIDIA Technical Blog一手来源模型发布13

Meta 发布 Muse Glimmer 模型,NVIDIA 平台支持本地代理工作流

Meta 发布了 Muse Glimmer,一个 30B 参数的开源稠密模型,支持 120K+ 上下文窗口,专为本地 AI 代理工作流设计。该模型在 NVIDIA 的 GPU 平台上优化运行,单 GPU 可实现每秒 20K tokens 的吞吐量,支持全本地推理,无需模型分片或外部端点。NVIDIA 提供了多种部署选项,包括 GeForce RTX 5090

llama.cpp Releases一手来源开源8

llama.cpp 新增 Granite-Switch 架构,支持逐 token LoRA 切换

llama.cpp 新增 Granite-Switch 架构后端,支持带多个 LoRA 适配器的模型,通过控制 token 实现逐 token 切换。该实现采用路由注意力机制在图中恢复适配器索引,解决了并发序列隔离问题,但存在单序列内无法回退的已知限制。目前支持 CPU 和 Mac (Metal) 构建,并已通过相关测试。

Import AI研究4

Import AI 468:23项RSI政策建议与AI竞赛中的信任透明度研究

本期 Import AI 468 报道了 IFP 智库提出的 23 项应对 AI 研发自动化(RSI)风险的政策建议,涵盖透明度、风险管理和国际合作等七类。MIT 和哥伦比亚大学的研究《Racing to Ruin》通过博弈论分析指出,信任与透明度是 AI 企业实现协调减速的关键变量。此外,还包含一篇关于未来 AI 交互的科幻短篇故事。

TechCrunch AI商业4

Discovered Materials用AI代理寻找更优芯片材料

初创公司Discovered Materials利用AI代理群寻找新型半导体材料,以解决芯片过热问题,并已获得900万美元种子轮融资。该公司结合Anthropic模型和自训练的物理模型进行材料筛选,已发现多种与现有芯片材料性能匹配的新材料,但尚未公开细节。其创始人认为,AI加速了材料发现过程,但实际合成仍是瓶颈。

Hugging Face New and Trending Models一手来源模型发布12

DeepSeek-V4-Flash 0731 推出 92GB GGUF 量化版,支持 GB10 全量运行

twaggs88 发布了 DeepSeek-V4-Flash-0731 的 GGUF 量化版本,这是一个 284B 参数的 MoE 模型,通过 IQ2_XXS_MMQ、MXFP4 和 MXFP8 等量化技术压缩至 92GB,可在 NVIDIA GB10 设备上全量运行。该版本包含完整的 256 个专家,并集成了 DSpark 投机解码草稿模型,支持长上下文和

llama.cpp Releases一手来源产品发布11

llama.cpp b10338 修复 MoE 模型保存加载 bug

llama.cpp 发布 b10338 版本,修复了模型保存时共享专家 FFN 长度键被覆盖的 bug,该问题导致 MoE 模型(如 qwen2moe、granite-moe 等)在保存后无法重新加载。修复后,共享专家和分块 FFN 长度均能正确保存,并添加了相应测试。

Hugging Face New and Trending Models一手来源模型发布11

DreamFast 发布 Gemma 3 12B Heretic v2:去审查量化模型

DreamFast 发布了基于 Google Gemma 3 12B IT 的 abliterated 版本 Heretic v2,通过 Heretic v1.3.0 减少模型拒绝行为,同时保持质量,并针对视频生成模型 LTX-2 优化。该模型提供 FP8、INT8 (ConvRot)、NVFP4、MXFP8 和 GGUF 等多种量化格式,支持从 Ada 到