返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1724 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月12日周三 · 2 条
正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

Google 推进 AMIE 实现专家级视听临床咨询

Google Research 在博客中宣布其医疗 AI 系统 AMIE 升级为支持实时视频问诊的 AMIE (Video),基于 Gemini 和 Project Astra 构建,采用异步多智能体架构以平衡对话速度与深度推理。在包含 100 个场景、300 次实时咨询和 30 名认证医生的随机对照研究中,AMIE (Video) 首次展示了专家级表现,并

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Pixieset 借助 Amazon Bedrock 实现 35% AI 功能采用率

Pixieset 通过 Amazon Bedrock 开发了 AI 图像替代文本生成功能,解决了摄影师为大量图片手动编写 alt text 的痛点。该功能在 4 个月内从概念到上线,首周为超过 75 万张照片生成了替代文本,并实现了 35% 的用户采用率。Pixieset 采用逐步信任的设计,让用户逐张审核 AI 生成的描述,并利用 Bedrock 的跨区域

8月11日周二 · 18 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Nvidia发布Nemotron 3.5 Lightning:小参数高速度,性能对标GPT-oss-120b

Nvidia发布了开源权重模型Nemotron 3.5 Lightning,该模型拥有316亿总参数但仅激活36亿参数,在智能指数上达到24分,与OpenAI的gpt-oss-120b持平,但推理速度接近每秒670个token,远超同类模型。该模型在代理基准测试中表现显著提升,采用宽松的OpenMDW-1.1许可证,并提供BF16和NVFP4权重,多家云服务

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10360 发布:修复转义序列问题

llama.cpp 发布 b10360 版本,主要修复了 common/peg 模块中不完整的转义序列问题。该版本提供了适用于 macOS、Linux、Android、Windows 及 openEuler 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源模型发布

NVIDIA 发布 Nemotron 3.5 Lightning:为长时 AI 代理提供快速精准执行

NVIDIA 发布了 Nemotron 3.5 Lightning,一个 30B 参数的 MoE 模型,仅有 3B 活跃参数,专为长时间运行的 AI 代理的高频执行任务设计。该模型支持 OpenClaw 和 Hermes Agent 等框架,并配合 NVIDIA NeMo Switchyard 进行模型路由,以及 NeMoClaw 安全与管理栈。Nemotr

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA NeMo Switchyard:跨模型路由 AI 代理工作负载

NVIDIA 发布了 NeMo Switchyard,这是一个用于 AI 代理工作负载的模型路由库,允许开发者根据任务需求在多个模型之间路由请求,以平衡准确性、成本和延迟。该库支持多种路由算法,并提供与提供商无关的 SDK 和服务器参考实现,可接受 OpenAI、Anthropic 等 API 请求。通过智能路由,系统可以在复杂任务中使用更强大的模型,在简单

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.8.0 发布:新增代理工具审批与多项修复

Langfuse 发布 v4.8.0 版本,主要新增了应用内代理功能,允许用户在一次对话中批准一次工具使用。同时修复了 OpenTelemetry 中 Anthropic 缓存令牌别名映射和评估过滤器选项加载的问题,并更新了依赖库版本。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10359 发布:修复 WebGPU CI 错误并支持多平台

llama.cpp 发布 b10359 版本,主要修复了 ggml-webgpu 的 CI 错误,并添加了 i32 支持到 cpy 操作。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
InfoQ AI ML and Data Engineering观点

生产全球最便宜Token的实用指南

在InfoQ的演讲中,Doubleword公司的Meryem Arik指出多数公司在推理上超支2到5倍,甚至一个数量级,因为未优化推理栈。她介绍了如何从零设计推理系统以最低成本生成token,强调非实时、高token量用例(如离线代理、数据生成)的增长,并对比了Cerebras等低延迟但高成本方案与低成本高延迟方案的权衡。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10358 发布:修复评审意见并更新多平台构建

llama.cpp 发布 b10358 版本,主要修复了 PR 25532 的评审意见。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布

Langfuse v4.7.0 发布:新增代理工具审批跟踪与多项修复

Langfuse 发布 v4.7.0 版本,包含多项新功能与修复。新功能包括新的会话头部、自动化 webhook 操作改进、应用内代理工具审批跟踪、OTel 流量自动直写、PostHog 和 Mixpanel 集成等。修复涉及代理会话取消、仪表板成本显示、MCP 工具模式验证、正则回溯 DoS 防护、Datadog 追踪中移除用户邮箱等。此外,还进行了多项性

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

OasisKV:利用前瞻稀疏预取将解码 KV 缓存扩展至 HBM 之外

OasisKV 是一个面向大语言模型推理的内存中心系统设计,通过将 KV 缓存与 HBM 解耦来缓解 HBM 容量压力。它利用推测解码生成的 lookahead tokens 预测未来重要 token,并采用高效的注意力后台流水线从更高容量内存层级预取相关 KV 块。基于 vLLM 的实现显示,在 2048 token KV 预算下精度损失不超过 0.7 点

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10357 发布:OpenCL FA prefill 内核优化

llama.cpp 发布 b10357 版本,主要更新为在 OpenCL 的 FA prefill 内核中于本地内存转置 K 矩阵,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10356 发布:ROCm 升级至 7.14

llama.cpp 发布 b10356 版本,主要将 ROCm 构建目标从 7.2.1 升级到 7.14,这是首个采用 TheRock 构建系统的生产版本,并调整了 Linux 和 Windows 的 ROCm 相关 CI 配置。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,支持多种后端如 CUDA、V

正文结构化主题已通过公开置信门槛
Ray Releases一手来源产品发布

Ray 2.57.0 发布:数据、Serve 与 Core 多项增强

Ray 2.57.0 发布,主要更新包括 Ray Data 默认启用 DataSourceV2,引入基于任务的 Hash Shuffle V2 以优化内存使用,并支持 join 操作;Ray Serve 将 HAProxy 作为独立 PyPI 包分发,新增 gRPC 支持,并为 LLM 提供实验性的 KV 缓存感知路由;Ray Core 新增嵌入式 Rock

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

DeepSeek回应取外号争议,千问办公助理收费,英伟达筹5000亿美元建AI基建

本期资讯涵盖多个AI相关动态:DeepSeek回应了用户被取外号的争议,解释为临时对话标签;千问办公助理推出收费服务;DeepSeek-V4-Flash正式版周调用量全球第一;英伟达计划筹集5000亿美元用于AI基建;扎克伯格呼吁美国放宽开源AI限制。此外,还包括携程反垄断罚单、苹果测试长鑫存储芯片、宇树科技IPO等商业新闻。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10355 发布:支持多输出后端采样

llama.cpp 发布 b10355 版本,主要支持多输出后端采样功能,并修复了 CPU 与 GPU 之间的采样差异及 Vulkan 测试问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10354 发布:修复 Android CPU 亲和性掩码问题

llama.cpp 发布 b10354 版本,主要修复了 Android 上 CPU 亲和性掩码被忽略的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多种平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10353 发布:修复 CUDA/Metal 的 ROLL 操作

llama.cpp 发布 b10353 版本,修复了 CUDA 和 Metal 后端中 ggml roll 操作对非连续输入产生错误结果的问题。该修复要求 src 张量连续,并添加了相应的测试用例。同时提供了多个平台的预编译二进制文件。