返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月22日周二 · 20 条
正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

用并发扫描为 SageMaker AI 生成式端点做容量规划

AWS 博客介绍在 Amazon SageMaker AI 上通过并发扫描(concurrency sweep)为生成式 AI 端点做容量规划的方法。文章以部署 NVIDIA Nemotron-3 Nano 30B(MoE,仅 3B 激活参数)到 ml.g7e.2xlarge 为例,使用原生 vLLM 容器和 CreateAIBenchmarkJob API

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11104:llama-server 支持绑定多个地址

llama.cpp 发布 b11104 版本,主要更新为 llama-server 新增绑定多个地址的能力(PR #28690),并处理了地址重叠、多 TCP 地址下拒绝 --port 0 等边界情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制,涵盖 CPU、CUDA、Vu

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

Synthyra 发布 ESM2-35M 蛋白质语言模型

Synthyra 在 Hugging Face 上发布了 ESM2-35M 模型,将 facebook/esm2 t12 35M UR50D 检查点与 FastPLMs 运行时打包,用于蛋白质语言建模。该模型支持序列与残基分类、数据集嵌入、PEFT/LoRA 微调以及测试时训练(TTT),并可通过 trust remote code 在 Transforme

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11103:为 HunyuanOCR 增加 DFlash 投机解码支持

llama.cpp 发布 b11103 版本,为 HunyuanOCR 目标模型增加 DFlash 投机解码支持,在 Hunyuan 图构建中注册层输入张量,修复了此前因张量为空导致的断言中止问题。同时修复了针对 HunYuan 目标转换 DFlash 草稿模型时的词表处理错误,包括缺失的 fix special tokens 方法和配置读取错误。测试显示图

正文结构化主题已通过公开置信门槛
THE DECODER产品发布

TBC 联手 AWS 推「神经元衍生」视频模型,号称快 5 倍省 80%

旧金山初创公司 The Biological Computing Co.(TBC)宣布与 AWS 合作,推出号称首个「神经元衍生」的文本到视频模型,声称比基础开源模型快 5 倍、推理成本低 80%。其做法并非用生物神经元计算,而是先在 4096 电极芯片上培养皮层神经细胞、测量信号扩散与衰减规律,再将其转化为不到基础模型 0.1% 大小的软件适配器,插入现有

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布1

NVIDIA 发布 DLSS 5 与 ACE、RTX Kit 更新

NVIDIA 发布 DLSS 5,引入 3D-Guided Neural Rendering,以游戏引擎渲染帧为基础,在保留场景结构与艺术意图的前提下增强光照与材质细节,并已在 NBA 2K27 中上线。同时更新 NVIDIA ACE,推出 Nemotron Speech 3.5 Streaming 与 Qwen3 TTS 等模型,并升级 NVIGI SDK

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11101:支持重复 find package 调用

llama.cpp 发布 b11101 版本,主要变更是允许对 llama 进行重复的 find package 调用(#29228)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA 为 ROS 2 贡献 CUDA buffer 后端并演示 AI 代理迁移节点

NVIDIA 在 ROS 2 Lyrical 中贡献了 CUDA buffer 后端,配合上游 rosidl::Buffer 抽象,让 ROS 2 节点在满足同主机、同 CUDA 设备、同 Linux 用户及受支持 RMW 实现等条件时,可通过零拷贝传输交换 GPU 常驻数据,否则自动回退到 CPU 路径。NVIDIA Isaac ROS 5.0 的所有节点

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布1

阿里PAI发布MiniMax-H3视频ControlNet-Union模型

阿里 PAI 团队在 Hugging Face 发布 MiniMax-H3-Fun-Controlnet-Union,这是一个基于 VideoX-Fun 流程训练的 ControlNet-Union 模型,可为 MiniMax-H3 视频生成器提供 Canny、Depth、HED、MLSD、Pose 五种控制条件以及视频修复能力。该模型仅包含约 6.8GB

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

阿里云发布AgentCore等新品,加速构建Agentic Cloud

在2026杭州云栖大会上,阿里云CTO李飞飞系统阐述了Agentic Cloud战略,将Model、Harness、Context作为核心构建场景,并发布企业级Agent构建治理平台AgentCore、Agent Sandbox、新一代高性能存储CPFS等新品。阿里云重构了从AI Native Cloud、Agent Native Cloud到Context

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11100:修复 Muse Glimmer 工具调用解析错误

llama.cpp 发布 b11100 版本,主要修复了 chat 模块中 Muse Glimmer 工具调用(tool-call)首次解析错误的问题,并新增测试验证、精简匹配模式。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYC

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11099 发布:Snapdragon NPU 构建进入正式发布

llama.cpp 发布 b11099 版本,主要变更是在 release 工作流中同时构建 Snapdragon 目标,使 Hexagon NPU 二进制文件首次随正式发布页提供。此前 Snapdragon CI 构建仅用于 QDC 设备测试,NPU 二进制从未进入发布页。该版本同时提供 macOS、Linux、Android、Windows 等多平台预编

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

对话 COBRA-Skills 一作:50 样本重构 Agent 技能降本路线

香港中文大学(深圳)、天津大学、香港科技大学(广州)和新加坡国立大学的研究团队提出 COBRA-Skills,将 Agent 技能优化建模为带预算控制的情境多臂老虎机问题,用轻量 MLP 预测收益加 LinearUCB 量化探索来筛选候选技能,再由进化算子按对数调度生成与精炼技能。该方法仅用 50 个优化样本,在 6 个跨领域 Benchmark 上全面超越

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

2026中国民营企业500强发布:华为腾讯研发投入居前二

全国工商联9月22日发布2026中国民营企业500强榜单及调研分析报告,京东、阿里、恒力、华为、比亚迪、腾讯位列前六,入围门槛255.99亿元。研发投入方面华为、腾讯排名前二,500强研发费用总额1.26万亿元,腾讯2025年研发投入857.5亿元、资本开支792亿元均创新高,并持续加码AI基础设施以支持混元模型升级及WorkBuddy、CodeBuddy推

正文结构化主题已通过公开置信门槛
Meituan Technical Team一手来源研究

美团统一推荐基座大模型MTFM在外卖多业务落地实践

美团技术团队提出统一推荐基座大模型 MTFM,在外卖多个主要业务场景实现统一精排模型,通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计解决规模可扩展性、场景可延展性与架构高效性挑战。该模型在外卖多业务中实现订单量提升 2.06% 6.68%,推理成本降低 24%,相关工作已被 KDD 2026 收录。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11097:OpenCL 新增 A8 Q4 0 非 MoE dp4a 内核

llama.cpp 发布 b11097 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 非 MoE 的 dp4a 二值化内核(PR #29055)。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO

正文结构化主题已通过公开置信门槛
vLLM Releases一手来源开源

vLLM 发布 v0.30.0:新增多模型支持与性能优化

vLLM 发布 v0.30.0,包含来自 315 位贡献者的 762 个提交。新增 DeepSeek-V4.1-Flash、GLM-5.3-Flash、K2-Horizon 等模型支持,并引入 Fast Start 权重缓存、Gumbel-max 水印、HiSparse 主机端稀疏解码等特性。同时优化了 Qwen3.8-Flash-Next 与 Kimi K

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

RBS-Attention:面向长上下文LLM的半径受限稀疏预填充

该论文提出 RBS-Attention,一种免训练的稀疏预填充方法,用于缓解长上下文 LLM 推理中密集自注意力预填充的开销。作者指出块质心评分会因「均值稀释」而漏掉块内高度相关的 token,因此设计双分支选择:质心基分支捕捉平均相关性,救援分支利用最大键块半径及其随提示、层、头变化的分布来识别可能被低估的块。在 H100 上,该方法在 Qwen3-30B

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

面向任务的多智能体框架用于复杂可穿戴健康分析

该论文提出一种面向任务的多智能体框架,用于处理复杂的可穿戴健康查询。框架通过意图-任务层级将复合查询拆解为不同意图和带显式依赖的类型化任务,由专门智能体分别执行检索、分析和建议任务,并保持各意图状态隔离。在含一个月纵向可穿戴记录的合成数据集上,Query Agent 在检索问题上准确率优于直接调用 LLM 的基线,并将查询阶段平均 token 消耗从较高值降