返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月15日周二 · 20 条
正文结构化主题已通过公开置信门槛
TechCrunch AI模型发布

Salesforce 联手 Nvidia 推出推理模型 Koa,剑指企业级 AI 市场

Salesforce 在 Dreamforce 大会上发布首个推理模型 Koa,基于 Nvidia 开源权重模型 Nemotron 后训练而成,专攻销售、营销和客服任务。Koa 以开源权重、不摄入客户数据、token 消耗更少等特性,作为 Agentforce 平台中 Claude、ChatGPT 等前沿模型的替代选项。Salesforce 高管称此前缺乏具

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10980 发布:OpenCL 新增通用 ssm scan

llama.cpp 发布 b10980 版本,主要变更是为 OpenCL 后端新增通用的 ssm scan 算子(PR #28881),并修复了空白字符问题。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows、openEuler 等多平台的预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10978:Metal 新增支持 MiniCPM3 的 FA 内核

llama.cpp 发布 b10978 版本,为 Metal 后端新增了 HSK=96、HSV=64 的 Flash Attention 内核,以支持 MiniCPM3 模型。此前 MiniCPM3 将 attention.key length 设为 96 且 value length 默认为 64,Metal 缺少 (96,64) 实例化导致 -fa au

正文结构化主题已通过公开置信门槛
量子位开源

无问芯穹联合清华上交开源具身端侧推理引擎APXInf

无问芯穹联合清华大学、上海交通大学正式开源具身智能端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Jetson Thor等平台,覆盖模型开发到机器人本体部署的完整链路。APXInf将PI 0.5 FP8在Jetson Thor上的端到端推理延迟从278ms降至26ms以内,达到38.46Hz推理频率,并采用Rust极简运行时加Pyth

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10977:Windows CUDA 构建升级至 13.4.1

llama.cpp 发布 b10977 版本,主要变更是将 Windows x64 平台的 CUDA 构建版本升级到 13.4.1。该版本同时提供 macOS、Linux、Android、Windows 等多平台预编译包,覆盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论开源

英伟达开源 IMO 金牌配方:代码平权下的算力集权

NVIDIA 于 9 月 9 日公开了 Nemotron 3 Ultra 在 2026 年 IMO 上取得 30/42 分(超过 29 分金牌线)的完整数学推理系统,包括两个数学专家 checkpoint、SFT 与 RL 训练数据、推理代码、训练配方、提交证明及 200 道 Nemotron-IMO-Bench。该系统通过多 checkpoint 采样、p

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

腾讯云 EdgeOne 首次入选 IDC 全球托管边缘服务领导者类别

IDC 发布《Worldwide Managed Edge Services 2026 Vendor Assessment》报告,腾讯云凭借边缘安全加速平台 EdgeOne 首次入选领导者类别,是本次唯一入选领导者类别的中国及亚太厂商。IDC 指出传统 CDN 正加速向托管边缘服务演进,竞争焦点转向边缘侧 AI 推理能力。腾讯云 EdgeOne 推出边缘 A

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

ShadowPEFT 正式加入 Hugging Face PEFT 库

Hugging Face 的 PEFT 库正式将 ShadowPEFT 纳入为一等方法。ShadowPEFT 与 LoRA 的适配器几何结构根本不同,但共用 get peft model 入口和适配器保存/加载路径。它引入一个带持久隐藏状态的有状态影子模型,在每层进行影子注入、基础编码和影子更新,实现跨层协调,并让任务特定组件成为可独立推理的模型。

正文结构化主题已通过公开置信门槛
OpenAI Status History一手来源产品发布

GPT-5.6 及 GPT-5.6 Instant 付费计划错误率升高后已恢复

OpenAI 状态页面报告,GPT-5.6 和 GPT-5.6 Instant 在付费计划上出现错误率升高。事件从 2026 年 9 月 15 日 07:12 开始调查,07:24 应用缓解措施并监控恢复,07:53 宣布所有受影响服务已完全恢复。OpenAI 说明可用性指标为所有层级、模型和错误类型的聚合数据,单个客户的可用性可能因订阅层级及所用模型和 A

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10976:修复 Android 发布流程

llama.cpp 发布 b10976 版本,主要修复了 Android 平台的 CI 发布流程(#28936)。该版本继续为 macOS、iOS、Linux、Windows、Android 和 openEuler 等多平台提供预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
量子位研究

Meta新研究:字节级蒸馏突破Token天花板

Meta FAIR与华盛顿大学发表论文,提出将知识蒸馏的学习单位从Token换成Byte,让字节级学生模型直接学习教师的字节级概率分布。团队提出Marginalize-It和End-Of-Token两种转换方法,以Llama 3-8B为教师进行实验。按缩放定律预测,End-Of-Token蒸馏的下游平均准确率上限达52.4%,比传统Token蒸馏的48.4%

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

自索引注意力:兼容压缩的稀疏长上下文 LLM 推理

该论文提出 Self-Indexing Attention,一种无需训练的稀疏长上下文 LLM 推理框架,基于共享的变换域符号-幅值表示,将 key 的符号位复用为 token 级索引,同时服务于 prefill 分组选择与 decode 检索,并与外部 KV-cache 压缩兼容。在 5% 注意力密度下,该方法在 LongBench 和 RULER 上接近

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

LLM还是朴素贝叶斯?旧方法在新场景下的对比研究

该研究对比了Complement Naive Bayes(CNB)与从27B到1T参数的多系列LLM在文本分类任务上的表现。结果显示LLM仅在无标注数据场景占优(Amazon Polarity上98.0%对88.2%),但存在数据污染风险;一旦有标注数据,CNB在AG News上达到89.1%,与零样本27B LLM持平并优于397B前沿模型,且CPU推理吞

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

面向RAG系统的预检索查询聚类自适应Top-k文档检索

该论文提出一种面向RAG系统的预检索查询聚类框架,用于自适应选择top-k文档检索深度。方法离线通过NDCG-k曲线估计每个查询的饱和点k ,再在嵌入空间聚类查询并为每个簇推荐检索深度;运行时将查询分配到簇并常数时间选择top-k。相比依赖检索后文档聚类的CAR方法,该方案是预检索且以查询为中心,在异构语料中更稳健。作者称在全流量查询测试中效果提升超36%,

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

混合专家语言模型可成为强大高效的检索器

该研究系统比较了混合专家(MoE)与稠密LLM作为一阶段检索器的效果与效率。在相同训练流程下,MoE检索器在BEIR上比激活参数量相当的稠密模型高1.4–3.0 nDCG@10,其中一个MoE检索器以少59%的激活参数和低18%的查询编码时间匹配8B稠密检索器。研究还表明,无需重训练或重建索引即可减少查询编码使用的专家数,保留99%以上效果并将查询编码时间最

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

多语言语音识别中的Token Merging:跨模型规模与微调的系统研究

该论文系统评估了 token merging 技术在多语言语音识别模型 Whisper 上的效果,覆盖十六种语言和三种模型规模。研究发现,合并 token 能提升计算效率,在大多数低资源语言和模型规模下几乎不损失转录准确率,且在 DoRA 微调后依然有效。结果表明 token merging 是一种让多语言语音识别部署更快、更便宜的高实用方法。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

ByteShape 发布 Qwen3.8-27B GGUF 量化模型

ByteShape 在 Hugging Face 发布 Qwen3.8-27B 的 GGUF 量化版本,使用其 ShapeLearn 方法为每个张量学习最优数据类型,以在极低位宽下保持质量。该版本取代此前的 ShapeLearn-Lite 量化,包含 5 个 GPU 优化模型(2.56–3.84 bpw,8.8–13.1 GB),并在数学、编程、指令遵循和智

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论开源

英伟达开源 SoL-Pi:AI 自我优化工作流,Token 最高省 64%

英伟达开源了名为 SoL-Pi 的工作流优化 Harness,基于开源项目 Pi 改造,通过让 AI 自动审查并优化 Agent 工作流来降低 Token 消耗和 API 成本。团队让 AI 批量提出 152 个优化想法,经自动化沙盒筛选后仅保留 4 个核心机制,包括合并连续操作、压缩上下文历史、工具输出本地化存储、用小模型提炼日志等。在 535 个可验证环

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NVIDIA 发布 Muse-Glimmer-30B NVFP4 量化模型

NVIDIA 发布了 Muse-Glimmer-30B 的 NVFP4 量化版本,该模型基于 Meta Superintelligence Lab 的 Muse-Glimmer-30B 稠密因果 Transformer,带有专用感知编码器,支持文本与图像交错输入,面向本地智能体任务。量化使用 NVIDIA Model Optimizer v0.46.0,采用

正文结构化主题已通过公开置信门槛
Gemini API Release Notes一手来源模型发布

Gemini 3.8 Live 与 Live Extended Thinking 正式可用

Google 在 Gemini API 发布说明中宣布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款音频到音频模型正式可用(GA),面向使用 Live API 的实时语音应用。Gemini 3.8 Live 是低延迟语音代理与实时对话的默认选项,具备交错推理、默认异步函数调用和完整会话客户端内容

另有 2 家信源报道