返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月22日周二 · 7 条
正文结构化主题已通过公开置信门槛
智东西商业

2026全球AI芯片峰会上海落幕:智能体时代CPU回归与3D存算成焦点

2026全球AI芯片峰会在上海落幕,由智东西发起、智猩猩主办,超过60位嘉宾围绕架构创新、3D堆叠、存算一体、HBF新型存储、智能体推理等议题展开分享。英特尔高宇提出智能体时代CPU重回C位,并预告将展示单机柜承载5万Agent的高密度CPU机柜;后摩智能、奎芯科技、东方算芯、亿铸科技等企业分别披露3D CIM、定制内存、软件定义芯片、通用存算一体等进展。大

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11076 版本

llama.cpp 发布 b11076 版本,主要变更为移除测试中的过时注释(#29140)。该版本同步提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11075:简化 ggml-metal 融合算子声明

llama.cpp 发布 b11075 版本,主要改动是简化 ggml-metal 后端中融合算子(fusion pattern)操作列表的声明方式,从 ops all 派生非空融合算子并去掉模式向量中的 all 后缀。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROC

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Positron 现可在 Amazon SageMaker AI 上运行

AWS 博客介绍 Positron(Posit 面向数据科学的 IDE)现可在 Amazon SageMaker AI 上运行。数据科学家可在 SageMaker Studio Space 中直接使用 Positron,通过 Space 执行角色访问 Athena、Glue Data Catalog 和 S3,无需管理凭证,并可用 Amazon Bedroc

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3-Flash 去审查版 Q2 量化模型发布

Hugging Face 上发布了一个名为 DogContext/GLM-5.3-Flash-Uncensored-Q2-ds4 的模型,它是 GLM-5.3-Flash 的去审查(abliterated)版本,经 imatrix 校准量化为约 2-bit GGUF,可在单台 128GB Apple Silicon Mac 上常驻运行。该模型保留原生 MTP

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

EXL 在 AWS 上推出医疗理赔智能文档处理方案

EXL 在 AWS 上推出 Medical IDP 解决方案,结合 Xtrakto.AI 文档处理与基于保险医疗数据微调的 EXL Insurance LLM,将医疗记录审核从每案 100 多分钟的人工流程转为自动化管道。方案使用 SageMaker AI 做训练与推理、Bedrock 调用通用基础模型,并通过 IAM 控制受保护健康信息访问,面向理赔与核保

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11074:修复 JSON 枚举处理

llama.cpp 发布 b11074 版本,主要修复了 JSON 枚举(enum)处理问题,为枚举值添加了 common json value 处理逻辑,并曾添加 tests/test-json.cpp 测试但按要求移除。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台多后端(CUDA、Vulkan、ROCm、SYC

9月21日周一 · 13 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11073:SYCL 合并 MKL-FA softmax 加载

llama.cpp 发布 b11073 版本,主要变更是 SYCL 后端对 MKL-FA softmax 加载进行合并(coalesce),替代原先每行一个 work-item 的实现方式,并改进了变量命名可读性。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

NVIDIA Earth-2 推出 AI 数据同化工具,提升天气预报时效性

NVIDIA 发布技术博客,介绍其 Earth-2 平台中的 AI 数据同化工具,可将专有或第三方观测数据融入天气预报流程。教程涵盖两种技术:用点观测约束扩散模型(适用于区域模型)以及将多源数据集同化为一致状态(适用于全球模型)。文中以 CorrDiff 为例,展示如何利用 Score-Based Data Assimilation 在不重新训练模型的情况下

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源开源

Langfuse 发布 v4.40.0:新增 trace 批处理关联功能

Langfuse 发布 v4.40.0 版本,新增将 transcript spans 关联到源 trace 的 trace-batching 功能,并修复了删除 API key 记录后缓存未清除的认证问题。此外还包含若干 Web 页面重构、文档修正和 AGENTS.md 使用方式调整等杂项改动,并迎来一位新贡献者。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11071 发布:Ubuntu CUDA 构建升级至 13.4

llama.cpp 发布 b11071 版本,主要变更是将 Ubuntu CUDA 发布构建的 CUDA 版本升级到 13.4(PR #29202)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CPU、Vulkan、CUDA 12/13、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b11069:为 SM70 (Volta) 调整 MMVQ 到 MMQ 切换

llama.cpp 发布 b11069 版本,主要变更是针对 SM70(Volta)架构调整了 MMVQ 到 MMQ 的切换阈值(crossover),由 Yangyu Chen 提交并经 Johannes Gaessler 审阅。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b11068:修复 macOS 27 SDK Metal 弃用警告

llama.cpp 发布 b11068 版本,主要修复了 macOS 27 SDK 下 Metal 后端的弃用警告(PR #29136)。该版本同时提供覆盖 macOS/iOS、Linux、Windows、Android 及 openEuler 的多平台预编译二进制,支持 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

OpenRouter 排行榜:425 个模型的价格、实测速度与韩语质量

该项目基于 OpenRouter 公开 API 构建了一个覆盖 425 个模型的排行榜,展示每百万 token 价格、服务商、精度、可用性、上下文长度、实测响应速度和韩语质量。作者对 330 个模型从敬语、韩国制度知识、格式遵循、术语等七个维度独立评分,发现约三分之一模型韩语评级为 F,且质量、性价比、速度领先者几乎从不重合。此外,作者用付费 API 对 3

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

Proxifield:基于语义邻近度的去中心化多智能体通信

该论文提出 Proxifield,一种去中心化的多智能体通信协议,通过智能体演化中的语义邻近度构建稀疏通信图,无需模型训练或集中式规划器,在推理时利用直接寻址、信息需求、计划对齐和信息互补四种路由信号连接智能体。在无人机搜救和 HiddenBench 集体推理两个领域,Proxifield 在最大规模模型(397B)下优于 Star 和 Shared Con

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

弹性阈值注意力:面向长上下文解码的学习型上下文稀疏

该论文提出 Elastic Threshold Attention(ETA),一种端到端可训练的稀疏注意力架构,用于缓解长上下文解码中的 KV 缓存内存带宽瓶颈。ETA 通过查询表示预测动态的逐头阈值,并在训练中以退火 sigmoid 门控乘性抑制低于阈值的 logits,而非直接删除,从而避免表示坍塌并消除初始 token 上的注意力汇。作者还实现了基于

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

超大规模个性化搜索的混合GPU-CPU检索系统

该论文提出一种混合 GPU-CPU 协同服务系统,用于超大规模个性化搜索。系统通过 GPU 路径在约十亿文档的精选库存上融合检索与交互预排序,CPU 路径在约二十倍大的库存上进行轻量级个性化评分,两条路径可按请求独立运行并去重后共享下游排序。生产环境 A/B 测试显示,相比原有纯 CPU 配置,模型评分相关性和实质互动均有提升,验证了深度-广度分离架构的实用

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

小语言模型能否知道自己不知道?语义熵作为置信信号

该研究探讨了参数量低于30亿的小语言模型(SLM)能否通过熵信号判断自身不确定性。作者在7个模型对和5个NLU基准上评估了7种方法,发现91%的数据集-模型组合中token级熵几乎为零,无法作为置信信号;而语义熵(多次采样并按语义聚类)能恢复有效的不确定性信号。利用语义熵将不确定查询路由到更大的专家模型,准确率最高提升50个百分点,且跨家族路由(如SmolL

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

MAGIC:基于最优传输的边际引导压缩用于高效视觉文档检索

该论文提出 MAGIC,一种无需训练的事后压缩方法,用于提升视觉文档检索(VDR)效率。针对 ColPali 等多向量检索系统中 patch 级向量带来的存储与 MaxSim 计算开销,MAGIC 通过估计检索需求并构建双边际熵最优传输问题,在压缩时优先保留高使用率 patch 并均衡保留 facet 的使用。在 ViDoRe 基准上,MAGIC 在多种保留

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

Bio-MF:面向混合运动想象脑机接口的低延迟高保真EEG到fNIRS跨模态生成

该论文提出 Bio-MF,一种无需预训练、无潜变量的单步 MeanFlow 框架,用于在混合运动想象脑机接口中由 EEG 条件生成 fNIRS 信号。Bio-MF 直接预测干净 fNIRS 信号并转化为 MeanFlow 速度监督,单次网络评估即可完成推理,并整合时空交互 4D 编码、跨模态无分类器引导和噪声级门控 FFT 正则化。在 Dataset 1 上