返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 20 条
正文结构化主题已通过公开置信门槛
量子位产品发布

高通携手中兴努比亚与豆包推出智能体手机NaviX Ultra

高通技术公司宣布与中兴努比亚、豆包手机助手合作,推出搭载第五代骁龙8至尊版移动平台和豆包手机助手消费者版的智能体手机努比亚NaviX Ultra。该平台集成第三代Qualcomm Oryon CPU、Adreno GPU和面向智能体AI优化的Hexagon NPU,支持生成式AI与智能体AI体验。努比亚称该机可实现多方式唤醒模型、连续对话、多任务及跨APP操

正文结构化主题已通过公开置信门槛
量子位商业

基元律动与无问芯穹达成战略合作,推进高质量Token供给与应用

2026年9月15日,AI基础设施公司基元律动(TokenRhythm)与无问芯穹(Infinigence AI)签署战略合作协议,双方将结合无问芯穹的Agentic Infra产品服务体系与基元律动的多模型服务、智能路由能力,围绕高质量Token的供给、调度与应用展开合作。基元律动已首发接入Qwen-3.8-Max及牛来(GLM-5.3-Flash),双方

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10995:Vulkan MUL MAT ID BN/2 尾部分支改为无条件

llama.cpp 发布 b10995 版本,主要变更是让 Vulkan 后端的 MUL MAT ID BN/2 尾部分支变为无条件启用,将 BN/2 设为默认并作为 BNover4 的禁用回退,同时移除该分支的启用门控;BN/4 分支仍由 enable smaller matrices 控制。该版本同时提供 macOS、Linux、Windows、Andr

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 修复 Metal mul mm id 激活超 f16 范围导致的 NaN

llama.cpp 修复了 Metal 后端 mul mm id 算子在激活值超出 f16 范围(65504)时产生 NaN 的问题。原因是 simdgroup MMA 将 src1 窄化为 half 导致 inf 并污染整个 8x8 累加器,修复方式是按 2 的幂对 src1 重新缩放并在存储时还原,保证结果精确且对现有模型比特级一致。该缺陷曾导致 Mis

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10993 发布:为 hf-jobs 添加自托管 WebGPU 与 Vulkan

llama.cpp 发布 b10993 版本,主要变更是为 hf-jobs 添加自托管的 WebGPU 和 Vulkan 后端,并调整 CPU 后端线程数。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制,支持 CUDA、ROCm、Vulkan、SYCL、OpenVINO 等多种加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10992:llama-bench 支持 --version 打印构建信息

llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
NVIDIA Generative AI Blog一手来源研究

曼彻斯特大学用NVIDIA Earth-2预测全英空气污染

曼彻斯特大学David Topping团队利用NVIDIA Earth-2系列开放AI模型(CorrDiff、StormCast)在英国国家AI超算Isambard-AI上训练出覆盖全英的空气质量预测模型,训练仅用两天,分辨率达2-3平方公里。该模型可预测未来污染情景,并能在DGX Spark桌面AI系统上运行推理和小规模训练,团队计划开源训练数据与工作流,

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

TAARDIS-27B 全三值量化模型发布:1.75bit 仅 5.9GB

开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

LLM推理网络的最优模型激活策略

该论文提出「推理网络」(inference networks)框架,将多个LLM专家建模为有向图,节点为模型、边表示条件激活,以在给定性能约束下最小化推理成本。作者针对串联拓扑证明最优激活策略具有阈值结构:先调用最低成本模型,仅当置信度低于阈值时才调用更贵模型;判别任务每类一个阈值,生成任务仅一个阈值。实验在开源LLM的分类与生成基准上显示,在满足性能预算的

正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

后训练量化在文本嵌入模型上的失效边界:四类嵌入器家族的实测图谱

该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重

正文结构化主题已通过公开置信门槛
量子位观点

把记忆交给CPU,大模型会变快

量子位报道,随着Coding Agent等长任务普及,KV Cache占用显存导致并发下降、TTFT升高。英特尔提出以CPU侧管理、分层存储和QAT硬件压缩为核心的KV Cache优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity四个方向。测试显示KV Shrink在80%缓存命中率下TTFT最高约5倍加速,QAT

正文结构化主题已通过公开置信门槛
LiteLLM Releases一手来源开源

LiteLLM 发布 v1.103.0-dev.1,含 cosign 镜像签名验证

LiteLLM 发布 v1.103.0-dev.1 开发版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 两种验证方式。该版本包含大量修复与功能更新,涉及 responses、proxy、MCP、日志、Bedrock、Anthropic 适配器、路由、认证、定价等多个模块。

正文结构化主题已通过公开置信门槛
量子位研究

华为GTS推出NetCanvas,让Agent看着网络拓扑排障

华为GTS AI算法团队提出NetCanvas机制,通过「可交互视觉拓扑」为网络运维Agent提供外部工作记忆画布,解决纯文本Agent在复杂IP承载网排障中的「拓扑失忆」问题。在公开基准CTBench上,Agent综合通过率从30.3%提升至54.5%,双防火墙、ECMP等复杂子任务从约10%跃升至约90%,平均探查步数从159步降至113步,Token试

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10991:修复 hexagon 后端快速路径

llama.cpp 发布 b10991 版本,主要修复了 hexagon 后端缺失的 contiguous 快速路径,并为每次运行补回 hvx copy uu。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10990:hex-cpy 连续内存时改用 DMA

llama.cpp 发布 b10990 版本,主要变更为 hex-cpy 在源和目标内存连续时使用 DMA 进行拷贝(PR #28906)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
Simon Willison's Weblog模型发布

Google 发布 Gemini 3.8 Live 语音模型,附浏览器试用 UI

Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态类似 OpenAI 的 GPT-Live 系列。作者用 GPT-6 Astra Extra High 参考文档构建了一个网页 UI,可选择模型和语音预设、输入系统提示词,并通过浏览器进行可打断的语音对话。该实现不依赖任何库,直

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10989:为 ROCm 启用 HIP AllReduce

llama.cpp 发布 b10989 版本,主要变更为在 HIP 后端为 ROCm 启用 AllReduce(PR #27825)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。此次更新提升了

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B 无审查模型发布六档 NVFP4 GGUF 量化版

Hugging Face 用户 esatapedico 发布了 DavidAU 的 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored 模型的六个 GGUF 量化版本,采用 NVFP4(W4A16,FP8 缩放,组大小 16)格式,面向 Blackwell sm 120 架构。六个文件共享字节完

正文结构化主题已通过公开置信门槛
Google Research Blog一手来源研究

Google 提出 Retrieve-for-Train:用离线 RL 加速复杂 AI 搜索

Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出行为编译为监督信号,再蒸馏进轻量扩散检索器,从而在推理时单次生成连贯、专家级的搜索结果集合。该方法在 Gemma3-4B 和 Qwen3-4B 上使用 Soft-GRPO 训练,并在时尚文本到图像与音乐文本到音乐

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10988:OpenCL 按 batch size 选择 MoE expert matmul

llama.cpp 发布 b10988 版本,主要更新 OpenCL 后端:在投机解码/MTP 场景下根据 batch size 选择 MoE expert matmul 实现,并针对路由数量对预构建的 q4 0 MoE GEMM 进行门控,同时停止向填充的 MoE 激活槽写入零值。该改动由高通工程师参与贡献,旨在优化 MoE 模型在 OpenCL 设备上的