返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月31日周一 · 20 条
正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

VidParse:在线解析自我中心程序,无需训练

VidParse 是一个无需训练的在线自我中心程序解析框架,利用冻结的 DINOv2 和手-物检测器构建操作锚定特征,通过时间相似性矩阵和棋盘核检测动作边界,并使用图约束波束搜索强制执行程序性任务图。在 GTEA 和 EgoPER 基准上,该方法在复杂多步解析准确率上比强在线基线提升高达 10 倍,且无需梯度更新。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

DAMP:衰减感知的循环状态混合精度量化

DAMP是一种针对Gated DeltaNet和Kimi Delta Attention等混合架构语言模型的新型量化方法,首次研究其循环状态的后训练量化。该方法通过结合量化误差能量和衰减持久性识别高风险通道,以混合精度存储,在9.9比特每状态值下保持接近FP32基线的精度,同时减少69.1%的存储并加速解码。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

基于向量索引的输出嵌入加速LLM推理

该研究提出将大语言模型解码中的输出投影和top-k token选择重构为最大内积搜索(MIPS)问题,并使用基于HNSW的向量索引替代密集词汇投影,仅检索少量高得分token。在Gemma 3、Llama 3.2和Qwen 3模型上,该方法在CPU推理和批大小为1时,端到端吞吐量最高提升82%,同时保持生成质量。该方案无需重新训练,可无缝集成到现有模型中,适

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

量化触发后门:跨量化器迁移性与验证-部署差距

该论文提出量化触发后门攻击,利用后训练量化作为触发器,使模型在源精度验证时表现良性,但在INT8或4位压缩后激活恶意行为。研究将攻击扩展到多语言编码器-解码器seq2seq模型,并发现攻击持久性取决于量化器几何和模型架构而非标称位宽。结果表明源精度审计不足以认证部署行为,最终部署配置必须纳入行为认证。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

FAID:面向隐式仇恨言论的细粒度自适应检测框架

本文提出了一种名为FAID的细粒度自适应隐式仇恨言论检测框架,将隐式仇恨言论分为浅层、定向和上下文依赖三类,并针对不同类别采用轻量级提示调优、知识增强和智能体推理等不同策略。实验表明,FAID在四个基准数据集上显著优于现有最先进方法,同时减少了计算冗余。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

概率事件:实现实时量子感知的计算原语

本文提出了一种名为“概率事件”的计算原语,用于实时处理量子图像传感器(如SPAD)产生的光子流。该方法通过递归贝叶斯推断跟踪强度变化后的时间,生成运动自适应场景通量、高保真活动图和熵感知不确定性三种低延迟信号,避免了传统事件相机的固定阈值触发。在0.05勒克斯的极低光照下,该方法无需重新训练视觉模型即可实现人体姿态估计,处理速度超过每秒50,000帧量子帧,

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10709 发布:修复 RPC 跨服务器序列化问题

llama.cpp 发布 b10709 版本,主要修复了 RPC 后端中跨服务器张量序列化的问题,避免序列化来自其他服务器的缓冲区,并新增了双服务器回归测试。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10708 发布:修复 ggml 内存分配防护

llama.cpp 发布 b10708 版本,主要修复了 ggml backend buft get alloc size() 的防护问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10707 发布:优化 kv-cells 扫描提升长上下文生成速度

llama.cpp 发布 b10707 版本,优化了 kv-cells 的序列扫描逻辑,在保持行为不变的前提下提前终止扫描。该优化显著提升了长上下文下的生成速度,例如在 RTX PRO 6000 上 55k 上下文从 56.3 t/s 提升至 74.3 t/s,132k 上下文从 33.6 t/s 提升至 50.9 t/s。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10706 发布:新增 SWIGLU CLAMP 及 Vulkan 支持

llama.cpp 发布 b10706 版本,新增 SWIGLU CLAMP 操作,并为其添加了 Vulkan 着色器支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Inco AI 发布 DFlash 2 草稿模型,加速 GLM-5.3-Flash 投机解码

Inco AI 发布了 DFlash 2 草稿模型,用于 GLM-5.3-Flash 的投机解码。该模型采用块扩散技术,单次预测整个 token 块,并通过轻量选择器保持解码无损。用户可通过 SGLang 集成使用,模型以 CC BY-NC-ND 4.0 许可发布,仅限研究用途。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10705 发布:改进 TENSOR READ LAZY 处理

llama.cpp 发布 b10705 版本,主要改进了 TENSOR READ LAZY 处理逻辑,在启用 lazy 模式时强制 CPU 上的张量使用 lazy 加载。该版本提供了覆盖 macOS、Linux、Windows、Android 等多平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10704 发布:优化 MoE 专家路径,提升推理速度

llama.cpp 发布 b10704 版本,优化了 CUDA 下 MoE 模型的 mm ids helper 路径,使 n expert used 为 10 时也能使用快速路径,在 Qwen3.8-Flash-Next 模型上 prompt 处理速度从 2334 t/s 提升至 2600 t/s。该版本同时提供了多平台二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10703 发布:优化 RDNA 3 矩阵乘法配置

llama.cpp 发布 b10703 版本,主要更新为针对 RDNA 3 架构调整了矩阵乘法(MMQ)配置,以优化 AMD GPU 上的推理性能。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10702 发布:优化 HIP Q2 0 点积性能

llama.cpp 发布 b10702 版本,主要针对 HIP 后端优化了 Q2 0 量化格式的点积路径,特别为 gfx1201 架构使用原生 amdgcn perm 指令提升性能。该版本提供了多平台预编译二进制,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10701 修复 NVFP4 草稿模型投机解码问题

llama.cpp 发布 b10701 版本,修复了 DFlash2 NVFP4 草稿模型在投机解码中因未传递 Q、K、V 和输出投影的缩放因子而导致接受 token 极少的问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10700 发布:重命名参数并更新多平台构建

llama.cpp 发布 b10700 版本,将命令行参数 --tensor-read-lazy 重命名为 --lazy-mode,并新增 -lzm 简写。该版本同步更新了 README 文档,并提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10699 发布:优化后端内存分配与 RPC 支持

llama.cpp 发布 b10699 版本,新增 ggml backend op alloc size may expand 函数,用于处理 Metal、SYCL、WebGPU 等后端在特定算子上的额外内存需求,并优化了 RPC 后端的内存分配查询逻辑。该版本提供了多平台(macOS、Linux、Windows、Android 等)的预编译二进制文件。

正文结构化主题已通过公开置信门槛
智东西商业

高通高管谈2bit量化与HBC技术:性价比优于HBM,已与中国厂商合作

高通工程技术高级副总裁侯纪磊在圣迭戈总部与媒体交流,介绍了高通在2bit量化感知训练(QAT)方案上的进展,已与部分中国厂商合作。他还详解了高带宽计算(HBC)技术,相比HBM具有性价比优势,有效内存带宽提升显著。高通正推动端云协同的智能体体验,并与模型厂商深度适配形成参考方案。

正文结构化主题已通过公开置信门槛
Mistral Platform Changelog一手来源模型发布

Mistral 发布 Large 2.1 与 Pixtral Large,Le Chat 新增多项功能

Mistral 于 11 月 18 日发布了 Mistral Large 2.1 和 Pixtral Large 模型,后者为多模态模型,支持文档和图像理解。同时,Le Chat 平台新增了带引用的网络搜索、画布功能、图像生成(由 Black Forest Labs 的 Flux Pro 驱动)以及更快的响应速度。