返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月4日周二 · 20 条
正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

3DZip:面向3D问答的空间感知特征多样性引导令牌压缩

Hugging Face 每日论文发布了一篇题为《3DZip: Spatial-Aware Feature Diversity-Guided Token Compression for 3D Question Answering》的研究论文。该论文提出了一种名为3DZip的三阶段令牌压缩框架,用于3D视觉语言模型,通过粗体素化、基于特征多样性的锚点选择以及空

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10255 扩展 SYCL SDPA 支持非 FP16 KV 缓存

llama.cpp 发布 b10255 版本,扩展了 SYCL oneDNN SDPA 路径以支持非 FP16 的 KV 缓存(包括 Q4 0-Q8 0 和 FP32),通过在设备上将 K/V 反量化为 FP16 后送入 SDPA 图,使融合的 systolic 内核与原生 FP16 路径一致运行。该版本还包含流同步修复和移除 V is K view 别名,

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10254 发布:新增 DeepSeek V4 Flash 0731 模板

llama.cpp 发布 b10254 版本,主要更新是为 DeepSeek V4 Flash 0731 模型添加新的聊天模板,并调整了 DeepSeek V4 模板以对齐官方编码器,包括默认丢弃思考内容、支持结构化输出响应格式、新增 Flash 0731 模板等。该版本还提供了多平台二进制文件下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10253 发布:更新 cpp-httplib 至 0.52.0

llama.cpp 发布了 b10253 版本,主要更新是升级 cpp-httplib 到 0.52.0。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 等多种平台的预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
arXiv cs.MA一手来源研究

BANDMAS:因果启发的语义包调度实现带宽高效多智能体协作

BANDMAS 是一个面向 LLM 多智能体协作的语义包调度框架,通过因果启发的重放估值将消息分解为数据包,仅传输贡献超过资源成本的包,以降低带宽和推理开销。在 SciFact、HotpotQA 和 FanOutQA 数据集上,使用冻结的 Qwen3-4B 模型,BANDMAS 在选定上限下将应用层字节减少 53.2% 至 77.3%,并在所有三个工作负载上

正文结构化主题已通过公开置信门槛
arXiv cs.SE一手来源研究

代码作者归属从竞赛到课堂不具泛化性

一项研究微调预训练Transformer模型CodeBERT,在Google Code Jam竞赛数据上达到92.6%的Top-1准确率(10位作者),但在大学课程作业数据集上表现仅与随机基线相当(Top-1准确率0.2%或更低)。多模型基准测试显示该性能差距普遍存在,表明基于竞赛数据的基准高估了代码作者归属在教育场景中的实际适用性。

正文结构化主题已通过公开置信门槛
arXiv cs.AI一手来源研究

消费级GPU本地LLM能源效率基准:架构与量化策略影响显著

一项针对消费级GPU上本地部署LLM的能源效率基准研究,在RTX 4060Ti上测试了9个开源模型(1B-7B参数),发现模型架构和量化策略比参数数量更影响能效,其中gemma3:1b和llama3.2:1b能耗最低,而7B-Mistral能耗最高达4.4倍,qwen3.5:2b因内部推理导致每提示能耗异常高。

正文结构化主题已通过公开置信门槛
arXiv cs.CV一手来源研究

PhysAgent:用于可靠远程心率估计的多智能体框架

PhysAgent是一个用于远程心率估计的多智能体框架,由arXiv论文提出。该框架利用多个基础估计器生成候选心率,并通过轻量级4B多模态大语言模型Qwen3-VL-4B驱动多智能体推理,结合确定性生理验证器进行融合,以提高心率估计的稳定性和可靠性。实验表明,PhysAgent在多个公共基准上优于直接预测和传统融合方法,代码即将发布。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

面向运筹学的不确定性感知模拟推理框架

该研究提出了一种面向运筹学(OR)数学建模的不确定性感知推理框架,无需训练即可提升大语言模型(LLM)的建模可靠性。该方法通过短视前瞻模拟评估中间候选步骤,量化下游预测不确定性,并利用重要性重采样动态选择更可能生成连贯数学公式的候选。在NL4OPT、MAMO和IndustryOR等多个OR基准上的实验表明,该框架优于标准和低温基线,为可靠的OR公式生成提供了

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

自然语言数学证明的低成本自动评判方法

该研究探讨了使用廉价开源权重模型作为自然语言数学证明的自动评判者。在IMO-GradingBench的200个实例验证样本上,三个廉价评判模型(GPT-OSS 120B、DeepSeek-V4 Flash、Gemma-4 31B)与人类通过/失败判断的一致性在统计上与Claude Opus 4.7和Gemini 3.1 Pro等前沿模型相当,但成本低至100

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10252 发布:更新 BoringSSL 至 0.20260803.0

llama.cpp 发布 b10252 版本,主要更新是将 BoringSSL 升级至 0.20260803.0。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm 等。部分平台构建(如 KleidiAI 和 openEuler)被禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10251 发布:支持 GLM-4.7-Flash 多 token 预测

llama.cpp 发布 b10251 版本,新增对 GLM-4.7-Flash 模型的多 token 预测(MTP)支持。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face Daily Papers一手来源研究

StyleForge:基于超图反事实推理的室内家具风格搭配

StyleForge 是一个用于固定布局室内家具风格搭配的框架,它利用动态超图风格场和反事实推理来确保家具在形状、材质和颜色上的协调。该方法通过多模态大语言模型提取风格先验,并在推理时通过测试时训练优化候选选择。在 3D-FRONT 数据集上的实验表明,StyleForge 在家具检索和场景级风格一致性方面优于现有基线。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10250 发布:新增模型解析测试与 HTTP 客户端封装

llama.cpp 发布 b10250 版本,主要新增了模型解析测试,通过模拟 Hugging Face 仓库列表和本地 HTTP 服务器,端到端验证了模型解析、分片、mmproj、sidecar 等功能的正确性。同时引入了可移植的环境变量辅助函数和 HTTP 客户端封装,并修复了 Windows 和 TLS 构建下的兼容性问题。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwopus3.6-27B-Coder 发布 NVFP4 量化版,支持 vLLM 与工具调用

Hugging Face 上发布了 Qwopus3.6-27B-Coder 的 NVFP4 量化版本,该模型基于 Jackrong/Qwopus3.6-27B-Coder,采用 W4A4 量化,大小约 18GB,相比 bf16 原始模型减少约 33%,在 wikitext-2 上困惑度为 6.63,支持 256K 上下文,专为 NVIDIA Blackwel

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10249 发布:server 新增 get info 工具

llama.cpp 发布 b10249 版本,主要更新为 server 新增 get info 工具,用于获取服务器信息。该工具改进了探测结果处理,当探测进程失败或超时时将操作系统报告为未知,并简化了结果处理逻辑。同时提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制下载。

正文结构化主题已通过公开置信门槛
量子位商业

出海AI应用靠跨云架构与RTX PRO 6000砍掉75% GPU集群

一家亿级日活AI穿搭购物出海应用因推理成本倒挂(ARPU 2美元 vs 算力成本3美元)陷入亏损,通过将推理层迁移至Akamai推理云并采用NVIDIA RTX PRO 6000 GPU,结合FP4量化与跨云架构,将GPU集群规模缩减75%,生图耗时从12秒降至3-5秒,流量成本降至0.005美元/GB,实现扭亏为盈。文章还提及韩国游戏公司DevSister

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10248 发布:验证默认特殊 token ID

llama.cpp 发布 b10248 版本,主要更新是验证默认特殊 token ID(PR #26506)。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端(如 CUDA、Vulkan、ROCm 等)。部分平台(如 macOS KleidiAI、openEuler)的构建被禁用。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10247 发布:修复宽 MoE 模型多后端加载崩溃

llama.cpp 发布 b10247 版本,主要更新是 ggml 后端调度器改用动态分配来管理分割图输入,替代原先固定大小的数组,解决了加载 Gemma 4、Qwen MoE、Mixtral、DeepSeek 等宽 MoE 模型时在多后端环境下因图分割超过 30 个输入张量而导致的崩溃问题。该版本提供了适用于 macOS、Linux、Windows、And

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10246 发布:优化 OpenCL 大权重 GEMV 性能

llama.cpp 发布 b10246 版本,主要修复了 OpenCL 后端中大型 q6 K 权重(如 gemma-4 E2B 的 lm head)在 GEMV 计算中的性能问题,通过增加直接大小条件来避免维度条件不足导致的性能下降。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。