返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月7日周一 · 17 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10833 发布:Vulkan 优化提升 gemma4 性能

llama.cpp 发布 b10833 版本,主要针对 Vulkan 后端进行了优化,实现了 RMS NORM 与 MUL、ADD 等操作的融合,并扩展了 ROPE 对 IMROPE 的支持,在 gemma4 上性能提升约 4%。该版本同时提供了多平台预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10831:Vulkan 新增 TQ1 0 支持,Metal 拒绝相关操作

llama.cpp 发布 b10831 版本,为 Vulkan 后端新增 TQ1 0 量化格式支持,涵盖矩阵乘法、向量乘法、反量化及行获取等操作,并修复了独立反量化着色器中的错误。同时,Metal 后端明确拒绝 TQ1 0 的 GET ROWS 和矩阵乘法操作,以避免因缺少内核而崩溃。该版本还优化了代码结构,提取共享解码辅助函数,并精简了注释。

正文结构化主题已通过公开置信门槛
量子位商业

中科类脑完成数亿元B+轮融资,推进算电协同Token工厂

中科类脑完成数亿元B+轮战略融资,由中车资本领投,银杏谷资本等跟投,此前已获中国移动旗下基金投资。融资将用于Token工厂核心技术、博弈决策智能及生态建设,旨在推动算电协同型AI基础设施发展。

正文结构化主题已通过公开置信门槛
arXiv cs.CL一手来源研究

大语言模型中的证据整合机制研究

该研究提出了一种关于大语言模型(LLM)如何整合外部证据的分布理论,认为证据会通过接收者先验权重和候选证据倾斜来改变模型的初始答案分布。基于超过一千万次试验、十二个模型和八个领域的验证,研究发现模型更易接受自身倾向的候选,且相同证据可能提升弱模型而损害强模型。因果干预表明候选整合发生在网络后期,而验证表征对最终答案几乎没有因果影响。

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

量子辅助显存高效训练用于Wi-Fi人体活动识别

本文提出了一种量子辅助的显存高效训练框架 Q-MET,用于基于 Wi-Fi 的人体活动识别(HAR)。该框架通过混合量子-经典神经网络间接生成模型参数,将可训练参数减少 90%-95%,同时保持或超过传统分类精度。结合结构化剪枝,模型稀疏度达 75%-85%,精度损失小于 2%。这是首个同时解决 HAR 系统训练和推理阶段显存低效问题的量子辅助方法。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

GLM-5.3 GGUF 量化版发布,支持超长上下文

Hugging Face 上发布了 GLM-5.3 的 GGUF 量化版本,由 L-Alchemyst 基于 zai-org/GLM-5.3-BF16 制作,专为 ik llama.cpp 优化。该模型采用 GLM-DSA 架构,总参数 744B,激活参数 40B,上下文长度达 1,048,576。量化版本包括 IQ2 K、IQ3 K、IQ4 K 等,并提供

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10830 发布:新增 --fuse-qkv 转换标志

llama.cpp 发布 b10830 版本,主要新增 --fuse-qkv 标志,用于在 HF 到 GGUF 转换过程中融合 Q/K/V 矩阵为 QKV。该版本提供了多平台预编译二进制文件,包括 macOS、Linux、Windows、Android 等,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Red Hat AI 发布 Qwen3.8-27B INT4 量化模型

Red Hat AI 发布了 Qwen3.8-27B 的 INT4 量化版本 RedHatAI/Qwen3.8-27B-INT4,基于 Qwen/Qwen3.8-27B 模型,使用 LLM Compressor 和 GPTQ/AWQ 技术进行量化,支持 vLLM 推理。该模型在多项评测中表现接近原始 BF16 模型,部分任务甚至略有提升,如 GSM8K 和

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10829 发布:修复 GDN 归一化对齐

llama.cpp 发布 b10829 版本,修复了 GDN 归一化从 max 改为 rsqrt 的问题,以与 flash-linear-attention 和 transformers 的实现对齐。该修复影响 Qwen3-Next 等模型的推理精度,并提供了多平台二进制下载。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10828 发布,新增 Spark2 5 模型支持

llama.cpp 发布 b10828 版本,新增对 Spark2 5ForCausalLM 模型的支持,该模型由 Hugging Face 和社区开发者共同贡献。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等多种后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-Flash-Next 剪枝版:体积缩小28%,性能持平

Cyronius 发布了一个名为 Qwen3.8-Flash-Next-131B-A6B-GGUF 的模型,通过对 Qwen3.8-Flash-Next 的 n-gram 哈希嵌入表进行剪枝,将 GGUF 大小从 90GB 降至 64.8GB,同时保持工具调用、GSM8K 和 MMLU 基准性能不变。该模型无需训练或修改 transformer 架构,仅保留

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10827 发布:修复 OpenCL 量化矩阵乘法

llama.cpp 发布 b10827 版本,主要修复了 OpenCL 后端中 q4 K 和 q5 K 矩阵乘法的权重打包问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.0.51 发布:支持 Opus 4.5 并推出桌面版

Claude Code 2.0.51 版本新增了对 Opus 4.5 模型的支持,并推出了桌面版应用。同时调整了使用限制,Pro 用户可购买额外用量以访问 Opus 4.5。此外,改进了计划模式的精确性和执行彻底性,优化了使用限制通知,修复了思考错误处理和性能回退问题。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.0.67 更新:默认启用 Opus 4.5 思考模式并修复多项问题

Claude Code 发布 2.0.67 版本更新,默认启用 Opus 4.5 的思考模式,并将思考模式配置移至 /config。新增 /permissions 命令的搜索功能,修复了多个问题,包括非交互模式下 MCP 服务器挂起、非拉丁文本的编辑操作、以及 Windows 插件 MCP 服务器故障等。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.77 发布:提升输出上限并修复多项问题

Claude Code 2.1.77 版本更新将 Opus 4.6 默认最大输出 token 提升至 64k,上限提升至 128k,并新增 allowRead 沙箱设置。修复了多个 bug,包括复合命令权限、自动更新器内存泄漏、--resume 截断历史等问题。还改进了启动速度和 --resume 性能,并调整了 Agent 工具和 /fork 命令。

正文结构化主题已通过公开置信门槛
Claude Code Changelog一手来源产品发布

Claude Code 2.1.108 发布:新增提示缓存与回顾功能

Claude Code 2.1.108 版本发布,新增了可选的 1 小时提示缓存 TTL 环境变量、会话回顾功能,并允许模型通过 Skill 工具调用内置斜杠命令。此外,该版本改进了模型切换警告、恢复会话选择器、错误提示,并修复了多项与缓存、遥测、Bash 工具、会话恢复等相关的缺陷。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10826 发布:修复 CUDA 竞态条件

llama.cpp 发布 b10826 版本,主要修复了 CUDA 后端中 mmid 和 mmf 的竞态条件问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 Vulkan、ROCm、OpenVINO 等。

9月6日周日 · 3 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10825 发布:修复 grammar 重复阈值问题

llama.cpp 发布 b10825 版本,主要修复了 grammar 中最大重复阈值的问题(PR #28469)。该版本提供了适用于 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,并支持多种后端如 Vulkan、CUDA、ROCm、OpenVINO 和 SYCL。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10823 发布:新增 JSONL 日志支持

llama.cpp 发布 b10823 版本,新增 --log-jsonl 命令行选项,用于以 JSONL 格式输出日志,并将日志级别 'unknown' 重命名为 'none'。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多平台预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Qwen3.8-27B EfficientThink GGUF 模型发布

Hugging Face 上发布了 nerkyor/Qwen3.8-27B-EfficientThink-Uncensored-K3-Opus5-Grok4.6-GPT5.6Sol-SFT-SimPO-DFlash2-GGUF,这是一个基于 Qwen3.8-27B 的 GGUF 量化模型,支持 DFlash2 投机解码和多种量化级别(Q2-Q8)。模型在 G