llama.cpp b10587 为 Vulkan 后端新增 PAD REFLECT 1D 操作
llama.cpp 发布 b10587 版本,为 Vulkan 后端新增了 PAD REFLECT 1D 操作,通过 GLSL 计算着色器实现反射逻辑,并注册了 SPIR-V 编译、更新了相关代码。该操作在 Intel Iris Xe 上通过了正确性和性能测试,性能数据已公布。同时发布了适用于多个平台和硬件加速器的二进制文件。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1721 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10587 版本,为 Vulkan 后端新增了 PAD REFLECT 1D 操作,通过 GLSL 计算着色器实现反射逻辑,并注册了 SPIR-V 编译、更新了相关代码。该操作在 Intel Iris Xe 上通过了正确性和性能测试,性能数据已公布。同时发布了适用于多个平台和硬件加速器的二进制文件。
Hugging Face 上发布了 Mistral-Nemo-Instruct-heretic,这是 Mistral-Nemo-Instruct-2407 的去审查变体,通过 Heretic 工具进行方向消融(abliteration)而非微调,抑制了模型的拒绝行为,同时保留了基础模型的能力。该模型提供多种 GGUF 量化版本,可在消费级 GPU 上运行,但
2026全球AI芯片峰会(GACS 2026)将于9月20-21日在上海举行,由智东西发起,智猩猩主办,芯东西协办。峰会以“芯路求索 聚力致远”为主题,将举办开幕式、高峰论坛及多场技术研讨会,包括大模型KV Cache、超节点、异构混训混推等。目前已公布31位演讲嘉宾,涵盖华为、腾讯混元、上海AI实验室等机构专家,聚焦AI芯片加速大模型、Agent与具身智能
llama.cpp 发布 b10585 版本,主要新增 common/json.h 抽象层,并迁移了 common、jinja、server 及测试代码,修复了服务器崩溃问题。该版本为各平台提供了预编译二进制包,包括 macOS、Linux、Windows、Android 和 iOS。
llama.cpp 发布 b10584 版本,主要修复了 draft 模型上下文大小与目标上下文不匹配的问题,并优化了内存适配逻辑。该版本还引入了可选的第二模型支持,使 draft 或 MTP 上下文的内存测量更精确,同时移除了服务器中的预留块。
cHunter789 在 Hugging Face 上发布了 Qwen3.8-27B 模型的 GGUF 量化版本,采用 ik llama.cpp 项目的 IQ4 KS 和 IQ4 KT 量化技术,旨在让模型适配 16GB 显存的 NVIDIA 显卡。该量化版本通过 q4 0 KV 缓存量化支持最长 110k 上下文,并对比了与 mradermacher 量化
llama.cpp 发布 b10582 版本,主要恢复了 Ubuntu 上的 ROCm CI 构建,并调整了 ccache 配置以提升缓存命中率。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO 等多种后端。
DoorDash 软件工程师 Bruna Pereira 在演讲中介绍了 SafeChat 系统,该系统用于实时市场平台中的 AI 安全检测。他们先收集数据训练小型分类器,快速过滤明显安全的消息,仅对少数消息调用 LLM 进行多维度评分,以平衡延迟和成本。该系统每天处理数百万条消息,确保平台安全。
llama.cpp 发布 b10581 版本,新增对 DSpark 的支持,用于 bailingmoe3 模型。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10580 版本,主要更新是支持 dots3-note 模型的视觉和音频处理(PR #27524),包括文本转换、初始化实现和 GGUF 张量映射的修改。该版本提供了适用于 macOS、Linux、Android、Windows 和 openEuler 的多种预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、Ope
junafinity 发布了 Qwen-3.8-27B-Uncensored-8-Bit-MLX,这是对 Qwen-3.8-27B-Uncensored 的 8 位 MLX 量化版本,专为 Apple Silicon 设计,磁盘占用 28GB,视觉塔保持 bf16 未量化。该模型通过 ZeroFuse 权重编辑实现去审查,旨在用于红队和防御性网络安全研究,作
llama.cpp 发布 b10578 版本,主要优化了 ggml 库中的 concat 操作,将逐元素 memcpy 替换为行级 memcpy,以提升性能。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,并支持 Vulkan、CUDA、ROCm、OpenVINO 等后端。
llama.cpp 发布 b10577 版本,主要修复了 draft-mtp 与 embeddings 的兼容性问题。该版本提供了覆盖 macOS、Linux、Windows、Android 及 openEuler 等多平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布 b10576 版本,重新引入了 SYCL 后端针对 Q2 K 量化格式的重排序 MMVQ 和 ESIMD 内核,并添加了门控参数。该版本提供了适用于 macOS、Linux、Windows、Android 和 iOS 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。
Netflix开发了基于语言模型的推荐系统GenRec,将用户行为转换为纯文本,通过微调开源权重模型进行推荐排序。离线测试和在线A/B实验显示,其推荐质量优于现有系统,且所需标注数据减少约40倍。Netflix认为这是从定制架构向通用语言模型转变的一部分,但尚未完全替代现有系统。
Hugging Face 上发布了 SenseNova-U1-8B-MoT-Merger-gguf 模型,该模型基于 SenseNova-U1-8B-MoT,支持在 ComfyUI 中运行,并针对 8GB 显存进行了优化。模型提供 Q4 和 Q6 量化版本,并展示了文本到图像生成的测试效果。
ChrisColeTech 发布了 LTX-2.3-uncensored-v1.4-fp8 模型,基于 Lightricks 的 LTX-2.3 并融合了 Eros10 极端 NSFW LoRA 和 DMD 蒸馏 LoRA,支持文本到视频、图像到视频等多种模式,并提供了 GGUF 和 FP8 量化版本。该模型宣称可在 4-8 步内生成高质量视频,并支持长达
DavidAU 发布了基于 Qwen3.8-27B 的微调模型 Qwen3.8-27B-Cold-Fusion-GAIN-V1.1-NM-DAU-NEO-MAX-MTP-GGUF,采用 COLD FUSION(GAIN+Unsloth)训练方法,将思考 token 减少至原来的 1/2 到 1/10,同时保持或提升推理能力。该模型在 4bit 和 8bit
SGLang 发布 v0.5.18 版本,包含 710 个 PR,来自 212 位贡献者。新增支持 Muse Glimmer、Intern-S2-Mobius、SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image 等模型,并优化了启动性能、LMHead 通信和缓
Ollama 发布了 v0.33.0 版本,主要修复了 MLX 在 Linux/Windows 上的兼容性问题,并更新了 MLX 相关组件。同时,应用新增了对 Claude 桌面应用的支持,改进了模型管理功能,并优化了引导布局。此外,启动时增加了对 DeepSeek Harness 的 npx 回退方案,并增强了 MLX 运行器的前缀缓存恢复能力。