llama.cpp b10902 发布:OpenCL 新增 A8 Q4 0 矩阵乘法内核
llama.cpp 发布 b10902 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 矩阵乘法的二进制内核支持(PR #28268)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10902 版本,主要变更为在 OpenCL 后端新增 A8 Q4 0 矩阵乘法的二进制内核支持(PR #28268)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,涵盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后
论文提出 AcFlow,一种在推理阶段控制文本到图像扩散 Transformer(DiT)的方法。它通过一个学习到的、以概念描述为条件的速度场,对中间层图像 token 激活进行传输,同时保持基础 DiT 冻结。该方法支持连续调节风格强度并抑制不需要的概念,在风格-内容权衡上优于基线,且无需针对每个概念单独拟合即可泛化到未见概念。
该论文提出 VikingRAG,一个面向结构化文档的目录感知语义数据管理系统,将语义与结构访问紧密结合,支持基于证据缺口的多轮检索。系统通过将多轮检索轨迹物化为可复用的经验边,并引入自适应升级策略,在证据充分时仅用单轮经验增强检索。实验显示基础系统在保持高准确率的同时仅消耗现有方法 11.6%–51.9% 的 token,结合轨迹复用与自适应升级后可降至 5
上海AI Lab与上海交大LUMIA Lab联合发布NCP-ArchPreview技术报告,提出一种在标准下一词预测(NTP)之外增加下一概念预测(NCP)的潜在空间语言模型。该模型通过从隐藏状态构建乘积量化概念词表,并用专门的Concept Module预测跨多token的离散概念,再反馈到token层指导生成,NTP与NCP端到端联合训练。模型规模达8.
另有 1 家信源报道
戴尔技术团队发表论文,提出跨部署栈的AI推理优化统一分析框架。作者将部署分解为模型层(量化、剪枝、蒸馏)、编译器层(图融合、布局优化、内核自动调优)和系统层(动态批处理、准入控制、内存分层)三层分类法,并将部署形式化为精度、延迟、吞吐、内存和能耗的多目标约束优化问题。论文还提出证据协议以解决现有基准测试条件不可比的问题,并综合了边缘平台与数据中心GPU的实证
该论文研究联邦学习在室内火灾检测中的应用,针对上行带宽受限、拜占庭客户端攻击以及固定聚合服务器单点故障三个问题提出解决方案。作者构建了来自八个公开来源的室内火灾检测数据集,设计了基于冻结MobileNet-V2特征提取器的边缘可部署检测器,并通过INT8/INT4量化和Top-k稀疏化压缩模型更新。同时提出一种半去中心化拜占庭鲁棒联邦学习方法,结合历史感知聚
该论文提出 NCP-ArchPreview,一种在自回归预训练中同时进行下一 token 预测(NTP)和下一概念预测(NCP)的潜在空间语言模型。模型通过从隐藏状态构建乘积量化概念词表,并用专门的 Concept Module 预测跨多个 token 的离散概念,再反馈到 token 层指导生成。模型规模达 8.9B 参数,在 Dolma-3 的 5.73
另有 1 家信源报道
文章提出「归零稳态」概念,认为硅基系统无法从「有」回到「空」,因为自回归生成、注意力与矩阵乘法等每一步都是「有到有」,架构中不存在空的接口。作者据此提出三条先天约束(必须存在归零操作、归零须独立于生成过程、须可重复稳态维持),并主张在现有自回归架构外挂一个不依赖训练数据、基于公理的独立判断模块,输出「继续或归零」二元信号。文章认为硅基只能无限逼近归零稳态,碳
Hugging Face 用户 DavidAU 发布了基于 Qwen/Qwen3.8-27B 微调的模型 Qwen3.8-27B-TURBO-Fable-Cold-Fusion-735-882-Heretic-Uncensored-NM-DAU,采用 Apache-2.0 许可,主打去审查(uncensored)与多阶段调优。作者称该模型在 ARC-C 等核
Anthropic 报告 Claude API 出现延迟升高问题,影响部分通过美国中西部入口访问的客户,表现为响应变慢和部分请求超时。该事件同时影响 Claude API(api.anthropic.com)和 Claude Cowork。目前问题已被缓解并标记为已解决。
Hugging Face 博客介绍了一种针对 GGUF 量化的逐张量布局映射方法。作者利用 Claude Code 在 Framework 提供的 AMD AI Max+ 395 128GB 桌面上运行约 96 小时,对 Qwen3.5-0.8B 和 Qwen3.5-4B 等模型进行了 1000 多次量化实验,通过 degrade-one 和 upgrade
llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA
AWS 在 Amazon SageMaker Inference 上推出 prefix-aware routing 路由策略,通过将具有相同提示前缀的请求持续发送到同一实例,使 KV 缓存得以复用。在 Llama 3.1 70B 的基准测试中,该策略将 P50 TTFT 降低最多 77%,吞吐量提升最多 16%,KV 缓存命中率从约 25% 提升至 80%
AWS 为 Amazon SageMaker HyperPod 上的推理推出模型缓存功能,通过预加载模型权重和容器镜像到集群节点的本地 NVMe 存储,将推理 Pod 的冷启动时间从数十分钟缩短到数秒。该功能针对 DeepSeek-R1 等 600GB 以上大模型,解决自动扩缩容时因重复下载镜像和权重导致的响应延迟问题。缓存采用优先调度而非强制调度,未命中缓
OpenAI 因最新最强模型 Astra 需求激增,暂时停止其每月 200 美元的 Pro 订阅新用户注册,以缓解基础设施压力。产品负责人 Thibault Sottiaux 在 X 上宣布了这一决定,称 Pro 计划对系统压力最大,但 API 及低价的 Go、Plus 计划仍可订阅。Astra 于 9 月 3 日发布,被宣传为迈向“AGI 时代”的世代级跃
llama.cpp 发布 b10900 版本,主要变更是 Vulkan 后端使用 add alloc dep 以在 prefill 阶段启用 topk moe 融合(PR #28422)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、C
llama.cpp 发布 b10899 版本,主要针对 Vulkan 后端进行小 M 矩阵运算优化,面向 Qwen 模型。改动包括通过交换 A/B 优化 m=1 的 mul mat、允许小 M 场景使用 split k,并让 coopmat2 的小/中 tile 选择依赖 M 而非仅依赖 N。该版本同时提供 macOS、Linux、Windows、Andro
llama.cpp 发布 b10897 版本,主要更新是将 Windows ARM64 平台的 CUDA 13.4 构建从 Developer Preview 归档迁移到 13.4.1 GA 可再发行组件。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、OpenV
OpenAI 将 GPT-Live-1 语音模型以 API 形式开放给开发者,该模型支持全双工(同时听说),已在 ChatGPT 内部运行。开发者可将其与不同后端模型搭配,按任务匹配推理深度、速度与成本,定价为每分钟 0.05 美元。Yelp 已用其处理电话预订并报告通话处理改善。OpenAI 基准显示该模型在全双工交互、轮次延迟、工具调用准确率等指标上明显
蚂蚁灵波开源三款世界模型:LingBot-World 2.0 Small(1.3B)、Bidirectional(双向Teacher模型)和Causal Pretrain(因果预训练基座模型)。其中1.3B版本面向消费级单卡GPU,可实时生成,便于个人开发者和高校实验室本地复现;双向Teacher模型提供高质量蒸馏源,因果预训练模型面向后训练、评测与场景适配