高通剧透下一代骁龙旗舰芯:CPU、GPU、NPU全面进化
高通提前剧透了将在2026骁龙峰会上发布的新一代骁龙旗舰移动平台的核心技术升级,涵盖CPU、GPU、NPU三大模块面向智能体AI的全面进化。NPU方面推出新的Hexagon NPU、Element Accelerator和更大共享内存,并联合内存与模型厂商引入MoE架构;CPU方面Oryon成为业内首个最高主频达5GHz的移动CPU,并引入动态缓存架构Fle
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
高通提前剧透了将在2026骁龙峰会上发布的新一代骁龙旗舰移动平台的核心技术升级,涵盖CPU、GPU、NPU三大模块面向智能体AI的全面进化。NPU方面推出新的Hexagon NPU、Element Accelerator和更大共享内存,并联合内存与模型厂商引入MoE架构;CPU方面Oryon成为业内首个最高主频达5GHz的移动CPU,并引入动态缓存架构Fle
NVIDIA 技术博客介绍其 NIM 2.0.12 全栈优化如何在 Nemotron 3 Ultra 上实现 2.5 倍并发用户提升。在 4xB200 硬件、64K 上下文、76% KV 复用、50 TPS/用户(20ms ITL)的 agentic 负载基准下,优化后吞吐从 718 tok/s 提升至 1,997 tok/s。优化来自精度与自动调优内核、张
AWS Machine Learning Blog 介绍了一种基于 LLM 的模型无关 PII 检测器,通过指令驱动检测逻辑,可在 Amazon Bedrock 或自托管模型上运行。该方案将实体类型和输出格式变为可配置项,无需重新训练即可扩展检测范围,并在五个公开 PII 语料库上与包括 OpenAI PrivacyFilter 在内的九种 LLM 检测器进
Hugging Face 用户 peculiar-ragdoll 发布了 Nail-Qwen3.6-35B-A3B-GGUF-MTP,这是基于 Qwen3.6-35B-A3B 的 4-bit GGUF 量化模型,保留了标准量化中被丢弃的多 token 预测(MTP/nextn)张量,并内置改进的聊天模板与强制系统提示。该模型面向推理、多轮对话和 agenti
llama.cpp 发布 b10896 版本,修复了在使用 DFlash 推测解码与视觉模型(mtmd)配合时无法解码图像 chunk 的问题。修复方式是停止将图像 token 复制给 drafter,并将 M-RoPE 跳过逻辑限制为仅图像,允许音频正常通过。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制。
Ampixa 在 Hugging Face 发布 sanoTTS,一个参数规模 294k 至 2.27M 的微型神经语音合成模型家族,可在约 3 美元的 ESP32-S3 微控制器上实时运行,也可通过 WASM 在浏览器中运行。该系列覆盖 6 种语言共 11 个音色,采用 GPL-3.0 开源许可,并提供 Python 与 JavaScript 包。其意义在
NVIDIA 发布 BioNeMo Inference Runtime(BioIR),在 NVIDIA GPU 上加速生物分子结构预测模型,同时保留 PyTorch 工作流,并支持通过 Ray 在单节点多 GPU 上运行完整模型副本以提升吞吐。该运行时已用于 AlphaFold Database 的扩展,在 4,777 个蛋白质组中加速生成约 3,100 万
llama.cpp 发布 b10894 版本,主要改动是清理旧模型代码中已失效的 switch 分支(#28669),移除早期重构时复制粘贴、现已不可能触发的条件判断,仅保留 llama model bert::graph::graph 的共享逻辑。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖
Desert Ant Labs 在 Hugging Face 发布多语言端侧 emoji 推荐模型 Emo,可根据输入的单词或句子建议合适的 emoji。模型支持 22 种语言,体积仅 5MB(Core ML)或 11MB(LiteRT),端侧推理耗时低于 2ms。模型采用双流分类架构,结合 n-gram 词法流与基于 Model2Vec 蒸馏的语义流,输出
开发者 brandonmusic 在 Hugging Face 发布了 GLM-5.3-Flash 的 EXL3/TR3 4bpw 量化检查点,基于 zai-org/GLM-5.3-Flash-BF16,面向 SM120 双 GPU 环境。该版本提供多模态 DFlash2、纯文本 DFlash2 和纯文本 MTP3 三种 vLLM 服务配置,并附带可复现的
Hugging Face 用户 reaperdoesntknow 发布了 Qwen3.5-2B-CyberSec 的 GGUF 量化版本,便于在 llama.cpp 兼容运行时(含 Ollama)本地推理。该模型基于 unsloth/Qwen3.5-2B,并使用 Trendyol 网络安全指令微调数据集训练。发布方明确说明未提供基准测试或安全评估结果,并提示
Hugging Face 用户 reaperdoesntknow 发布了基于 Qwen/Qwen3.5-0.8B 的 GGUF 量化模型仓库 Qwen3.5-0.8-Cyber-GGUF,提供从 BF16 到 Q2 K L 的多档量化版本,面向本地推理与资源受限场景。仓库还包含一个 BF16 mmproj 多模态投影文件,但作者明确表示未验证端到端多模态路径
Deepseek 发布新模型 V4.1-Flash,通过大幅压缩 KV 缓存降低长文本处理成本:快速 GPU 内存中的缓存仅需前代 V4-Flash 约四分之一,永久卸载部分降至约八分之一,相比 V1 每 token 全局 KV 缓存缩小 437 倍。模型采用输入/输出计算拆分,读取输入时每 token 仅激活 80 亿参数、生成时激活 160 亿,并将主
另有 1 家信源报道
llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。
llama.cpp 发布 b10892 版本,主要变更是从 test-backend-ops.cpp 中移除 SYCL 的特殊处理逻辑(PR #28688)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CPU、Vulkan、ROCm、OpenVINO、SYCL、CU
llama.cpp 发布 b10891 版本,针对 PowerVR GPU 的 Vulkan 后端修复了一个严重问题:Imagination 专有 Vulkan 编译器对使用仅子组归约(要求子组大小 =16)的反量化 mul mat vec 着色器返回 VK ERROR UNKNOWN,导致 k-quants、i-quants、TQ2 0、MXFP4、NVF
Mistral AI 与 Cloudera 宣布建立合作伙伴关系,将 Mistral 的模型集成到 Cloudera 的混合数据平台中,使企业能够在私有云、公有云、本地及完全气隙环境中部署 AI 模型并保持完全控制。双方还将支持企业在受控环境中利用专有数据训练定制模型,从而拥有数据和由此产生的智能。该合作旨在满足受监管行业对主权 AI 日益增长的需求。
DeepSeek 上线 V4.1-Flash,采用因果编码器-解码器(CED)、第二代压缩稀疏注意力(CSA2)与三档推理力度旋钮的全新架构,针对长上下文场景重写。该架构将运行时显存占用降低约 3/4,落盘持久 KV 缓存降至上一代的 1/8,KV 缓存最高暴降 437 倍,使百万 Token 级长上下文进入工业级生产力阶段。模型主干 552B 参数、外挂
llama.cpp 发布 b10889 版本,主要改动是内存优化:在索引器场景下不再分配 V cache,因为该缓存实际未被使用(PR #28330,由 Stanisław Szymczyk 参与)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、Ope
llama.cpp 发布 b10888 版本,主要变更是为 Vulkan 后端添加命令缓冲区(command-buffer)调试标签,以便 GPU 性能分析工具(profiler)识别和追踪。该改动由 gabby-zy 等人贡献,并借助 Claude Code 协助完成。同时该版本照例提供 macOS、Linux、Windows、Android 等多平台预编