高通携手中兴努比亚与豆包推出智能体手机NaviX Ultra
高通技术公司宣布与中兴努比亚、豆包手机助手合作,推出搭载第五代骁龙8至尊版移动平台和豆包手机助手消费者版的智能体手机努比亚NaviX Ultra。该平台集成第三代Qualcomm Oryon CPU、Adreno GPU和面向智能体AI优化的Hexagon NPU,支持生成式AI与智能体AI体验。努比亚称该机可实现多方式唤醒模型、连续对话、多任务及跨APP操
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
高通技术公司宣布与中兴努比亚、豆包手机助手合作,推出搭载第五代骁龙8至尊版移动平台和豆包手机助手消费者版的智能体手机努比亚NaviX Ultra。该平台集成第三代Qualcomm Oryon CPU、Adreno GPU和面向智能体AI优化的Hexagon NPU,支持生成式AI与智能体AI体验。努比亚称该机可实现多方式唤醒模型、连续对话、多任务及跨APP操
2026年9月15日,AI基础设施公司基元律动(TokenRhythm)与无问芯穹(Infinigence AI)签署战略合作协议,双方将结合无问芯穹的Agentic Infra产品服务体系与基元律动的多模型服务、智能路由能力,围绕高质量Token的供给、调度与应用展开合作。基元律动已首发接入Qwen-3.8-Max及牛来(GLM-5.3-Flash),双方
另有 1 家信源报道
llama.cpp 发布 b10995 版本,主要变更是让 Vulkan 后端的 MUL MAT ID BN/2 尾部分支变为无条件启用,将 BN/2 设为默认并作为 BNover4 的禁用回退,同时移除该分支的启用门控;BN/4 分支仍由 enable smaller matrices 控制。该版本同时提供 macOS、Linux、Windows、Andr
llama.cpp 修复了 Metal 后端 mul mm id 算子在激活值超出 f16 范围(65504)时产生 NaN 的问题。原因是 simdgroup MMA 将 src1 窄化为 half 导致 inf 并污染整个 8x8 累加器,修复方式是按 2 的幂对 src1 重新缩放并在存储时还原,保证结果精确且对现有模型比特级一致。该缺陷曾导致 Mis
llama.cpp 发布 b10993 版本,主要变更是为 hf-jobs 添加自托管的 WebGPU 和 Vulkan 后端,并调整 CPU 后端线程数。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制,支持 CUDA、ROCm、Vulkan、SYCL、OpenVINO 等多种加速后端。
llama.cpp 发布 b10992 版本,主要变更是为 llama-bench 增加 --version 参数以打印构建信息(PR #28971)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。
曼彻斯特大学David Topping团队利用NVIDIA Earth-2系列开放AI模型(CorrDiff、StormCast)在英国国家AI超算Isambard-AI上训练出覆盖全英的空气质量预测模型,训练仅用两天,分辨率达2-3平方公里。该模型可预测未来污染情景,并能在DGX Spark桌面AI系统上运行推理和小规模训练,团队计划开源训练数据与工作流,
开发者 CodeMasterCody3D 在 Hugging Face 发布 TAARDIS-27B 全三值量化模型,基于 Qwen3.8-27B,将全部权重(含 LM head 与 embedding)压至 1.75 bit/权重、5.90 GB,并附带 496 个跨层低秩三值修正分支 The Doctors,使 Wikitext 困惑度从 13.61 降
该论文提出「推理网络」(inference networks)框架,将多个LLM专家建模为有向图,节点为模型、边表示条件激活,以在给定性能约束下最小化推理成本。作者针对串联拓扑证明最优激活策略具有阈值结构:先调用最低成本模型,仅当置信度低于阈值时才调用更贵模型;判别任务每类一个阈值,生成任务仅一个阈值。实验在开源LLM的分类与生成基准上显示,在满足性能预算的
该研究系统测试了仅权重量化(PTQ)在检索嵌入模型上的表现,覆盖四个架构家族的五个检查点,在多种位宽和分组大小下评估三个检索语料库。结果显示,INT4/g16 下模块级量化影响极小(最多约1个NDCG点),INT3 下模块敏感度排序因模型家族而异且成本不可加,INT2 下检索质量保留率从1.3%到65.9%不等,存在强烈的模型家族依赖的“低比特悬崖”。权重重
量子位报道,随着Coding Agent等长任务普及,KV Cache占用显存导致并发下降、TTFT升高。英特尔提出以CPU侧管理、分层存储和QAT硬件压缩为核心的KV Cache优化方案,包括KV Shrink、KV Fuse、KV Cascade和KV Infinity四个方向。测试显示KV Shrink在80%缓存命中率下TTFT最高约5倍加速,QAT
LiteLLM 发布 v1.103.0-dev.1 开发版本,所有 Docker 镜像均使用 cosign 签名,并提供了基于固定 commit hash 和 release tag 两种验证方式。该版本包含大量修复与功能更新,涉及 responses、proxy、MCP、日志、Bedrock、Anthropic 适配器、路由、认证、定价等多个模块。
华为GTS AI算法团队提出NetCanvas机制,通过「可交互视觉拓扑」为网络运维Agent提供外部工作记忆画布,解决纯文本Agent在复杂IP承载网排障中的「拓扑失忆」问题。在公开基准CTBench上,Agent综合通过率从30.3%提升至54.5%,双防火墙、ECMP等复杂子任务从约10%跃升至约90%,平均探查步数从159步降至113步,Token试
llama.cpp 发布 b10991 版本,主要修复了 hexagon 后端缺失的 contiguous 快速路径,并为每次运行补回 hvx copy uu。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
llama.cpp 发布 b10990 版本,主要变更为 hex-cpy 在源和目标内存连续时使用 DMA 进行拷贝(PR #28906)。该版本同时提供 macOS/iOS、Linux、Android、Windows 等多平台预编译二进制,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。
Google 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款语音到语音模型,形态类似 OpenAI 的 GPT-Live 系列。作者用 GPT-6 Astra Extra High 参考文档构建了一个网页 UI,可选择模型和语音预设、输入系统提示词,并通过浏览器进行可打断的语音对话。该实现不依赖任何库,直
llama.cpp 发布 b10989 版本,主要变更为在 HIP 后端为 ROCm 启用 AllReduce(PR #27825)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。此次更新提升了
Hugging Face 用户 esatapedico 发布了 DavidAU 的 Qwen3.8-27B-TWIN-TURBO-Fable-Cold-Fusion-709-L-Uncensored 模型的六个 GGUF 量化版本,采用 NVFP4(W4A16,FP8 缩放,组大小 16)格式,面向 Blackwell sm 120 架构。六个文件共享字节完
Google Research 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,通过离线强化学习将奖励对齐的查询扇出行为编译为监督信号,再蒸馏进轻量扩散检索器,从而在推理时单次生成连贯、专家级的搜索结果集合。该方法在 Gemma3-4B 和 Qwen3-4B 上使用 Soft-GRPO 训练,并在时尚文本到图像与音乐文本到音乐
llama.cpp 发布 b10988 版本,主要更新 OpenCL 后端:在投机解码/MTP 场景下根据 batch size 选择 MoE expert matmul 实现,并针对路由数量对预构建的 q4 0 MoE GEMM 进行门控,同时停止向填充的 MoE 激活槽写入零值。该改动由高通工程师参与贡献,旨在优化 MoE 模型在 OpenCL 设备上的