llama.cpp 发布 b10901:Vulkan 空闲时改用 CPU 写入
llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA
产业与政策 · 加速卡、算力供给与硬件供应链 · 共 243 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
llama.cpp 发布 b10901 版本,主要变更是 Vulkan 后端在上下文空闲时,ggml backend vk cpy tensor async 改用 CPU 写入方式。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA
llama.cpp 发布 b10900 版本,主要变更是 Vulkan 后端使用 add alloc dep 以在 prefill 阶段启用 topk moe 融合(PR #28422)。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、C
llama.cpp 发布 b10899 版本,主要针对 Vulkan 后端进行小 M 矩阵运算优化,面向 Qwen 模型。改动包括通过交换 A/B 优化 m=1 的 mul mat、允许小 M 场景使用 split k,并让 coopmat2 的小/中 tile 选择依赖 M 而非仅依赖 N。该版本同时提供 macOS、Linux、Windows、Andro
llama.cpp 发布 b10897 版本,主要更新是将 Windows ARM64 平台的 CUDA 13.4 构建从 Developer Preview 归档迁移到 13.4.1 GA 可再发行组件。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,涵盖 CUDA、Vulkan、ROCm、OpenV
高通提前剧透了将在2026骁龙峰会上发布的新一代骁龙旗舰移动平台的核心技术升级,涵盖CPU、GPU、NPU三大模块面向智能体AI的全面进化。NPU方面推出新的Hexagon NPU、Element Accelerator和更大共享内存,并联合内存与模型厂商引入MoE架构;CPU方面Oryon成为业内首个最高主频达5GHz的移动CPU,并引入动态缓存架构Fle
NVIDIA 技术博客介绍其 NIM 2.0.12 全栈优化如何在 Nemotron 3 Ultra 上实现 2.5 倍并发用户提升。在 4xB200 硬件、64K 上下文、76% KV 复用、50 TPS/用户(20ms ITL)的 agentic 负载基准下,优化后吞吐从 718 tok/s 提升至 1,997 tok/s。优化来自精度与自动调优内核、张
llama.cpp 发布 b10893 版本,主要变更是提高 Add fusion 测试的容差(#28691)。该版本同时提供 macOS、iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CPU、Vulkan、ROCm、OpenVINO、SYCL、CUDA 等多种后端。
llama.cpp 发布 b10891 版本,针对 PowerVR GPU 的 Vulkan 后端修复了一个严重问题:Imagination 专有 Vulkan 编译器对使用仅子组归约(要求子组大小 =16)的反量化 mul mat vec 着色器返回 VK ERROR UNKNOWN,导致 k-quants、i-quants、TQ2 0、MXFP4、NVF
llama.cpp 发布 b10888 版本,主要变更是为 Vulkan 后端添加命令缓冲区(command-buffer)调试标签,以便 GPU 性能分析工具(profiler)识别和追踪。该改动由 gabby-zy 等人贡献,并借助 Claude Code 协助完成。同时该版本照例提供 macOS、Linux、Windows、Android 等多平台预编
FuriosaAI 在 Hugging Face 发布了 furiosa-ai/Qwen3-8B-FP8 模型仓库,将 Qwen3-8B-FP8 与 Furiosa Executable Bundle(FXB)打包,使其可在 FuriosaAI RNGD 硬件上通过 Furiosa-LLM 运行。该模型为 8.2B 稠密模型,支持思考/非思考模式切换、工具调
NVIDIA 发布 CUDA Toolkit 13.4,新增对 Windows on Arm 平台的支持,并预览支持下一代 Rubin GPU 架构(计算能力 107)。该版本还引入了 MPS V3 以增强共享 GPU 资源管理,以及 CUDA Compute Fabric Transport (CFT) 用于大规模 NVLink 数据传输。此外,CUDA
苹果在发布会上推出了首款折叠屏手机iPhone Duo,起售价15999元,采用液态金属铰链并借助AI辅助设计。同时发布了iPhone 18 Pro系列、AirPods 5和Apple Watch S12/Ultra 4,并升级了Siri AI,使其能跨应用协作。市场反应积极,苹果股价上涨。
另有 1 家信源报道
苹果在周三的 Surprise and Shine 活动上发布了其首款折叠屏手机 Duo,该手机的关键铰链采用 AI 和 3D 打印技术制造。苹果硬件主管 Johny Srouji 表示,制造过程中使用 AI 算法精确匹配每个铰链与外壳,并通过共聚焦激光扫描和 3D 打印定制光聚合物层来消除波纹。此外,Duo 还采用了纳米纹理表面和多层压合策略以增强耐用性,
苹果将于9月10日凌晨举行秋季发布会,预计推出首款折叠屏iPhone Duo、iPhone 18 Pro系列、AirPods 5及Apple Watch新品。据爆料,iPhone Duo采用书本式设计,搭载A20 Pro芯片和自研C2基带,起售价约2000美元;Pro系列将升级影像并涨价。国行Apple智能与阿里、百度的合作进展及具体上线时间仍是悬念。
另有 1 家信源报道
初创公司 Besxar 由前 OpenAI 员工 Ashley Pilipiszyn 创立,计划利用 SpaceX 猎鹰 9 号火箭助推器在太空轨道上测试半导体制造技术,已筹集近 1400 万美元。其首批两个小型罐体在 7 月的星链任务中成功验证了在太空真空环境下保护晶圆的能力,尽管一个罐体出现飞行数据系统故障。公司目标是在未来两年内迭代技术,最终在 Sta
联想在IFA 2026上发布多款AI终端,包括搭载NVIDIA RTX Spark的Yoga笔记本和概念机,并升级个人智能体Qira(国内名天禧),实现跨设备系统级AI体验。联想IDG总裁Luca Rossi表示,AI PC的'ChatGPT时刻'正在发生,高额云Token成本推动需求,未来12个月势能加速释放。联想AI PC市场份额达25.1%居全球第一,
NVIDIA 于 2026 年 9 月宣布推进 CUDA Rust,支持用 Rust 原生编写 GPU 内核并编译为 PTX,提供 SIMT 和 Tile 两种编程模型。首个工具 cuda-oxide 作为 rustc 代码生成后端,可将 Rust 内核编译到 PTX,并提供了完整的向量加法示例。此举旨在满足 AI 系统层对 Rust 的需求,并计划在 20
Arm在Arm Everywhere China 2026大会上发布CSS for Mobile 2,CPU通过SME2增强AI能力以普及端侧AI,Mali GPU首次集成神经网络加速器实现神经图形技术,提升游戏性能。Arm未集成NPU,而是将NPU创新留给合作伙伴,自身聚焦CPU、GPU及软件生态,以支持个人AI体验。
本末科技是一家专注机器人本体的公司,推出了全球首款商业化直驱双轮足机器人刑天、TITA以及可模块化合体的D1机器人。其直驱动力模组2025年出货约850万套,占中国消费机器人市场61.1%份额,轮足整机出口全球50多国。公司创始人张笛认为,在具身智能领域,本体能力是大脑模型落地的关键前提。
芯思杰(PHOGRAIN)将在第27届中国国际光电博览会(CIOE)上正式发布400Gbps背照式PIN型光电探测器芯片,该芯片采用电荷补偿技术和背部透镜一体化集成设计,旨在支撑AI算力驱动下光收发模块向1.6T、3.2T速率迭代。芯思杰凭借IDM全链自研能力,已形成覆盖2.5Gbps-400Gbps的全速率产品矩阵,并布局全球六大产业基地,以推动下一代高速