返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1717 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月8日周二 · 9 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10852 发布:Hexagon 新增 RELU 与 LEAKY RELU 算子

llama.cpp 发布 b10852 版本,为 Hexagon 架构新增 RELU 和 LEAKY RELU 算子支持。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,涵盖 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

neureps 发布 0.8B 端侧多模态 GGUF 模型

neureps 发布了 warmly-qwen35-08b-enko-gguf,这是一个基于 Qwen3.5-0.8B-enko 的 0.8B 端侧模型,采用剪枝和蒸馏技术,并以 GGUF 格式提供。该模型用于 Warmly 应用的小型设备部署,支持图像字幕和文本评论,总大小约 542MB。v3.1 版本包含蒸馏权重和 LoRA 人物适配器,通过 llama

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

NAICS GitHub 仓库分类器:基于 RoBERTa 的行业分类模型

Hugging Face 上发布了 aquiro1994/naics-github-classifier 模型,这是一个基于 RoBERTa-large 微调的多类文本分类模型,用于将 GitHub 仓库分类到 19 个 NAICS 行业部门。该模型使用 6,588 个标注仓库训练,支持通过仓库名称、描述、主题和 README 进行预测。模型提供了详细的 P

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10850 发布:修复 L2 NORM 测试初始化问题

llama.cpp 发布 b10850 版本,主要修复了测试中 L2 NORM 批量数组的初始化问题,以避免 GCC 12 在 aarch64 Release 构建中因未初始化警告而失败。该版本提供了适用于 macOS、Linux、Windows、Android 等多平台的二进制包,并支持多种后端如 Vulkan、CUDA、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10844 为 Vulkan 添加 DeepSeek-V4 融合算子

llama.cpp 发布 b10844 版本,为 Vulkan 后端添加了 DeepSeek-V4 超连接融合算子(DSV4 HC COMB/PRE/POST),将 Sinkhorn 迭代等操作融合到寄存器中,大幅减少调度次数,提升解码性能。该版本还包含多个平台的二进制构建。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10842 发布:新增 AMD gfx90c HIP 支持

llama.cpp 发布 b10842 版本,主要新增对 AMD gfx90c GPU 的 HIP 支持,并提供了适用于 macOS、Linux、Windows、Android 等多平台的预编译二进制文件。该版本还包含针对不同硬件(如 CUDA、Vulkan、ROCm、OpenVINO、SYCL)的构建,以及 iOS 和 UI 资源。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Synaptics 发布 MobileNetV2 多格式量化模型

Synaptics 在 Hugging Face 上发布了 MobileNetV2 模型,该模型由 tf.keras.applications 生成,支持 int16、int8、float32 和 float16 格式,其中 int8 量化使用随机数据。此外,还提供了 Google 发布的原始量化模型 kaggle.tflite,采用 v1 tflite 量

正文结构化主题已通过公开置信门槛
智东西产品发布

小米发布玄戒O3等三款自研芯片,雷军称已走在赢的路上

小米发布旗舰AI SoC芯片玄戒O3,采用3nm工艺,跑分超561万,性能较上代大幅提升,并首发搭载于小米18 Fold等产品。同时发布高带宽AI加速芯片玄戒O100和智驾芯片玄戒D100,实现三芯协同。小米自研芯片研发投入已达210亿元,计划十年投入500亿元。

正文结构化主题已通过公开置信门槛
智东西产品发布

安努智能发布六项成果,加速具身智能商业化落地

安努智能发布了六项具身智能商业化成果,包括视频生成技术Helios、仿真平台ANU SimLab、动作锚定世界模型ActiWorld、真机强化学习技术RoHIL与EvoHIL、垂类小模型AnuVerse-0.5及端到端部署系统Nexus,旨在解决机器人落地中的部署、预测、执行和复制问题。其中ActiWorld在真机分拣任务中成功率提升6个百分点,AnuVer

9月7日周一 · 11 条
正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10840 发布:CUDA 量化加速与 DGX Spark 预取优化

llama.cpp 发布 b10840 版本,主要更新包括在 CUDA 后端为 Q4 K/Q5 K 量化模型引入无分支解包以加速 mmvq 操作,并针对 DGX Spark 添加 L2 预取优化。该改动在批量大小大于 1 时提升性能,并调整了切换点以适应更多模型。同时提供了多平台二进制下载。

正文结构化主题已通过公开置信门槛
THE DECODER研究

OpenAI 报告 AI 研究智能体进展,首席科学家警告控制风险

OpenAI 发布内部数据,显示 AI 智能体已深度参与其研究,并宣称达到“自动化研究实习生”里程碑,同时首席科学家 Jakub Pachocki 发文警告,当前对 AI 系统的控制能力不足,链式思维监控可靠性下降,呼吁加强安全标准。

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论商业

燧原科技科创板发行募资61.19亿元,国产AI芯片龙头即将上市

燧原科技于9月7日公布科创板发行结果,募资61.19亿元,发行价142.18元/股,中签率0.0246%。公司专注云端AI芯片,已迭代四代架构、五款芯片,2026年上半年营收11.20亿元,同比增长279%,预计2026年或2027年盈利。此次上市将增强国产AI芯片竞争力,满足国内算力需求。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10839 修复 Vulkan GET ROWS 偏移崩溃

llama.cpp 发布 b10839 版本,主要修复 Vulkan 后端中 GET ROWS 操作在张量偏移未对齐时导致的崩溃问题,该问题影响 Qwen3-TTS 和 Qwen3-VL 等模型。修复包括在量化路径中正确应用偏移、调整缓冲区绑定和 push constants 传递,并新增后端测试覆盖。所有 223 个 GET ROWS 测试在 Vulkan

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Nemotron-3-Nano-4B 登陆 Apple Core AI,实现高效端侧推理

mlboydaisuke 在 Hugging Face 上发布了 Nemotron-3-Nano-4B-CoreAI,这是 NVIDIA 的混合 Mamba-2/Transformer 模型在 Apple Core AI 运行时上的量化版本。该模型在 iPhone 17 Pro 上达到 16.0 tok/s 的解码速度,在 M4 Max 上达到 85.2 t

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

React Native ExecuTorch 发布 Qwen 2.5 模型系列

software-mansion 在 Hugging Face 上发布了适用于 React Native ExecuTorch 库的 Qwen 2.5 模型仓库,包含 0.5B、1.5B 和 3B 规模的未量化与量化版本,文件格式为 .pte。这些模型使用 ExecuTorch v0.6.0 导出,不保证向前兼容,用户需确保运行时版本匹配。该发布旨在支持在移

正文结构化主题已通过公开置信门槛
量子位模型发布

GPT-6 Sol内测曝光:速度是Astra的6倍,OpenAI研究员人均带3个AI实习生

OpenAI正在内部测试GPT-6 Sol模型,其单次测试速度是刚发布的Astra的6倍,但输出能力较弱。同时,OpenAI披露内部数据显示,研究员人均使用3个AI Agent辅助工作,并宣布实现自动化AI研究实习生目标。首席科学家Jakub Pachocki发文呼吁行业减速,并警告AI监控难度加大。

正文结构化主题已通过公开置信门槛
量子位研究

菲尔兹奖得主团队用“桥”技术让4B模型刷爆ARC-AGI 3

Mostik公司(成立4个月,15人团队,含菲尔兹奖得主Stanislav Smirnov)开发了一种模型间通信的“桥”技术,让4B的Qwen-3.5与云端753B的GLM-5.2协作,在ARC-AGI 3上取得高分。该技术通过传递隐藏状态而非文本,使小模型弥补了50%的性能差距,准确率提升25%,并将大模型推理成本降至约二十分之一。团队计划探索蒸馏和专项化

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10837 发布:修复模板字符串检查并更新多平台构建

llama.cpp 发布 b10837 版本,主要修复了模板检查字符串时的类型检查问题。该版本提供了适用于 macOS、Linux、Windows、Android 和 openEuler 的多种预编译二进制文件,支持 CPU、Vulkan、CUDA、ROCm、OpenVINO、SYCL 等后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10835 发布:修复 CUDA f16 闪存注意力屏障问题

llama.cpp 发布 b10835 版本,主要修复了 CUDA 后端中 f16 闪存注意力机制的屏障分歧问题,并优化了元数据指针设置。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,支持 CPU、CUDA、Vulkan、ROCm、OpenVINO、SYCL 等多种后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10834 发布:ggml 后端输入优化

llama.cpp 发布 b10834 版本,主要更新为 ggml 后端允许输入不创建额外的 split。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件后端如 Vulkan、CUDA、ROCm、OpenVINO 等。