返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月14日周一 · 15 条
正文结构化主题已通过公开置信门槛
arXiv cs.IR一手来源研究

Pinterest 发布 PinDCO:十亿级整页感知动态创意优化系统

Pinterest 在 arXiv 发布其生产级动态创意优化系统 PinDCO,用于十亿级视觉发现平台上的广告创意检索与选择。系统核心为 Creative Component Fusion Network(CCFN),对图像、标题、布局等创意组件分别建模并融合打分,同时引入 Pixel-aware Adjustment Module(PAM)根据创意尺寸调整

正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源开源

基于ONNX的量化分析工具助力高效AI模型部署

马里兰大学的研究者提出 Quantization Analysis Tool,一个基于 ONNX 框架的量化分析工具,用于简化 AI 模型量化工作流。该工具提供逐层敏感度分析、权重与激活分布可视化,帮助开发者识别对低精度敏感或鲁棒的层,从而在模型大小、延迟与精度之间做出权衡。实验表明该工具能有效提升量化后精度,改善边缘设备部署效率。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论研究

NUS Show Lab 寿政:融合自回归与离散扩散,打造具身大模型底座

新加坡国立大学 Show Lab 负责人寿政教授在 ECCV 2026 上介绍了 Show-o 系列统一多模态模型,该架构在单个 Transformer 中融合自回归预测与离散掩码扩散生成,解决文本离散性与视觉连续性难以统一的问题。团队进一步提出循环一致性监督实现理解与生成的双向反哺,并通过 3D Tokenizer 与时空双向注意力提升连续视频生成质量。研

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Qwen3.8-Flash 量化包登陆 Strix Halo,支持长上下文与视觉输入

开发者 jcbtc 在 Hugging Face 发布了 Qwen3.8-Flash-CIRU-STRIX-IU4 v4.0.0,这是面向 128 GB AMD Strix Halo(Ryzen AI Max+ 395)机器的 Qwen3.8 Flash 量化包,支持长上下文文本生成、OpenAI 兼容 API、Web UI 和可选图像输入。该包基于 Qwe

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

handy-computer 发布 nemotron-3.5 流式 ASR 的 GGUF 量化版

handy-computer 在 Hugging Face 发布了 nvidia/nemotron-3.5-asr-streaming-0.6b 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型是 0.6B 参数的 cache-aware 流式 FastConformer 编码器加 RNN-T 解码器,支持 32 种语言区域的多语言语音

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

handy-computer 发布 whisper-small 的 transcribe.cpp GGUF 量化版

handy-computer 在 Hugging Face 发布了 openai/whisper-small 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语言检测和语音翻译,提供 F32 到 Q4 K M 六种量化规格,其中 Q8 0 仅 270MB 且 LibriSpeech test-clean WER 为 3.

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

handy-computer 发布 whisper-medium GGUF 量化版

handy-computer 在 Hugging Face 发布了 openai/whisper-medium 的 GGUF 量化版本,供 transcribe.cpp 使用。该模型支持多语言转录、语种检测和语音翻译,提供 F32 到 Q4 K M 共六种量化规格,其中 Q4 K M 仅 504 MB 且 LibriSpeech test-clean WER

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

MiniMax H3 INT4 量化与混合精度 VAE 模型发布

Hugging Face 用户 koongrizzly 发布了 MiniMax H3 的量化模型合集,包含来自 Winnougan 的 INT4/W4A8 ConvRot 量化 transformer 与文本编码器,以及自行转换的混合 FP16/FP32 Video VAE,并整合了 Turbo LoRA。该仓库面向消费级 GPU 的本地低显存推理,官方适配

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Argmax 发布 SpeakerKit Core ML 说话人分离模型

Argmax 在 Hugging Face 上发布了 SpeakerKit Core ML 模型,这是一个基于 pyannote 的说话人分离(diarization)模型,采用 Core ML 格式并经过量化,配套 WhisperKit 使用。该模型与 Swift 框架 SpeakerKit 配合,相关架构和基准测试发表在 Interspeech 2025

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10948:WebGPU 测试排除 HY V4

llama.cpp 发布 b10948 版本,主要变更是将 HY V4 从 WebGPU 的 test-llama-archs 测试中排除(PR #28855,由 Stanisław Szymczyk 共同提交)。该版本同时提供 macOS/iOS、Linux、Android、Windows 及 openEuler 等多平台预编译二进制包,覆盖 CUDA、V

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10947 修复 nemotron-h 专家 FFN 除零崩溃

llama.cpp 发布 b10947 版本,修复了 nemotron-h 模型在加载时的专家 FFN 尺寸回退逻辑缺陷。当 NextN/MTP 尾部循环中 expert feed forward length 未提供该层数值时,代码会用 n ff/n expert used 推导专家 FFN 尺寸,而这两个逐层数组在非 MoE 层上合法地为 0,导致同时为

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10946:修复 s390x VXE repack 辅助函数

llama.cpp 发布 b10946 版本,主要变更是为 ggml-cpu 的 s390x 架构添加对 VXE 专用 repack 辅助函数的保护(PR #28775)。该版本同时提供覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,支持 CUDA、Vulkan、ROCm、SYCL、Ope

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Ornith-1.5-35B-A3B 去审查版 GGUF 量化发布

Hugging Face 用户 gbuzhf 发布了 Ornith-1.5-35B-A3B 的 abliterated(去审查)GGUF 量化版本,基于 huihui-ai 的 abliterated 权重,提供 19G/21G/23G/25G 四档 ICE 量化及 BF16 主模型。该版本使用 27,513 条全语料重要性矩阵校准,并嵌入模型自带的 MTP

正文结构化主题已通过公开置信门槛
智东西商业

英特尔2026技术创新与产业生态大会9月22日开幕

智东西报道,英特尔将于9月22日-23日举办2026英特尔技术创新与产业生态大会(Intel Connection 2026),聚焦智能体AI、端侧全场景创新与AI基础设施三大赛道。大会包含11场主题演讲、7大专题论坛、40+场技术课堂、15000平方米AI成果展区(1300+项成果)及5场免费开发者实操工作坊,英特尔与60余家合作伙伴展示云边端全栈技术。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10944:修复 SYCL 内存获取错误

llama.cpp 发布 b10944 版本,主要修复 SYCL 后端获取内存时的错误(#28227),包括对不支持 ZES API 的处理、优化代码、调整日志级别、清理无用头文件,并修复检测 Level Zero SDK/开发包失败时的构建错误。该版本同时提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

9月13日周日 · 5 条
正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

CMSManhattan 发布 JiRack Ultra 7B CPU 三值模型

CMSManhattan 在 Hugging Face 发布 JiRack Ultra 7B(CPU)模型,基于 DeepSeek R1-7B 架构并加入 BitNet 风格的三值(1.58bit)支持,提供 GGUF 量化版本,面向 CPU 推理优化。模型附带更新的 JiRack Precision Tokenizer,新增 Routing、Media、V

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

CMSManhattan 发布 JiRack Ultra 32B CPU 三值量化模型

CMSManhattan 在 Hugging Face 发布 JiRack Ultra 32B(CPU)模型,基于 DeepSeek R1-32B 架构并引入 BitNet 风格的三值(1.58bit)量化与更新版 JiRack 分词器,新增路由、媒体、视觉、声音、工具调用和机器人等标签。模型提供 GGUF 量化版本,面向 CPU 推理优化,可用于 RAG

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

K2-Horizon-7B 社区 GGUF 量化版本发布

社区开发者 ngquocvinh 在 Hugging Face 上发布了 IFM/K2-Horizon-7B 的 GGUF 量化版本,共 15 个文件,覆盖 Q8 0 到 Q1 0 等多种量化等级。该模型原生支持 524,288 token 上下文,面向英文、中文、编程、推理、长上下文和智能体任务。发布者提供了与 BF16 参考模型在 WikiText 上的

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

AMAImedia 发布 DeepSeek-V4.1-Flash FP8 GGUF 量化版

AMAImedia 在 Hugging Face 发布了 DeepSeek-V4.1-Flash 的 FP8 GGUF 量化版本,基于 deepseek-ai/DeepSeek-V4.1-Flash 原始模型转换而来,属于 NOESIS 多语言配音自动化平台的一部分。该模型为 552B 参数的多模态 MoE 架构,支持百万级上下文,通过 CED 架构、CSA

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

后摩智能与绿联合作推出HomeAgent家庭AI中枢

9月12日晚,绿联科技在品牌全球发布会上推出与后摩智能合作的UGREEN HomeAgent HA100 Pro,定位为以本地AI算力打造的家庭AI中枢。该产品结合后摩智能M50芯片的本地AI算力,将本地计算、存储、家庭看护和全屋设备管理能力融为一体,试图解决家庭设备数据分散、入口割裂及隐私安全问题。后摩智能M50基于存算一体架构,单芯片提供160 TOPS