返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1715 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月16日周三 · 12 条
正文结构化主题已通过公开置信门槛
THE DECODER模型发布

Google 发布 Gemini 3.8 Live,以低价对标 OpenAI GPT-Live-1

Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两款面向开发者的音频模型,可通过 Gemini API 和 Google AI Studio 使用。Gemini 3.8 Live 支持语音代理在通话同时进行后台 API 调用和视觉输入处理,覆盖 97 种以上语言;Extended

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
智东西开源

无问芯穹联合清华上交开源具身端侧推理引擎APXInf

无问芯穹联合清华大学、上海交通大学正式开源具身端侧推理引擎APXInf,支持RTX 4090、Jetson Orin、Jetson Thor等主流计算平台。该引擎在Jetson Thor上将PI 0.5 FP8的端到端推理延迟从278ms降至26ms以内,达到46Hz推理频率,并采用Rust极简运行时与Python接口兼顾稳定性与易用性。APXInf作为RL

另有 1 家信源报道

正文结构化主题已通过公开置信门槛
智东西产品发布

华为发布全球首个3D数据中心,机电交付缩至3个月

华为在AIDC产业发展大会上发布全球首个3D数据中心,将供冷、IT设备和供电系统分层部署,电池独立置于屋顶,机电系统预制化率超90%,机电交付周期由6个月缩短至3个月。华为云已在安徽、贵州和内蒙古三大枢纽布局3D数据中心,IT设备层部署昇腾950系列产品。华为还发行《3D数据中心》专著并开放概要设计图库,全球计算联盟联合数十家产业链伙伴发起共建新一代AIDC

正文结构化主题已通过公开置信门槛
Google ADK JavaScript Releases一手来源开源

Google ADK JS devtools 发布 v2.1.0:新增 Docker 沙箱代码执行

Google ADK JavaScript 的 devtools 发布 v2.1.0 版本。新增 ContainerCodeExecutor 支持 Docker 沙箱化代码执行,为 agent engine deploy 增加 --min instances/--max instances 参数,并为开发服务器加入 Origin 校验以防御 DNS 重绑定攻

正文结构化主题已通过公开置信门槛
Google DeepMind News一手来源模型发布

Google DeepMind 发布 Gemini 3.8 Live 系列语音模型

Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两款面向近实时语音交互的新模型。前者主打规模化与成本效率,支持近实时视觉输入、97 种语言自动切换及后台工具调用;后者面向高复杂度任务,可边推理边说话,在 Artificial Analysis 语音到语音质量指数上以

另有 2 家信源报道

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程

稠密模型与 MoE 模型对比:激活参数、吞吐量与选择时机

NVIDIA 技术博客对比了稠密模型与 MoE(混合专家)架构,解释 MoE 如何让 30B 参数模型每 token 仅激活约 3B 参数,并仍利用大模型容量。文章以 Nemotron 3.5 Lightning 为例,说明 MoE 通过路由网络为每个 token 选择部分专家 FFN,注意力与嵌入权重仍全量参与。核心结论是 MoE 将显存成本(总参数)与计

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Krea2-Turbo 4步蒸馏LoRA发布:速度提升1.6倍

开发者 lvladikov 在 Hugging Face 发布 Krea2-Turbo-Distill-4step-LoRA,这是一个基于 krea/Krea-2-Turbo 的蒸馏 LoRA 适配器,将文生图模型的最低可用步数从 8 步降至 4 步,端到端速度约提升 1.6 倍。该 LoRA 在单张 RTX 3090 上训练 21 天,使用 78,000

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA Groq 3 LPX 确定性执行如何驱动高能效推理

NVIDIA 在技术博客中介绍其 Vera Rubin 平台如何通过功耗管理实现高能效 AI 推理,核心是 NVIDIA Groq 3 LPX 的确定性执行模型。该模型让 LPU 编译器在运行前生成精确到时钟周期的执行调度,从而预测每个周期的电流需求,并借助 Preemptive Power(PEP)和 Clock Period Synthesis(CPS)

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源产品发布

NVIDIA NVLink 6 为 AI 工厂提供多层弹性

NVIDIA 在技术博客中介绍 NVLink 6 面向大规模 AI 工厂的多层弹性架构,覆盖物理层、链路层、系统冗余和应用软件层。物理层通过轻量级 FEC、物理层重传(PLR)和 UPHY 恢复实现无损传输,链路层采用基于信用的流控(CBFC)消除丢包,系统层消除单点故障,软件层提供 Dynamo Shadow Engine Recovery 和检查点恢复。

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布

Amazon Bedrock 提示缓存降低 90% 输入成本

AWS 博客介绍 Amazon Bedrock 的提示缓存功能,通过在请求中加入 cachePoint 标记缓存系统提示、文档和工具定义等重复上下文,缓存命中时输入 token 成本最多降低 90%,TTFT 也会缩短。文章给出缓存写入比标准输入贵 25%、缓存读取便宜 90% 的定价,并展示消息内容、系统提示、工具定义、混合 TTL、租户隔离及 LangC

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源教程

用 SageMaker 无服务器定制构建 AI 产品打标系统

AWS 博客介绍如何用 Amazon SageMaker 无服务器模型定制构建 AI 产品打标系统。方案先对 Qwen3-8B 做监督微调(SFT),再用带可验证奖励的强化学习(RLVR)和 GRPO 优化,训练由 SageMaker 无服务器定制管理容量,最终模型部署到 SageMaker 异步推理做批量目录富化。文章对比了无服务器与 SageMaker

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源

Mozilla AI 发布 llamafile v0.10 系列预打包模型

Mozilla AI 在 Hugging Face 发布 llamafile v0.10 系列仓库,基于 v0.10.5 版本构建了多个预打包 llamafile。这些文件内置对 CPU、Mac Metal GPU 以及 Linux/Windows 上 CUDA+Vulkan 的支持,并附带 Bonsai、Qwen3.5/3.6、Ministral 3、ge

9月15日周二 · 8 条
正文结构化主题已通过公开置信门槛
阿里 ModelScope Releases一手来源开源

ModelScope 发布 v1.40.1:新增 JAEC 推理与语音分离模型

阿里 ModelScope 发布 v1.40.1 版本,新增 JAEC 原生推理流水线以及 FLA-TF-Locoformer、FLA-T-SepReformer 两个语音分离模型,并加入 Agent IDP 与 MCP/Studio OpenAPI 支持。同时修复了 vLLM Ascend 在 OpenEuler 和 x86 上的构建依赖问题,统一上传环境

正文结构化主题已通过公开置信门槛
TechCrunch AI商业

TechCrunch Disrupt 2026 探讨 AI 从原型到量产的落地挑战

TechCrunch 宣布在 TechCrunch Disrupt 2026 的 Real World AI Stage 举办名为「From Prototype to Production: Can It Scale in Reality?」的专题讨论,聚焦 AI 原型走向量产部署的挑战。MBRYONICS 联合创始人兼 CEO John Mackey、Be

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10985:RPC 哈希缓存仅限权重张量

llama.cpp 发布 b10985 版本,修复了 RPC 后端的哈希缓存问题。此前 ggml backend rpc 会对所有超过 HASH THRESHOLD 的传输(包括调度器在节点间复制的激活值)进行哈希并写入 rpc-server 的磁盘缓存,导致 Qwen3.8-Flash-Next 双节点拆分下一天内缓存膨胀至 1.4 TB。补丁改为仅对标记

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10984:CUDA 支持行连续 SUM ROWS

llama.cpp 发布 b10984 版本,主要更新为 CUDA 后端支持行连续的 SUM ROWS 操作,并整理代码、新增 GGML OP MEAN 以复用同一共享内核处理行连续张量,同时为 MEAN 的 permute/slice 添加测试。该版本同步提供 macOS、Linux、Windows、Android 等多平台预编译二进制包。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

LTX-2.5 无审查视频模型 v1.1 FP8 版发布

Hugging Face 用户 ChrisColeTech 发布了 LTX-2.5-uncensored-v1.1-FP8,这是基于 Lightricks/LTX-2.5 的预合并量化版本,将 Eros10 NSFW、DMD 蒸馏、IC-LoRA、IC-LoRA Detailer 和 Img2Vid 五个微调 LoRA 直接烘焙进权重。模型提供 GGUF 与

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp 发布 b10983:调整 build arch graph 定义顺序

llama.cpp 发布 b10983 版本,主要变更是将 build arch graph() 的函数定义移动到 graph 和 graph 模板特化之后,以修复编译顺序问题。该版本同时提供 macOS、iOS、Linux、Android、Windows 等多平台预编译二进制包,覆盖 CUDA、Vulkan、ROCm、SYCL、OpenVINO 等后端。

正文结构化主题已通过公开置信门槛
雷峰网 AI科技评论产品发布

联发科发布天玑9600 Pro:2nm制程首创AI原生架构

联发科正式发布新一代旗舰移动平台天玑9600 Pro,这是天玑首款Pro旗舰,率先采用台积电2nm制程,并首创AI原生架构,将CPU、GPU、NPU、ISP等异构计算核心整合为系统级融合计算架构。该平台搭载2+3+3全大核CPU、双NPU架构、天玑神经网络渲染架构及智能影像架构,支持端侧运行最高30B MoE大模型,并与vivo、OPPO、阶跃星辰合作落地主

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源

llama.cpp b10981:优化 OpenVINO 有状态解码与 GPU MoE 推理

llama.cpp 发布 b10981 版本,主要针对 OpenVINO 后端进行优化,涵盖有状态解码、GPU MoE 推理、KV 状态重排、RoPE 与归一化翻译等。修复了 Gemma-4 等模型因逐层 KV 头数/头尺寸差异导致解码乱码的问题,并拒绝无法从 KV 状态恢复的有状态解码。性能上,GPU 上 gemma-4-12B 在深度 8192 时从 6