返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1714 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

9月25日周五 · 7 条
正文结构化主题已通过公开置信门槛
智东西模型发布3

科大讯飞发布全国产算力语音识别大模型Spark-ASR-2.0

科大讯飞于9月24日推出语音识别大模型Spark-ASR-2.0,基于全国产算力训练的语音基座模型Spark-Audio-1.0-Preview构建,重点提升通用识别、复杂声学场景识别、上下文识别和文本流畅规范性。该模型融合非自回归与LLM增强的自回归识别能力,通过投机解码实现先快速识别再重点纠错,推理成本较上代仅增10%,已上线讯飞输入法并通过讯飞开放平台

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布5

AWS 在 SageMaker AI 上推出 WhisperX 说话人标注转写容器

AWS 发布 WhisperX 深度学习容器(DLC),在 SageMaker AI 上提供带说话人标注的语音转写能力。该容器封装了 OpenAI Whisper,并加入 wav2vec2 强制对齐实现逐词时间戳,以及说话人分离(diarization)功能,无需 Hugging Face token 即可部署。用户可将其部署到 SageMaker AI 实

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B 高效推理模型

UkisAI 发布了 Swift-Qwen3.8-27B,这是基于 Qwen3.8-27B 微调而来的推理高效衍生模型。该方法通过识别并惩罚导致过度思考的推理标记 token,使思考 token 数量减少 58.3%,性能损失低于 1%,在多个任务上实现约 1.95 倍加速。模型还引入了来自 BottleCap AI 的 ThinkingCap-Qwen3.

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B-NVFP4 混合精度量化模型

UkisAI 在 Hugging Face 发布 Swift-Qwen3.8-27B-NVFP4,这是其推理高效模型 Swift-Qwen3.8-27B 的 NVFP4/FP8 混合精度量化版本,基于 NVIDIA Model Optimizer 从原始 BF16 权重直接生成。该版本将 192 个 MLP 投影和 lm head 量化为 NVFP4(blo

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

UkisAI 发布 Swift-Qwen3.8-27B GGUF 量化模型

UkisAI 在 Hugging Face 发布了 Swift-Qwen3.8-27B 的 GGUF 量化版本,该模型是 Qwen3.8-27B 的推理高效衍生版本。据其评测,Swift 版本在保持性能损失小于 1% 的前提下,平均思考 token 减少约 58.3%,并在多项任务上实现约 1.95 倍加速。该模型采用自定义的 swift-open-lice

正文结构化主题已通过公开置信门槛
AWS Machine Learning Blog一手来源产品发布4

Aderant 用 Amazon Nova 构建智能工单分诊系统

Aderant 为法律行业提供业务管理软件,其 SierraOps 团队利用 Amazon Bedrock 上的 Amazon Nova Lite 构建了智能工单分诊系统 Intelligent Ticket Analyzer。该系统通过 AWS Lambda 和 EventBridge 每小时处理未分配工单,从 Jira、Confluence、Athena

正文结构化主题已通过公开置信门槛
THE DECODER研究1

AI 性能成本下降速度超过以往任何技术

Epoch AI 研究显示,在特定 AI 基准上达到固定性能水平的成本自 2023 年以来以每季度约 47%、每年约 13 倍的速度下降,快于以往任何变革性技术。MIT 研究者基于 Artificial Analysis 数据得出年降幅为 5 至 10 倍,剔除硬件降价和竞争压力后,纯算法效率提升约为每年 3 倍。研究同时指出,新推理模型因消耗更多测试时算力

9月24日周四 · 13 条
正文结构化主题已通过公开置信门槛
Cerebras Blog一手来源观点1

Cerebras:网络防御为何需要更快的推理速度

Cerebras 博客文章指出,AI 智能体正以更快的速度和规模发动网络攻击,CrowdStrike 报告显示 AI 驱动的攻击操作同比增长 89%,最快突破时间仅 27 秒。OpenAI 的 Greg Brockman 透露已将 25% 的生产工程师调去构建「防御工厂」。Cerebras 借此宣传其推理速度优势,称运行 GPT-5.6 Sol Ultraf

正文结构化主题已通过公开置信门槛
NVIDIA Technical Blog一手来源教程1

NVIDIA 博客:用 Transformer Engine 高效训练生物基础模型 MoE

NVIDIA 发布技术博客,介绍如何利用 Transformer Engine(TE)和 BioNeMo MoE recipe 高效训练生物基础模型。文章指出 MoE 架构虽能更高效扩展模型容量,但面临专家计算碎片化、路由通信开销和内存压力等瓶颈。TE 通过 GroupedLinear、MXFP8 低精度训练和融合 GroupedMLP 内核(整合量化、Sw

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布5

Kyutai 发布 Pocket TTS:100M 参数 CPU 端轻量语音合成模型

Kyutai 发布 Pocket TTS,一个仅 100M 参数、可在 CPU 上高效运行的轻量级文本转语音模型,支持流式音频、约 200ms 首块延迟、约 6 倍实时速度,并仅需 2 个 CPU 核心。该模型支持英语、法语、德语、葡萄牙语、意大利语和西班牙语,提供 Python API 与 CLI,并可在浏览器端运行。模型采用 cc-by-4.0 许可,明

正文结构化主题已通过公开置信门槛
The Verge AI商业1

谷歌下周将发射搭载AI芯片的卫星

谷歌计划于10月1日通过SpaceX猎鹰9号火箭发射一颗搭载其Tensor Processing Unit(TPU)的卫星,作为Project Suncatcher实验计划的第一步,测试AI芯片在太空飞行、辐射和极端温度下的表现。谷歌的目标是最终将AI数据中心送入轨道,并计划明年再发射两颗卫星。项目高管Travis Beals表示,芯片在轨道上只能运行约15

正文结构化主题已通过公开置信门槛
量子位研究1

任少卿署名新论文:MM-Future让自动驾驶多未来联合规划

蔚来智能驾驶基础模型预研团队在任少卿指导下发布论文《MM-Future: Multi-Mode Joint World–Action Modeling for Autonomous Driving》,提出多模式世界—动作联合模型,可一次生成多组配对场景—动作假设并让场景与动作双向演化。在NAVSIM-v1上取得94.0 PDMS、NAVSIM-v2上取得91

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布4

Langfuse 发布 v4.45.1 修复图表与评分测试

Langfuse 发布 v4.45.1 版本,包含三项改动:修复饼图配色使其与其他图表一致、调整评分测试中更新后评分的事件时间戳、为 TypeSafe 连接新增默认与自定义模型支持。该版本为常规维护性更新,主要影响使用 Langfuse 进行 LLM 可观测性与评估的开发者。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源3

llama.cpp b11159:修复 Vulkan 卷积对齐问题

llama.cpp 发布 b11159 版本,主要修复了 Vulkan 后端在 conv 2d 和 conv 3d 卷积操作中的内存对齐(misalignment)问题,并修正了 test-backend-ops 的打印输出。该版本同时提供覆盖 macOS、Linux、Windows、Android 等平台的预编译二进制包,支持 CUDA、Vulkan、RO

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布4

Langfuse v4.45.0 发布:新增图表组件与自定义连接配置

Langfuse 发布 v4.45.0 版本,主要包含 Web 端混淆矩阵查询修复、导出设置表格迁移至设计系统、新增 StackedBarChart 和 AreaChart 组件、ClickHouse 计费结账时发送组织名称、TypeSafe 连接支持自定义 base URL 和额外请求头,以及自托管 Docker 日志保留文档更新。本次更新以内部重构和功能

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布4

inclusionAI 开源 Ling-mini-2.0:16B MoE 模型仅激活 1.4B

inclusionAI 开源了 Ling 2.0 系列首个模型 Ling-mini-2.0,这是一个基于 MoE 架构的大语言模型,总参数 16B、每 token 仅激活 1.4B(非嵌入 789M),在 20T+ tokens 上训练。该模型采用 1/32 激活比、MTP、QK-Norm 等设计,宣称以 1.4B 激活参数达到 7-8B 稠密模型性能,在

正文结构化主题已通过公开置信门槛
Langfuse Releases一手来源产品发布3

Langfuse v4.44.0 发布:新增 AI 网关与评估功能

Langfuse 发布 v4.44.0 版本,主要新增 LLM 连接、AI 网关与评估相关功能:支持在 Vertex AI Gemini 请求中发送额外请求头,AI 网关可转发 Anthropic Messages 并采集用量遥测与完整内容,评估模块新增对话信号决策模型模板。同时修复了会话工具行展示、ClickHouse 写入关闭、仪表盘聚合错误等问题,并推

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源2

llama.cpp b11157:CUDA 新增 implicit GEMM conv3d

llama.cpp 发布 b11157 版本,主要变更是为 CUDA 后端新增基于 implicit GEMM 的 conv3d 支持,并对其进行了细化、处理空 kernel 的情况。该版本同时提供覆盖 macOS/iOS、Linux、Android、Windows 等多平台多后端的预编译二进制包。

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源开源2

xidisdg 发布 Qwen3.8-27B NInfer 量化模型文件

用户 xidisdg 在 Hugging Face 发布了 Qwen3.8-27B 的 NInfer 原生 .ninfer 量化模型文件,包含 NVFP4、NVFP4Full 及 DFlash2 变体,并区分原始版本与适配最新版 NInfer 的 V3 版本。文件仅兼容 NInfer 运行时,非 GGUF 或 Safetensors,发布者提示 uncens

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源开源2

llama.cpp 发布 b11155:修复 GCC 12 误报并更新多平台构建

llama.cpp 发布 b11155 版本,主要修复了 server 和 common 模块中 GCC 12 的 stringop-overread 误报问题(由 Adrien Gallouët 提交,PR #29325)。该版本同时提供了覆盖 macOS、iOS、Linux、Android、Windows 及 openEuler 的多平台预编译二进制包,