返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月3日周一 · 20 条
正文结构化主题已通过公开置信门槛
arXiv cs.LG一手来源研究

分层 Copula-Gumbel-Top-K 路由:冻结 MoE 的双侧依赖控制

该论文提出了一种名为 Hierarchical Copula-Gumbel-Top-K 的新型路由机制,用于冻结的混合专家模型,在不改变每个 token 路由分布的前提下,通过高斯 copula 和反演构造分别控制组内正相关和组间负相关,从而调节专家负载的方差。该方法通过小规模控制器在冻结特征上训练,仅需前向传播,初步实验验证了机制的有效性,但未展示任务级微

正文结构化主题已通过公开置信门槛
Hugging Face New and Trending Models一手来源模型发布

Liquid AI发布LFM2系列混合模型,主打边缘AI部署

Liquid AI发布了新一代混合模型LFM2系列,包括350M、700M、1.2B和2.6B四个参数规模的检查点,专为边缘AI和端侧部署设计。LFM2采用乘法门和短卷积的新架构,训练速度比上一代快3倍,CPU上的解码和预填充速度比Qwen3快2倍,在知识、数学、指令跟随和多语言等基准上优于同尺寸模型。该系列支持8种语言,上下文长度32,768 tokens

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

无需重训即可解除 LLM 审查:abliteration 技术详解

Hugging Face 博客文章介绍了 abliteration 技术,可在不重新训练的情况下移除 LLM 内置的拒绝机制,使其能响应所有类型的提示。该方法通过识别模型残差流中的拒绝方向,并通过推理时干预或权重正交化来消除该方向。文章提供了基于 TransformerLens 库的代码实现,并已在 Google Colab 和 GitHub 上发布。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10235 发布,新增 Metal SILU BACK 支持

llama.cpp 发布 b10235 版本,主要新增了 Metal 后端对 SILU BACK 操作的支持,该操作针对 f32 类型实现,并移除了冗余断言。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10234 发布:Metal 后端新增 F16 二元运算支持

llama.cpp 发布 b10234 版本,主要更新是为 Metal 后端添加了 F16 支持,用于二元运算。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10233 发布:修复 OpenCL GLU 操作工作组大小限制

llama.cpp 发布了 b10233 版本,主要修复了 OpenCL 后端中 GLU 操作的本地工作组大小限制问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10232 发布:Metal 支持 DeepSeek V4 超连接

llama.cpp 发布 b10232 版本,主要更新是在 Metal 后端实现了 DeepSeek V4 的超连接(hyper-connections)支持,包括新增 GGML OP DSV4 HC COMB、GGML OP DSV4 HC PRE 和 GGML OP DSV4 HC POST 算子,并针对 SIMDgroup 寄存器与 shuffle 进

正文结构化主题已通过公开置信门槛
llama.cpp Releases一手来源产品发布

llama.cpp b10231 发布:支持 DSpark 投机解码 sidecar

llama.cpp 发布 b10231 版本,新增对 DSpark 投机解码 sidecar 的支持,其解析方式与其他 speculative sidecars 类似,并支持 -hfd 标签、自动发现及 -md 选择禁用。在自动选择中,dspark 优先于 dflash,因为其 sidecar 带有额外的马尔可夫头。该版本提供了多平台二进制文件,包括 mac

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

LettucePrevent:RAG 中实时预防事实幻觉的新方法

Hugging Face 博客发布了 LettucePrevent,一种在 RAG 生成循环中集成 token 级检测器以实时抑制事实幻觉的方法。其数字检测器在多个模型上将数字幻觉相对减少超过 60%,但事实检测器仅在 Llama-2 7B 上显著降低幻觉(-26.6%),且运行时开销高达 7 倍。该方法通过自定义 LogitsProcessor 和 Hug

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源开源

ECMWF 开源 AI 天气预报模型 AIFS,并简化运行流程

ECMWF 将其 AI 天气预报模型 AIFS 开源,权重发布在 Hugging Face 上,但运行需要特定 GPU。Hugging Face 与 ECMWF 合作开发了兼容补丁,使模型能在任意设备上运行,并提供了教程和在线演示。AIFS 已投入业务运行,能耗比传统物理模型低约 1000 倍,并支持研究、应用开发和教学等用途。

正文结构化主题已通过公开置信门槛
Hugging Face Blog一手来源研究

DFlash加速Qwen3.6:英特尔AI PC上MoE模型解码提速2.2倍

英特尔与Hugging Face合作,在搭载Intel Core Ultra(Panther Lake)的AI PC上,利用DFlash投机解码和OpenVINO加速Qwen3.6-35B-A3B MoE模型,实现HumanEval 2.2倍、GSM8K 1.6倍、MT-Bench 1.3倍的解码加速。DFlash通过并行掩码草稿器替代自回归草稿模型,缓解了

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源开源

ThunderKittens 针对 NVIDIA Blackwell GPU 优化并开源新内核

Together AI 与斯坦福大学合作开发了 ThunderKittens 框架,并针对 NVIDIA Blackwell 架构开源了新的内核,包括 BF16/FP8 GEMM 和注意力前向/反向内核。这些内核在 B200 上接近 cuBLAS/cuDNN 速度,在 H100 上比 cuBLAS 和 FA3 快达 2 倍。文章深入探讨了如何利用第五代张量核

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Chipmunk:利用动态列稀疏增量加速扩散 Transformer

Together AI 和 UCSD 的研究人员提出了 Chipmunk,一种无需训练即可加速扩散 Transformer 推理的方法。该方法利用扩散步骤间激活值变化缓慢且稀疏的特性,通过缓存注意力权重和 MLP 激活,并动态计算稀疏增量,实现了高达 3.7 倍的视频生成加速(HunyuanVideo)和 1.6 倍的图像生成加速(FLUX.1-dev)。C

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 定制投机解码加速 DeepSeek-R1 推理

Together AI 在博客中展示了为 DeepSeek-R1 定制投机解码(speculative decoding)加速器的方法,通过基于客户工作负载微调,相比其基础加速器可实现 1.23-1.45 倍解码速度提升和约 25% 成本降低,相比传统逐 token 预测则达到 1.85-2.97 倍加速和约 55% 成本削减。该方法利用客户专用端点的数据分

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 发布 YAQA 量化算法,显著降低模型输出偏差

Together AI 发布了新的后训练量化方法 YAQA,通过直接最小化 KL 散度来保留原始模型输出,与现有量化器(如 QTIP)兼容,可将 KL 散度降低超过 30%,并在下游任务上取得最优性能。该方法利用 Fisher 信息矩阵和 Kronecker 分解来近似 Hessian,从而在保持模型质量的同时实现高效量化。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源观点

Together AI 用 AI 代理自动化复杂工程任务的经验

Together AI 通过博客分享了使用 AI 代理自动化复杂工程任务的经验,重点介绍了开发高效 LLM 推理系统(如推测解码)的案例。他们提出了六个构建自动化代理的模式,分为基础设施模式和行为模式,强调工具质量、文档完善、任务可验证性等原则。该代理系统显著减少了人工干预,提高了工程效率。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

AutoJudge:自动化数据集筛选加速 LLM 推理

Together AI 推出 AutoJudge,一种通过自动化数据集筛选加速大语言模型推理的方法。它采用有损投机解码,无需人工标注,可接受最多 40 个草稿令牌,实现 1.5-2 倍加速,并兼容 vLLM 等主流框架。研究将在 NeurIPS 2025 展示。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 在原生云上支持 TorchForge RL 流水线

Together AI 宣布其 Native Cloud 平台现已支持 TorchForge 强化学习(RL)流水线,提供分布式训练和沙箱环境,并发布了在 Instant Clusters 上运行 Qwen 1.5B 模型玩 BlackJack 的演示。该平台集成了 CodeSandbox 和 Code Interpreter,用于工具执行和代码评估,为即将

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源观点

计算视角:AGI 可实现,硬件远未到极限

Together AI 的 Dan Fu 发表新文章,反驳 AI 发展遇到硬件瓶颈的观点。他认为当前芯片利用率极低,通过软硬件协同设计和 FP4 训练等创新可大幅提升性能。他还指出模型训练滞后于硬件发展,且现有模型已能改变复杂工作流。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

一致性扩散语言模型:推理速度提升14倍且不损质量

Together AI 的研究团队提出了一致性扩散语言模型(CDLM),通过结合基于一致性的多令牌定稿和块级 KV 缓存,将扩散语言模型的推理速度提升高达 14.5 倍,同时保持质量。该方法通过后训练配方,使用块因果注意力实现精确的 KV 缓存,并联合优化蒸馏损失、一致性损失和辅助去噪损失。实验表明,CDLM 在数学和编程任务上显著减少了推理步骤,并提升了吞