分层 Copula-Gumbel-Top-K 路由:冻结 MoE 的双侧依赖控制
该论文提出了一种名为 Hierarchical Copula-Gumbel-Top-K 的新型路由机制,用于冻结的混合专家模型,在不改变每个 token 路由分布的前提下,通过高斯 copula 和反演构造分别控制组内正相关和组间负相关,从而调节专家负载的方差。该方法通过小规模控制器在冻结特征上训练,仅需前向传播,初步实验验证了机制的有效性,但未展示任务级微
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
该论文提出了一种名为 Hierarchical Copula-Gumbel-Top-K 的新型路由机制,用于冻结的混合专家模型,在不改变每个 token 路由分布的前提下,通过高斯 copula 和反演构造分别控制组内正相关和组间负相关,从而调节专家负载的方差。该方法通过小规模控制器在冻结特征上训练,仅需前向传播,初步实验验证了机制的有效性,但未展示任务级微
Liquid AI发布了新一代混合模型LFM2系列,包括350M、700M、1.2B和2.6B四个参数规模的检查点,专为边缘AI和端侧部署设计。LFM2采用乘法门和短卷积的新架构,训练速度比上一代快3倍,CPU上的解码和预填充速度比Qwen3快2倍,在知识、数学、指令跟随和多语言等基准上优于同尺寸模型。该系列支持8种语言,上下文长度32,768 tokens
Hugging Face 博客文章介绍了 abliteration 技术,可在不重新训练的情况下移除 LLM 内置的拒绝机制,使其能响应所有类型的提示。该方法通过识别模型残差流中的拒绝方向,并通过推理时干预或权重正交化来消除该方向。文章提供了基于 TransformerLens 库的代码实现,并已在 Google Colab 和 GitHub 上发布。
llama.cpp 发布 b10235 版本,主要新增了 Metal 后端对 SILU BACK 操作的支持,该操作针对 f32 类型实现,并移除了冗余断言。此版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件。
llama.cpp 发布 b10234 版本,主要更新是为 Metal 后端添加了 F16 支持,用于二元运算。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种硬件加速后端。
llama.cpp 发布了 b10233 版本,主要修复了 OpenCL 后端中 GLU 操作的本地工作组大小限制问题。该版本提供了适用于 macOS、Linux、Windows、Android 等多个平台的预编译二进制文件,并支持多种后端如 CUDA、Vulkan、ROCm 等。
llama.cpp 发布 b10232 版本,主要更新是在 Metal 后端实现了 DeepSeek V4 的超连接(hyper-connections)支持,包括新增 GGML OP DSV4 HC COMB、GGML OP DSV4 HC PRE 和 GGML OP DSV4 HC POST 算子,并针对 SIMDgroup 寄存器与 shuffle 进
llama.cpp 发布 b10231 版本,新增对 DSpark 投机解码 sidecar 的支持,其解析方式与其他 speculative sidecars 类似,并支持 -hfd 标签、自动发现及 -md 选择禁用。在自动选择中,dspark 优先于 dflash,因为其 sidecar 带有额外的马尔可夫头。该版本提供了多平台二进制文件,包括 mac
Hugging Face 博客发布了 LettucePrevent,一种在 RAG 生成循环中集成 token 级检测器以实时抑制事实幻觉的方法。其数字检测器在多个模型上将数字幻觉相对减少超过 60%,但事实检测器仅在 Llama-2 7B 上显著降低幻觉(-26.6%),且运行时开销高达 7 倍。该方法通过自定义 LogitsProcessor 和 Hug
ECMWF 将其 AI 天气预报模型 AIFS 开源,权重发布在 Hugging Face 上,但运行需要特定 GPU。Hugging Face 与 ECMWF 合作开发了兼容补丁,使模型能在任意设备上运行,并提供了教程和在线演示。AIFS 已投入业务运行,能耗比传统物理模型低约 1000 倍,并支持研究、应用开发和教学等用途。
英特尔与Hugging Face合作,在搭载Intel Core Ultra(Panther Lake)的AI PC上,利用DFlash投机解码和OpenVINO加速Qwen3.6-35B-A3B MoE模型,实现HumanEval 2.2倍、GSM8K 1.6倍、MT-Bench 1.3倍的解码加速。DFlash通过并行掩码草稿器替代自回归草稿模型,缓解了
Together AI 与斯坦福大学合作开发了 ThunderKittens 框架,并针对 NVIDIA Blackwell 架构开源了新的内核,包括 BF16/FP8 GEMM 和注意力前向/反向内核。这些内核在 B200 上接近 cuBLAS/cuDNN 速度,在 H100 上比 cuBLAS 和 FA3 快达 2 倍。文章深入探讨了如何利用第五代张量核
Together AI 和 UCSD 的研究人员提出了 Chipmunk,一种无需训练即可加速扩散 Transformer 推理的方法。该方法利用扩散步骤间激活值变化缓慢且稀疏的特性,通过缓存注意力权重和 MLP 激活,并动态计算稀疏增量,实现了高达 3.7 倍的视频生成加速(HunyuanVideo)和 1.6 倍的图像生成加速(FLUX.1-dev)。C
Together AI 在博客中展示了为 DeepSeek-R1 定制投机解码(speculative decoding)加速器的方法,通过基于客户工作负载微调,相比其基础加速器可实现 1.23-1.45 倍解码速度提升和约 25% 成本降低,相比传统逐 token 预测则达到 1.85-2.97 倍加速和约 55% 成本削减。该方法利用客户专用端点的数据分
Together AI 发布了新的后训练量化方法 YAQA,通过直接最小化 KL 散度来保留原始模型输出,与现有量化器(如 QTIP)兼容,可将 KL 散度降低超过 30%,并在下游任务上取得最优性能。该方法利用 Fisher 信息矩阵和 Kronecker 分解来近似 Hessian,从而在保持模型质量的同时实现高效量化。
Together AI 通过博客分享了使用 AI 代理自动化复杂工程任务的经验,重点介绍了开发高效 LLM 推理系统(如推测解码)的案例。他们提出了六个构建自动化代理的模式,分为基础设施模式和行为模式,强调工具质量、文档完善、任务可验证性等原则。该代理系统显著减少了人工干预,提高了工程效率。
Together AI 推出 AutoJudge,一种通过自动化数据集筛选加速大语言模型推理的方法。它采用有损投机解码,无需人工标注,可接受最多 40 个草稿令牌,实现 1.5-2 倍加速,并兼容 vLLM 等主流框架。研究将在 NeurIPS 2025 展示。
Together AI 宣布其 Native Cloud 平台现已支持 TorchForge 强化学习(RL)流水线,提供分布式训练和沙箱环境,并发布了在 Instant Clusters 上运行 Qwen 1.5B 模型玩 BlackJack 的演示。该平台集成了 CodeSandbox 和 Code Interpreter,用于工具执行和代码评估,为即将
Together AI 的 Dan Fu 发表新文章,反驳 AI 发展遇到硬件瓶颈的观点。他认为当前芯片利用率极低,通过软硬件协同设计和 FP4 训练等创新可大幅提升性能。他还指出模型训练滞后于硬件发展,且现有模型已能改变复杂工作流。
Together AI 的研究团队提出了一致性扩散语言模型(CDLM),通过结合基于一致性的多令牌定稿和块级 KV 缓存,将扩散语言模型的推理速度提升高达 14.5 倍,同时保持质量。该方法通过后训练配方,使用块因果注意力实现精确的 KV 缓存,并联合优化蒸馏损失、一致性损失和辅助去噪损失。实验表明,CDLM 在数学和编程任务上显著减少了推理步骤,并提升了吞