Together AI 推出缓存感知预填充-解码分离架构,长上下文推理提速达40%
Together AI 推出了缓存感知的预填充-解码分离(CPD)架构,通过按缓存命中率分离冷热工作负载,并利用分布式 KV 缓存,在长上下文推理中实现了高达 35-40% 的可持续吞吐量提升,并显著降低了首令牌延迟(TTFT)。该架构引入了预预填充节点、预填充节点和解码节点的三层角色划分,以及三级 KV 缓存层次,以优化混合真实流量下的服务性能。
技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条
只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。
Together AI 推出了缓存感知的预填充-解码分离(CPD)架构,通过按缓存命中率分离冷热工作负载,并利用分布式 KV 缓存,在长上下文推理中实现了高达 35-40% 的可持续吞吐量提升,并显著降低了首令牌延迟(TTFT)。该架构引入了预预填充节点、预填充节点和解码节点的三层角色划分,以及三级 KV 缓存层次,以优化混合真实流量下的服务性能。
Together AI 的研究(ICLR 2026)提出了一种分而治之的框架,让较弱的模型通过策略性拆分长上下文任务,在长上下文任务上匹配或超越 GPT-4o 的单次处理性能。该框架识别了模型噪声、任务噪声和聚合器噪声三种噪声来源,并通过调整提示词来减少聚合器噪声。实验表明,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上优于单次读取
Together AI 发布了开源框架 Aurora,基于强化学习,从实时推理轨迹中学习,持续更新投机解码中的草稿模型,无需中断服务。实验表明,Aurora 在 Qwen3 和 Llama3 等模型上比静态草稿模型额外获得 1.25 倍加速,并降低了基础设施成本。该框架支持异步训练和热替换,将投机解码转变为动态自改进的飞轮。
Together AI 发布了 FlashAttention-4,一种针对 Blackwell 架构不对称硬件扩展的注意力内核优化算法。该算法通过软件流水线、多项式近似指数函数和 2-CTA MMA 等技术,在 B200 上达到 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3 倍,比 Triton 快 2.7 倍。
Together AI 在首届 AI Native Conf 上发布了七项研究和产品,涵盖内核、强化学习和算法推理优化。其中 FlashAttention-4 针对 NVIDIA Blackwell GPU 优化,速度比 Triton 快 2.7 倍;Together Megakernel 将实时语音代理的首 token 延迟从 281ms 降至 77ms;
Together AI 在 NVIDIA GTC 2026 上宣布多项合作与产品更新,包括采用 NVIDIA Dynamo 1.0 优化推理、通过 NVIDIA OpenShell 集成 NemoClaw、支持 NVIDIA Nemotron 3 Super 模型用于多智能体工作流,并在模型库中新增 NVIDIA Parakeet TDT 0.6B V3 语
Together AI 与卡内基梅隆大学、普林斯顿大学、Cartesia AI 合作发布了 Mamba-3,这是一种以推理效率为核心的新型状态空间模型(SSM),通过更富表现力的递推公式、复数值状态跟踪和 MIMO 变体,在 1.5B 规模下实现了比 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B 更低的预填充和解码延迟。该模型还
Together AI 的 kernels 团队在 2022 年通过 FlashAttention 实现了 2-3 倍加速,证明了 GPU 优化仍有巨大潜力。2025 年 3 月,该团队在获得 NVIDIA Blackwell GPU 后的一周内,利用 ThunderKittens 库开发出最快的 FP4/FP8 GEMM 内核,性能比 H100 上的 cu
Together AI 在博客中提出“AI 原生云”概念,认为 AI 公司需要不同于传统 CPU 时代云的基础设施,以支持快速迭代、大规模 GPU 训练和推理。文章阐述了 AI 原生云的五大特征,包括全栈集成、研究到生产的快速路径、开发者速度等,并强调其对于 AI 公司保持竞争力的关键作用。
Together AI 在 NVIDIA GTC 2026 上强调推理效率对 AI 生产系统的重要性,指出推理成本占系统总成本的 80-90%。该公司通过 FlashAttention、ThunderKittens 和 Aurora 等开源技术优化推理性能,并利用 Blackwell 硬件实现全栈优化,帮助客户降低单位经济成本。文章还引用斯坦福 AI 指数,
Together AI 发布了一项针对编码代理工作负载的大规模推理基准测试,结果显示其推理引擎在相同硬件上比最快的开源引擎吞吐量高 31%,且在饱和状态下 TTFT 快 2 倍。该基准测试模拟了长上下文、高并发的生产环境,并强调了 TTFT 和预填充压力等关键指标。性能提升源于全栈优化,包括 ThunderMLA 内核融合和自定义内核重写。
Together AI 推出了 Provisioned Throughput 服务,为前沿开放模型提供预留推理容量,采用基于 token 的定价和 99% 可用性 SLA。该服务允许客户购买 PTU 单位,以固定速率保证吞吐量,成本比 Claude Opus 4.8 低 90%。目前支持 MiniMax M3 和 GLM-5.2,覆盖北美和 EMEA 地区。
Together AI 发布博客文章,解释推理服务中 99.9% 可用性的实际含义,指出不同可靠性等级对应不同的故障域和架构要求。文章强调,99.9% 需要跨数据中心部署和实时流量路由,而非冷备。Together AI 为 Cursor 等客户提供推理服务,并分享了其架构选择和运维经验。
Together AI 发布了 GPU 集群的多项更新,包括被动健康检查、自动节点修复、Slinky 2.0 以及新的运维控制功能,旨在提升大规模训练和推理的可靠性。这些更新通过检测硬件故障、自动修复节点、增强 Slurm 稳定性,并提供 OIDC、启动脚本等自定义选项,帮助团队更高效地管理生产集群。
Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。
Together AI 发布了其推理平台的重大更新,提供对性能、成本和质量的完全控制,支持金丝雀发布、蓝绿部署、A/B 测试和自动回滚等功能,并宣布了自定义训练的封闭测试版。该平台旨在帮助团队在生产环境中运行开源权重模型,同时避免从零构建推理栈的复杂性。Together AI 每月处理超过 4000 亿 token,其新平台整合了研究、模型优化和平台工程团队
Together AI 平台推出了专用模型推理功能,由端点、部署和配置三部分组成,并通过基于容量的流量分配实现路由。该架构支持 A/B 测试、影子实验和零停机变更,且配置不可变,确保行为稳定。文章详细解释了权重与副本数的关系,以及如何通过配置选择优化延迟或吞吐量。
Together AI 为其专用模型推理平台推出了基于推理引擎原生指标(如 in-flight 请求数、TTFT、GPU 利用率、token 吞吐量)的自动扩缩容功能。用户可设置副本范围、选择指标和目标值,并调整扩缩容窗口以平衡延迟和成本。文章通过实验对比了不同扩缩容策略,并提供了选择合适指标的建议。
Together AI 联合多所大学推出 ThunderAgent,一种面向智能体推理的高吞吐调度系统。它通过程序级调度缓解 KV 缓存抖动,在单节点上实现 2.5 倍吞吐提升,8 节点集群加速 2.4 倍,并保持近线性扩展。该系统已作为 Spotlight 论文被 ICML 2026 接收。
Together AI 在 ICML 2026 上发表了九篇论文,覆盖从智能体到 GPU 内核的全栈研究。其中,Aurora 论文提出的自适应投机解码已作为 ATLAS 投机器在生产环境中部署。研究还包括 DSGym 数据科学智能体评估框架、ThunderAgent 智能体工作负载优化、TTT-Discover 开放模型科学发现,以及 RARO 无验证器强化