返回主题地图

部署工程

技术方向 · 把模型跑起来的工程实践:推理优化、量化与成本、Serving 架构与可观测性 · 共 1727 条

只展示置信度达到公开门槛且每篇排名前三的主题标签,降低泛化误贴。

8月3日周一 · 20 条
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 推出缓存感知预填充-解码分离架构,长上下文推理提速达40%

Together AI 推出了缓存感知的预填充-解码分离(CPD)架构,通过按缓存命中率分离冷热工作负载,并利用分布式 KV 缓存,在长上下文推理中实现了高达 35-40% 的可持续吞吐量提升,并显著降低了首令牌延迟(TTFT)。该架构引入了预预填充节点、预填充节点和解码节点的三层角色划分,以及三级 KV 缓存层次,以优化混合真实流量下的服务性能。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

分而治之:弱模型如何超越 GPT-4o 处理长上下文

Together AI 的研究(ICLR 2026)提出了一种分而治之的框架,让较弱的模型通过策略性拆分长上下文任务,在长上下文任务上匹配或超越 GPT-4o 的单次处理性能。该框架识别了模型噪声、任务噪声和聚合器噪声三种噪声来源,并通过调整提示词来减少聚合器噪声。实验表明,Llama-3-70B 或 Qwen-72B 等较弱模型在长上下文任务上优于单次读取

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源开源

Together AI 发布 Aurora:基于强化学习的自适应投机解码框架

Together AI 发布了开源框架 Aurora,基于强化学习,从实时推理轨迹中学习,持续更新投机解码中的草稿模型,无需中断服务。实验表明,Aurora 在 Qwen3 和 Llama3 等模型上比静态草稿模型额外获得 1.25 倍加速,并降低了基础设施成本。该框架支持异步训练和热替换,将投机解码转变为动态自改进的飞轮。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

FlashAttention-4:面向不对称硬件扩展的算法与内核流水线协同设计

Together AI 发布了 FlashAttention-4,一种针对 Blackwell 架构不对称硬件扩展的注意力内核优化算法。该算法通过软件流水线、多项式近似指数函数和 2-CTA MMA 等技术,在 B200 上达到 1605 TFLOPs/s(71% 利用率),比 cuDNN 9.13 快 1.3 倍,比 Triton 快 2.7 倍。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 发布 FlashAttention-4 等七项创新,强化 AI 云全栈能力

Together AI 在首届 AI Native Conf 上发布了七项研究和产品,涵盖内核、强化学习和算法推理优化。其中 FlashAttention-4 针对 NVIDIA Blackwell GPU 优化,速度比 Triton 快 2.7 倍;Together Megakernel 将实时语音代理的首 token 延迟从 281ms 降至 77ms;

正文结构化主题已通过公开置信门槛
正文结构化主题已通过公开置信门槛
Together AI Blog一手来源模型发布

Mamba-3发布:以推理效率为核心的新型状态空间模型

Together AI 与卡内基梅隆大学、普林斯顿大学、Cartesia AI 合作发布了 Mamba-3,这是一种以推理效率为核心的新型状态空间模型(SSM),通过更富表现力的递推公式、复数值状态跟踪和 MIMO 变体,在 1.5B 规模下实现了比 Mamba-2、Gated DeltaNet 和 Llama-3.2-1B 更低的预填充和解码延迟。该模型还

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 内核团队:从 FlashAttention 到 Blackwell 的突破

Together AI 的 kernels 团队在 2022 年通过 FlashAttention 实现了 2-3 倍加速,证明了 GPU 优化仍有巨大潜力。2025 年 3 月,该团队在获得 NVIDIA Blackwell GPU 后的一周内,利用 ThunderKittens 库开发出最快的 FP4/FP8 GEMM 内核,性能比 H100 上的 cu

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源观点

什么是 AI 原生云?Together AI 定义新一代云基础设施

Together AI 在博客中提出“AI 原生云”概念,认为 AI 公司需要不同于传统 CPU 时代云的基础设施,以支持快速迭代、大规模 GPU 训练和推理。文章阐述了 AI 原生云的五大特征,包括全栈集成、研究到生产的快速路径、开发者速度等,并强调其对于 AI 公司保持竞争力的关键作用。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源观点

Together AI 强调推理效率是 AI 生产系统的关键

Together AI 在 NVIDIA GTC 2026 上强调推理效率对 AI 生产系统的重要性,指出推理成本占系统总成本的 80-90%。该公司通过 FlashAttention、ThunderKittens 和 Aurora 等开源技术优化推理性能,并利用 Blackwell 硬件实现全栈优化,帮助客户降低单位经济成本。文章还引用斯坦福 AI 指数,

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 基准测试:编码代理推理引擎性能领先

Together AI 发布了一项针对编码代理工作负载的大规模推理基准测试,结果显示其推理引擎在相同硬件上比最快的开源引擎吞吐量高 31%,且在饱和状态下 TTFT 快 2 倍。该基准测试模拟了长上下文、高并发的生产环境,并强调了 TTFT 和预填充压力等关键指标。性能提升源于全栈优化,包括 ThunderMLA 内核融合和自定义内核重写。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出 Provisioned Throughput,提供开放模型预留推理容量

Together AI 推出了 Provisioned Throughput 服务,为前沿开放模型提供预留推理容量,采用基于 token 的定价和 99% 可用性 SLA。该服务允许客户购买 PTU 单位,以固定速率保证吞吐量,成本比 Claude Opus 4.8 低 90%。目前支持 MiniMax M3 和 GLM-5.2,覆盖北美和 EMEA 地区。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源观点

Together AI 解读推理服务 99.9% 可用性的真实含义

Together AI 发布博客文章,解释推理服务中 99.9% 可用性的实际含义,指出不同可靠性等级对应不同的故障域和架构要求。文章强调,99.9% 需要跨数据中心部署和实时流量路由,而非冷备。Together AI 为 Cursor 等客户提供推理服务,并分享了其架构选择和运维经验。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 增强 GPU 集群:可靠性提升与运维控制

Together AI 发布了 GPU 集群的多项更新,包括被动健康检查、自动节点修复、Slinky 2.0 以及新的运维控制功能,旨在提升大规模训练和推理的可靠性。这些更新通过检测硬件故障、自动修复节点、增强 Slurm 稳定性,并提供 OIDC、启动脚本等自定义选项,帮助团队更高效地管理生产集群。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源模型发布

Together AI 首日上线 Thinking Machines Lab 多模态模型 Inkling

Thinking Machines Lab 发布了新模型 Inkling,这是一个多模态混合专家模型,支持文本、图像和音频输入,并具有可控推理能力。Together AI 在发布当天即在其推理平台上提供该模型,并优化了其推理内核以支持新架构。Inkling 在科学推理、数学、编程等基准测试中表现强劲,总参数达 975B,激活参数 40B,上下文窗口 1M。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出生产级推理平台更新及自定义训练测试版

Together AI 发布了其推理平台的重大更新,提供对性能、成本和质量的完全控制,支持金丝雀发布、蓝绿部署、A/B 测试和自动回滚等功能,并宣布了自定义训练的封闭测试版。该平台旨在帮助团队在生产环境中运行开源权重模型,同时避免从零构建推理栈的复杂性。Together AI 每月处理超过 4000 亿 token,其新平台整合了研究、模型优化和平台工程团队

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出专用模型推理,实现容量感知路由

Together AI 平台推出了专用模型推理功能,由端点、部署和配置三部分组成,并通过基于容量的流量分配实现路由。该架构支持 A/B 测试、影子实验和零停机变更,且配置不可变,确保行为稳定。文章详细解释了权重与副本数的关系,以及如何通过配置选择优化延迟或吞吐量。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源产品发布

Together AI 推出 LLM 推理自动扩缩容端点

Together AI 为其专用模型推理平台推出了基于推理引擎原生指标(如 in-flight 请求数、TTFT、GPU 利用率、token 吞吐量)的自动扩缩容功能。用户可设置副本范围、选择指标和目标值,并调整扩缩容窗口以平衡延迟和成本。文章通过实验对比了不同扩缩容策略,并提供了选择合适指标的建议。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

ThunderAgent:实现 2 倍加速的智能体推理系统

Together AI 联合多所大学推出 ThunderAgent,一种面向智能体推理的高吞吐调度系统。它通过程序级调度缓解 KV 缓存抖动,在单节点上实现 2.5 倍吞吐提升,8 节点集群加速 2.4 倍,并保持近线性扩展。该系统已作为 Spotlight 论文被 ICML 2026 接收。

正文结构化主题已通过公开置信门槛
Together AI Blog一手来源研究

Together AI 在 ICML 2026 展示全栈前沿研究

Together AI 在 ICML 2026 上发表了九篇论文,覆盖从智能体到 GPU 内核的全栈研究。其中,Aurora 论文提出的自适应投机解码已作为 ATLAS 投机器在生产环境中部署。研究还包括 DSGym 数据科学智能体评估框架、ThunderAgent 智能体工作负载优化、TTT-Discover 开放模型科学发现,以及 RARO 无验证器强化