Together AI 发布自适应投机系统 ATLAS,推理速度大幅提升
Together AI 推出了自适应学习投机系统 ATLAS,这是首个无需手动调优即可自动提升推理性能的投机解码系统。ATLAS 结合静态和自适应投机器,根据实时流量动态调整,在 DeepSeek-V3.1 上达到 500 TPS,在 Kimi-K2 上达到 460 TPS,比标准解码快 2.65 倍。该系统旨在解决静态投机器在多变工作负载下性能下降的问题,
公司与模型 · 月之暗面 Kimi 系列模型与产品动态:K 系列开源模型、长上下文技术与产品演进
关联由结构化实体与正文位置共同判定 · 最近刷新 2026-09-26 18:14
Together AI 推出了自适应学习投机系统 ATLAS,这是首个无需手动调优即可自动提升推理性能的投机解码系统。ATLAS 结合静态和自适应投机器,根据实时流量动态调整,在 DeepSeek-V3.1 上达到 500 TPS,在 Kimi-K2 上达到 460 TPS,比标准解码快 2.65 倍。该系统旨在解决静态投机器在多变工作负载下性能下降的问题,
Groq 在 GroqCloud 上预览了 Moonshot 的 Kimi K2 模型,并解释了其 LPU 架构如何通过 TruePoint 数值格式、SRAM 存储和静态调度等技术,在不损失精度的情况下实现万亿参数模型的快速推理。该架构通过选择性降低精度和优化内存层次,实现了比传统 GPU 更高的推理速度和更低的延迟。
Simon Willison 参加了 Oxide and Friends 播客,讨论开放权重模型的革命性进展,包括 Kimi K3 与专有前沿模型的竞争、网络安全事件以及关于开放权重和美国 AI 领导力的公开信。对话还涉及 Golden Gate Claude 等话题,并更新了年初的预测,新增了关于教皇对开放模型表态的预测。
Agno 发布 v2.8.5 版本,新增 AgentOSTools 工具用于报告 AgentOS 的使用情况、延迟、失败、调度、评估、组件和待批准事项。改进包括为 PostgresDb 和 SqliteDb 添加按代理、团队、工作流或端点分组的延迟和错误统计,以及工具和模型调用统计。Moonshot 默认模型改为 kimi-k3,新增 thinking 模式
SGLang 发布 v0.5.11 版本,默认 CUDA 版本升级至 13.0,PyTorch 升级至 2.11,并默认启用 Speculative Decoding V2 以降低 CPU 开销。该版本新增了对 Gemma 4、GLM-5.1、Qwen3.6、MiMo-V2.5、Kimi-K2.6 等新模型的支持,并增强了 PD 分离场景下的解码端 Radi