返回全部动态

LLM服务一年追踪:工作负载演变、缓存与负载均衡

原标题:A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing

arXiv cs.AI一手来源研究质量 85

AI 摘要

该研究基于公司X一年的生产追踪数据,对LLM服务负载进行了纵向分析,覆盖多个模型和用户,揭示了工作负载演变、缓存和负载均衡等特征。研究将发布完整追踪数据以支持后续研究,弥补现有研究在时间跨度和用户-模型交互方面的不足。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

[Page 1] A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing William Nixon Jon Durbin Florian Standhartinger University of Chicago Chutes Chutes Harvard University Haryadi S. Gunawi Juncheng Yang University of Chicago Harvard University Abstract


发布时间:2026-08-17 12:00
抓取时间:2026-08-17 12:06
来源机构:arXiv
阅读原文arxiv.org