返回全部动态
LLM服务一年追踪:工作负载演变、缓存与负载均衡
原标题:A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing
AI 摘要
该研究基于公司X一年的生产追踪数据,对LLM服务负载进行了纵向分析,覆盖多个模型和用户,揭示了工作负载演变、缓存和负载均衡等特征。研究将发布完整追踪数据以支持后续研究,弥补现有研究在时间跨度和用户-模型交互方面的不足。
以上摘要由 AI 生成,可能存在误差。事实请以原文为准。
正文节选
[Page 1] A Year in LLM Serving: Workload Evolution, Caching and Load-Balancing William Nixon Jon Durbin Florian Standhartinger University of Chicago Chutes Chutes Harvard University Haryadi S. Gunawi Juncheng Yang University of Chicago Harvard University Abstract
发布时间:2026-08-17 12:00
抓取时间:2026-08-17 12:06
来源机构:arXiv