首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >61 亿次请求背后:LLM Serving 的 Cache 与调度难题

61 亿次请求背后:LLM Serving 的 Cache 与调度难题

作者头像
七牛开发者
发布2026-08-25 14:20:30
发布2026-08-25 14:20:30
790
举报
概述
本文基于CompanyX一年61.2亿次真实LLM请求Trace,揭示Serving工作负载动态演化规律:长输入/短输出趋势凸显、Prefix Cache复用呈强时间局部性(99%在15分钟内),并首次系统论证多节点下“缓存复用”与“负载均衡”的本质权衡——Cache-aware路由可提升效率,仅牺牲5%~7%负载均衡度。

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档