背景:我在给一个 RAG 应用做推理成本治理,实测开启 prompt 前缀缓存后输入成本降了 60% 以上,量化(INT8)也把显存砍了一半。但继续往下优化时遇到两个问题:
1. 缓存命中率对提示词前缀的稳定性非常敏感。我们的系统提示词里目前混入了时间戳和用户个性化字段,怀疑这会直接打穿缓存。想请教大家有没有工程上通用的「缓存友好提示词」拆分模式?比如把动态内容统一挪到消息尾部、静态系统段做哈希锁定这类做法是否成熟?
2. 量化(INT8 权重 + FP8 KV Cache)叠加后的质量归因。评测集上综合掉点约 1.5 个点,但说不清是权重量化还是 KV 量化贡献的。有没有推荐的归因方法或监控指标(比如按注意力层、按上下文长度分段评测)?
环境:vLLM 部署,模型 14B 级别,QPS 峰值 30 左右。希望有生产经验的同行分享下踩坑经验。
相似问题