背景:三节点生产集群(每个节点 16C32G),节点整体资源水位不高(CPU 60%、内存 70% 左右),但最近一周业务 Pod 频繁被驱逐(Evicted),主要集中在内存压力和磁盘压力两类原因。
已经做了kubelet 资源预留(--system-reserved / --eviction-hard 调整),驱逐仍偶发发生。想请教:
1. 除了资源预留,大家还有哪些实战排查方向?比如镜像 GC 策略、emptyDir 日志写满根分区、容器内内存泄漏导致的节点压力?
2. 有没有办法在驱逐发生前拿到更细的信号(比如 kubelet 的 summary API 里哪些指标最值得监控告警)?
环境:K8s 1.28,容器运行时 containerd。
相似问题