Pod异常状态诊断全流程
Kubernetes运维日常最高频的操作就是排查Pod异常。Pod状态码直接反映问题方向:Pending说明调度失败,CrashLoopBackOff说明容器启动后反复崩溃,OOMKilled说明内存超限被杀。
Pending状态排查:kubectl describe pod看Events字段,重点关注FailedScheduling事件。常见原因:资源不足、节点选择器匹配不到、PVC无法挂载。CrashLoopBackOff分两种情况:启动就退出看日志,启动后一段时间退出用kubectl logs –previous。
Service与网络问题定位
Service无法访问的排查要从简到繁:第一步验证Pod网络,第二步验证ClusterIP可达,第三步验证DNS解析。CoreDNS挂了会大面积影响服务发现。kube-proxy的iptables/ipvs模式对排查方向有影响。CNI插件问题更复杂,NetworkPolicy也是常见干扰项。
监控告警体系搭建实践
kube-state-metrics提供Pod重启次数、Deployment副本偏差等指标。节点级监控关注CPU steal time、磁盘IO等待、网络包丢失率。告警规则基于SLO而非阈值,分级处理:P0电话、P1短信+IM、P2工单。
CI/CD流水线部署安全控制
RBAC权限分级是基础。生产环境必须用RollingUpdate或蓝绿部署,禁用Recreate。金丝雀发布配合流量切分。Readiness Gate确保应用就绪后才接收流量。
原创文章,作者:小编,如若转载,请注明出处:https://www.yunthe.com/kubernetes-rong-qi-bian-pai-ce-zhang-pai-cha-shou-ce-cong/