Kubernetes 滚动发布卡住:用 startupProbe 避免慢启动应用被 livenessProbe 反复误杀
## 适用场景 Java、Django、Node.js 等服务在 Kubernetes 中滚动发布后,新 Pod 长时间处于 `CrashLoopBackOff`,Deployment 一直无法完成;而在开发或低负载环境中启动正常。日志常只来得及打印数据库连接、缓存预热或迁移检查的前几行。 本文以“应用冷启动约 9
Tag
包含这个标签的文章。
## 适用场景 Java、Django、Node.js 等服务在 Kubernetes 中滚动发布后,新 Pod 长时间处于 `CrashLoopBackOff`,Deployment 一直无法完成;而在开发或低负载环境中启动正常。日志常只来得及打印数据库连接、缓存预热或迁移检查的前几行。 本文以“应用冷启动约 9
## 适用场景 集群中的应用偶发报出 `lookup xxx on 10.96.0.10:53: i/o timeout`、`SERVFAIL` 或连接外部服务失败;重试后又恢复。故障通常集中在业务高峰,Pod 重建、扩容或切换节点后更明显。本文适用于使用 CoreDNS 作为集群 DNS,且 CoreDNS 需要转
## 适用场景 部署在 Kubernetes 中的 Web、API 或消费服务在高峰期 CPU 已长期接近上限,但 HorizontalPodAutoscaler(HPA)始终保持原副本数;也可能在 `kubectl get hpa` 中看到 CPU 显示为 `<unknown>`。本文以基于 CPU 利用率的 HP
## 适用场景 本文适用于 Kubernetes 集群中出现以下问题的场景: - 新发布的 Pod 长时间处于 `Pending` 状态; - `kubectl describe pod` 中看到 `node(s) had disk pressure`; - 节点状态出现 `DiskPressure=True`;
## 适用场景 这篇文章适用于 Pod 一直停留在 `Pending`、`ErrImagePull` 或 `ImagePullBackOff`,业务发布后没有新实例可用的场景。常见环境包括自建 Kubernetes、云厂商托管集群、私有镜像仓库 Harbor、阿里云/腾讯云镜像仓库,以及通过 CI/CD 自动更新镜像
## 适用场景 本文适用于 Kubernetes 中业务 Pod 间歇性进入 `CrashLoopBackOff`、`RestartCount` 持续增长、服务短时间不可用,但应用日志里又看不到明确业务异常的场景。常见于 Spring Boot、Django、Go HTTP 服务、Node.js 服务等 Web 应用
# Kubernetes 集群内 DNS 超时导致服务偶发访问失败的排查 ## 适用场景 本文适用于 Kubernetes 集群中应用访问 Service、数据库、Redis、外部域名时,偶发出现 DNS 解析超时、连接超时或请求延迟突然升高的场景。常见环境包括使用 CoreDNS、kube-proxy、conta
# 关于 ServiceAccounts 及其 Secrets 的重大变化 kubernetes v1.24.0 更新之后进行创建 ServiceAccount 不会自动生成 Secret 需要对其手动创建 ### 创建 ServiceAccount ```shell cat<<EOF | kubectl app
在ingress注释中添加以下配置一直没有生效的状态 ```yaml apiVersion: networking.k8s.io/v1 kind: Ingress metadata: annotations: nginx.ingress.kubernetes.io/proxy-connect-timeout
[TOC] ### 一、k8s containerd配置 #### 1、环境 三台机器 系统 centos7.9 ```shell hostnamectl set-hostname k8s-master hostnamectl set-hostname k8s-node1 hostnamectl set-h