kubeadm在Linux上快速搭建K8s测试集群需禁用swap和SELinux、配置国内镜像源与containerd加速、确保CNI网络插件网段匹配且适配cgroupv2,否则易卡在init拉镜或节点NotReady。

kubeadm 能在 Linux 上快速搭出可工作的 K8s 测试集群,但不是敲两条命令就完事——跳过初始化检查或忽略国内网络环境,大概率卡在 kubeadm init 拉镜像阶段,或者节点加入后 NotReady 一直不消失。
必须禁用 swap 和 selinux,否则 kubeadm init 直接失败
kubeadm 从 1.24 版本起强制校验 swap 状态,只要 swapon --show 有输出,init 就会报错退出,错误信息类似:
error execution phase preflight: [preflight] Some fatal errors occurred:
[ERROR Swap]: running with swap on is not supported. Please disable swap-
swapoff -a只是临时关闭,重启后恢复 - 必须同时注释掉
/etc/fstab中含swap的行:sed -ri '/swap/ s/^/#/' /etc/fstab - SELinux 也必须设为
disabled(不能只setenforce 0),否则 kubelet 启动后无法加载 cgroup v2 驱动,日志里反复出现failed to run Kubelet: unable to determine runtime CRI socket
国内环境必须配镜像源和容器运行时,否则卡在拉取 k8s.gcr.io 镜像
Rocky Linux 9 / CentOS Stream 9 默认使用 cri-dockerd 或 containerd,但无论哪种:
-
kubeadm init默认尝试拉取k8s.gcr.io/kube-apiserver:v1.32.2这类镜像,国内直连超时 - 解决方案不是改
kubeadm init --image-repository(它只管控制平面镜像),还要确保底层容器运行时能访问加速 registry
推荐做法:
- 安装
containerd后,修改/etc/containerd/config.toml,在[plugins."io.containerd.grpc.v1.cri".registry]下加镜像配置:config_path = "/etc/containerd/certs.d" - 创建
/etc/containerd/certs.d/quay.io/hosts.toml,填入阿里云镜像代理地址 - 执行
systemctl restart containerd - 初始化时显式指定国内 registry:
kubeadm init --image-repository registry.cn-hangzhou.aliyuncs.com/google_containers
注意:registry.cn-hangzhou.aliyuncs.com/google_containers 是阿里云维护的同步镜像,版本滞后通常不超过 24 小时,够测试用。
kubeadm join 失败常见于证书过期或网络不通,别盲目重试
kubeadm join 命令里的 token 默认 24 小时过期,discovery-token-ca-cert-hash 是单次绑定的。如果复制命令太慢、或者 master 重装过,token 就失效,错误类似:
couldn't validate the identity of the API Server: x509: certificate has expired or is not yet valid
- 查新 token:在 master 上运行
kubeadm token create --print-join-command - 确保 node 节点能通 master 的 6443 端口:
telnet <master-ip> 6443</master-ip> - 如果用的是 Rocky Linux 9,默认 firewalld 已关,但若手动启过,要确认
firewall-cmd --list-ports不含 6443
另外,node 加入后长期 NotReady,90% 是 CNI 插件没装或配置错网段——比如 kubeadm init 指定了 --pod-network-cidr=10.244.0.0/16,但你部署的 flannel yaml 里写的是 10.240.0.0/16,就会导致 kubelet 报 Failed to get network plugin。
测试集群是否真可用,别只看 kubectl get nodes
kubectl get nodes 显示 Ready 只代表 kubelet 注册成功,不代表网络、DNS、存储都通。真实验证步骤应包括:
-
kubectl apply -f <a href="https://www.php.cn/link/7d8f4257cd076de8488812a008c5e355">https://www.php.cn/link/7d8f4257cd076de8488812a008c5e355</a>(确保 CNI 装对) -
kubectl -n kube-system get pods -o wide确认所有coredns、etcd、flannel都是Running状态 -
kubectl run nginx-test --image=nginx --restart=Never,再kubectl exec nginx-test -- ping kubernetes.default.svc.cluster.local - 如果 ping 不通,先查
kubectl logs -n kube-system <coredns-pod-name></coredns-pod-name>,常见原因是 CoreDNS 配置里 upstream DNS 写成了114.114.114.114(国内 DNS 不支持 TCP 查询,CoreDNS 会 fallback 失败)
真正容易被忽略的是:Rocky Linux 9 默认启用 cgroupv2,而旧版 flannel 或某些自定义 CNI yaml 没适配,会导致 Pod 启动卡在 ContainerCreating,此时 kubectl describe pod 里会出现 FailedCreatePodSandBox,根源在 containerd 日志里 —— 必须确认 CNI 插件 manifest 显式声明了 cgroupDriver: systemd。


















