GPU硬件和驱动已就绪但K8s未识别,问题出在设备插件链路:需确认nvidia-device-plugin是否部署运行、socket是否存在且可访问、kubelet是否成功注册nvidia.com/gpu资源,再验证容器运行时GPU透传能力。

当你在Kubernetes集群中执行kubectl describe node发现Allocatable字段里没有nvidia.com/gpu条目,或者Pod因Insufficient nvidia.com/gpu持续Pending,而宿主机上nvidia-smi能正常输出GPU列表——这说明GPU硬件和驱动在节点层面已就绪,但K8s尚未将其识别为可调度资源,问题卡在设备上报链路的中间环节。
确认GPU是否被kubelet识别为扩展资源
登录目标GPU节点,执行以下命令查看kubelet上报的节点资源能力:
kubectl get node <node-name> -o jsonpath='{.status.allocatable}' | jq
重点检查输出中是否存在nvidia.com/gpu字段及其数值。若完全缺失,说明Device Plugin未成功注册资源,或kubelet未加载该插件;若值为0,可能是插件启动失败、健康检查未通过,或插件声明的资源名与Pod请求的不一致(例如插件注册的是nvidia.com/gpu,但YAML里写了nvidia.com/GPU)。
这一步必须在节点本地执行,远程kubectl无法反映kubelet实际感知到的allocatable状态。
检查nvidia-device-plugin DaemonSet运行状态
在集群控制平面执行:
kubectl get daemonset -n kube-system | grep nvidia
若无输出,说明Device Plugin根本未部署;若有输出但READY列显示0/0,需进一步查日志:
kubectl logs -n kube-system deploy/nvidia-device-plugin-daemonset
常见报错包括:failed to initialize NVML、could not communicate with device plugin socket、no NVIDIA devices found。前两者往往指向驱动模块未加载(lsmod | grep nvidia返回空)或nvidia-smi执行失败;后者则可能因PCIe设备被BIOS禁用、GPU物理未插稳,或驱动安装后未重启kubelet。
验证设备插件socket文件是否存在且可访问
Device Plugin通过Unix domain socket与kubelet通信,默认路径为/var/lib/kubelet/device-plugins/kubelet.sock。但nvidia-device-plugin实际监听的是自身socket,路径通常是/var/lib/kubelet/device-plugins/nvidia.sock。
登录节点后执行:
ls -l /var/lib/kubelet/device-plugins/nvidia.sock
若文件不存在,说明插件进程未创建socket,大概率是容器启动失败或主动退出;若存在但权限为root:root且mode不是srw-rw----,kubelet将拒绝连接。此时需检查插件容器是否以privileged模式运行,并确认其挂载了/host-var-lib-kubelet-device-plugins目录。
【关键前提】插件容器内必须将宿主机的/var/lib/kubelet/device-plugins目录以读写方式挂载进去,否则socket无法落地到kubelet能扫描的位置。
手动触发kubelet重载设备插件
有时插件已运行但kubelet未及时发现新socket,可强制刷新:
sudo systemctl kill -s USR2 kubelet
这条命令会通知kubelet重新扫描/var/lib/kubelet/device-plugins/下的所有.sock文件。紧接着执行:
sudo journalctl -u kubelet -n 50 --no-pager | grep -i "nvidia\|deviceplugin"
观察是否有Registered new device plugin for 'nvidia.com/gpu'字样。如果没有,说明插件socket不可达或格式非法;如果出现Repeated registration attempts,说明插件反复崩溃重启,需回溯上一步查容器日志。
绕过K8s直接测试容器运行时GPU透传能力
方法一:使用ctr命令直连containerd(适用于containerd作为运行时)
sudo ctr run --rm --gpus all docker.io/nvidia/cuda:12.2.0-base-ubuntu22.04 gpu-test nvidia-smi
若输出GPU表格,证明nvidia-container-toolkit与containerd集成正常;若报错could not select device driver with capabilities: [[gpu]],说明toolkit未配置为默认runtime,或/etc/containerd/config.toml中disabled_plugins未注释掉"nvidia"
方法二:用docker run测试(适用于Docker运行时)
docker run --rm --gpus all nvidia/cuda:12.2.0-base-ubuntu22.04 nvidia-smi
这步成功才能说明问题不在底层驱动和运行时,而是纯粹出在K8s设备插件或调度层。如果这步失败,K8s层面的所有排查都无意义,必须先修复容器运行时GPU支持。


















