讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Python中通过Python脚本监控PyTorch显存_调用nvidia-ml-py

雨晨同学_1398

雨晨同学_1398

发布时间:2026-05-09 10:10:47

|

956人浏览过

|

来源于php中文网

原创

nvidia-ml-py更可靠,因其通过NVML直接读取驱动级硬件显存数据(与nvidia-smi一致),涵盖所有进程占用、缓存及碎片,而torch.cuda.memory_allocated()仅统计PyTorch当前Python引用的活跃张量显存,无法反映真实系统压力。

如何在python中通过python脚本监控pytorch显存_调用nvidia-ml-py

为什么直接用 nvidia-ml-py 获取显存比 torch.cuda.memory_allocated() 更可靠

PyTorch 自身的 torch.cuda.memory_allocated() 只反映当前 Python 引用持有的显存,不包含缓存、未释放的碎片、驱动层保留内存,也不体现其他进程(如 tensorboard、另一个训练脚本)的占用。而 nvidia-ml-py 是 NVIDIA Management Library (NVML) 的 Python 封装,它读取的是 GPU 驱动实时上报的硬件级显存使用量——和 nvidia-smi 显示一致,这才是监控“真实压力”的依据。

常见错误现象:脚本里 torch.cuda.memory_allocated() 显示只用了 2GB,但 nvidia-smi 显示已用 10GB,导致 OOM 被系统 kill;此时靠 PyTorch 自身 API 根本无法预警。

  • 必须先安装 nvidia-ml-py:pip install nvidia-ml-py(注意不是 nvidia-ml-py3,后者已废弃且不兼容新驱动)
  • 该库不依赖 PyTorch,即使没 import torch 也能查显存,适合做独立监控进程
  • 需要 CUDA 驱动正常工作(nvidia-smi 命令能执行),但不需要 CUDA Toolkit 或 cuDNN

初始化 NVML 并获取单卡显存使用率的最小可行代码

每次调用前都必须初始化 NVML 上下文,且用完需显式 nvmlShutdown(),否则多次运行会报 NVMLError_LibRmVersionMismatch 或内存泄漏。

from pynvml import *
import time
<p>def get_gpu_memory_usage(device_id=0):
try:
nvmlInit()
handle = nvmlDeviceGetHandleByIndex(device_id)
info = nvmlDeviceGetMemoryInfo(handle)</p><h1>info.used / info.total 返回字节值</h1><pre class="brush:php;toolbar:false;">    return info.used / info.total
except NVMLError as e:
    print(f"NVML error: {e}")
    return None
finally:
    try:
        nvmlShutdown()
    except:
        pass

示例:每秒打印一次 GPU 0 使用率

while True: usage = get_gpu_memory_usage(0) if usage is not None: print(f"GPU 0: {usage*100:.1f}%") time.sleep(1)

  • device_id 从 0 开始编号,对应 nvidia-smi 左侧的索引
  • info.used 是当前被所有进程占用的显存总量(单位字节),info.total 是显卡显存总容量
  • 不要在循环外调用 nvmlInit() 后长期持有句柄——NVML 不是线程安全的,多线程需各自 init/shutdown

监控多卡并触发告警的实用封装

实际训练常跑在多卡环境,需同时监控全部 GPU,并在某卡超阈值时记录日志或发通知。关键点在于:避免因某张卡查询失败(如设备不存在、权限不足)导致整个监控中断。

testing-python
testing-python

使用pytest编写和评估有效的Python测试。适用于编写测试、审查测试代码、调试测试失败或提高测试覆盖率。

下载

立即学习“Python免费学习笔记(深入)”;

from pynvml import *
import logging
<p>def check_all_gpus(threshold=0.9):
try:
nvmlInit()
device_count = nvmlDeviceGetCount()
alerts = []
for i in range(device_count):
try:
handle = nvmlDeviceGetHandleByIndex(i)
info = nvmlDeviceGetMemoryInfo(handle)
usage_pct = info.used / info.total
if usage_pct > threshold:
alerts.append(f"GPU{i}: {usage_pct<em>100:.1f}% > {threshold</em>100:.0f}%")
except NVMLError:
alerts.append(f"GPU{i}: unavailable")
return alerts
finally:
try:
nvmlShutdown()
except:
pass</p><h1>使用示例</h1><p>while True:
alerts = check_all_gpus(threshold=0.85)
if alerts:
logging.warning("GPU memory alert: " + "; ".join(alerts))
time.sleep(5)
  • 阈值设为 0.85(即 85%)比较稳妥——留出缓冲空间应对突发分配,避免刚到 90% 就触发误报
  • PyTorch 分布式训练中,torch.cuda.device_count() 返回的卡数可能少于物理卡数(如某些卡被 CUDA_VISIBLE_DEVICES 屏蔽),但 nvmlDeviceGetCount() 始终返回驱动识别到的全部卡数
  • 若脚本以非 root 用户运行,某些旧驱动版本可能拒绝返回显存信息,此时需检查 nvidia-smi -q -d MEMORY 是否可执行

和 PyTorch 训练循环集成时的注意事项

直接把 get_gpu_memory_usage() 塞进训练 loop 里容易拖慢训练速度,尤其高频调用时。NVML 查询本身耗时约 0.5–2ms,看似不多,但在每个 batch 都查就会累积成显著开销。

  • 建议采样频率控制在每 10–30 个 step 一次,或按时间间隔(如每 30 秒)而非 step 触发
  • 不要在 torch.no_grad() 或 eval() 模式下调用——这不是原因,而是提醒你:推理阶段同样可能爆显存,监控不能只在 train 模式开启
  • 如果训练脚本使用 torch.distributed,确保只在 rank 0 进程中调用 NVML 监控,否则所有进程重复查卡,无意义且增加驱动负载
  • 遇到 NVMLError_DriverNotLoaded 错误,说明当前环境没有加载 NVIDIA 驱动(比如在 CPU-only 容器里),应捕获并静默跳过,而不是 crash

最易被忽略的一点:NVML 返回的是瞬时快照,它不告诉你哪块显存被谁占了。要定位具体是哪个模型或 dataloader 导致暴涨,仍得配合 torch.cuda.memory_snapshot() + torch.cuda.memory._dump_snapshot() 做事后分析。

热门AI工具

更多
蛙蛙写作

一款AI论文写作工具,主要用于超级AI智能写作助手,适合需要提升相关任务效率的用户。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

UpDream
UpDream Hot

一款AI视频创作工具,主要用于哔哩哔哩推出的自研AI视频创作工具,适合需要提升相关任务效率的用户。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

Atoms
Atoms Hot

Atoms是一款AI智能体工具,第一支自动构建真实业务的 AI 团队。

DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

AionClaw
AionClaw Hot

AionClaw是一款面向办公、创作和编程任务的AI桌面智能体。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1671

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

4224

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1669

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

24517

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2987

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

3027

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1163

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

596

2023.08.10

C++运算符基础入门
C++运算符基础入门

本专题详细讲解了C++运算符的类型、语法与使用方法,涵盖算术运算符、关系运算符、逻辑运算符、位运算符、赋值运算符、条件运算符及其他特殊运算符,并通过代码示例解析优先级与结合性。

0

2026.10.09

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn