讲师中心 微信公众号
AI工具推荐 视频效率加速

如何在Python中利用PyTorch的Stream功能并行化处理非依赖算子?

夏瑶同学_1965

夏瑶同学_1965

发布时间:2026-06-04 10:54:25

|

592人浏览过

|

来源于php中文网

原创

PyTorch Stream 是 CUDA 执行队列,不自动并行化,需手动绑定无依赖算子到不同 stream 并避免隐式同步(如 CPU-GPU 拷贝、in-place 操作、autograd),才能实现 kernel 重叠执行;验证须用 nsys 或 torch.cuda.Event,而非 time.time()。

如何在python中利用pytorch的stream功能并行化处理非依赖算子?

PyTorch Stream 是什么,它真能并行化“非依赖算子”?

Stream 本身不自动并行化计算;它只是 CUDA 上的执行队列,允许你显式控制不同操作在 GPU 上的调度顺序和并发性。所谓“非依赖算子”的并行化,实际是指:当两个 tensor 运算彼此无数据依赖(比如不共享输入/输出、不涉及 in-place 修改),且你把它们分发到不同 torch.cuda.Stream 上,CUDA 驱动才可能让它们重叠执行(overlap)——前提是硬件资源(SM、内存带宽)有余量。

关键判断点:不是所有“看起来独立”的操作都能真正并发。例如两个大张量的 matmul 可能抢同一组 SM 或争抢全局内存带宽,最终仍是串行或部分重叠。

  • 必须手动创建并切换 stream,PyTorch 不会自动分配
  • 默认 stream(torch.cuda.default_stream())和其他 stream 之间天然同步,不加干预就会阻塞
  • torch.cuda.synchronize() 会等待所有 stream,而 stream.synchronize() 只等该 stream

如何正确启动两个 stream 并让它们运行独立算子?

核心是「绑定操作到 stream + 避免隐式同步」。常见错误是:在 stream A 中 launch 算子后,立刻在 stream B 中 launch 另一个,但中间穿插了 CPU 到 GPU 的拷贝、或调用了 .item()/.cpu() ——这些都会触发默认 stream 同步,导致 B 实际要等 A 完全结束。

以下是最小可行模式:

立即学习Python免费学习笔记(深入)”;

python全能编程助手
python全能编程助手

SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、

下载
import torch
<p>a = torch.randn(2048, 2048, device='cuda')
b = torch.randn(2048, 2048, device='cuda')
c = torch.randn(2048, 2048, device='cuda')
d = torch.randn(2048, 2048, device='cuda')</p><p>s1 = torch.cuda.Stream()
s2 = torch.cuda.Stream()</p><p>with torch.cuda.stream(s1):
x = torch.mm(a, b)  # 在 s1 执行</p><p>with torch.cuda.stream(s2):
y = torch.mm(c, d)  # 在 s2 执行</p><h1>此刻 x 和 y 尚未完成,但 kernel 已提交</h1><p>s1.synchronize()  # 等 s1 结束
s2.synchronize()  # 等 s2 结束
  • 必须用 with torch.cuda.stream(...) 上下文管理器,否则操作仍落在 default stream
  • 不能在 stream 上下文中做 print(x)x.sum().item(),这会强制同步
  • 如果后续要用 xy 做联合运算(如 x + y),需确保两者都已就绪,否则触发隐式等待

哪些算子适合放不同 stream?哪些会悄悄破坏并行?

适合的:纯计算密集型、无跨 stream 数据依赖、输入 tensor 已驻留 GPU 且不共享 memory(如不同 .data_ptr())。典型例子:torch.mmtorch.nn.functional.conv2d(输入 channel 不重叠)、torch.softmax(独立 batch 维度)。

会破坏并行的常见情况:

  • 共享 input tensor:比如 a 同时被 s1 和 s2 读取,虽不写,但某些 kernel 可能触发 cache 冲突或 warp stall
  • in-place 操作:如 x.add_(y)xy 来自不同 stream,行为未定义,极易死锁或结果错乱
  • CPU-GPU 数据搬移:tensor.cpu()tensor.numpy()torch.load(..., map_location='cuda') 都隐式同步 default stream
  • autograd 张量参与 backward:除非你用 torch.no_grad() 或明确分离计算图,否则 backward() 会按拓扑序强制同步所有相关 stream

怎么验证两个 stream 确实并发执行了?

不能只看 wall-clock 时间变短——那可能是 kernel 自身优化或缓存效应。真验证得靠 CUDA 工具链:

  • nsys profile --trace=cuda,nvtx python your_script.py 生成时间线,观察两个 stream 的 kernel 是否在 GPU timeline 上横向重叠
  • 在代码中插入 NVTX 标记:torch.cuda.nvtx.range_push("matmul_s1"),方便 nsys 分辨逻辑段
  • 避免用 time.time() 测,它精度低且受 Python GIL 干扰;改用 torch.cuda.Event 计时:
e1_start = torch.cuda.Event(enable_timing=True)
e1_end = torch.cuda.Event(enable_timing=True)
e2_start = torch.cuda.Event(enable_timing=True)
e2_end = torch.cuda.Event(enable_timing=True)
<p>with torch.cuda.stream(s1):
e1_start.record()
x = torch.mm(a, b)
e1_end.record()</p><p>with torch.cuda.stream(s2):
e2_start.record()
y = torch.mm(c, d)
e2_end.record()</p><p>torch.cuda.synchronize()  # 确保 events 都写入
t1 = e1_start.elapsed_time(e1_end)
t2 = e2_start.elapsed_time(e2_end)

注意:elapsed_time() 返回毫秒,但只有当两个 event 在同一 stream 或已同步后调用才安全;更稳妥做法是分别 record + synchronize 对应 stream 后再读。

真正难的是让多个 stream 的负载均衡且内存访问不冲突——这往往比加 stream 更花时间调优。别指望加个 stream 就提速 2x,先确认瓶颈真在 kernel 启动串行上,而不是显存带宽或 compute bound。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

墨刀AI
墨刀AI Hot

一款AI图像与设计工具,主要用于产品经理的专属智能体,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

二狗PPT
二狗PPT Hot

一款AI演示文稿工具,主要用于专为中式职场打造的AI PPT生成工具,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

立刻MV
立刻MV Hot

立刻MV是一款AI文本写作工具,AI 音乐视频(MV)创作工具。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

Lovart
Lovart Hot

一款面向视觉设计创作的AI设计平台,可通过智能体和画布工作流辅助制作海报、Logo、网页、PPT及其他视觉内容。

相关专题

更多
python打包成可执行文件
python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章,大家可以免费的下载体验。

1571

2023.07.20

python能做什么
python能做什么

python能做的有:可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

3724

2023.07.25

format在python中的用法
format在python中的用法

Python中的format是一种字符串格式化方法,用于将变量或值插入到字符串中的占位符位置。通过format方法,我们可以动态地构建字符串,使其包含不同值。php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

1569

2023.07.31

python教程
python教程

Python已成为一门网红语言,即使是在非编程开发者当中,也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章,大家可以免费体验学习。

21297

2023.08.03

python环境变量的配置
python环境变量的配置

Python是一种流行的编程语言,被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后,我们需要配置环境变量,以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2627

2023.08.04

python eval
python eval

eval函数是Python中一个非常强大的函数,它可以将字符串作为Python代码进行执行,实现动态编程的效果。然而,由于其潜在的安全风险和性能问题,需要谨慎使用。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

2687

2023.08.04

scratch和python区别
scratch和python区别

scratch和python的区别:1、scratch是一种专为初学者设计的图形化编程语言,python是一种文本编程语言;2、scratch使用的是基于积木的编程语法,python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容,供大家免费下载体验。

1083

2023.08.11

python合并两个列表
python合并两个列表

Python是一种强大的编程语言,具有许多方便的功能和工具。在Python中,有多种方法可以合并两个列表。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

576

2023.08.10

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

20

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
PyTorch 官方文档与教程
PyTorch 官方文档与教程

共0课时 | 0人学习

C++教程
C++教程

共115课时 | 42万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn