requests无法获取JS动态加载的音视频URL,因其仅获取初始HTML,而真实链接由fetch/XHR异步请求返回,常含签名、时间戳等动态参数;需用Playwright拦截网络响应或逆向分析XHR接口。

直接用 requests 或 urllib 拿不到 JS 动态加载的音视频 URL,必须模拟浏览器行为或逆向分析请求逻辑。
为什么 requests.get() 拿不到音视频链接?
网页源码里根本没写真实音视频地址,而是靠 JS 运行时调用 fetch() 或 XMLHttpRequest 异步获取,甚至带签名、时间戳、加密参数。直接抓 HTML 只能看到占位 <video> 标签或空 src。
常见错误现象:requests.get(url).text 返回的 HTML 中搜索 .mp4、.m3u8 一无所获;用 BeautifulSoup 解析也找不到有效 src。
关键判断点:打开浏览器开发者工具 → 切到 Network → 刷新页面 → 筛选 Media 或 XHR → 找到实际返回音视频信息(如 JSON)或直链的请求。
立即学习“Python免费学习笔记(深入)”;
用 Playwright 抓取 JS 渲染后的资源链接
Playwright 是目前最稳的无头浏览器方案,能执行 JS、等待元素加载、拦截网络请求,适合拿动态生成的音视频 URL。
实操建议:
- 安装:
pip install playwright,再运行playwright install chromium - 启用请求拦截,监听
response事件,过滤出Content-Type含video/、audio/或后缀为.mp4、.m3u8、.mp3的响应 - 注意设置
page.set_extra_http_headers()补全 Referer、User-Agent,否则部分接口会 403 - 避免用
page.content()再解析 DOM,优先从网络层直接捕获 URL,更可靠
示例片段(简化):
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
from playwright.sync_api import sync_playwright
<p>with sync_playwright() as p:
browser = p.chromium.launch(headless=True)
page = browser.new_page()
page.goto("<a href="https://www.php.cn/link/4d955d1b3361aadcee7b34c1a48ef872">https://www.php.cn/link/4d955d1b3361aadcee7b34c1a48ef872</a>")</p><pre class='brush:python;toolbar:false;'>video_urls = []
def handle_response(response):
if any(suffix in response.url for suffix in [".mp4", ".m3u8", ".mp3"]):
if "video/" in response.headers.get("content-type", "") or "audio/" in response.headers.get("content-type", ""):
video_urls.append(response.url)
page.on("response", handle_response)
page.wait_for_timeout(5000) # 等 JS 加载完成
browser.close()</pre>逆向分析 XHR 请求比启动浏览器更快
如果目标网站结构稳定,且音视频地址由固定 API 返回(比如 /api/v1/play?vid=xxx),手动逆向一次,后续全靠 requests + 签名算法,速度和稳定性远超浏览器自动化。
怎么做:
- 在浏览器 Network 面板中找到那个返回播放信息的 XHR 请求(通常响应是 JSON,含
play_url、hls_url字段) - 右键 →
Copy → Copy as cURL (bash),粘贴到在线工具(如 curlconverter.com)转成 Pythonrequests代码 - 重点检查哪些参数是动态生成的:常见有
sign、ts、token、checksum—— 这些往往需从页面 JS 中提取生成逻辑(搜function sign、md5(、hmac.) - 用
execjs或pyexecjs直接运行 JS 片段生成参数(注意 Node.js 环境依赖)
性能影响:纯 requests 方案并发轻松上 10+,而 Playwright 启一个浏览器实例内存占用 >200MB,不适合高频批量下载。
下载 m3u8 并合并 ts 文件要绕过 referer 和分片加密
很多视频用 HLS(.m3u8)分发,不能直接 requests.get(m3u8_url) 下载完事——ts 片段常校验 Referer,且可能被 AES-128 加密。
容易踩的坑:
- 没带
Referer头导致 ts 返回 403,必须和 m3u8 请求一致 - 忽略
#EXT-X-KEY行,直接拼接 ts 会下出乱码文件;得先用requests下密钥(uri="xxx.key"),再用pycryptodome解密每个 ts -
ffmpeg合并时加-headers "Referer: xxx"参数,否则合并过程仍可能失败
不推荐手写 ts 下载器。更稳妥的是用 ffmpeg -i "xxx.m3u8" -c copy out.mp4,但得确保 ffmpeg 能正常访问所有分片(即环境网络 + headers 支持)。
真正难的不是“怎么下载”,而是确认目标网站的反爬强度和资源生成逻辑是否可稳定复现——有些站点每 5 分钟换一次 sign 算法,或者 key 有效期仅 30 秒,这种就得实时注入 JS 上下文,而不是写死规则。

















