用ChatGPT生成Python脚本可全自动下载网页文字内容,需明确指定目标网址(含分页规律)、识别依据(如text为“Transcript”或rel="bookmark")、本地保存路径,运行前须检查robots.txt、网页结构稳定性并添加User-Agent请求头。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要从多个网页中批量获取文字内容,比如播客逐字稿、股东大会纪要或博客文章,但手动点开→复制→粘贴效率极低,还容易漏页、错命名、保存失败。
用ChatGPT生成Python脚本,全自动下载指定网页
第一步:打开ChatGPT(推荐使用支持代码执行的版本,如GPT-4 Turbo with Code Interpreter),输入清晰指令,明确告诉它你要下载什么、从哪来、存哪去。
第二步:在提示词中必须包含三个硬性要素——目标网址(含分页规律)、识别依据(如链接文字含“Transcript”或rel="bookmark")、本地保存路径(如D:\podcasts);缺一不可,否则生成的脚本会漏抓或报错。
第三步:粘贴完整提示词后发送,等待ChatGPT返回可运行的Python代码;【不要直接运行,先检查requests和BeautifulSoup是否已安装】。
第四步:将代码复制到本地VS Code或PyCharm中,右键运行;若提示ModuleNotFoundError,依次执行pip install requests beautifulsoup4 lxml。
关键参数怎么写?看这两个真实案例
方法一:提取页面中所有含“Transcript”文字的链接
适用于lexfridman.com这类播客站——每个节目页下方有独立“Transcript”按钮,href指向纯文本页。
提示词关键句:“提取所有a标签中text为‘Transcript’的href值,再访问该href,取其title标签内容作文件名,下载HTML正文到指定文件夹”。
用于在用户想通过浏览器自动化与 Google Gemini 或 ChatGPT 交互时。触发短语包括“ask Gemini”“ask ChatGPT”“ask GPT”“让...”。
方法二:按分页URL批量抓取+用rel="bookmark"定位正文链接
适用于blog.umd.edu这类博客站——搜索结果分页,每页内所有文章链接都带rel="bookmark"属性。
提示词关键句:“遍历https://blog.umd.edu/davidkass/page/{1..2}/?s=Notes+From+Berkshire+Hathaway,提取每页中rel='bookmark'的a标签href和text,用text做文件名,下载对应网页HTML”。
【注意:Windows文件名禁用字符(: / \ * ? " |)必须替换为短横线,否则保存会失败】
运行前必做的三件事
① 确认目标网站robots.txt允许爬取——访问https://目标域名/robots.txt,查看Disallow字段是否为空或未限制你访问的路径。
② 检查网页结构是否稳定——打开一个示例页,右键“查看网页源代码”,搜索“Transcript”或“bookmark”,确认该文本或属性确实存在于源码中,而非JavaScript动态渲染生成。
③ 在Python脚本开头添加请求头伪装,避免被服务器拒绝:
headers = {'User-Agent': 'Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36'}
requests.get(url, headers=headers)

















