讲师中心 微信公众号
AI工具推荐 视频效率加速

如何使用 Python 逐行读取 URL 列表并依次解析每个网页内容

落强酱_1798

落强酱_1798

发布时间:2026-01-17 15:22:01

|

861人浏览过

|

来源于php中文网

原创

如何使用 Python 逐行读取 URL 列表并依次解析每个网页内容

本文详解如何修正 readlines() 循环逻辑错误,确保 python 脚本对文本文件中每一行 url 都执行独立的 http 请求与 html 解析,避免仅处理最后一行的问题。

你的原始代码中存在一个典型的缩进与作用域错误:for link in linksList: 循环体仅包含 url = link 这一行,后续所有网络请求、解析和写入操作均位于循环外部。因此,url 变量在循环结束后只保留最后一个值,最终仅对该 URL 执行了一次处理。

要实现“逐个解析每个 URL”,必须将整个请求-解析-保存流程完整包裹在 for 循环内。以下是优化后的完整实现(含关键改进说明):

Python Testing
Python Testing

Python 测试速查:运行 pytest、使用 mock/patch、参数化、fixtures、异步、覆盖率测试。

下载

✅ 正确结构:循环内完成全流程

import requests
from bs4 import BeautifulSoup

def news():
    # 使用 with 语句安全读取文件(自动关闭)
    with open('list.txt', 'r') as links_file:
        links_list = links_file.readlines()

    # 对每个 URL 执行独立处理
    for link in links_list:
        link = link.strip()  # 去除换行符和首尾空格,避免请求失败
        if not link:  # 跳过空行
            continue

        print(f"Processing: {link}")

        try:
            resp = requests.get(link, timeout=10)
            resp.raise_for_status()  # 抛出非200状态异常

            soup = BeautifulSoup(resp.text, 'html.parser')
            target_div = soup.find("div", {"class": "m-exhibitor-entry__item__body__contacts__additional__website"})

            if target_div:
                # 提取所有 <a> 标签的文本内容
                with open("Websites.txt", "a", encoding="utf-8") as f:
                    for anchor in target_div.find_all("a"):
                        f.write(anchor.get_text(strip=True) + "\n")
                print(f"✓ Extracted from {link}")
            else:
                print(f"⚠ Warning: Target div not found on {link}")

        except requests.exceptions.RequestException as e:
            print(f"✗ Failed to fetch {link}: {e}")
        except Exception as e:
            print(f"✗ Error parsing {link}: {e}")

if __name__ == "__main__":
    news()

? 关键改进点:

  • 缩进修复:全部网络请求、解析、写入逻辑均置于 for 循环内部,确保每轮迭代独立处理一个 URL;
  • 健壮性增强
    • link.strip() 清除 \n 和空格,防止 requests.get("https://...\n") 报错;
    • try/except 捕获网络异常(超时、连接拒绝等)和解析异常;
    • resp.raise_for_status() 主动检查 HTTP 错误状态;
    • 空行跳过与目标元素存在性校验,避免 AttributeError;
  • 资源管理优化
    • 使用 with open(...) 替代手动 open/close,防止文件句柄泄露;
    • 每次写入前重新打开文件("a" 模式),或更推荐:一次性打开写入流(见下方进阶建议);
  • 编码声明:encoding="utf-8" 避免中文等特殊字符写入乱码。

⚠ 注意事项:

  • list.txt 中每行应为一个有效 URL(如 https://www.enlit-europe.com/exhibitors/precept),无需额外符号;
  • 目标网站可能有反爬机制,若频繁请求被拒,请添加 time.sleep(1) 或设置 headers(如 'User-Agent');
  • 若需提升性能,可考虑使用 concurrent.futures.ThreadPoolExecutor 并发请求(注意遵守 robots.txt 及服务条款)。

通过以上重构,你的脚本将真正实现「逐一解析列表中每个 URL」的目标,并具备生产环境所需的稳定性与可维护性。

热门AI工具

更多
DeepSeek

DeepSeek是一款面向对话、写作、编程和推理场景的AI大模型工具。

VibeKnow
VibeKnow Hot

一款AI视频创作工具,主要用于全球首个AI知识视频创作平台,文档、文章、网页,一键生成视频,适合需要提升相关任务效率的用户。

火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

豆包大模型

豆包大模型是一款由字节跳动推出的企业级大语言模型服务平台。

咔片AIPPT

一款在线AI演示文稿制作工具,可根据主题和内容需求辅助生成PPT结构与页面,提高演示材料制作效率。

切问学术

切问学术是一款AI论文写作工具,复旦大学NLP团队推出的AI学术智能体。

讯飞绘文

讯飞绘文是一款由科大讯飞推出的一站式 AIGC 内容运营平台。

LibLibAI
LibLibAI Hot

一款AI视频创作工具,主要用于国内领先的AI创意平台,以海量模型、低门槛操作与“创作-分享-商业化”生态,让小白与专业创作者都能高效实现图文乃至视频创意表达,适合需要提升相关任务效率的用户。

WorkBuddy

一款AI办公效率工具,主要用于腾讯云推出的AI原生桌面智能体工作台,适合需要提升相关任务效率的用户。

相关专题

更多
http500解决方法
http500解决方法

http500解决方法有检查服务器日志、检查代码错误、检查服务器配置、检查文件和目录权限、检查资源不足、更新软件版本、重启服务器或寻求专业帮助等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2883

2023.11.09

http请求415错误怎么解决
http请求415错误怎么解决

解决方法:1、检查请求头中的Content-Type;2、检查请求体中的数据格式;3、使用适当的编码格式;4、使用适当的请求方法;5、检查服务器端的支持情况。更多http请求415错误怎么解决的相关内容,可以阅读下面的文章。

794

2023.11.14

HTTP 503错误解决方法
HTTP 503错误解决方法

HTTP 503错误表示服务器暂时无法处理请求。想了解更多http错误代码的相关内容,可以阅读本专题下面的文章。

6086

2024.03.12

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

5230

2024.08.16

Go 语言 HTTP 编程与中间件开发教程合集
Go 语言 HTTP 编程与中间件开发教程合集

全面讲解 Go 语言 HTTP 编程的核心知识,涵盖 net/http 标准库的 Server/Handler/HandlerFunc 体系、DefaultServeMux 路由注册与自定义路由器、Request / ResponseWriter 请求响应处理、中间件(Middleware)链式设计模式与常见中间件(日志/CORS/认证/限流)开发、http.Client 的超时配置与连接池管理、Cookie / Session 处理、

401

2026.05.08

http与https有哪些区别
http与https有哪些区别

http与https的区别:1、协议安全性;2、连接方式;3、证书管理;4、连接状态;5、端口号;6、资源消耗;7、兼容性。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

5230

2024.08.16

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

20

2026.09.23

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

0

2026.09.23

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

0

2026.09.23

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn