文本内容
" />
本文详解为何BeautifulSoup无法获取JavaScript动态渲染的文本,并提供Selenium模拟浏览器与requests+TSV数据重构两种可靠解决方案。
本文详解为何beautifulsoup无法获取javascript动态渲染的`
`文本,并提供selenium模拟浏览器与requests+tsv数据重构两种可靠解决方案。
在使用 requests + BeautifulSoup 抓取类似 https://www.php.cn/link/7cd012c8f261921cd44742ec554f398d 这类现代前端网站时,常会遇到“元素存在但文本为空”的问题——例如 <h1 id="mainheader" class="mainheader"></h1> 在源码中确实存在,但内部无文本。根本原因在于:该页面依赖 JavaScript 动态注入内容,而 requests.get() 仅获取服务器返回的初始 HTML 骨架(不含执行 JS 后的 DOM 状态),因此 soup.find('h1').get_text() 返回空字符串。
✅ 正确方案一:使用 Selenium 模拟真实浏览器(推荐初学者)
Selenium 启动真实浏览器(如 Chrome),完整执行页面 JS,确保 <h1></h1> 被填充后再解析:
from selenium import webdriver
from selenium.webdriver.chrome.options import Options
from bs4 import BeautifulSoup
import time
# 无头模式运行(不弹出窗口)
chrome_options = Options()
chrome_options.add_argument("--headless")
chrome_options.add_argument("--no-sandbox")
chrome_options.add_argument("--disable-dev-shm-usage")
driver = webdriver.Chrome(options=chrome_options)
try:
driver.get("https://www.php.cn/link/7cd012c8f261921cd44742ec554f398d")
time.sleep(2) # 等待JS渲染完成(可优化为显式等待)
soup = BeautifulSoup(driver.page_source, 'html.parser')
h1 = soup.find('h1', id='mainheader')
if h1 and h1.get_text(strip=True):
print(f"✅ 提取成功:{h1.get_text(strip=True)}")
# 输出:World Football Elo Ratings: Year 1999
else:
print("❌ 仍未能获取h1文本,请检查页面结构或等待时间")
finally:
driver.quit()⚠️ 注意事项:
- 需提前安装 ChromeDriver 并确保其在系统 PATH 中,或使用
webdriver_manager自动管理;time.sleep(2)是简单做法,生产环境建议改用WebDriverWait等待特定元素可见;- 若需批量抓取,注意添加请求间隔、User-Agent 及异常重试机制。
✅ 方案二:纯 requests + TSV 数据解析(高效、轻量、适合批量)
观察该站点源码可知,所有年份数据均来自独立 TSV 文件(如 1999.tsv),而 <h1></h1> 文本由 en.labels.tsv 中的 year_header 字段拼接生成。可直接请求并解析:
立即学习“Python免费学习笔记(深入)”;
import requests
import pandas as pd
from io import StringIO
# 获取多语言标签(含标题模板)
labels_url = "https://www.eloratings.net/en.labels.tsv"
labels = pd.read_csv(labels_url, sep='\t', index_col='key')
# 获取年份数据(验证页面逻辑)
year_data_url = "https://www.php.cn/link/7cd012c8f261921cd44742ec554f398d.tsv"
year_df = pd.read_csv(year_data_url, sep='\t')
# 构建h1文本:根据labels中定义的模板格式化
year_header = labels.loc['year_header', 'value'] # "World Football Elo Ratings: Year {year}"
h1_text = year_header.format(year=1999)
print(f"✅ 重构h1文本:{h1_text}")
# 输出:World Football Elo Ratings: Year 1999此方式无需浏览器,速度快、稳定性高,且天然支持导出完整表格(year_df 即为页面中显示的全部球队排名数据):
# 保存1999年完整排名表为CSV
year_df.to_csv("elorating_1999.csv", index=False)
print(f"? 已保存 {len(year_df)} 行球队数据到 elorating_1999.csv")总结对比
| 方案 | 优点 | 缺点 | 适用场景 |
|---|---|---|---|
| Selenium | 通用性强,无需逆向分析,可处理任意JS渲染页 | 速度慢、资源占用高、需维护驱动 | 少量页面、结构复杂、无公开API/TSV |
| requests + TSV | 极快、稳定、易并行、零渲染开销 | 依赖站点暴露结构化数据,需理解业务逻辑 | 该站等明确提供TSV源的静态数据型网站 |
最佳实践建议:优先查看目标网站是否提供 .json、.tsv、.csv 等原始数据接口(常藏于 Network 面板中);若无,则再选用 Selenium。二者结合(TSV为主 + Selenium兜底校验)可构建鲁棒的数据采集管道。


















