
本文介绍如何使用 python 模拟用户选择一级选项(如尺寸)后,动态请求并解析后续层级(如容量、包装件数)的全部可选值,解决 scrapy 直接抓取无法获取联动下拉菜单内容的问题。
本文介绍如何使用 python 模拟用户选择一级选项(如尺寸)后,动态请求并解析后续层级(如容量、包装件数)的全部可选值,解决 scrapy 直接抓取无法获取联动下拉菜单内容的问题。
在电商网站(如 BCF)中,产品变体常采用级联式下拉菜单:用户先选“Size”,页面再动态加载对应的“Capacity”选项;再选“Capacity”,才触发“Pack Pieces”的更新。这类交互依赖前端 JavaScript 向后端 API 发送参数化请求(如 dwvar_{pid}_size),而非静态 HTML 渲染——因此仅靠 response.css() 无法获取未触发的二级/三级选项。
✅ 正确方案:模拟 AJAX 变体请求
核心思路是:主动构造并发送变体查询请求(API 调用),而非等待浏览器渲染。BCF 使用 Demandware 平台,其变体接口为:
https://www.bcf.com.au/on/demandware.store/Sites-bcf-au-Site/en_AU/Product-Variation
该接口接受 pid(商品 ID)、dwvar_{pid}_size(所选尺寸值)、source 等参数,返回含完整 <select> 的 HTML 片段。
以下为可运行的完整示例(基于 requests + BeautifulSoup,更适用于此类动态变体场景):
import requests
from bs4 import BeautifulSoup
def fetch_all_variations(product_id: str, base_url: str = "https://www.bcf.com.au"):
# Step 1: 获取主商品页,提取所有尺寸链接文本(即用户可见的 Size 选项)
product_page = requests.get(f"{base_url}/p/daiwa-23-td-black-spinning-rod/{product_id}.html")
soup = BeautifulSoup(product_page.content, "html.parser")
size_options = []
for a in soup.select("li > a.swatchanchor"):
size_text = a.text.strip()
if size_text and size_text not in size_options:
size_options.append(size_text)
# Step 2: 对每个尺寸,调用变体 API 获取对应 Capacity 选项
api_url = f"{base_url}/on/demandware.store/Sites-bcf-au-Site/en_AU/Product-Variation"
all_variants = []
for size in size_options:
params = {
"pid": product_id,
f"dwvar_{product_id}_size": size,
"source": "detail",
"variant_order": "size",
"Quantity": "1",
"productlistid": "undefined",
"format": "ajax"
}
try:
resp = requests.get(api_url, params=params, timeout=10)
resp.raise_for_status()
soup2 = BeautifulSoup(resp.content, "html.parser")
# 提取 Capacity 下拉框(跳过空的 placeholder 选项)
capacity_select = soup2.select_one(".capacity select")
if capacity_select:
for opt in capacity_select.select("option")[1:]: # 跳过首项(如 "-- Select --")
capacity = opt.text.strip()
if capacity:
all_variants.append({
"size": size,
"capacity": capacity,
# 可继续嵌套请求获取 Pack Pieces(需传入 capacity 参数)
})
except Exception as e:
print(f"[WARN] Failed fetching capacities for size '{size}': {e}")
return all_variants
# 使用示例
if __name__ == "__main__":
variants = fetch_all_variations("M675158")
for v in variants:
print(f"{v['size']:<10} {v['capacity']}")⚠️ 注意事项与进阶建议
- 参数命名敏感:dwvar_{pid}_size 中的 size 必须与页面实际 data-variation-attribute 属性名一致(可通过浏览器 Network 面板确认);
- 三级联动处理:若需获取 Pack Pieces,需在获取 capacity 后,再次调用同一 API,但将 dwvar_{pid}_capacity 作为参数,并解析 .packpieces select;
- 反爬与稳定性:添加 headers(如 User-Agent)、合理 timeout 和重试机制;避免高频请求;
- Scrapy 兼容方案:可在 Scrapy 中用 scrapy.Request(url, method='GET', cb_kwargs={...}) 替代 requests,保持框架一致性;
- 数据去重:部分尺寸可能对应重复容量值,建议用 (size, capacity) 元组去重。
通过主动构造变体请求,你不再依赖 DOM 渲染状态,而是直接与后端 API 对话——这是处理级联下拉菜单最可靠、最可控的方式。

















