Scrapy
爬虫时,由于重定向或是其他原因,会导致原始的start_url
发生改变,怎样才能得到原始的start_url
?
def start_requests(self):
start_url = 'your_scrapy_start_url'
yield Request(start_url, self.parse)
def parse(self, response):
item = YourItem()
item['start_url'] = 原始请求的start_url
yield item
Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号
参考文章:Scrapy爬虫常见问题总结
利用
Request
中的meta
参数传递信息