标签:python request self selenium spider chrome scrapy url
spider.py
import scrapy
from scrapy import signals
from selenium import webdriver
class BaiduSpider(scrapy.Spider):
name = 'baidu'
allowed_domains = ['baidu.com']
start_urls = ['http://www.baidu.com/']
# 抓捕信号
@classmethod
def from_crawler(cls, crawler, *args, **kwargs):
# 创建爬虫对象
spider = super(BaiduSpider, cls).from_crawler(crawler, *args, **kwargs)
spider.chrome = webdriver.Chrome()
# 定义信号连接
crawler.signals.connect(spider.spider_closed, signal=signals.spider_closed)
return spider
def spider_closed(self, spider):
spider.logger.info('Spider closed: %s', spider.name)
spider.chrome.close()
def parse(self, response):
print(response.text)
middlewares.py
from scrapy.http.response.html import HtmlResponse
# useful for handling different item types with a single interface
class Selenium:
# def __init__(self):
# self.chrome = webdriver.Chrome()
def process_request(self, request, spider):
# chrome = webdriver.Chrome()
# chrome.get(request.url)
# html = chrome.page_source
# self.chrome.get(request.url)
# html = self.chrome.page_source
spider.chrome.get(request.url)
html = spider.chrome.page_source
# 推送到spider.py中 response,该路由已被爬取
return HtmlResponse(url=request.url,body=html,encoding='utf-8')
信号 可参考官网:
信号(Signals) — Scrapy 0.24.6 文档
标签:python,request,self,selenium,spider,chrome,scrapy,url 来源: https://blog.csdn.net/qq_53582111/article/details/120733187
本站声明: 1. iCode9 技术分享网(下文简称本站)提供的所有内容,仅供技术学习、探讨和分享; 2. 关于本站的所有留言、评论、转载及引用,纯属内容发起人的个人观点,与本站观点和立场无关; 3. 关于本站的所有言论和文字,纯属内容发起人的个人观点,与本站观点和立场无关; 4. 本站文章均是网友提供,不完全保证技术分享内容的完整性、准确性、时效性、风险性和版权归属;如您发现该文章侵犯了您的权益,可联系我们第一时间进行删除; 5. 本站为非盈利性的个人网站,所有内容不会用来进行牟利,也不会利用任何形式的广告来间接获益,纯粹是为了广大技术爱好者提供技术内容和技术思想的分享性交流网站。