Scrapy CrawlSpider - errback per start_urls

Sep 23 2020

Sto usando CrawlSpidercon la regola linkextractor che ha errback.

Sto usando parse_start_urlper essere in grado di analizzare il start_urlsma ho bisogno errbackanche di loro.

class CS(CrawlSpider):
    name = "CS"
    rules = (Rule(LinkExtractor(allow=[], deny=[]), follow=True, callback='my_parse', errback='my_errback'),)           
    custom_settings = {
        'DEPTH_LIMIT': 3,
        #etc
    }
    
    start_urls = ['url']
    allowed_domains = ['domain']
    
    def my_errback(self, failure):
        # log all failures
    
    def parse_start_url(self, response):
        return self.my_parse(response)

    def my_parse(self, response):
        # parse responses

Il problema che sto affrontando è che l'errback viene chiamato SOLO per i collegamenti estratti e NON per start_urls.

Non posso utilizzare il metodo start_requests (come di seguito) poiché sto utilizzando CrawlSpider e le regole. Quando lo faccio, vengono raschiati solo start_urls:

def start_requests(self):
            for u in self.start_urls:
                yield scrapy.Request(u, callback=self.my_parse,
                                        errback=self.my_errback)

Risposte

J_Z Sep 24 2020 at 07:20

Questa è la risposta: https://stackoverflow.com/a/34345668/13903397

Fondamentalmente, dobbiamo usare start_requestsma rimuovere il parametro callback. In questo modo verrà chiamato il self.parse predefinito e le regole verranno rispettate.

class CS(CrawlSpider):
    name = "CS"
    rules = (Rule(LinkExtractor(allow=[], deny=[]), follow=True, callback='my_parse', errback='my_errback'),)           
    custom_settings = {
        'DEPTH_LIMIT': 3,
        #etc
    }
    
    start_urls = ['url']
    allowed_domains = ['domain']

    def start_requests(self):
        for u in self.start_urls:
            yield scrapy.Request(u, errback=self.my_errback)
    
    def my_errback(self, failure):
        # log all failures
    
    def parse_start_url(self, response):
        return self.my_parse(response)

    def my_parse(self, response):
        # parse responses