Не могу войти в linkedin через ScrapyPython

Программы на Python
Anonymous
Не могу войти в linkedin через Scrapy

Сообщение Anonymous »

Я постоянно получаю 303, перенаправление на какую-то страницу с контрольной точкой. Я проверил документацию и попытался найти похожие проблемы, но ничего особенного не нашел.
вот мой код:

Код: Выделить всё

import scrapy
from scrapy.http import FormRequest

class LinekdInSpider(scrapy.Spider):
name = 'linkedin'

def start_requests(self):
urls = ['https://www.linkedin.com/checkpoint/rm/sign-in-another-account']
meta = {
"proxy": "http://scraperapi:*@proxy-server.scraperapi.com:8001"
}

for url in urls:
yield scrapy.Request(url=url, callback=self.login)

def login(self, response):
token = response.css('form[class="login__form"] input[name="loginCsrfParam"]::attr(value)').get()
yield FormRequest.from_response(response, formcss='form[class="login__form"]',
formdata={
'username': '*',
'password': '*',
'csrf_token': token
}, callback=self.parse)

def parse(self, response): # just a test parser
yield {'url': response,
'text': response.css('h4')}
и вот какую ошибку я получаю:

Код: Выделить всё

2024-06-29 09:44:09 [scrapy.utils.log] INFO: Scrapy 2.11.2 started (bot: linkedin)
2024-06-29 09:44:09 [scrapy.utils.log] INFO: Versions: lxml 5.2.1.0, libxml2 2.10.4, cssselect 1.2.0, parsel 1.9.1, w3lib 2.1.2, Twisted 24.3.0, Python 3.11.9 | packaged by Anaconda, Inc.  | (main, Apr 19 2024, 16:40:41) [MSC v.1916 64 bit (AMD64)], pyOpenSSL 24.0.0 (OpenSSL 3.3.0 9 Apr 2024), cryptography 42.0.7, Platform Windows-10-10.0.22631-SP0
2024-06-29 09:44:09 [scrapy.addons] INFO: Enabled addons:
[]
2024-06-29 09:44:09 [asyncio] DEBUG: Using selector: SelectSelector
2024-06-29 09:44:09 [scrapy.utils.log] DEBUG: Using reactor: twisted.internet.asyncioreactor.AsyncioSelectorReactor
2024-06-29 09:44:09 [scrapy.utils.log] DEBUG: Using asyncio event loop: asyncio.windows_events._WindowsSelectorEventLoop
2024-06-29 09:44:09 [scrapy.extensions.telnet] INFO: Telnet Password: 9ffb532406bc3a66
2024-06-29 09:44:09 [scrapy.middleware] INFO: Enabled extensions:
['scrapy.extensions.corestats.CoreStats',
'scrapy.extensions.telnet.TelnetConsole',
'scrapy.extensions.feedexport.FeedExporter',
'scrapy.extensions.logstats.LogStats']
2024-06-29 09:44:09 [scrapy.crawler] INFO: Overridden settings:
{'BOT_NAME': 'linkedin',
'COOKIES_ENABLED': False,
'DOWNLOAD_DELAY': 3,
'FEED_EXPORT_ENCODING': 'utf-8',
'NEWSPIDER_MODULE': 'linkedin.spiders',
'REQUEST_FINGERPRINTER_IMPLEMENTATION': '2.7',
'SPIDER_MODULES': ['linkedin.spiders'],
'TWISTED_REACTOR': 'twisted.internet.asyncioreactor.AsyncioSelectorReactor'}
2024-06-29 09:44:09 [scrapy.middleware] INFO: Enabled downloader middlewares:
['scrapy.downloadermiddlewares.offsite.OffsiteMiddleware',
'scrapy.downloadermiddlewares.httpauth.HttpAuthMiddleware',
'scrapy.downloadermiddlewares.downloadtimeout.DownloadTimeoutMiddleware',
'scrapy.downloadermiddlewares.defaultheaders.DefaultHeadersMiddleware',
'scrapy.downloadermiddlewares.useragent.UserAgentMiddleware',
'scrapy.downloadermiddlewares.retry.RetryMiddleware',
'scrapy.downloadermiddlewares.redirect.MetaRefreshMiddleware',
'scrapy.downloadermiddlewares.httpcompression.HttpCompressionMiddleware',
'scrapy.downloadermiddlewares.redirect.RedirectMiddleware',
'scrapy.downloadermiddlewares.httpproxy.HttpProxyMiddleware',
'scrapy.downloadermiddlewares.stats.DownloaderStats']
2024-06-29 09:44:09 [scrapy.middleware] INFO: Enabled spider middlewares:
['scrapy.spidermiddlewares.httperror.HttpErrorMiddleware',
'scrapy.spidermiddlewares.referer.RefererMiddleware',
'scrapy.spidermiddlewares.urllength.UrlLengthMiddleware',
'scrapy.spidermiddlewares.depth.DepthMiddleware']
2024-06-29 09:44:09 [scrapy.middleware] INFO: Enabled item pipelines:
[]
2024-06-29 09:44:09 [scrapy.core.engine] INFO: Spider opened
2024-06-29 09:44:10 [scrapy.extensions.logstats] INFO: Crawled 0 pages (at 0 pages/min), scraped 0 items (at 0 items/min)
2024-06-29 09:44:10 [scrapy.extensions.telnet] INFO: Telnet console listening on 127.0.0.1:6023
2024-06-29 09:44:10 [scrapy.core.engine] DEBUG: Crawled (200)  (referer: https://www.linkedin.com/home)
2024-06-29 09:44:14 [scrapy.downloadermiddlewares.redirect] DEBUG: Redirecting (303) to  from
2024-06-29 09:44:19 [scrapy.core.engine] DEBUG: Crawled (200)   (referer: https://www.linkedin.com/checkpoint/rm/sign-in-another-account)
2024-06-29 09:44:19 [scrapy.core.scraper] DEBUG: Scraped from 
{'url': , 'text': []}
2024-06-29 09:44:19 [scrapy.core.engine] INFO: Closing spider (finished)
2024-06-29 09:44:19 [scrapy.extensions.feedexport] INFO: Stored csv feed (1 items) in: test.csv
2024-06-29 09:44:19 [scrapy.statscollectors] INFO: Dumping Scrapy stats:
{'downloader/request_bytes': 2593,
'downloader/request_count': 3,
'downloader/request_method_count/GET': 2,
'downloader/request_method_count/POST': 1,
'downloader/response_bytes': 40377,
'downloader/response_count': 3,
'downloader/response_status_count/200': 2,
'downloader/response_status_count/303': 1,
'elapsed_time_seconds': 9.269729,
'feedexport/success_count/FileFeedStorage': 1,
'finish_reason': 'finished',
'finish_time': datetime.datetime(2024, 6, 29, 7, 44, 19, 350355, tzinfo=datetime.timezone.utc),
'httpcompression/response_bytes': 98836,
'httpcompression/response_count': 2,
'item_scraped_count': 1,
'log_count/DEBUG': 7,
'log_count/INFO': 11,
'request_depth_max': 1,
'response_received_count': 2,
'scheduler/dequeued': 3,
'scheduler/dequeued/memory': 3,
'scheduler/enqueued': 3,
'scheduler/enqueued/memory': 3,
'start_time': datetime.datetime(2024, 6, 29, 7, 44, 10, 80626, tzinfo=datetime.timezone.utc)}
2024-06-29 09:44:19 [scrapy.core.engine] INFO: Spider closed (finished)
Насколько я понимаю, проблема где-то внутри from_response. Что касается всех тегов, то я уверен, что расположил их правильно, поскольку проверил их все в Scrapy Shell.


Подробнее здесь: https://stackoverflow.com/questions/786 ... ith-scrapy

Вернуться в «Python»