Встречается на собеседованиях • сегодня

Какие знаешь библиотеки для работы с веб парсингом

В Python есть несколько популярных библиотек для веб-парсинга:

  1. BeautifulSoup — удобна для разбора HTML/XML, часто используется вместе с requests.

    python
    from bs4 import BeautifulSoup
    import requests
    
    response = requests.get('https://example.com')
    soup = BeautifulSoup(response.text, 'html.parser')
    print(soup.title.string)
  2. Scrapy — мощный фреймворк для парсинга и краулинга, поддерживает асинхронность.

    python
    import scrapy
    
    class MySpider(scrapy.Spider):
        name = 'example'
        start_urls = ['https://example.com']
        
        def parse(self, response):
            yield {'title': response.css('title::text').get()}
  1. lxml — быстрая библиотека для парсинга XML/HTML, работает через XPath.

    python
    from lxml import html
    
    tree = html.fromstring(requests.get('https://example.com').content)
    print(tree.xpath('//title/text()')[0])
  2. Selenium — автоматизирует браузер, подходит для динамических страниц (JS).

    python
    from selenium import webdriver
    
    driver = webdriver.Chrome()
    driver.get('https://example.com')
    print(driver.title)
    driver.quit()

Выбор зависит от задачи: для статичных страниц — BeautifulSoup/lxml, для сложных — Scrapy или Selenium.

Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы