Встречается на собеседованиях • сегодня

Как парсил данные

Для парсинга данных в Python чаще всего использую библиотеки:

  1. BeautifulSoup (для HTML/XML):
python
from bs4 import BeautifulSoup
import requests

url = 'https://example.com'
response = requests.get(url)
soup = BeautifulSoup(response.text, 'html.parser')
titles = [h1.text for h1 in soup.find_all('h1')]
  1. lxml (быстрее BeautifulSoup для сложных документов):
python
from lxml import html
tree = html.fromstring(response.content)
elements = tree.xpath('//div[@class="content"]')
  1. re (регулярные выражения для сложных случаев):
python
import re
emails = re.findall(r'[\w\.-]+@[\w\.-]+', text)
  1. API-запросы (если доступен API):
python
import requests
data = requests.get('https://api.example.com/data').json()

При парсинге учитываю:

  • Задержки между запросами (time.sleep)
  • Обработку ошибок (try/except)
  • User-Agent и headers
  • Политику сайта (robots.txt)
  • Возможность блокировки (прокси, ротация)
Sophi
Софи собрала все вопросы. Тренируйся и получай
офферы быстрее!
Попробовать бесплатноArrow

Следующий вопрос

Это единственный вопрос по вашему фильтру

как отвечать на вопрос
пример собеседования
фреймворки на собеседовании
типичные вопросы junior
интервью вопросы и ответы