Парсинг на Python: с чего стартовать новичку и чего не забыть
Ребята, кто недавно начал или давно занимается парсингом на Python, поделитесь, пожалуйста, что для вас оказалось самым важным в самом начале. Я вот заметил, что многие новички сразу бросаются на requests и BeautifulSoup, но часто упускают момент с правильной обработкой ошибок и задержками между запросами — из-за этого легко словить бан или неожиданный сбой.
Ещё любопытно, как вы подходите к выбору библиотек? Кто-то советует Scrapy, кто-то более легкие связки, типа requests + lxml. И как у вас с сохранением результатов? Кто-то пишет прямо в базу, кто-то сначала в csv — что оказалось удобнее и почему?
Кроме того, часто сталкивался с тем, что начальные скрипты быстро перестают работать, потому что сайт поменял структуру. Как обычно отслеживаете такие изменения и поддерживаете парсер в актуальном состоянии?
Будет классно услышать реальные советы и лайфхаки, которые реально упрощают жизнь тем, кто только начал ковырять парсинг на Python.