Задать вопрос
@burn_bridges

Как спарсить определенные pdf документы с сайта, которые содержат нужные слова?

Есть картотека арбитражного суда (kad.arbitr.ru), которая содержит различные открытые документы в pdf.
Нужно спарсить ссылки на документы, в которых присутствуют определенные ключевые слова.

Я еще только изучаю python, так что прошу дать наводку в какую сторону двигаться, что почитать/посмотреть, какие особенности учитывать. Может есть какие-то похожие решения?

Как понимаю сайт картотеки на javascript - будут ли тут какие-то сложности?
После нескольких поисковых запросов вылезает капча - в этом будет какая-то проблема при парсинге?
  • Вопрос задан
  • 235 просмотров
Подписаться 2 Простой 3 комментария
Помогут разобраться в теме Все курсы
  • Нетология
    Python-разработчик: расширенный курс + нейросети
    12 месяцев
    Далее
  • Яндекс Практикум
    Python-разработчик
    10 месяцев
    Далее
  • Академия Эдюсон
    Python-разработчик + ИИ
    9 месяцев
    Далее
Пригласить эксперта
Ваш ответ на вопрос

Войдите, чтобы написать ответ

Похожие вопросы