Задать вопрос
@kustovnikolay

Как выполнить массовое приведение PDF к новым ГОСТ?

Столкнулся с задачей привести архив PDF-документов на сайте в соответствие с требованиями ГОСТ Р 70176-2022.

Речь идет именно о требованиях доступности (Tagged PDF, корректная структура документа, возможность чтения программами экранного доступа и т.д.), а не об изменении оформления.

Проблема в масштабе.

На сайте размещены сотни тысяч PDF-документов, накопленных примерно с 2014 года. Исходников давно нет.

Насколько я понимаю, для соответствия ГОСТ Р 70176-2022 документ должен содержать структуру (теги, заголовки, списки, таблицы, альтернативные описания изображений, правильный порядок чтения и т.д.).

Сталкивался ли кто-нибудь уже с подобной задачей?
Есть ли инструменты, позволяющие автоматически размечать большие объемы PDF с приемлемым качеством?
Использовал ли кто-нибудь Adobe Acrobat Pro, CommonLook, axesPDF, PDFix, PyMuPDF или другие решения именно для массовой обработки?
Насколько реально автоматизировать этот процесс, а где неизбежна ручная разметка?
Есть ли опыт прохождения проверок на соответствие ГОСТ Р 70176-2022 или PDF/UA для больших архивов документов?

Буду благодарен за любой практический опыт, ссылки на статьи, доклады или кейсы. Особенно интересует опыт государственных организаций, вузов или крупных компаний, которым уже пришлось приводить многолетние архивы PDF в соответствие с новыми требованиями.
  • Вопрос задан
  • 274 просмотра
Подписаться 1 Средний 1 комментарий
Помогут разобраться в теме Все курсы
  • Нетология
    1C-программист: расширенный курс
    18 месяцев
    Далее
  • Академия Эдюсон
    Python-разработчик + ИИ
    9 месяцев
    Далее
  • ProductStar × РБК
    Профессия DevOps-инженер + ИИ
    5 месяцев
    Далее
Пригласить эксперта
Ответы на вопрос 4
VoidVolker
@VoidVolker
Dark side eye. А у нас печеньки! А у вас?
возможность чтения программами экранного доступа и т.д.

сотни тысяч PDF-документов ... Исходников давно нет

    Правильное решение тут очень простое: надо просто слать лесом этих фантастических фантазёров, а архив оставить архивом и пусть он там лежит как есть. Ну или вручить этот архив, офисный пакет и пусть они там сами своими ручками всё исправляют, если им так это надо. Формат PDF предназначен для отображения информации, а не как формат документов для редактирования. Если вам нужен нормальный результат — надо перегонять документы в стандартный офисный формат полуавтоматически и вручную подгонять под стандарт каждый документ и проверять его своими глазами и руками. Там в PDF часто разные люди такого разного накручивают, что какая-нибудь бяка 100% в каждом документе вылезет. Если эту задачу вам поставило руководство: тогда просто посчитайте число страниц со всех документов, среднее время на приведение одной страницы к стандарту вручную, перемножьте эти числа и сообщите в отчёте, что выполнение данной задачи займёт столько-то десятилетий человеко-часов пусть дальше у них болит голова об этом.
    Да, есть всякие утилиты распознавания, неронки и прочее — но точность там хромает, иногда даже на все четыре ноги, когда они встречаются с творческими фантазиями креативных личностей, что пихают всякие непотребства в PDF. А неронки ещё и отсебятину разую навтыкают и результат всё равно придётся проверять вручную. И на кой вам нужны документы, доверять которым нельзя или там может чего-то не хватать? Выдирать программно данные из PDF — это тот ещё мазохизм.
Ответ написан
opium
@opium
Просто люблю качественно работать
Стопроцентной автоматики не будет: ГОСТ 70176 это PDF/UA, важна семантика и порядок чтения, а не просто теги, а сканы без OCR вообще не затегируешь. Из твоего списка под такой объём реально заточен PDFix (batch+AI-tagging), результат гоняй через veraPDF. Если сайт госоргана или подведомственной организации, с 1 марта 2026 (пост. №102) можно вместо правки каждого PDF выложить альтернативную доступную версию документа — для архива без исходников это обычно дешевле.
Ответ написан
Комментировать
@Drno
потратить несколько сот(тысяч ?) баксов и натравить на базу Opus 5 ?
а потом еще вручную надо будет всё проверить

либо слать лесом
Ответ написан
Комментировать
NeiroNx
@NeiroNx
Программист
В любом случае потребуется пересборка PDF, для формального соотвествия будет достаточно извлечь первый заголовок и краткое содержание документа(для большинства документов). Остальной контент можно оставить в виде графики.
Нужен будет какой то классификатор шаблона(письмо, договор, акт), а далее обработчик согласно шаблона вытягивает нужные поля через распознавание и лепит из них что-то похожее на документ соответствующий ГОСТу.
Ответ написан
Комментировать
Ваш ответ на вопрос

Войдите, чтобы написать ответ

Похожие вопросы