Как выполнить массовое приведение PDF к новым ГОСТ?
Столкнулся с задачей привести архив PDF-документов на сайте в соответствие с требованиями ГОСТ Р 70176-2022.
Речь идет именно о требованиях доступности (Tagged PDF, корректная структура документа, возможность чтения программами экранного доступа и т.д.), а не об изменении оформления.
Проблема в масштабе.
На сайте размещены сотни тысяч PDF-документов, накопленных примерно с 2014 года. Исходников давно нет.
Насколько я понимаю, для соответствия ГОСТ Р 70176-2022 документ должен содержать структуру (теги, заголовки, списки, таблицы, альтернативные описания изображений, правильный порядок чтения и т.д.).
Сталкивался ли кто-нибудь уже с подобной задачей?
Есть ли инструменты, позволяющие автоматически размечать большие объемы PDF с приемлемым качеством?
Использовал ли кто-нибудь Adobe Acrobat Pro, CommonLook, axesPDF, PDFix, PyMuPDF или другие решения именно для массовой обработки?
Насколько реально автоматизировать этот процесс, а где неизбежна ручная разметка?
Есть ли опыт прохождения проверок на соответствие ГОСТ Р 70176-2022 или PDF/UA для больших архивов документов?
Буду благодарен за любой практический опыт, ссылки на статьи, доклады или кейсы. Особенно интересует опыт государственных организаций, вузов или крупных компаний, которым уже пришлось приводить многолетние архивы PDF в соответствие с новыми требованиями.
PDF/A делается из просто PDF буквально одной командой GhostScript.
У меня так сервер молча пережевывает файлы не первый год.
Но PDF/UA - это требование предоставления информации, которой в PDF нет и быть не может, даже если это не скан.
Более того - скорее всего, ее нет и в исходниках, потому что документы по-секретарски никакой семантики не содержат. Вместо стиля Заголовок - полужирный, сцентрованный, покрупнее - так сойдет. И так весь документ.
Соответственно, задача решения не имеет в принципе.
Ну, не считая "авось нейронка чего-нибудь угадает, а на проверке будет не человек, а другая нейронка".
возможность чтения программами экранного доступа и т.д.
сотни тысяч PDF-документов ... Исходников давно нет
Правильное решение тут очень простое: надо просто слать лесом этих фантастических фантазёров, а архив оставить архивом и пусть он там лежит как есть. Ну или вручить этот архив, офисный пакет и пусть они там сами своими ручками всё исправляют, если им так это надо. Формат PDF предназначен для отображения информации, а не как формат документов для редактирования. Если вам нужен нормальный результат — надо перегонять документы в стандартный офисный формат полуавтоматически и вручную подгонять под стандарт каждый документ и проверять его своими глазами и руками. Там в PDF часто разные люди такого разного накручивают, что какая-нибудь бяка 100% в каждом документе вылезет. Если эту задачу вам поставило руководство: тогда просто посчитайте число страниц со всех документов, среднее время на приведение одной страницы к стандарту вручную, перемножьте эти числа и сообщите в отчёте, что выполнение данной задачи займёт столько-то десятилетий человеко-часов пусть дальше у них болит голова об этом.
Да, есть всякие утилиты распознавания, неронки и прочее — но точность там хромает, иногда даже на все четыре ноги, когда они встречаются с творческими фантазиями креативных личностей, что пихают всякие непотребства в PDF. А неронки ещё и отсебятину разую навтыкают и результат всё равно придётся проверять вручную. И на кой вам нужны документы, доверять которым нельзя или там может чего-то не хватать? Выдирать программно данные из PDF — это тот ещё мазохизм.
Добавлю, вам ещё повезёт, если у вас PDF-A, в котором есть текстовый слой. Если же у вас простые сканы, как это часто бывает, то добавится ещё и OCR со своими проблемами.
Стопроцентной автоматики не будет: ГОСТ 70176 это PDF/UA, важна семантика и порядок чтения, а не просто теги, а сканы без OCR вообще не затегируешь. Из твоего списка под такой объём реально заточен PDFix (batch+AI-tagging), результат гоняй через veraPDF. Если сайт госоргана или подведомственной организации, с 1 марта 2026 (пост. №102) можно вместо правки каждого PDF выложить альтернативную доступную версию документа — для архива без исходников это обычно дешевле.
В любом случае потребуется пересборка PDF, для формального соотвествия будет достаточно извлечь первый заголовок и краткое содержание документа(для большинства документов). Остальной контент можно оставить в виде графики.
Нужен будет какой то классификатор шаблона(письмо, договор, акт), а далее обработчик согласно шаблона вытягивает нужные поля через распознавание и лепит из них что-то похожее на документ соответствующий ГОСТу.