Зачем извлекать все ссылки из PDF?
PDF часто скрывает десятки внешних указателей: ссылки, источники, страницы отслеживания или кнопки действий. Возможность извлечь ссылки из PDF за один проход избавляет вас от просмотра каждой страницы вручную и даёт мгновенный обзор всего, на что указывает файл. Это основа полноценного аудита: вы с первого взгляда видите, куда отчёт на самом деле отправляет своих читателей.
Сбор ссылок PDF также полезен для создания переиспользуемого списка ссылок, для проверки, что ни один URL не ведёт на нежелательный домен, или для подготовки миграции контента на другую платформу. Аккуратное извлечение каждого адреса вместе со страницей, на которой он расположен, превращает статичный файл в пригодные для использования данные для ваших проверок или архивов.
Что обнаруживается и конфиденциальность
Инструмент находит кликабельные аннотации-ссылки, содержащие URL: каждая гиперссылка перечисляется с адресом, на который она ведёт, и номером страницы, где она появляется, и всё это экспортируется в виде простого текстового списка, удобного для просмотра или копирования. Честно об ограничении: адрес, просто набранный текстом в теле документа без прикреплённой кликабельной ссылки, не включается, потому что это не аннотация-ссылка.
Чтобы пойти дальше, metadata раскрывает невидимую информацию файла, extract-attachments восстанавливает встроенные вложения, а extract-pages выделяет интересующие вас страницы. В pdfOutils конфиденциальность на первом месте: регистрация не требуется, а ваши файлы удаляются автоматически после обработки, никогда не хранятся и не используются повторно.