Многостраничные документы


НАЧАЛО >> Электронная библиотека >> Руководство администратора модуля FT >> Настройка модуля и параметров отображения >> Многостраничные документы📄 Скачать в DOCX


Настройки работы с текстовыми и графическими многостраничными документами (PDF, PPT, DOC, TIFF и др.).

Важное требование к серверу: Для работы автоматической конвертации офисных документов (DOC/DOCX, XLS/XLSX, PPT/PPTX) в формат PDF для последующего просмотра, на сервере (в среде ОС Windows) должен быть установлен пакет Microsoft Office. Также в конфигурации PHP должно быть включено расширение com_dotnet и задан параметр com.allow_dcom = true. Обратите внимание: пользователю, от имени которого работает веб-сервер (например, IIS_IUSRS или IUSR), должны быть выданы права на запуск и активацию DCOM-объектов Microsoft Office через системную утилиту dcomcnfg. В противном случае конвертация офисных файлов будет завершаться "тихой" ошибкой (Access Denied).

Для серверов на базе Linux: Нарезка PDF на страницы и извлечение текстового слоя производятся встроенными утилитами mutool и pdftotext. Убедитесь, что бинарным файлам в директории bin/nix64/mutool/ на сервере выданы права на исполнение (chmod +x), иначе конвертация PDF-документов не будет выполнена.

Оптимизация (DP_Irbis64Direct): Если система ИРБИС 128 работает с использованием нативного провайдера DP_Irbis64Direct (параметр localProvider), модуль использует встроенные функции PHP-расширения (webirbis_pdf_*) для прямого извлечения текста, координат и изображений из PDF. В этом случае внешние утилиты mutool и pdftotext не требуются, а обработка происходит быстрее и стабильнее.

1. Настройки автоматического распознавания документов

Примечание: Если документ (например, отсканированный PDF) не имеет встроенного текстового слоя, а внешняя система распознавания не настроена, модуль автоматически попытается извлечь текст, поставив задачу в очередь для встроенного движка Tesseract OCR. При этом Tesseract не только извлечет текст для полнотекстового поиска, но и сформирует невидимый текстовый слой (координаты HOCR), который будет автоматически вшит обратно в исходный PDF-документ, создавая полноценный Searchable PDF. Важно: Язык распознавания для Tesseract определяется автоматически на основе поля 101 (Язык текста) связанной библиографической записи. Модуль имеет встроенную таблицу соответствия и автоматически конвертирует стандартные библиотечные 3-буквенные коды (например, ger -> deu, fre -> fra, chi -> chi_sim), подбирая нужный языковой пакет Tesseract. Для корректного распознавания текстов на иностранных языках убедитесь, что поле 101 заполнено каталогизатором, а в системной папке bin/data/tessdata на сервере присутствуют соответствующие языковые пакеты (.traineddata). По умолчанию используются русский и английский языки.

2. Настройки просмотра многостраничных документов

2.1. Индивидуальные параметры документа

При редактировании свойств конкретного многостраничного документа вы можете вручную ограничить отображаемый диапазон, задав поля «Первая страница» и «Последняя страница».

Также в блоке технической информации можно переопределить параметр DPI (количество точек на дюйм). Если DPI не задан вручную или равен 72, система автоматически попытается извлечь реальное значение из метаданных (EXIF) исходного изображения, а при их отсутствии будет использовать эталонное значение в 300 DPI. Это позволяет оптимально масштабировать водяные знаки и области подсветки текста.

Важно: Как и в случае с одиночными изображениями, для работы с водяными знаками требуется включенное расширение gd в настройках PHP сервера.

3. Пересоздать все изображения страниц

Эта кнопка предназначена для запуска фоновой задачи, которая принудительно переконвертирует все страницы всех документов в библиотеке.