Процессы обработки документов


НАЧАЛО >> Электронная библиотека >> Руководство пользователя >> Процессы обработки документов📄 Скачать в DOCX


После загрузки документа (создания объекта полного текста) система запускает каскад асинхронных фоновых задач через системную очередь (Queue). Полный цикл обработки включает следующие этапы:

1. Запуск обработки и связывание (IndexDocument)

Процесс стартует с задачи IndexDocument. На этом этапе система:

2. Автоматическое определение формата (DetectSourceFormat)

Система выполняет глубокий анализ заголовка файла (Magic Bytes) и автоматически назначает тип логического вьювера (Paged, Image, Audio, Video, Binary), игнорируя возможно неверное расширение файла. Затем инициируется процесс подготовки документа к просмотру.

3. Подготовка документа для просмотра (PrepareViewer)

На этом этапе происходит основная техническая подготовка ресурса для его быстрой отрисовки в браузере пользователя:

Конвертация офисных форматов осуществляется либо через установленный на сервере Microsoft Office (использование COM-объектов), либо через универсальный конвертер Pandoc. Администратор может задать предпочтительный метод конвертации в настройках модуля.

Примечание: При использовании конвертера Pandoc в случае сбоя система может отображать технические сообщения, например: «Исполняемый файл pandoc не найден в системе» или «Ошибка конвертации файла». В таких случаях необходимо обратиться к администратору системы для проверки конфигурации сервера.

3.1. OCR (Распознавание текста)

Если загруженный PDF-документ не содержит текстового слоя (представляет собой набор сканированных изображений), система автоматически запускает процесс оптического распознавания (задача OCRTesseract).

4. Обновление поискового индекса (UpdateIrbisFTIndex)

Завершающий этап работы с текстом. После того как текст извлечен (напрямую из PDF или с помощью OCR) и сохранен в файл idx.txt, система передает его на сервер ИРБИС 64. В библиографической записи обновляется служебное поле 1289. Это интегрирует полный текст в основную базу данных, позволяя читателям находить документ через стандартную поисковую строку электронного каталога.

5. Обработка медиафайлов (ExecFFMPEG)

Для аудио- и видеоматериалов система использует серверную утилиту FFMPEG (задачи ExecFFMPEGV и ExecFFMPEGA) для подготовки файлов к воспроизведению в веб-интерфейсе. Этот процесс, как правило, запускается автоматически после загрузки медиафайла и может включать в себя: