НАЧАЛО >> Электронная библиотека >> Руководство пользователя >> Процессы обработки документов📄 Скачать в DOCX
После загрузки документа (создания объекта полного текста) система запускает каскад асинхронных фоновых задач через системную очередь (Queue). Полный цикл обработки включает следующие этапы:
Процесс стартует с задачи IndexDocument. На этом этапе система:
AppendFTUrlToBookRecord, которая автоматически добавляет или обновляет прямую ссылку на полный текст (создает подполе 951^I) в связанной библиографической записи ИРБИС.Система выполняет глубокий анализ заголовка файла (Magic Bytes) и автоматически назначает тип логического вьювера (Paged, Image, Audio, Video, Binary), игнорируя возможно неверное расширение файла. Затем инициируется процесс подготовки документа к просмотру.
На этом этапе происходит основная техническая подготовка ресурса для его быстрой отрисовки в браузере пользователя:
ExecFFMPEG.Конвертация офисных форматов осуществляется либо через установленный на сервере Microsoft Office (использование COM-объектов), либо через универсальный конвертер Pandoc. Администратор может задать предпочтительный метод конвертации в настройках модуля.
|
Примечание: При использовании конвертера Pandoc в случае сбоя система может отображать технические сообщения, например: «Исполняемый файл pandoc не найден в системе» или «Ошибка конвертации файла». В таких случаях необходимо обратиться к администратору системы для проверки конфигурации сервера. |
Если загруженный PDF-документ не содержит текстового слоя (представляет собой набор сканированных изображений), система автоматически запускает процесс оптического распознавания (задача OCRTesseract).
idx.txt и папка coord). Они используются для полнотекстового поиска и подсветки слов во вьювере.Завершающий этап работы с текстом. После того как текст извлечен (напрямую из PDF или с помощью OCR) и сохранен в файл idx.txt, система передает его на сервер ИРБИС 64. В библиографической записи обновляется служебное поле 1289. Это интегрирует полный текст в основную базу данных, позволяя читателям находить документ через стандартную поисковую строку электронного каталога.
Для аудио- и видеоматериалов система использует серверную утилиту FFMPEG (задачи ExecFFMPEGV и ExecFFMPEGA) для подготовки файлов к воспроизведению в веб-интерфейсе. Этот процесс, как правило, запускается автоматически после загрузки медиафайла и может включать в себя:
GenerateDashManifest, которая формирует манифест для плеера, позволяя ему автоматически подбирать наилучшее качество потока в зависимости от скорости интернет-соединения пользователя (технология DASH/HLS).forTranscribation.wav для локального Whisper или forTranscribation.ogg для Yandex Speech API; запуск выполняется через действие FT/Transcribe.