НАЧАЛО >> Электронная библиотека >> Руководство администратора модуля FT >> Поиск📄 Скачать в DOCX
В панели администрирования модуля (страница «Управление контентом электронной библиотеки») предусмотрены различные виды поиска для удобного нахождения полнотекстовых документов.
В версии 2026.1 были добавлены новые поисковые режимы для панели администрирования, позволяющие более гибко отбирать документы:
FTTIP=)FTDBNAME=, FTSHIFR=)FTDATE=)FTSOURCE=)Поиск по FTDBNAME= и FTSHIFR= предназначен для отбора записей полного текста, связанных с конкретной записью электронного каталога. При создании записи FT из БО в поле 2 сохраняются реквизиты источника: подполе ^A содержит имя базы данных ЭК, подполе ^B - шифр БО из поля 903. Актуализация базы I128F индексирует эти подполя как отдельные термины FTDBNAME=<имя_базы> и FTSHIFR=<шифр_БО>.
В административном списке документов эти термины доступны как виды поиска БД-источник БО и Шифр БО. Их удобно использовать, когда нужно найти карточки полного текста для определенной базы ЭК, проверить наличие электронного документа по шифру БО или отобрать связанные документы перед обслуживанием записей каталога.
Если нужно искать по паре значений одновременно, используйте обычное поисковое выражение с обоими префиксами, например FTDBNAME=IBIS * FTSHIFR=А123. Значения должны совпадать с тем, что сохранено в поле 2 записи FT; при изменении связи запись нужно сохранить и актуализировать, чтобы словарь поиска получил новые термины.
Помимо поиска записей в панели администратора, модуль реализует глубокий полнотекстовый поиск внутри самих многостраничных документов при их просмотре пользователем (во вьюверах Vanila и др.).
При загрузке многостраничного документа (PDF) система автоматически извлекает текстовый слой и координаты слов с помощью утилит mutool и pdftotext (сохраняя их в папке FT/Paged/txt/ и формируя индекс idx.txt).
Если документ представляет собой сканы без текстового слоя, модуль автоматически ставит задачу в очередь для распознавания движком Tesseract OCR.
При поиске пользователем внутри документа система использует алгоритмы оценки осмысленности и связности текста (coherence score). Это позволяет эффективно отсеивать техническую информацию (УДК, ББК, ISBN, копирайты, тиражи), а также нечитаемый «мусор» после распознавания OCR, выдавая результаты в виде удобной карусели с точной подсветкой найденных фрагментов.
Кроме того, алгоритмы поиска и подсветки «на лету» очищают текст от невидимых типографских символов (BOM, неразрывные пробелы) и автоматически распознают и «склеивают» слова, разорванные переносами на следующую строку, что значительно повышает полноту нахождения терминов.
Помимо текстов самих файлов, модуль формирует дополнительный поисковый индекс (словарь) на стороне базы данных ИРБИС для связи документа с ЭК. При сохранении записи:
K.PHOTONUMBER.G.При создании записи электронной библиотеки из библиографического описания запись FT сохраняет связь с ЭК в поле 2: в подполе ^A хранится имя базы данных ЭК, в подполе ^B - шифр БО из поля 903, в подполе ^C - SID библиографической записи. Эти значения используются для поиска документа по префиксам FTDBNAME= и FTSHIFR=, а также для восстановления связи между карточкой полного текста и записью ЭК.
Формально-логический контроль dbnflc в базе ЭК учитывает эту связь при сохранении библиографической записи. Если для текущего шифра 903 уже есть связанная запись электронной библиотеки в I128F, смена поля 903 блокируется непреодолимой ошибкой ФЛК. Это защищает ссылку FT -> БО от рассинхронизации: полный текст остается привязан к тому библиографическому описанию, для которого он был создан.
Если шифр библиографического описания нужно изменить осознанно, сначала перенесите или удалите связь с записью FT: проверьте поля БД библиографического описания, Шифр библиографического описания, SID библиографического описания и дополнительные Ссылки на БД ЭК в карточке документа на странице ?id=FT/Manage. После синхронизации связи повторите сохранение библиографической записи.