НАЧАЛО >> Электронная библиотека >> Руководство администратора модуля FT >> Транскрибация аудио и видео📄 Скачать в DOCX
Модуль FT поддерживает преобразование речи из аудио- и видеодокументов в текст. Отдельный модуль Transcribation для этого сценария больше не используется: выбор сервиса, параметры локального распознавания и настройки Yandex Speech API находятся в настройках модуля FT.
Транскрибация выполняется как фоновая задача через модуль Queue. Результат используется для полнотекстового поиска по медиаматериалам и для отображения субтитров или интерактивного распознанного текста в медиаплеере.
В настройках FT откройте блок Преобразование голоса в текст (транскрибация) и задайте параметр Сервис транскрибации:
whisper-cli.Для локального распознавания выберите:
Автоопределение (CUDA/CPU), Только CPU (fallback), Nvidia CUDA 11 или Nvidia CUDA 12.Tiny, Small, Base, Medium или Large v3.При автоопределении система проверяет доступность nvidia-smi и выбирает CUDA 12, CUDA 11 или CPU. Если выбранный CUDA-бинарник отсутствует в поставке, используется CPU-исполняемый файл.
Файл выбранной модели должен находиться в каталоге modules/FT/bin/data/whisper/. Если модель не найдена, задача транскрибации не ставится в очередь и пользователь получает сообщение об отсутствующем файле модели.
Перед запуском Whisper система подготавливает файл forTranscribation.wav: приводит аудио к моно, 16 кГц и применяет фильтры FFmpeg. Whisper формирует JSON, SRT и VTT; эти файлы сохраняются рядом с документом как SID-файлы с суффиксами .whisper.json, .whisper.srt и .whisper.vtt.
Для распознавания через Яндекс заполните параметры:
Если обязательные параметры бакета или сервисного ключа не заполнены, действие транскрибации вернет ошибку и задача Queue не будет создана.
В карточке документа FT для аудио- и видеоресурсов доступна кнопка Запустить транскрибацию аудио/видео файла. Она запускает действие FT/Transcribe, которое проверяет тип документа, наличие входного файла и выбранный сервис.
Для видео и аудио подготовка медиаданных выполняется через FFmpeg. Действия ExecFFMPEGV, ExecFFMPEGA, PrepareViewerVideoDash и PrepareViewerVideoHls поддерживают параметр actionAfter: после завершения конвертации можно автоматически поставить в очередь следующее действие, например транскрибацию.
После успешного локального распознавания Whisper текст сохраняется в FT/idx.txt, а затем в очередь ставится FT/UpdateIrbisFTIndex. Это делает распознанную речь доступной для полнотекстового поиска.
Медиаплееры ShowFTVideo и ShowFTVideoVanila автоматически подключают найденные файлы .whisper.vtt или .whisper.srt как субтитры. Если доступен JSON-результат Whisper или результат Yandex Speech API, под плеером отображается распознанный текст; клик по фрагменту текста перематывает воспроизведение к соответствующему времени.