Транскрибация аудио и видео


НАЧАЛО >> Электронная библиотека >> Руководство администратора модуля FT >> Транскрибация аудио и видео📄 Скачать в DOCX


Модуль FT поддерживает преобразование речи из аудио- и видеодокументов в текст. Отдельный модуль Transcribation для этого сценария больше не используется: выбор сервиса, параметры локального распознавания и настройки Yandex Speech API находятся в настройках модуля FT.

Транскрибация выполняется как фоновая задача через модуль Queue. Результат используется для полнотекстового поиска по медиаматериалам и для отображения субтитров или интерактивного распознанного текста в медиаплеере.

1. Выбор сервиса

В настройках FT откройте блок Преобразование голоса в текст (транскрибация) и задайте параметр Сервис транскрибации:

2. Локальный сервис Whisper

Для локального распознавания выберите:

При автоопределении система проверяет доступность nvidia-smi и выбирает CUDA 12, CUDA 11 или CPU. Если выбранный CUDA-бинарник отсутствует в поставке, используется CPU-исполняемый файл.

Файл выбранной модели должен находиться в каталоге modules/FT/bin/data/whisper/. Если модель не найдена, задача транскрибации не ставится в очередь и пользователь получает сообщение об отсутствующем файле модели.

Перед запуском Whisper система подготавливает файл forTranscribation.wav: приводит аудио к моно, 16 кГц и применяет фильтры FFmpeg. Whisper формирует JSON, SRT и VTT; эти файлы сохраняются рядом с документом как SID-файлы с суффиксами .whisper.json, .whisper.srt и .whisper.vtt.

3. Yandex Speech API

Для распознавания через Яндекс заполните параметры:

Если обязательные параметры бакета или сервисного ключа не заполнены, действие транскрибации вернет ошибку и задача Queue не будет создана.

4. Запуск транскрибации

В карточке документа FT для аудио- и видеоресурсов доступна кнопка Запустить транскрибацию аудио/видео файла. Она запускает действие FT/Transcribe, которое проверяет тип документа, наличие входного файла и выбранный сервис.

Для видео и аудио подготовка медиаданных выполняется через FFmpeg. Действия ExecFFMPEGV, ExecFFMPEGA, PrepareViewerVideoDash и PrepareViewerVideoHls поддерживают параметр actionAfter: после завершения конвертации можно автоматически поставить в очередь следующее действие, например транскрибацию.

5. Результат

После успешного локального распознавания Whisper текст сохраняется в FT/idx.txt, а затем в очередь ставится FT/UpdateIrbisFTIndex. Это делает распознанную речь доступной для полнотекстового поиска.

Медиаплееры ShowFTVideo и ShowFTVideoVanila автоматически подключают найденные файлы .whisper.vtt или .whisper.srt как субтитры. Если доступен JSON-результат Whisper или результат Yandex Speech API, под плеером отображается распознанный текст; клик по фрагменту текста перематывает воспроизведение к соответствующему времени.