Forced alignment: как привязать готовую расшифровку к времени аудио
Если текст уже вычитан, может оставаться другая задача — найти время каждого слова в записи. Принудительное выравнивание решает именно её, но требует соответствия текста исходному звуку.
Что делает выравнивание
Forced alignment сопоставляет известную транскрипцию со звуком и определяет временные интервалы. Распознавание речи, напротив, получает слова из аудио. Эти задачи могут находиться в одном процессе, но их результаты нельзя смешивать.
В документации Montreal Forced Aligner описано выравнивание орфографического текста с использованием моделей и словаря произношений. Конкретные входные форматы зависят от инструмента. Здесь рассматривается подготовка и проверка материала, а не обещание определённой функции в Транскрибаторе.
Подготовьте текст той же версии записи
Сначала получите расшифровку аудио и исправьте неверные слова по звуку. Проверьте, что текст относится к окончательному монтажу. Вставленное вступление, удалённый абзац или переставленный фрагмент меняют временную структуру.
Учебный пример: редактор убрал из текста объяснение на полминуты, но в аудио оно осталось. Выравнивание следующих слов может стать ненадёжным, потому что инструмент ищет последовательность, не соответствующую записи. Для работы со звуком сохраните полную текстовую версию, а сокращённую статью держите отдельно.
Проверьте сложные границы
После обработки прослушайте начало, конец, переходы после пауз и места с неразборчивой речью. Обратите внимание на имена, сокращения, слова другого языка и наложение голосов. Если инструмент сообщает о неизвестных словах, разберите их по документации, не заменяя произнесённый термин удобным вымыслом.
Для длинной записи заранее сохраните общую временную основу. При обработке частей нужен корректный сдвиг относительно исходника. Используйте правила разбиения с общими таймкодами. Не суммируйте длительности приблизительно, если между частями есть перекрытие.
Подготовьте результат для конкретной задачи
Интервалы слов ещё не являются удобными субтитрами. Их нужно объединить в читаемые реплики, проверить переносы, длительность показа и смену говорящего. Для исследовательской разметки, напротив, может быть важна более подробная сегментация.
При создании субтитров используйте проверку структуры SRT. После любого монтажа снова проверьте синхронизацию. Сохраняйте исходные интервалы и исправленную версию отдельно, чтобы можно было восстановить причины ручных изменений.
Рабочая таблица: учебный пример
Используйте структуру для своих материалов, заменяя пример подтверждёнными данными.
| Элемент | Учебный пример | Что проверить |
|---|---|---|
| Несоответствие | Абзац есть в аудио, но удалён из текста | Вернуть произнесённые слова |
| Граница | Слово после длинной паузы | Прослушать начало интервала |
| Экспорт | Слова объединены в субтитр | Проверить читаемость и время |
Частые вопросы
Можно ли выровнять краткое содержание?
Надёжного соответствия слов не будет, если пересказ отличается от произнесённой речи.
Исправляет ли выравнивание ошибки текста?
Не следует на это рассчитывать. Сначала проверьте слова, затем их временные границы.
Получаются ли сразу готовые субтитры?
Не всегда. Временная разметка и редактура читаемых субтитров — разные этапы.