Voyant Tools: как сравнить частые слова в интервью и проверить смысл результата
Работа с корпусом расшифровок в Voyant Tools: отдельные документы, стоп-слова, абсолютные и относительные частоты, проверка контекста и границы выводов.
Определите, какие тексты сравниваются
Voyant Tools помогает исследовать текстовый корпус: находить частые слова, смотреть их распределение и читать употребления рядом с другими словами. Для интервью полезна конкретная задача: определить, в каких разговорах встречается выбранное слово и что оно означает в каждом случае. Красивое облако слов само по себе на этот вопрос не отвечает.
Начните с проверенной расшифровки аудио. Для каждого интервью сохраните исходный текст и отдельную копию для анализа. В копии проверьте ключевые слова по записи: ошибка распознавания «срок» как «строк» меняет частотную таблицу, хотя для читателя разница может казаться небольшой.
Задайте единицу документа до загрузки. Например, I01.txt — одно интервью, I02.txt — второе. Если объединить все разговоры в один файл, сравнение документов перестанет показывать различия между интервью. Если разделить одну беседу по участникам, документом станет текст участника, а не разговор целиком. Обе схемы допустимы, но отвечают на разные вопросы.
Решите, включать ли речь интервьюера. Для исследования языка вопросов она нужна; для предварительного обзора ответов может потребоваться отдельный корпус реплик участников. Используйте проверенные обозначения говорящих. Не удаляйте вопросы только из части интервью: получится несопоставимая смесь правил.
Подготовьте файлы и откройте корпус
Для небольшого набора удобно использовать TXT в UTF-8. Оставьте понятные идентификаторы файлов и одинаковые правила очистки: включены ли служебные заголовки, подписи участников, таймкоды, ремарки и вопросы. Запишите эти правила до получения первых красивых результатов, чтобы затем не подгонять обработку под ожидаемый вывод.
На стартовом экране Voyant Tools можно вставить текст или загрузить файлы через Upload. Вставка общего текста создаёт один документ; несколько самостоятельных файлов сохраняют возможность работать с набором источников. Официальная инструкция также описывает загрузку ZIP для нескольких документов. После открытия проверьте список и читаемость кириллицы.
Сверьте несколько мест с рабочими файлами: начало, длинную реплику и конец. Если в документ попали названия страниц, повторяющиеся колонтитулы или большие блоки служебного текста, сначала исправьте корпус. Иначе частотность отражает оформление файла наряду с содержанием разговора.
Для размещённой в интернете версии не используйте закрытые интервью без допустимого основания их передачи. Для конфиденциальной работы официальная документация описывает локальный VoyantServer. Выбор размещения и допустимых данных сделайте заранее; ссылка на открытый корпус не должна становиться способом случайно поделиться материалами интервью.
Проверьте стоп-слова и масштаб частот
В Corpus Terms отображаются слова корпуса; в Document Terms можно исследовать их частоты по документам. Если нужная панель не видна, используйте меню выбора инструмента в заголовке панели. Найдите выбранное слово через поле запроса, а не делайте вывод только по первым строкам списка.
Откройте настройки инструмента и проверьте стоп-слова. Voyant поддерживает готовые и пользовательские списки, включая автоматический выбор языка. Режим None позволяет посмотреть результат без исключений. Не считайте автоматический выбор проверенным только потому, что интерфейс открылся: сравните несколько ожидаемых служебных слов и зафиксируйте применённый список.
Не исключайте отрицания механически. Если из чтения пропадает «не», употребления «помогает» и «не помогает» начинают выглядеть одинаково. Стоп-слова влияют на результаты поддерживающих их инструментов, а не отменяют необходимость читать исходную реплику. Дополнительные исключения должны соответствовать исследовательскому вопросу.
Абсолютная частота отвечает, сколько употреблений найдено в заданном наборе. Относительная помогает сравнивать тексты разной длины. В Corpus Terms показатель Relative рассчитывается на миллион слов: число употреблений делится на общее число слов корпуса и умножается на миллион. Для сравнения интервью обязательно смотрите распределение по документам, а не только общую долю корпуса.
Trends показывает частоты по документам корпуса или по участкам одного документа в зависимости от режима. Проверьте подписи и единицы перед чтением графика. Пик внутри одного объединённого текста не доказывает, что слово часто произносили разные участники. Сохраните режим и состав корпуса рядом с результатом.
Откройте контекст и сформулируйте ограниченный вывод
Перейдите в Contexts и найдите слово. Панель показывает документ, слово и окружающий текст; строку можно раскрыть для большего контекста. Для каждого выбранного употребления прочитайте достаточно текста, чтобы увидеть отрицание, вопрос, цитирование чужой фразы и связь с предыдущим ответом.
Возвращайтесь к полной расшифровке, если короткого окна недостаточно. Если слово относится к неоднозначному месту записи, проверьте аудио по исходному таймкоду. Наличие строки в Contexts подтверждает употребление текстовой формы в подготовленном корпусе, но не подтверждает правильность распознавания или вашу интерпретацию темы.
Разные формы — «срок», «сроки», «сроком» — проверяйте отдельно, если вы не настроили и не проверили способ их объединения. Не называйте число одной формы числом всех обсуждений сроков. Синонимы и разговор без ожидаемого слова тоже могут быть содержательно важными.
Запишите вывод вместе с основанием: «слово найдено в двух документах; проверены такие-то реплики; в одном случае речь о сроке оплаты, в другом — о сроке поставки». Для решений по результатам встреч сохраните проверяемую цитату и источник. Если нужно организовать таблицу реплик перед анализом, используйте нормализацию обозначений в OpenRefine, сохраняя исходные поля.
Учебный пример: одинаковое число слов при разной длине интервью
Числа условные и рассчитаны вручную для пояснения. Это не результаты работы сервиса и не изображение фактической панели Voyant.
| Документ | Слово «срок» | Что можно проверить |
|---|---|---|
| I01 — 2 000 слов | 8 употреблений: 4 000 на миллион | Прочитать все 8 контекстов, определить предмет обсуждения. |
| I02 — 8 000 слов | 8 употреблений: 1 000 на миллион | Абсолютное число такое же, относительная частота ниже. |
| Общий корпус — 10 000 слов | 16 употреблений: 1 600 на миллион | Общая доля не показывает число людей, считающих сроки проблемой. |
В I01 участник мог восемь раз повторить одну проблему; в I02 обсуждать восемь разных сроков без недовольства. Пока контексты не прочитаны, частотность не определяет ни количество проблем, ни их важность.
Карточка проверки частотного наблюдения
Вопрос исследования: Единица документа: интервью / участник / другое Список файлов и версия корпуса: Правила: вопросы, метки, таймкоды, ремарки Проверка распознавания ключевых слов: Инструмент Voyant и режим: Слово или проверяемая форма: Стоп-слова и дополнительные исключения: Абсолютная частота: Объём текста и относительная частота: Документы с употреблениями: Проверенные контексты и источники: Отрицания, вопросы, цитаты: Неоднозначные места для проверки аудио: Вывод, который подтверждают данные: Что по этому подсчёту установить нельзя:
Частые вопросы
Облако слов показывает главные проблемы участников?
Оно показывает частые текстовые формы с учётом настроек. Проблему, её значимость и позицию человека проверяют по содержанию реплик.
Нужно ли объединять интервью в один файл?
Для сравнения отдельных интервью удобнее отдельные документы. Объединение меняет единицу анализа; используйте его только если оно соответствует вашему вопросу.
Восемь употреблений означают восемь участников?
Нет. Один человек может произнести слово несколько раз. Для подсчёта участников нужна связь реплик с проверенными идентификаторами и отдельные правила подсчёта.
Почему слово не попало в частотный список?
Проверьте запрос, словоформу, выбранный корпус и стоп-слова. Отсутствие конкретной формы не доказывает, что тема вообще не обсуждалась.
Можно ли сравнить два интервью только по числу слов?
Учитывайте их длину и одинаковые правила подготовки. Затем прочитайте контексты: нормирование частоты не устраняет различия смысла и условий разговора.