AntConc: как найти употребления слова в расшифровках и проверить контекст
Поиск KWIC в нескольких текстах: подготовка корпуса, настройки запроса, проверка полных реплик и журнал результатов без ошибочных выводов по числу совпадений.
Когда нужен поиск контекстов в нескольких текстах
Допустим, в нескольких интервью встречается слово «срок», и вам нужно понять, о чём каждый раз говорили: о дате ответа, доставки или обучения. Обычный поиск в одном документе помогает найти одну фразу. Когда файлов несколько, полезно собрать употребления в одном рабочем представлении и сохранить связь каждого с источником.
AntConc — программа для корпусного анализа текста. Корпусом здесь называем выбранный набор расшифровок. KWIC показывает найденное слово с левым и правым окружением. Эта инструкция ограничена поиском контекстов: она не превращает совпадения автоматически в темы исследования или оценки людей.
Если нужен справочник определений, прочитайте как составить глоссарий по лекции. Список контекстов может помочь проверить употребления термина, но определение требует отдельной работы. Одинаковое написание не гарантирует одинаковый смысл.
До запуска сформулируйте вопрос: «В каких репликах речь о сроке ответа?» Он задаёт критерий чтения найденных фрагментов. Вопрос «Какие слова встречаются?» слишком широк, если в итоге нужно принять конкретное редакционное решение.
Подготовьте набор файлов и контрольную фразу
Получите текст записи в Транскрибаторе, проверьте важные слова и сохраните рабочие текстовые копии. Используйте понятные имена: interview-01.txt, interview-02.txt. Рядом храните соответствие имени, версии расшифровки и аудиофайла; номер файла не подтверждает личность говорящего.
Для первой пробы возьмите два коротких TXT в UTF-8. Не смешивайте исходную и исправленную версии одного интервью: тогда одна реплика будет посчитана дважды. Включайте в корпус только те материалы, на которые распространяется выбранный вопрос.
Заранее найдите одну известную фразу вручную. Она станет контрольным случаем: после загрузки вы должны увидеть её среди результатов соответствующего запроса. Если проверка не проходит, исправьте набор файлов или настройки прежде, чем делать вывод о том, что тема отсутствует.
Служебные заголовки, вопросы ведущего и повторяемые подписи могут давать совпадения вместе с ответами. Решите, включаете ли их в анализ, и запишите правило. Не удаляйте слова из единственной исходной расшифровки ради удобного числа: создавайте отдельную подготовленную копию.
Выполните первую пробу KWIC
Порядок ниже проверен по официальному руководству AntConc 4.4.1. В другой версии названия элементов могут отличаться. Сам интерфейс программы в этой проверке не запускался: учебные строки далее показывают логику чтения, а не выдают себя за скриншот результата.
- Выберите File → Open File(s) as Quick Corpus и загрузите подготовленные файлы.
- Откройте KWIC, введите запрос, например срок.
- Для первой пробы отключите Regex, выберите поиск Words и оставьте Case выключенным.
- Нажмите Start, прочитайте Total Hits и найденные строки.
- Дважды щёлкните нужную строку, чтобы открыть её контекст в File View.
Words отвечает за целые слова, Case — за учёт регистра. Context Size меняет размер видимого окружения. Проверьте Results Set: случайная выборка не должна подменять чтение всех совпадений, если вам нужен полный список. При больших результатах просмотрите страницы.
Сохраните настройки вместе с запросом. Фраза «найдено три совпадения» без имени корпуса, режима поиска и версии файлов не позволяет повторить проверку. Не меняйте одновременно запрос и набор текстов, если хотите понять причину расхождения.
Учитывайте словоформы и ложные совпадения
В русском тексте «срок», «срока» и «сроки» — разные написания. Для простой воспроизводимой проверки выполните отдельные запросы и запишите, какие формы включили. Не объявляйте отсутствие точного слова отсутствием понятия: участник мог сказать «до пятницы» или «дата ответа».
Начните с узкого запроса и известной фразы. Затем расширяйте список написаний, если это требуется вопросом. Поиск короткого фрагмента «сро» может захватить лишние слова; каждое такое совпадение всё равно требует чтения. Регулярное выражение без проверки не делает набор результатов полным.
При чтении отметьте, кто задавал вопрос, что было до реплики и после неё. «Срок ответа меня устраивает» и «Срок ответа меня не устраивает» имеют почти одинаковое окружение возле слова, но противоположный смысл. Если отрицание осталось за пределами короткой строки, откройте полный фрагмент.
Одно интервью может повторять слово много раз, а другое — выразить ту же мысль один раз. Поэтому счётчик употреблений нельзя выдавать за число участников или распространённость проблемы. Для отдельного вывода нужны определённая единица анализа и проверка содержательных фрагментов.
Сохраните результат с проверяемым основанием
Для каждого полезного совпадения сохраните имя файла, запрос, полную реплику или достаточный фрагмент и место в исходнике. Если точное время неизвестно, отметьте это. AntConc не должен получать выдуманный таймкод только ради заполнения таблицы.
Используйте три состояния: «подходит вопросу», «не подходит», «нужно уточнить». Например, упоминание срока обучения не относится к вопросу о сроке ответа поддержки. Отклонённые строки помогают объяснить, почему количество найденных совпадений больше количества отобранных оснований.
Перед использованием цитаты пройдите проверку расшифровки по записи. Особенно внимательно сверяйте отрицания, имена, числа и границы реплики. Поиск работает с загруженным текстом: ошибка распознавания способна одновременно скрыть нужное слово и создать лишнее совпадение.
В итоговой заметке пишите узко: «В двух выбранных текстах найдены три употребления точной формы; одно относится к другому сроку». Не превращайте такой результат в утверждение о всех пользователях. Сохраните копии корпуса и журнал запроса, чтобы вернуться к основаниям после правки текста.
Три совпадения не означают три одинаковых мнения
Учебный пример: в двух придуманных файлах есть три строки с точным словом «срок». Две относятся к ответу, но оценки противоположны; третья относится к обучению. Эти строки созданы для объяснения чтения контекста и не являются результатом анализа клиентов.
| Источник и учебная строка | Относится к сроку ответа? | Проверка |
|---|---|---|
| 01: «Срок ответа меня устраивает» | Да, положительная оценка | Сохранить целую реплику |
| 01: «Срок ответа меня не устраивает» | Да, отрицательная оценка | Не потерять слово «не» |
| 02: «Срок обучения — две недели» | Нет, другая задача | Оставить как отклонённое совпадение |
По выбранному вопросу остаются два содержательных фрагмента из одного файла. Если в том же наборе есть слово «сроки», отдельный точный запрос «срок» не заменяет его проверку. Число совпадений, отбор по смыслу и число источников фиксируют отдельно.
Журнал запроса и найденных контекстов
Вопрос анализа: Корпус / список файлов / версии: Подготовка текста / исключённые части: Контрольная фраза: AntConc / версия: Запрос / словоформа: Words / Case / Regex: Results Set / размер контекста: Total Hits / страницы просмотрены: Источник / полный фрагмент: Место в тексте / таймкод, если проверен: Подходит вопросу / нет / уточнить: Почему принято или отклонено: Отрицания и числа сверены по аудио: Ограничения итогового вывода:
Частые вопросы
Это автоматическая расшифровка аудио?
В этой инструкции AntConc ищет по подготовленным текстам. Сначала получите и проверьте расшифровку, затем загрузите рабочие копии.
Нулевой результат доказывает отсутствие темы?
Нет. Проверьте файлы, настройки, словоформы и выражения с похожим смыслом. Начните с известной контрольной фразы.
Можно считать Total Hits числом людей?
Нет. Один человек может повторить слово, а один файл может содержать нескольких говорящих. Сначала определите единицу анализа.
Почему надо открывать полный фрагмент?
Короткое окружение может скрыть отрицание, уточнение или смену говорящего. Для содержательного вывода нужны достаточный контекст и проверка источника.
Поиск по слову заменит кодирование интервью?
Он помогает найти кандидатов на чтение. Тематическое кодирование требует отдельных правил и решений по смыслу; совпадение слова само по себе не назначает тему.