Цель исследования заключается в анализе
изменений тематики научных статей в корпусе текстов по
компьютерной и корпусной лингвистике (ТКиКЛ)
с применением современных методов тематического
моделирования. Проведенные эксперименты
основываются на применении комбинированного
нейросетевого алгоритма BERTopic и матричного
алгоритма NMF, расширенного за счет частотного анализа
употребления слов-тематизаторов в текстах корпуса
ТКиКЛ. Значимость работы заключается в формировании
лингвистически обоснованной методологии для
семантического поиска научной информации и
отслеживания тенденций в области компьютерной и
корпусной лингвистики, что может быть использовано для
совершенствования наукометрических инструментов.
Результаты исследования демонстрируют динамику
изменений научных интересов в области компьютерной и
корпусной лингвистики под влиянием цифровизации
общества и технологического прогресса.