Кыргызско-Турецкий университет «Манас» (КТУМ) принимает международный семинар, посвящённый использованию технологий обработки естественного языка и методов корпусной лингвистики в исследованиях языка и перевода. Семинар организован отделением перевода и переводоведения филологического факультета КТУМ совместно с Саарландским университетом (Германия) и проходит с 21 по 24 сентября 2026 года.
Семинар «Технологии обработки естественного языка и корпусная лингвистика» проводится в рамках межуниверситетского соглашения Erasmus+ KA171. Программа стартовала 21 сентября в зале имени Касыма Тыныстанова филологического факультета. В течение четырёх дней участники проходят теоретическую и практическую подготовку по обработке естественного языка, созданию корпусов и использованию цифровых исследовательских инструментов.
В рамках семинара будут рассмотрены цифровые методы в исследованиях языка
Семинар посвящён современным методам, находящимся на пересечении компьютерных наук, искусственного интеллекта и лингвистики. В рамках программы рассматриваются метаданные и лингвистическая аннотация, синтаксический анализ, Universal Dependencies (UD), поиск по корпусам с использованием регулярных выражений, анализ корпусов с применением искусственного интеллекта, дискурсивный анализ, качественный анализ данных и параллельные корпуса.
В ходе занятий, которые проводят представители Саарландского университета кандидат наук Мари-Паулина Криэльке и кандидат наук Андреа Вурм, участники выполняют практические задания по выбору корпусных инструментов в соответствии с исследовательскими вопросами, созданию запросов, проведению синтаксического анализа и использованию различных цифровых платформ.
Программа также включает изучение переводческих ошибок на основе корпусов переводов студентов, анализ содержательных и грамматических ошибок, а также исследования в области истории перевода и двуязычия. Среди практических направлений — создание параллельных корпусов на основе исторических документов на французском и немецком языках, сканирование документов и преобразование их в текст с помощью искусственного интеллекта, выравнивание текстов и их ручная разметка.
Развиваются цифровые ресурсы кыргызского языка
На открытии семинара заведующая отделением перевода и переводоведения филологического факультета КТУМ профессор,кандидат филологических наук Аида Касиева выступила с презентацией на тему «Корпусная лингвистика кыргызского языка». В презентации основное внимание было уделено развитию электронных корпусов кыргызского языка и использованию языковых данных в научных исследованиях.
В рамках программы участникам представлены методы выбора, создания и использования корпусов в соответствии с собственными исследовательскими вопросами. Также рассматриваются возможности проведения исследований на основе параллельных корпусов по различным языковым парам, включая кыргызско-английскую, кыргызско-турецкую, русско-турецкую и турецко-английскую.
Заместитель декана филологического факультета КТУМ кандидат филологических наук Лейла Бабатюрк, оценивая значение семинара, отметила важность развития качественных и проверенных цифровых ресурсов кыргызского языка. По её словам, первый крупный электронный корпус кыргызского языка с морфологической разметкой начал создаваться в 2019 году на основе литературных текстов. После включения газетных архивов, пословиц и десятитомного собрания сочинений Чингиза Айтматова объём корпуса достиг примерно 4 миллионов слов.
Бабатюрк отметила, что системы искусственного интеллекта обучаются на основе языковых данных, и подчеркнула необходимость надёжных цифровых языковых ресурсов для снижения количества ошибок, которые такие системы допускают при работе с кыргызским языком.
Профессор, кандидат филологических наук Аида Касиева также отметила, что семинар направлен на содействие исследованию, сохранению и развитию кыргызского языка с использованием современных технологий. Обратив внимание на то, что кыргызский язык относится к языкам с ограниченными цифровыми ресурсами, Касиева подчеркнула важность работ, направленных на укрепление его присутствия в цифровой среде.
Практическая программа: от искусственного интеллекта до параллельных корпусов
Во второй день семинара основное внимание уделяется метаданным, лингвистической аннотации, корпусным запросам с использованием регулярных выражений и анализу корпусов с применением искусственного интеллекта.В третий день будут проведены занятия по Universal Dependencies, синтаксическому анализу и дискурсивному анализу с использованием платформы Sketch Engine.В последний день участники рассмотрят качественный анализ данных с использованием MAXQDA и TEI/XML, параллельные корпуса и соответствующие цифровые инструменты.
Обсуждалось развитие кыргызского языка в цифровой среде
Проведение семинара в неделю, на которую приходится 23 сентября — День государственного языка Кыргызской Республики, также привлекает внимание к вопросам сохранения и развития кыргызского языка в цифровой среде.Данное направление семинара соответствует положениям Доктрины «Национальный дух — глобальная вершина», опубликованной Президентом Кыргызской Республики, в части сохранения и развития государственного языка, а также его укрепления с использованием возможностей современной науки и технологий.Напомнив, что 23 сентября 1989 года кыргызскому языку был присвоен статус государственного, Касиева отметила значение Дня государственного языка для сохранения и развития родного языка, а также расширения сферы его использования в различных областях общественной жизни.
Международный семинар, рассчитанный на четыре дня, завершится 24 сентября. По окончании программы участникам будут вручены сертификаты.