Цифровая лингвистика: как платформа «ЛингвоДок» помогает изучать языки и диалекты

В Год единства народов России в серии материалов, посвященных цифровизации языков, мы рассказываем, как современные технологии помогают не только сохранять языки страны, но и возрождать утраченные языковые системы. С языковой политикой государства и технологическими процессами цифровизации можно познакомиться в материале «Единство в многообразии: как цифровые технологии помогают народам России оставаться собой». О том, как сохраняют родные языки народов в Республике Бурятии, мы рассказали в статье «Оцифровать и передать».


Новый выпуск посвящен уникальной разработке ученых Института системного программирования имени В. П. Иванникова Российской академии наук (ИСП РАН), Института языкознания РАН и других научных организаций. Лингвистическая платформа «ЛингвоДок» (LingvoDoc) стала цифровым архивом более 2,5 тысячи диалектов и говоров народов России, позволяющим исследовать не только тексты, но и аудиозаписи, а также создавать многослойные словари.

Об открытиях, которые делают ученые благодаря платформе, Наука.РФ рассказала Юлия Норманская, главный редактор «ЛингвоДок», ответственный редактор Уральских словарей платформы, доктор филологических наук, главный научный сотрудник, заведующая Лабораторией «Лингвистические платформы» ИСП РАН, ведущий научный сотрудник отдела «Урало-алтайских языков» ИЯз РАН. А о технологиях и алгоритмах проекта мы узнали у одного из разработчиков платформы Владимира Монахова, младшего научного сотрудника ИСП РАН.


Создание платформы

В 2012 году Юлия Норманская и ее коллеги, работая по грантам Российского гуманитарного научного фонда и Российского фонда фундаментальных исследований, в экспедициях по стране начали собирать цифровой архив уральских и тюркских диалектов языков России. На тот момент они столкнулись с проблемой, что часть диалектов вообще не была зафиксирована в словарях, а некоторые диалекты были отражены в них некорректно. При записи большого количества аудиоматериалов, которые нужно было прослушивать, анализировать и транскрибировать, возникла острая необходимость в платформе для их размещения.

Для этого программист Олег Борисенко начал работу над облачным решением, которое позволило бы лингвистам работать с данными синхронно. Им была разработана архитектура и ядро системы. Инициативу поддержал Арутюн Аветисян, директор ИСП РАН, и коллективу удалось получить гранты на развитие платформы. Академик РАН Владимир Алпатов и член-корреспондент РАН Анна Дыбо также оказали поддержку работе исследователей своими грантами, поэтому изначально проект развивали совместно с ИЯз РАН. Одновременно к работе над платформой подключился отдел программирования ИСП РАН, а к исследованиям со временем присоединились многие ученые и лингвисты. В настоящее время «ЛингвоДок» используют более 500 экспертов из разных регионов страны.

«Главный плюс для исследователя, работающего в поле, — готовая инфраструктура: небольшие аудиофрагменты, нарезанные и загруженные в „ЛингвоДок“, доступны онлайн. Эксперты из России и других стран могут оперативно просмотреть материал, добавить свою транскрипцию или комментарии. Облачные технологии позволяют коллегам, разделенным тысячами километров, работать с одними и теми же данными синхронно и получать обратную связь в удобном формате», — рассказала Юлия Норманская, главный редактор платформы «ЛингвоДок», доктор филологических наук.

На платформе доступны инструменты для фонетического, морфологического и этимологического анализа. Они помогают исследователям выявлять ошибки в транскрипции, проверять корректность работы, устанавливать родственные связи между словами и классифицировать языки и диалекты. «Наша платформа — единственный ресурс, где представлены аудиоматериалы более 2,5 тысячи диалектов и говоров народов России», — отметила эксперт.

По словам Юлии Норманской, специальные программы позволяют минимизировать искажения при сборе материалов. Например, при записи речи нескольких носителей система анализирует физические характеристики звука (форманты) и строит «облака» гласных.

«Программы с помощью математических методов усредняют данные, показывая средний центр гласных во рту и отклонения от него у носителей языка. Это позволяет с математической точностью определять, какие гласные можно объединять, а где отклонения критичны», — добавила ученая.


Архитектура системы позволяет исследователям параллельно работать с материалами платформы, а атомарность операций гарантирует, что каждая из них выполняется полностью, без риска прерывания или искажения другими процессами.

«Система гарантирует независимое отражение изменений, даже если один пользователь добавляет или редактирует „сущность“ (объект), а другой параллельно работает с текстом, звуком или разметкой. Все правки хранятся обособленными записями в базе данных платформы, формируя итоговый словарь или корпус через связи между таблицами», — отметил Владимир Монахов, младший научный сотрудник ИСП РАН, один из разработчиков «ЛингвоДок».

Исследователь пояснил, что автоматизированный инструмент слияния входов отслеживает возможные дублирующиеся лексические единицы, предлагая пользователю варианты для объединения схожих лексем. Данный алгоритм позволяет в итоге упростить структуризацию словаря или корпуса. Еще одно направление развития платформы связано с применением искусственного интеллекта для изучения родственных связей между словами разных языков.

«Для выявления в диалектах этимологических связей „когнат-когнат“ в технологиях платформы используется искусственный интеллект, что помогает определять близость языков и заимствования. Так как зарубежные нейросети закрыты для свободного использования, мы обучали с нуля собственную нейросеть. Дополняли ее эвристиками, то есть алгоритмами для ускорения обучения. Полученные предложения верифицируются экспертами, после чего подтвержденные связи „когнат-когнат“ используют для дообучения нейросети по алгоритмам „с учителем“ и „с подкреплением“, то есть модель учится последовательно принимать решения на основе обратной связи», — прокомментировал Владимир Монахов.


«ЛингвоДок» как лаборатория для открытий

Сегодня лингвистическая платформа — не просто инструмент для рутинной работы ученых, а катализатор для исследований. Но как цифровые технологии и передовые методы анализа открывают новые страницы в изучении языков и диалектов? Оказалось, что ресурс способен помочь даже в решении межреспубликанских споров. Так, исследования северо-западного диалекта башкирского языка долгое время были поводом для разногласий между учеными Башкортостана и Татарстана, претендующими на диалект.

Экспертам во главе с Юлией Норманской удалось найти рукописные книги, созданные около 150 лет назад. С помощью платформы был проведен детальный морфологический анализ, позволивший ученым установить принадлежность диалекта к башкирскому языку. На это указали аффиксы, такие видоизменяемые части слова как суффиксы, окончания, и другие признаки. За эту работу главному редактору «ЛингвоДок» вручили Государственную премию Республики Башкортостан.

Анализ говоров и диалектов страны при помощи технологий платформы «ЛингвоДок» позволил сделать еще одно значимое открытие. Оказалось, что разноместное ударение, когда от его позиции меняется смысл слов, как в русском «мукá/мýка», достаточно широко распространено. В некоторых языках оно сохранилось до сих пор, в других зафиксировано по первым архивным записям, доступным на платформе. Например, в эрзянском, мокшанском, горномарийском, коми-пермяцком, хантыйском и мансийском. Ранее разноместное ударение официально фиксировали только в трех языках, кроме русского, новое исследование расширило их число до 24.

«Благодаря тому, что на платформе представлено более двух тысяч диалектов и говоров, а также несколько сотен дореволюционных книг, мы сделали еще одно открытие, касающееся казахского языка. Ранее считалось, что современный литературный казахский язык был создан казахскими учеными Абаем Кунанбаевым и Ибраем Алтынсариным. Однако мы нашли в европейских архивах Финляндии и других стран книги, изданные еще до революции в селе Александровка Павлодарской области. Эти издания подготовили русские миссионеры, и язык обозначенных книг полностью совпадает с современным казахским языком. Таким образом, мы установили, что современный литературный казахский язык был создан в начале XX века русскими миссионерами, причем на нем вышло немало книг. Это важное открытие указывает на значимую роль России в формировании языков соседних регионов», — разъяснила доктор филологических наук.

Еще один результат работы ученых связан с изучением языков коренных народов Сибири. С помощью математического анализа исследователи сделали открытие, касающиеся классификации языков.

«Мы доказали, что восточно-хантыйский язык Томской области, включающий ваховский и васюганский диалекты, коренным образом отличается от хантыйского языка Ханты-Мансийского автономного округа — Югры. Всегда считалось, что это просто разные диалекты, но эти взаимонепонимаемые языки разделились еще несколько тысяч лет назад», — резюмировала Юлия Норманская.


Что касается ареала восточно-хантыйского языка, то он значительно шире, чем было принято считать, и доходил до Тобольска. Обнаружив первые книги региона, ученые смогли установить, где они составлялись, и где жили их авторы. Поэтому исследователи выдвинули гипотезу, что ханты и манси могли заселять практически всю Сибирь.

Технологии и алгоритмы платформы

На платформе размещены словари всех диалектов и говоров народов России, формировали их как вручную, так и с помощью алгоритмов. Последние основывались на фонетических и семантических регулярных соответствиях. Всего на «ЛингвоДок» представлены более 1,5 миллиона слов с этимологическими связями.

«В списки были преобразованы все возможные сочетания „когнат–когнат“, после чего из полученных пар удалили полные дубликаты. Итоговая коллекция положительных примеров составила около одного миллиона записей, а сбалансированный негативный класс был получен методом случайного „negative sampling“ (англ. — „негативная дискретизация“) с исключением любых сочетаний, совпадающих с позитивными примерами. На первом этапе была реализована сиамская нейронная сеть, учитывающая графическую (орфографическую) информацию из исходных примеров. Оценка качества на валидационной выборке продемонстрировала среднюю точность порядка 78%. На втором этапе архитектура модели была расширена за счет дополнительного пути обработки переводов слов и ряда эвристических приемов: булев признак „exact_match“ (англ. — „точное соответствие“) с фиксированной корректировкой, обучаемые весовые коэффициенты α/β, порог τ=0.9. Это позволило повысить точность классификации до 92%», — уточнил Владимир Монахов.

Для лингвистов из разных научных институтов разработчики проекта создают на базе платформы ее «двойники» более узкой специализации. Например, Владимиру Монахову удалось обеспечить для Калмыцкого государственного университета имени Б. Б. Городовикова доступ только к калмыцким словарям. Однако продолжая исследовать технологии «ЛингвоДок», важно понять, как решается синхронизация аудио, транскрипции и семантической разметки? Пользователь загружает на платформу звуковой файл, например, wav, и файл формата eaf с транскрипцией и семантической разметкой. Последний включает хронологически синхронизированные слои: текст, отдельные слова, их транскрипции и переводы.

«Первая версия синхронизации аудио, транскрипции и семантической разметки строилась на классическом машинном обучении: звукозапись разбивалась на перекрывающиеся части по несколько миллисекунд, вычислялись классические сущности звукораспознавания. После решения задачи вычисления разметки последовательности по полученным сущностям, используя их в качестве тренировочных данных, строили нейросетевую модель.

Для этого использовали открытую библиотеку Kaldi и стандартную нейросетевую библиотеку Google. Мы продолжаем совершенствовать инструменты синхронизации звукоряда и транскрипции текста, при этом качество результатов постоянно растет. В свою очередь удобство работы обеспечивается графическим интерфейсом. Он позволяет контролировать воспроизведение звукового файла, наблюдая осциллограмму (графическое представление звукового сигнала во времени) и движение курсора по транскрипциям и семантическим разметкам, хронологически соответствующим текущему звуковому ряду», — рассказал разработчик платформы.


Востребованность проекта

Платформу «ЛингвоДок» используют носители языка и активисты со всей страны, которые могут загружать свои записи и создавать словари. Например, участники Всероссийской олимпиады школьников в городе Сочи работали в своих проектах с картами и сведениями платформы. Данные «ЛингвоДок» полезны также для студентов и учителей из разных регионов, создающих на их основе обучающие курсы. Один из проектов Башкирии позволил сотням носителей языка загрузить на платформу аудиозаписи сказок, пословиц и рассказов о семье, благодаря чему эксперты зафиксировали специфику говора субъекта РФ. Главный редактор проекта сообщила, что много пользователей регистрируется из Сибири, Якутии и других удаленных регионов:


«Каждый носитель языка может оставить на „ЛингвоДок“ цифровой след, большинство опций платформы абсолютно открыты. У нас предусмотрено несколько уровней доступа и нет каких-либо ограничений. На главной странице можно получить консультацию у виртуального помощника, чтобы понимать, как использовать инструменты платформы. Благодаря „ЛингвоДок“ нам удается восстанавливать и утраченные языковые системы. Если раньше специалисты вручную вносили отдельные слова или страницы текста, то сейчас возможности платформы позволяют выкладывать большие тексты, загружать книги целиком. Эти материалы мы затем глоссируем, то есть пишем краткие пояснения к тексту при помощи специальных программ. За счет таких объемов в сотни тысяч слов мы гораздо быстрее и точнее восстанавливаем морфологию, фонетику и лексику языковых систем. В прошлом лингвисты проводили такую работу в ручном режиме, и это могло занять у специалистов полжизни».

В течение 14 лет алгоритмы платформы разрабатывали не только программисты ИСП РАН, но и ученые из других университетов. Они делились с командой проекта своими программами в открытом коде, что позволяло исследователям оперативно и успешно внедрять их для анализа массивов текста и аудиозаписей. Результатом этого сотрудничества стало более точное описание языков и диалектов.

Перспективы сотрудничества и инновации

Кроме взаимодействия с российскими регионами, руководство платформы называет перспективным налаживание связей с коллегами из Китая. Оказалось, что в КНР помимо китайского языка присутствуют и языки монгольских народов. В России к этой группе относятся бурятский и калмыцкий, а в Китае близкородственными считаются баоаньский, шира-югурский и дунсянский диалекты, о которых в России очень мало данных. Например, по баоаньскому языку у российских лингвистов есть только небольшой словник, включающий несколько сотен слов. Он был составлен около 70-80 лет назад, и, конечно, в него не входят аудиоматериалы, в то время как китайские словари содержат более 14 тысяч слов.

«В 2025 году при содействии наших коллег из Китая состоялась экспедиция российских лингвистов в провинцию Ганьсу, располагающуюся вблизи границы с Монголией. Там наши коллеги под руководством Виктории Кукановой, директора Калмыцкого научного центра РАН, при поддержке китайских ученых записали первые большие аудиословари монгольских языков, использующихся на территории Китая. Эти словари были успешно загружены на „ЛингвоДок“. Наряду с международными проектами для развития платформы важно и технологическое развитие ресурса.

Например, наши специалисты работают над умными колонками, которые носители языков вскоре смогут использовать в повседневной жизни. Второе наше направление — мы продолжим совершенствование и внедрение ИИ-алгоритмов, позволяющих ускорить на платформе поиск родственных слов и заимствований. И еще одно из самых интересных начинаний — проект нашей команды из Якутии, получившей сейчас большой грант. Ученые разработают программное обеспечение, с помощью которого соединят генетические и языковые данные, чтобы отследить миграционные пути народов России на протяжении многих тысячелетий», — поделилась Юлия Норманская.

Коллектив «ЛингвоДок» был дважды отмечен премиями Президента РФ, всероссийскими премиями «Лучший проект», «Ключевое слово» и другими наградами. Платформа стала не просто уникальным цифровым ресурсом для ученых и экспертов, а народным проектом, присоединившись к которому, каждый может внести свой вклад в сохранение языкового многообразия страны.




Светлана Минеева