«Бэлиг» приступил ко второй итерации сбора аудио дата-сета

«Бэлиг» приступил ко второй итерации сбора аудио дата-сета

Коллектив Республиканского центра «Бэлиг» приступил ко второй итерации сбора аудио дата-сета на бурятском языке. Напомним, проект реализуется ГБУ РЦ «Бэлиг» при поддержке Дома народов России и ООО «Яндекс». Он входит в число приоритетных направлений по цифровизации бурятского языка на современном этапе.

Отметим, что в конце минувшего месяца центр «Бэлиг» завершил первую итерацию и передал в компанию «Яндекс» массив аудио дата-сета объемом более 40 часов. Это стало первой стадией широкомасштабной инициативы, направленной на создание качественного ресурса для систем автоматического распознавания речи.

  • Сегодня перед нами стоит задача следующего, второго этапа большого цикла работ. Нам необходимо в кратчайшие сроки собрать новый аудио-массив. Для этого сотрудники центра и привлеченные специалисты отредактировали порядка 30 тысяч предложений, большую часть которых составили моно-тексты на бурятском языке, то есть исконно бурятские предложения без заимствований из других языков, — рассказала координатор проекта, заместитель директора ГБУ РЦ «Бэлиг» Оюна Забанова.

Следующими этапами станут разработка приложения для записи голоса, загрузка проверенных текстов в приложение, запуск бота по проверке записанных аудио. Эти направления курирует Отдел разработки УМК и цифровизации обучения бурятскому языку РЦ «Бэлиг».

В дальнейшем такие аудиоданные, представляющие собой запись устной речи на бурятском языке, предназначены для тренировки моделей искусственного интеллекта, используемых в технологиях голосового управления и автоматической транскрипции. Это позволит существенно повысить уровень доступности сервисов и услуг для носителей бурятского языка, включая интеграцию возможностей распознавания речи в мобильные приложения, виртуальные ассистенты и образовательные программы.

Опубликовал(а)ГБУ РЦ Бэлиг
ГБУ РЦ «Бэлиг»
Издательство
У вас есть вопрос?
Связаться