Центр «Бэлиг» продолжает пополнение аудио-корпуса на бурятском языке

Центр «Бэлиг» продолжает пополнение аудио-корпуса на бурятском языке

В Республиканском центре «Бэлиг» провели семинар-инструктаж для новой команды дикторов в рамках пополнения бурятского аудио дата-сета. Целью этого мероприятия стала подготовка участников -волонтеров к качественной записи аудиоматериалов для масштабного пополнения национального аудио-корпуса.

Специалист Отдела разработки УМК и цифровизации обучения бурятскому языку центра «Бэлиг» Вячеслав Котенев в кратчайшие сроки разработал отдельный сайт, позволяющий автоматизировать процесс сбора аудио. Затем на него загрузили ранее отредактированные тексты на бурятском языке.

Сейчас в базе порядка 30 тысяч фраз, озвучивание которых начали языковые активисты. Среди них — кандидаты наук, известные журналисты, преподаватели высшей школы, учителя бурятского языка и литературы, а также те, кто переживает за будущее родного языка.

В связи с тем, что компания «Яндекс» просит во второй итерации использовать новые голоса, команда по сбору аудио — новая. Однако, нужно отметить, что члены этой команды являются профессионалами в сфере бурятского языка и литературы.

В ходе мероприятия специалисты Центра ознакомили новую команду с техническими требованиями к звукозаписи, обсудили некоторые вопросы произношения фраз.

— Мы создаём современный аудио-корпус, который научит искусственный интеллект понимать бурятскую речь в реальной жизни. Чтобы наши будущие сервисы работали безупречно, нам нужны записи, сделанные в естественных условиях. От разнообразия голосов зависит то, насколько точно системы смогут понимать нашу речь. Ваша главная задача — записать фразы так, как вы бы говорили их в обычной жизни, — подчеркнул в своём выступлении начальник Отдела разработки УМК и цифровизации обучения бурятскому языку центра «Бэлиг» Саян Забанов.

В завершение семинара участникам были выданы индивидуальные логины и пароли для входа на сайт. Отметим, что автоматизация процесса позволяет ежедневно отмечать прогресс каждого диктора.

Записанные командой материалы станут неотъемлемой частью бурятского аудио-корпуса. Эта база данных является фундаментальным ресурсом для разработчиков систем синтеза речи, сервисов автоматического распознавания бурятского языка и широкого спектра цифровых продуктов на его основе. Пополнение корпуса напрямую способствует технологическому развитию языка и сделает цифровые сервисы более доступными для носителей бурятского языка.

Напомним, что в конце минувшего месяца нашим учреждением в компанию «Яндекс» был передан массив аудио дата-сета объемом более 40 часов, что стало первым этапом создания качественного ресурса для систем автоматического распознавания речи.

Опубликовал(а)ГБУ РЦ Бэлиг
ГБУ РЦ «Бэлиг»
Издательство
У вас есть вопрос?
Связаться