В Республиканском центре «Бэлиг» провели семинар-инструктаж для новой команды дикторов в рамках пополнения бурятского аудио дата-сета. Целью этого мероприятия стала подготовка участников -волонтеров к качественной записи аудиоматериалов для масштабного пополнения национального аудио-корпуса.
Специалист Отдела разработки УМК и цифровизации обучения бурятскому языку центра «Бэлиг» Вячеслав Котенев в кратчайшие сроки разработал отдельный сайт, позволяющий автоматизировать процесс сбора аудио. Затем на него загрузили ранее отредактированные тексты на бурятском языке.
Сейчас в базе порядка 30 тысяч фраз, озвучивание которых начали языковые активисты. Среди них — кандидаты наук, известные журналисты, преподаватели высшей школы, учителя бурятского языка и литературы, а также те, кто переживает за будущее родного языка.
В связи с тем, что компания «Яндекс» просит во второй итерации использовать новые голоса, команда по сбору аудио — новая. Однако, нужно отметить, что члены этой команды являются профессионалами в сфере бурятского языка и литературы.
В ходе мероприятия специалисты Центра ознакомили новую команду с техническими требованиями к звукозаписи, обсудили некоторые вопросы произношения фраз.
— Мы создаём современный аудио-корпус, который научит искусственный интеллект понимать бурятскую речь в реальной жизни. Чтобы наши будущие сервисы работали безупречно, нам нужны записи, сделанные в естественных условиях. От разнообразия голосов зависит то, насколько точно системы смогут понимать нашу речь. Ваша главная задача — записать фразы так, как вы бы говорили их в обычной жизни, — подчеркнул в своём выступлении начальник Отдела разработки УМК и цифровизации обучения бурятскому языку центра «Бэлиг» Саян Забанов.
В завершение семинара участникам были выданы индивидуальные логины и пароли для входа на сайт. Отметим, что автоматизация процесса позволяет ежедневно отмечать прогресс каждого диктора.
Записанные командой материалы станут неотъемлемой частью бурятского аудио-корпуса. Эта база данных является фундаментальным ресурсом для разработчиков систем синтеза речи, сервисов автоматического распознавания бурятского языка и широкого спектра цифровых продуктов на его основе. Пополнение корпуса напрямую способствует технологическому развитию языка и сделает цифровые сервисы более доступными для носителей бурятского языка.
Напомним, что в конце минувшего месяца нашим учреждением в компанию «Яндекс» был передан массив аудио дата-сета объемом более 40 часов, что стало первым этапом создания качественного ресурса для систем автоматического распознавания речи.







