В Уфе выложили новые данные для обучения нейросетей башкирскому языку
В открытый доступ выложили новые массивы данных для обучения нейросетей башкирскому языку. Хранилище bashkorttele пополнилось базой почти из 10 тысяч фраз, выровненных по трём языкам: башкирскому, русскому и одному из пяти дополнительных — алтайскому, арабскому, казахскому, якутскому или китайскому. Эту информацию сообщает сайт Башинформ.
Также появился корпус живой башкирской речи — 53,3 часа чистого звука из 293 аудиозаписей радиопрограмм ГТРК «Башкортостан». Эти данные нужны для предобучения моделей распознавания речи.
О работе по цифровизации башкирского языка сообщил первый вице-премьер правительства республики Урал Кильсенбаев. Он отметил, что цель проекта — сделать так, чтобы нейросети понимали башкирскую речь, общались на языке и знали культуру народа.
Кильсенбаев призвал IT-сообщество, лингвистов и разработчиков использовать эти данные для обучения моделей. По его словам, вместе они делают башкирский язык конкурентоспособным в эпоху искусственного интеллекта.



