Рәсәй халыҡтары телдәре көнө!
Хөрмәтле дуҫтар!
Работа по цифровизации башкирского языка идёт системно и высокими темпами. Недавно мы сообщали о создании межведомственной рабочей группы vk.ru/wall1316249_6987
Наша задача — не просто собирать данные, но и методично решать вопросы авторских прав, чтобы делать качественные массивы данных открытыми для разработчиков. Вслед за успешной публикацией аудиокниг на Hugging Face, организации-участники группы выложили сразу два новых открытых датасета — для текста и для аудио.
Что нового появилось в нашем репозитории bashkorttele:
1. Параллельный корпус разговорников
Ценнейший ресурс для машинного перевода (NMT), многоязычных эмбеддингов и кросс-языковых задач между башкирским, русским и родственными тюркскими языками (а также арабским и китайским).
🔹 Объём: 9 857 фраз, выровненных сразу по трём языкам: башкирский + русский + третий язык (алтайский, арабский, казахский, якутский или китайский).
🔹 Формат: каждая языковая пара выделена в отдельный конфиг и файл для удобства загрузки.
🔗 Ссылка: huggingface.co/datasets/b...
🎙 2. Корпус теле- и радиоречи
К инициативе подключились региональные телерадиокомпании Башкортостана, предоставив архивы своих программ. Для low-resource языков десятки часов чистой естественной речи из эфира — это буквально на вес золота!
🔹 Объём: 53,3 часа живой башкирской речи (293 аудиозаписи).
🔹 Формат: чистый звук без текстовых расшифровок (audio-only).
🔹 Зачем нужно: это идеальный фундамент для предобучения речевых моделей без учителя (self-supervised learning), таких как архитектуры Wav2Vec 2.0, HuBERT или для тонкой настройки (fine-tuning) моделей вроде Whisper.
🔗 Ссылка: huggingface.co/datasets/b...
Меня очень радует такой темп. На практике мы видим, как институты из нашей рабочей группы — университеты, медиахолдинги, архивы — один за другим вносят свой вклад в общую цифровую копилку. Мы методично собираем полноценный стек данных для обучения современных языковых и речевых моделей.
Обращаюсь к IT-сообществу, лингвистам и разработчикам: берите эти данные в работу, тестируйте и обучайте свои модели! Вместе мы делаем башкирский язык конкурентоспособным и востребованным в эпоху искусственного интеллекта.
Артабан тик АЛҒА!
Хөрмәтле дуҫтар!
Работа по цифровизации башкирского языка идёт системно и высокими темпами. Недавно мы сообщали о создании межведомственной рабочей группы vk.ru/wall1316249_6987
Наша задача — не просто собирать данные, но и методично решать вопросы авторских прав, чтобы делать качественные массивы данных открытыми для разработчиков. Вслед за успешной публикацией аудиокниг на Hugging Face, организации-участники группы выложили сразу два новых открытых датасета — для текста и для аудио.
Что нового появилось в нашем репозитории bashkorttele:
1. Параллельный корпус разговорников
Ценнейший ресурс для машинного перевода (NMT), многоязычных эмбеддингов и кросс-языковых задач между башкирским, русским и родственными тюркскими языками (а также арабским и китайским).
🔹 Объём: 9 857 фраз, выровненных сразу по трём языкам: башкирский + русский + третий язык (алтайский, арабский, казахский, якутский или китайский).
🔹 Формат: каждая языковая пара выделена в отдельный конфиг и файл для удобства загрузки.
🔗 Ссылка: huggingface.co/datasets/b...
🎙 2. Корпус теле- и радиоречи
К инициативе подключились региональные телерадиокомпании Башкортостана, предоставив архивы своих программ. Для low-resource языков десятки часов чистой естественной речи из эфира — это буквально на вес золота!
🔹 Объём: 53,3 часа живой башкирской речи (293 аудиозаписи).
🔹 Формат: чистый звук без текстовых расшифровок (audio-only).
🔹 Зачем нужно: это идеальный фундамент для предобучения речевых моделей без учителя (self-supervised learning), таких как архитектуры Wav2Vec 2.0, HuBERT или для тонкой настройки (fine-tuning) моделей вроде Whisper.
🔗 Ссылка: huggingface.co/datasets/b...
Меня очень радует такой темп. На практике мы видим, как институты из нашей рабочей группы — университеты, медиахолдинги, архивы — один за другим вносят свой вклад в общую цифровую копилку. Мы методично собираем полноценный стек данных для обучения современных языковых и речевых моделей.
Обращаюсь к IT-сообществу, лингвистам и разработчикам: берите эти данные в работу, тестируйте и обучайте свои модели! Вместе мы делаем башкирский язык конкурентоспособным и востребованным в эпоху искусственного интеллекта.
Артабан тик АЛҒА!