Китайские исследователи представили модель искусственного интеллекта Habibi, способную преобразовывать текст в речь с учетом более 20 региональных вариантов арабского языка.
Разработка с открытым исходным кодом призвана решить одну из сложных задач речевых технологий — воспроизведение многочисленных арабских диалектов в рамках единой системы, сообщает агентство «Синьхуа».
Модель разработана специалистами ряда китайских исследовательских учреждений, включая Шанхайский университет Цзяотун, совместно с видеоплатформой Kuaishou. На арабском языке говорят более 400 млн человек, при этом существует свыше 30 региональных вариантов, заметно различающихся произношением и лексикой. Современный стандартный арабский преимущественно используется в официальной и письменной речи, тогда как в повседневной жизни жители разных стран общаются на местных диалектах.
До появления Habibi открытые системы синтеза речи в основном работали со стандартным арабским или отдельными диалектами. Разработчики новой модели открыли доступ к файлам модели, программному коду для обучения и запуска, а также тестовым данным. Исследование опубликовано на платформе научных препринтов arXiv.
Еще одна возможность Habibi — воспроизведение голоса на основе короткой аудиозаписи без предварительного обучения модели под конкретного человека. Разработчики рассчитывают, что поддержка разговорных диалектов позволит сделать голосовые сервисы и ИИ-помощников более естественными и доступными для арабоязычных пользователей.