
Первый вице-министр искусственного интеллекта и цифрового развития Казахстана Ростислав Коняшкин объяснил, как государственные цифровые сервисы работают с казахским языком, и рассказал о нехватке качественных казахоязычных данных для обучения искусственного интеллекта.
eGov понимает три языка
Во время брифинга в правительстве журналисты спросили Коняшкина, на каком языке «думает» eGov.
«eGov доступен, именно портал, фронтальная часть доступна на трех языках. В том числе, если мы говорим про eGov GPT, про универсальный ассистент, который использует модели искусственного интеллекта, то модели искусственного интеллекта также у нас думают на трех языках и понимают три языка – казахский, русский, английский», – ответил вице-министр.
Данных на казахском языке пока мало
Один из журналистов обратил внимание на нехватку качественных датасетов для обучения ИИ казахскому языку. По его словам, самый крупный открытый датасет создал Назарбаев Университет – около 1 200-1 300 часов записей, основанных на парламентских выступлениях, без учета региональных особенностей произношения.
Коняшкин рассказал, что Казахстан уже запустил разработку собственных языковых моделей – KAZ-LLM и ALEM-LLM, чтобы они учитывали национальную специфику и историческое наследие страны.
«В рамках обучения и разработки наших языковых моделей мы брали максимально возможное из сферы образования, культуры, архивных данных из того контента на казахском языке», – сказал вице-министр.
В Минцифры хотят, чтобы казконтента было больше
По словам Коняшкина, в идеале модели должны черпать данные из интернета, но контента на английском языке там пока значительно больше, чем на казахском. Он подчеркнул, что министерство заинтересовано в увеличении объема казахоязычного контента в сети – это позволит качественнее обучать языковые модели.
Сейчас разработчики опираются в основном на архивные материалы, учебники и контент из сферы культуры. В этой работе министерству помогает Назарбаев Университет и исследовательский центр ISSAI. Коняшкин добавил, что министерство открыто и для других организаций, которые готовы подключиться к сбору и подготовке казахоязычных данных.