Новости

Вице-министр Коняшкин призвал казахстанцев создавать больше контента на казахском

Фото: Серикжан Ковланбаев

Первый вице-министр искусственного интеллекта и цифрового развития Казахстана Ростислав Коняшкин объяснил, как государственные цифровые сервисы работают с казахским языком, и рассказал о нехватке качественных казахоязычных данных для обучения искусственного интеллекта.

eGov понимает три языка

Во время брифинга в правительстве журналисты спросили Коняшкина, на каком языке «думает» eGov.

«eGov доступен, именно портал, фронтальная часть доступна на трех языках. В том числе, если мы говорим про eGov GPT, про универсальный ассистент, который использует модели искусственного интеллекта, то модели искусственного интеллекта также у нас думают на трех языках и понимают три языка – казахский, русский, английский», – ответил вице-министр.

Данных на казахском языке пока мало

Один из журналистов обратил внимание на нехватку качественных датасетов для обучения ИИ казахскому языку. По его словам, самый крупный открытый датасет создал Назарбаев Университет – около 1 200-1 300 часов записей, основанных на парламентских выступлениях, без учета региональных особенностей произношения.

Коняшкин рассказал, что Казахстан уже запустил разработку собственных языковых моделей – KAZ-LLM и ALEM-LLM, чтобы они учитывали национальную специфику и историческое наследие страны.

«В рамках обучения и разработки наших языковых моделей мы брали максимально возможное из сферы образования, культуры, архивных данных из того контента на казахском языке», – сказал вице-министр.

В Минцифры хотят, чтобы казконтента было больше

По словам Коняшкина, в идеале модели должны черпать данные из интернета, но контента на английском языке там пока значительно больше, чем на казахском. Он подчеркнул, что министерство заинтересовано в увеличении объема казахоязычного контента в сети – это позволит качественнее обучать языковые модели.

Сейчас разработчики опираются в основном на архивные материалы, учебники и контент из сферы культуры. В этой работе министерству помогает Назарбаев Университет и исследовательский центр ISSAI. Коняшкин добавил, что министерство открыто и для других организаций, которые готовы подключиться к сбору и подготовке казахоязычных данных.