Первый вице-министр искусственного интеллекта и цифрового развития Казахстана Ростислав Коняшкин объяснил, как государственные цифровые сервисы работают с казахским языком, и рассказал о нехватке качественных казахоязычных данных для обучения искусственного интеллекта... сообщает сайт infohub.kz.
Во время брифинга в правительстве журналисты спросили Коняшкина, на каком языке «думает» eGov. Вице-министр ответил, что портал eGov доступен на трех языках, и модели искусственного интеллекта, включая eGov GPT, также понимают и «думают» на казахском, русском и английском.
Один из журналистов обратил внимание на нехватку качественных датасетов для обучения ИИ казахскому языку. По его словам, самый крупный открытый датасет создал Назарбаев Университет – около 1 200-1 300 часов записей, основанных на парламентских выступлениях, без учета региональных особенностей произношения.
Коняшкин рассказал, что Казахстан уже запустил разработку собственных языковых моделей – KAZ-LLM и ALEM-LLM, чтобы они учитывали национальную специфику и историческое наследие страны. В рамках обучения и разработки моделей использовались максимально возможные данные из сферы образования, культуры и архивных материалов на казахском языке.
По словам Коняшкина, в идеале модели должны черпать данные из интернета, но контента на английском языке там пока значительно больше, чем на казахском. Он подчеркнул, что министерство заинтересовано в увеличении объема казахоязычного контента в сети – это позволит качественнее обучать языковые модели. Сейчас разработчики опираются в основном на архивные материалы, учебники и контент из сферы культуры. В этой работе министерству помогает Назарбаев Университет и исследовательский центр ISSAI. Коняшкин добавил, что министерство открыто и для других организаций, которые готовы подключиться к сбору и подготовке казахоязычных данных.


