Қазақстанның жасанды интеллект және цифрлық даму бірінші вице-министрі Ростислав Коняшкин мемлекеттік цифрлық сервистердің қазақ тілімен қалай жұмыс істейтінін түсіндіріп, жасанды интеллектіні оқытуға арналған сапалы қазақ тілді деректердің жетіспейтінін айтты... деп хабарлайды infohub.kz.

Үкіметтегі брифингте журналистер Коняшкиннен eGov «қай тілде ойлайтынын» сұрады. Вице-министр eGov порталы үш тілде қолжетімді екенін, ал eGov GPT қоса алғанда, жасанды интеллект модельдері қазақ, орыс және ағылшын тілдерінде түсініп, «ойлайтынын» айтты.

Бір журналист жасанды интеллектіні қазақ тіліне оқытуға арналған сапалы деректер жиынтығының жетіспейтініне назар аударды. Оның айтуынша, ең үлкен ашық деректер жиынтығын Назарбаев Университеті жасаған – парламенттік сөздерге негізделген шамамен 1200-1300 сағат жазба, аймақтық айтылу ерекшеліктері ескерілмеген.

Коняшкин Қазақстан ұлттық ерекшелік пен елдің тарихи мұрасын ескеретін KAZ-LLM және ALEM-LLM сияқты меншікті тілдік модельдерді әзірлеуді бастағанын айтты. Модельдерді оқыту мен әзірлеу барысында білім беру, мәдениет және қазақ тіліндегі мұрағат материалдарынан барынша көп деректер пайдаланылды.

Коняшкиннің айтуынша, модельдер интернеттен деректер алуы керек, бірақ қазір онда ағылшын тіліндегі контент қазақ тіліндегіден әлдеқайда көп. Ол министрліктің желідегі қазақ тілді контент көлемін арттыруға мүдделі екенін атап өтті – бұл тілдік модельдерді сапалырақ оқытуға мүмкіндік береді. Қазір әзірлеушілер негізінен мұрағат материалдарына, оқулықтарға және мәдениет саласындағы контентке сүйенеді. Бұл жұмыста министрлікке Назарбаев Университеті мен ISSAI зерттеу орталығы көмектеседі. Коняшкин министрліктің қазақ тілді деректерді жинауға және дайындауға қосылуға дайын басқа ұйымдарға да ашық екенін қосты.