Kazakistan Yapay Zeka ve Dijital Kalkınma Birinci Bakan Yardımcısı Rostislav Konyaşkin, devlet dijital hizmetlerinin Kazakça ile nasıl çalıştığını açıkladı ve yapay zeka eğitimi için kaliteli Kazakça veri eksikliğinden bahsetti... infohub.kz sitesi bildiriyor.

Hükümetteki brifing sırasında gazeteciler Konyaşkin'e eGov'un hangi dilde "düşündüğünü" sordu. Bakan yardımcısı, eGov portalının üç dilde erişilebilir olduğunu ve eGov GPT dahil yapay zeka modellerinin de Kazakça, Rusça ve İngilizce anladığını ve "düşündüğünü" söyledi.

Gazetecilerden biri, yapay zekayı Kazakça eğitmek için kaliteli veri setlerinin eksikliğine dikkat çekti. Ona göre, en büyük açık veri seti Nazarbayev Üniversitesi tarafından oluşturuldu - parlamentodaki konuşmalara dayanan, bölgesel telaffuz özellikleri dikkate alınmadan yaklaşık 1.200-1.300 saatlik kayıt.

Konyaşkin, Kazakistan'ın ulusal özellikleri ve ülkenin tarihi mirasını dikkate alan kendi dil modelleri KAZ-LLM ve ALEM-LLM'in geliştirilmesini başlattığını anlattı. Modellerin eğitimi ve geliştirilmesi sırasında eğitim, kültür ve Kazakça arşiv materyallerinden mümkün olan en geniş veri kullanıldı.

Konyaşkin'e göre, modeller ideal olarak verileri internetten almalı, ancak internette İngilizce içerik Kazakça'dan çok daha fazla. Bakanlığın internetteki Kazakça içerik hacminin artmasıyla ilgilendiğini vurguladı - bu, dil modellerinin daha kaliteli eğitilmesini sağlayacaktır. Şu anda geliştiriciler ağırlıklı olarak arşiv materyallerine, ders kitaplarına ve kültür alanındaki içeriklere dayanıyor. Bu çalışmada bakanlığa Nazarbayev Üniversitesi ve ISSAI araştırma merkezi yardımcı oluyor. Konyaşkin, bakanlığın Kazakça veri toplama ve hazırlama çalışmalarına katılmaya hazır diğer kuruluşlara da açık olduğunu ekledi.