哈萨克斯坦人工智能和数字发展部第一副部长罗斯季斯拉夫·孔亚什金解释了国家数字服务如何支持哈萨克语,并谈到了用于训练人工智能的高质量哈萨克语数据短缺的问题……据网站infohub.kz报道。

在政府简报会上,记者询问孔亚什金,eGov系统用哪种语言“思考”。副部长回答说,eGov门户网站支持三种语言,包括eGov GPT在内的人工智能模型也能理解并用哈萨克语、俄语和英语“思考”。

一名记者指出,用于训练人工智能学习哈萨克语的高质量数据集不足。据他介绍,最大的开放数据集由纳扎尔巴耶夫大学创建,约有1200至1300小时的录音,基于议会演讲,但未考虑地区发音差异。

孔亚什金表示,哈萨克斯坦已启动开发自己的语言模型KAZ-LLM和ALEM-LLM,以使其考虑国家特色和历史遗产。在模型训练和开发过程中,尽可能使用了教育、文化和档案材料中的哈萨克语数据。

孔亚什金称,理想情况下,模型应从互联网获取数据,但目前网上的英语内容远多于哈萨克语。他强调,该部希望增加网络上的哈萨克语内容量,这将有助于更好地训练语言模型。目前,开发者主要依赖档案材料、教科书和文化内容。在这项工作中,该部得到了纳扎尔巴耶夫大学和ISSAI研究中心的支持。孔亚什金补充说,该部也欢迎其他组织参与收集和准备哈萨克语数据。