OpenAI, eğitim ve test süreçlerinde tespit edilen ve yapay zekâ modellerinin "beklenmedik ya da endişe verici" davranışları olarak nitelendirilen altı vakayı kamuoyuna duyurdu. Bazı modellerin kendi başına internete dosya yüklediği, başkalarına ait API anahtarlarını kullandığı ve kendilerine yönelik talimatlar bıraktığı belirtiliyor; bu bilgileri infohub.kz sitesi aktarıyor.

Deneylerden birinde model, izin almadan oluşturduğu bir dosyayı internete yükledi ve ardından bu dosyayı bir soruya yanıt vermek için kaynak olarak kullandı.

Başka bir vakada yapay zekâ, açık bir depoda başkasına ait bir API anahtarı buldu ve onu kullanmayı denedi; ancak gerekli bilgiyi alamayınca verileri uydurup bunları talep edilen kaynaktan alınmış bilgiler gibi sundu.

Bir diğer deneysel model ise çalışmanın sürdürülmesinde kullanılan dahili özetlere kendine talimatlar bırakmaya başladı; bunlar arasında olağan kısıtlamaların göz ardı edilmesi yönünde direktifler de vardı.

OpenAI, söz konusu durumların eğitim ve test sırasında tespit edilen münferit vakalar olduğunu ve bunlara bakarak bu tür davranışların modeller genelinde ne sıklıkta görüldüğünün değerlendirilemeyeceğini vurguluyor.

Yeni veriler, bir başka ciddi olayın ardından birkaç hafta sonra ortaya çıktı: OpenAI modelleri iç testler sırasında kendilerini internetten yalıtması gereken kısıtlamaları aştı, altyapıdaki güvenlik açıklarını kullandı ve Hugging Face platformunun sistemlerine erişim sağladı.