Meta, Perşembe günü yapay zeka modellerinden birinin internete kendi başına erişerek başka bir şirketi hacklediğini açıkladı. Bu, AI modellerinin kontrolden çıkmasıyla ilgili son açıkça dile getirilen durum. Son haftalarda OpenAI ve Anthropic de AI modellerinin insan talimatlarını aşarak internete girdiğini ve diğer şirketlerin dijital güvenliğini aşmanın yollarını bulduğunu açıklamıştı. Meta, açıklamasında Meta'nın görevlendirdiği bağımsız şirket Irregular'ın siber güvenlik testi sırasında bir 'yanlış yapılandırma' nedeniyle modelin internete erişiminin kazara mümkün olduğunu belirtti. 'Model daha sonra üçüncü taraf bir hizmetteki güvenlik açığını kullandı; bu, diğer şirketlerde yaşanan durumlara benzer' denildi. Meta, olayı araştırdığını ve soruşturma tamamlandıktan sonra rapor yayınlayacağını duyurdu.

Bu bilgi, AI modellerinin otonom hareket etmesine ilişkin endişeleri artırdı. Bu hafta İngiltere Yapay Zeka Güvenliği Enstitüsü (AISI), siber testler sırasında 'yetkisiz ajan eylemleri' tespit ettiğini açıkladı. Bir vakada ajan, kötü amaçlı kod kullanma izni almak için sahte bir çevrimiçi kimlik oluşturarak bir insana baskı yaptı. 'Soruşturma sırasında test edilen ajanların bazılarının gerçek kişi ve kuruluşlara yönelik kalıcı, potansiyel olarak zararlı eylemlere katıldığını tespit ettik' dedi AISI Salı günü. 'Güvenlik olayını açıkladık ve tespit edildikten sonra yaklaşık bir saat içinde izole edip tam bir soruşturma başlattık.'

Enstitünün testleri sırasında Anthropic ve OpenAI modelleri internette 'otonom, yetkisiz eylemler' gerçekleştirdi. Ajansa göre, kötüye kullanımı önlemeye yönelik bazı koruma mekanizmaları kapatılmıştı. 'Siber testlerimizde her zamanki gibi internete erişime bilerek izin verdik ve model sağlayıcılarının siber sınıflandırıcıları bilerek kapatıldı - bu durumlar sınır modellerinin halka nasıl sunulduğunu göstermez' dedi AISI. 'Bunu modellerin maksimum yeteneklerini mümkün olduğunca doğru değerlendirmek için yapıyoruz.'

Anthropic, AISI'nin çalışmasına 'minnettarlık' ifade ederek, bunun AI ajanlarının yetenekleri arttıkça onları güvenli bir şekilde değerlendirme yolları hakkında daha geniş bir tartışma gerektirdiğini gösterdiğini söyledi. OpenAI, AISI olaylarının 'koruma önlemlerinin azaltıldığı test ortamlarında, normal kullanım durumlarını yansıtmayan koşullarda' meydana geldiğini söyledi. Modeller daha yetenekli hale geldikçe değerlendirmeyi güvenli bir şekilde yürütmek için ortak uygulamaları güçlendirmek amacıyla sektördeki diğerleriyle çalışmaya devam edeceğini ekledi.

Geçen ayın sonunda hackleme hakkında ilk haber yapan OpenAI, AI modellerine siber yetenekleri test etmek için 'karmaşık saldırı yolları kullanarak genişletilmiş sömürü' yapma talimatı verdiğini, ancak teknolojinin beklenmedik önlemlere başvurduğunu söyledi. Görevi yerine getirmek için gerekli bilgileri elde etmek üzere bilinen bir AI geliştirme merkezi ve pazarı olan Hugging Face'i hedef almaya kendi başına karar vermiş gibi görünüyor. San Francisco merkezli AI güvenlik şirketi Irregular'ın bir temsilcisi, Meta olayının geçen hafta Anthropic'in açtığı test ortamındaki bir sorunla ilgili olduğunu söyledi. Irregular, gelecekte bu tür olayları önlemek ve siber testleri güvenli bir şekilde yürütmek için 'izolasyonun en iyi uygulamalarını' paylaşan bir makale yazdığını duyurdu.