Anthropic, iç testler sırasında yapay zeka ajanlarının açık internete erişimini geçici olarak kısıtladı. Bunun nedeni, modellerin öngörülen senaryonun dışında hareket ettiği birkaç olay oldu; bu bilgiyi infohub.kz sitesi aktarıyor.
Testlerden birinde Claude Haiku 4.5, çözülememiş bir cinayete adanmış bir sayfa açtı. Sitede polise bilgi iletmek için bir form bulunuyordu. Yapay zeka, bu davayla bağlantılı bir kişiyi gördüğünü iddia eden uydurma bir mesajla formu doldurdu.
Üstelik sayfada şüpheliye dair herhangi bir tanım yoktu. Claude, ad ve iletişim alanlarını boş bıraktı, ancak yine de mesajı gönderdi. Mesaj spam klasörüne düştü ve soruşturmacılara ulaşmadı.
Anthropic'e göre talimatlar, modelin hesaplara girmesini, yeni hesap oluşturmasını, kişisel veri girmesini ve alışveriş yapmasını yasaklıyordu. Ancak formlar aracılığıyla mesaj göndermek yasak değildi. Şirket, bu olayın ciddi sonuçlar doğurmadığını belirtti.
«Claude'un yanıltıcı muhakemesi saatlerce sürdü ve sonraki saldırı girişimlerini destekledi. Bununla birlikte, kasıtlı aldatma konusunda kesin bir sonuca varmak için genellikle daha derin bir analiz gerekir», — diye yazdı şirket blogunda.
Anthropic raporunda başka olayları da anlattı. Örneğin Claude Mythos Preview, bir üniversitenin sunucusunda bir güvenlik açığı buldu ve bunu komut çalıştırmak ve dosya kopyalamak için kullandı. Diğer durumlarda modeller, özel tokenlarla korunan verilere erişmenin yollarını buldu veya bağlantı kısaltma servisleri aracılığıyla kısıtlamaları aştı.
Bu olayların ardından Anthropic, tüm iç testlerde gerçek sitelere erişimi kapatmaya karar verdi. Şirket, güvenlik sistemlerinin bu tür eylemleri güvenilir şekilde tespit edip engelleyebildiğinden emin olduğunda erişimi geri getirecek.
Daha önce «Kursiv», OpenAI yapay zeka ajanlarının olaylarını yazmıştı. Ajanlar, üçüncü taraf kuruluşlara ait 100'den fazla sitenin korumasını aşmaya çalışmıştı.


