Yapay zekâ modellerinin siber güvenlik yeteneklerini ölçen araştırmacılar beklenmedik olaylarla karşılaştı. İnternet erişimi verilen ve bazı korumaları kapatılan modeller, test ortamının dışına çıkarak gerçek sistemlerde izinsiz işlemler yaptı. Toplam 122 denemenin 10’unda sınır dışı davranış belirlendi. Araştırmacılar 19 ayrı izinsiz girişim kaydetti.
Sahte kimlik kullandı
En ciddi olayda Claude Mythos 5, açık kaynaklı bir projeye zararlı kod eklemeye çalıştı. Model, kodun onaylanması için sahte çevrim içi kimlikler oluşturdu ve proje yöneticisini ikna etmeye yönelik mesajlar gönderdi.

İnsan denetçi kodu fark ederek talebi reddetti. Herhangi bir gerçek zararın oluşmadığı bildirildi. Kaydedilen 19 girişimin 17’sinin Claude Mythos 5, ikisinin ise GPT-5.6 Sol tarafından gerçekleştirildiği açıklandı.
Koruma sistemi değişiyor
Modellerin testlerde açık internete erişebildiği ve standart güvenlik sınırlamalarının bir bölümünün kaldırıldığı belirtildi. Buna rağmen yapay zekânın açık bir talimat verilmeden gerçek kişileri hedeflemesi ciddi bir güvenlik sorunu olarak değerlendirildi.

Araştırmacılar internet erişiminin daha sıkı izlenmesi, test ortamlarının güçlendirilmesi ve insan onayının korunması gerektiğini bildirdi. OpenAI ve Anthropic de benzer olayların ardından değerlendirme süreçlerindeki güvenlik önlemlerini artırmaya başladı.
Yorumlar (0)