GPT-Red, yapay zeka sistemlerini yanıltabilecek yöntemleri otomatik olarak araştırıyor. Model özellikle e-posta, internet sitesi veya dosyalara gizlenen komutlarla yapılan istem enjeksiyonu saldırılarına odaklanıyor. Bulunan açıklar, yeni modeller kullanıma sunulmadan önce kapatılıyor. İnsan ekiplerin yürüttüğü güvenlik testleri de devam ediyor.
Saldırarak öğreniyor
GPT-Red, savunma amacıyla kullanılan farklı modellerle karşı karşıya getirilerek eğitildi. Başarılı saldırılar saldırı modelini, engellenen girişimler ise savunma modellerini geliştirdi. OpenAI şirketi bu eğitim sürecinde güvenlik çalışmaları için şimdiye kadarki en yüksek hesaplama kaynaklarından birini kullandığını belirtti.

Model, yapay zekanın çalışma belleğine yanlış bilgi yerleştiren yeni bir yöntem de geliştirdi. Bu saldırıda sistem, daha önce doğruladığını düşündüğü hatalı bir bilgiyi doğru kabul ederek işlem yapabiliyor.
Fiziksel sistemde denendi
GPT-Red, OpenAI ofisindeki yapay zeka destekli bir otomat üzerinde de test edildi. Sistem ürün fiyatlarını değiştirdi, pahalı bir ürünü en düşük fiyat seviyesine indirdi ve bir müşterinin siparişini iptal etti. Tespit edilen açıkların ilgili geliştiriciye bildirildiği belirtildi.

En güçlü saldırıların eski GPT-5 modelinde yüzde 90 üzerinde başarı sağladığı aktarıldı. GPT-5.6 modelinde ise bu oran yüzde 23 seviyesinin altında kaldı. OpenAI, GPT-Red modelinin uzun süren saldırılarda ve görsellere gizlenen komutlarda hâlâ sınırlı olduğunu belirtiyor.
Yorumlar (0)