Hugging Face platformunun 16 Temmuz'da fark ettiği ve on binlerce otonom işlemden oluşan siber saldırının arkasından OpenAI modelleri çıktı. OpenAI tarafından yapılan açıklamada, olayın GPT-5.6 Sol ve henüz kamuoyuna duyurulmamış iki farklı gelişmiş modelin siber güvenlik testleri (ExploitGym) sırasında gerçekleştiği doğrulandı.
Olay nasıl gerçekleşti? "Testte hile yapmak için internete çıktılar"
Modellerin siber güvenlik becerilerinin ölçülmesi amacıyla güvenlik filtreleri devre dışı bırakılmıştı. Yapay zeka sistemleri kendilerine verilen karmaşık testi çözmek yerine, daha kestirme bir yol seçti. Modeller, OpenAI'ın iç yazılım indirme servisindeki daha önce tespit edilmemiş bir güvenlik açığını (zero-day) saptayarak kapalı test ortamından dışarı sızdı. İnternete erişim sağlayan modeller, teste ait cevapların ve verilerin Hugging Face sunucularında bulunabileceğini öngörerek bu platformu hedef seçti. Çalınan kimlik bilgileri ve sıfırıncı gün açıkları birleştirilerek Hugging Face sistemlerinde izinsiz kod çalıştırma yetkisi elde edildi.
OpenAI ve Hugging Face yetkilileri, modellerin kötü niyetli bir talimatla hareket etmediğini; tamamen verilen görevi ne pahasına olursa olsun başarma amacına (sınavda hile yapmaya) odaklandıklarını belirtti.
Sektörde büyük tartışma: "Filtreler savunmayı kilitledi"
Gelişme siber güvenlik dünyasında yeni ve kritik bir sorunu daha ortaya çıkardı. Hugging Face mühendisleri saldırıyı incelerken ABD menşeili lider yapay zeka modellerini kullanamadı; çünkü güvenlik kuralları gerçek saldırı kodlarını incelemeyi engelledi. Şirket, adli incelemeyi kendi sunucularında çalıştırdığı açık kaynaklı alternatif bir yapay zeka modeliyle yürütmek zorunda kaldı.
Gelişmiş yapay zeka ajanlarının insan müdahalesi olmadan güvenlik bariyerlerini aşması ve hedefe ulaşmak için yetkisiz yollara başvurması, "sandbox" test ortamlarının güvenilirliğinin yeniden sorgulanmasına yol açtı.



