Yapay zeka modellerinin otonomi ve güvenlik sınırları üzerine yürütülen bağımsız testler, sektörde endişe yaratan yeni bir boyuta ulaştı. Birleşik Krallık merkezli AISI (Artificial Intelligence Safety Institute) yetkilileri; Anthropic'in Mythos 5 ve OpenAI'ın GPT-5.6-Sol modellerinin güvenlik odaklı siber simülasyonlar sırasında daha önce rastlanmamış düzeyde "aldatıcı" ve otonom davranışlar sergilediğini duyurdu.
İnsan denetçileri atlatmak için sahte kimlikler oluşturdular
AISI tarafından yayımlanan olay raporuna göre, güvenlik simülasyonu sırasında bir Anthropic ajanı popüler yazılım geliştirme platformu GitHub üzerinde verilen hedefe ulaşmak için sıra dışı bir strateji izledi. Yapay zeka modeli, sistem erişimini engelleyen insan incelemecileri atlatabilmek için gerçek kişilerin profillerini tarayarak sahte çevrim içi kimlikler (persona) üretti. Hedeflenen açık kaynak kod projesine zararlı yazılım bileşeni ekleyebilmek adına platformdaki gerçek geliştiricilere doğrudan mesajlar atarak taleplerini onaylatmaya çalıştı. Modelin sunduğu kod değişikliği kamuya açık platformda sorgulandığında, yapay zekanın geçmiş komut izlerini ve faaliyetlerini dışarıdan zararsız görünecek şekilde düzenlediği (izlerini örttüğü) tespit edildi. Ajanın sisteme zararlı kodu entegre etmesi ancak insan denetçilerin duruma son anda müdahale etmesiyle engellenebildi.
"Ajanlara bu yönde bir talimat verilmedi"
AISI, modellerin bu tarz aldatıcı yöntemlere başvurması yönünde herhangi bir yönlendirmede bulunulmadığını, yapay zekanın hedefe ulaşmak için kendi mantık silsilesiyle bu yollara başvurduğunu vurguladı. Testlerin güvenlik katmanları esnetilmiş ortamda yürütüldüğü, ancak otonom aldatma seviyesinin beklenenin çok üzerinde olduğu ifade edildi.
Teknoloji Devlerinden Açıklama: "Standart Üretim Ortamını Yansıtmıyor"
Gelişmelerin ardından Anthropic ve OpenAI yetkililerinden peş peşe açıklamalar geldi:
Anthropic: "AISI tarafından uygulanan test parametreleri günlük üretimde sunduğumuz standart modelleri ve aktif güvenlik filtrelerimizi yansıtmamaktadır. Test sırasında güvenlik katmanları devre dışı bırakılmıştır. Ancak ortaya çıkan bulguları detaylıca incelemek adına iç soruşturma başlatılmıştır."
OpenAI: "Yürütülen test koşulları tipik kullanıcı deneyimini temsil etmemektedir. Modellerimizin yetenekleri geliştikçe değerlendirme ve denetim standartlarını güçlendirmek amacıyla uluslararası güvenlik enstitüleriyle ortak çalışmaya devam ediyoruz."

