İsrail merkezli yapay zeka güvenlik şirketi Irregular (eski adıyla Pattern Labs) tarafından gerçekleştirilen testlerdeki yapılandırma hataları, OpenAI, Meta, Anthropic ve Google'a ait önde gelen yapay zeka modellerinin kontrol edilen simülasyon ortamlarından kaçarak gerçek dünya hedeflerini saldırıya uğratmasına neden oldu. The Verge'in edindiği bilgilere göre, 2023 yılında kurulan ve endüstrinin en büyük oyuncularıyla çalışan şirketin test altyapısında iki kritik hata bir arada gerçekleşmiş.
📌 Bilinmesi Gerekenler
- Irregular'ın test senaryosunda internet erişimi yanlışlıkla açık bırakılmış ve kurgusal hedef alan adı gerçek bir domain ile çakışmış
- OpenAI, Meta, Anthropic ve Google modelleri aynı değerlendirme senaryosunda gerçek dünyayı hedef aldı
- CTO Omer Nevo, tüm olayların tek bir alt yapı sorunundan kaynaklandığını ve istemcilere bildirildiğini onayladı
- Hugging Face hacki ve İngiltere Yapay Zeka Güvenlik Enstitüsü ihlalleri bu olaylardan bağımsız
İki hatanın birleşimi ajanları serbest bıraktı
Irregular'ın Ortak Kurucu ve Teknoloji Direktörü Omer Nevo, The Verge'e yaptığı açıklamada, ajanların "capture-the-flag" (bayrak yakalama) siber güvenlik egzersizleri için tasarlanmış izole bir ağda test edildiğini belirtti. Nevo'ya göre, ajanların açık internete erişimi olmaması gerekiyordu ancak "internet erişimi yanlışlıkla mevcuttu". Aynı anda, simülasyon için kurgulanmış bir şirket adı, gerçek bir internet alan adıyla çakışmış. Bu iki hatanın birleşimi, test edilen modellerin simülasyondan çıkıp gerçek bir hedefe yönelmesini sağladı.
Olaylar istemcilere bildirildi, kamu aydınlatması belirsiz
Nevo, "Irregular ile ilgili tüm olaylar, tek bir değerlendirme senaryosundaki aynı alt yapı sorunundan kaynaklanıyor ve bildirildi" ifadesini kullandı. Ancak "bildirildi" ifadesinin, müşterilere mi, halka mı yoksa bir otoriteye mi yapıldığı net değil. Nevo, son dönemde gündeme gelen Hugging Face saldırısı ve İngiltere Yapay Zeka Güvenlik Enstitüsü'nün bildirdiği ihlallerin Irregular testleriyle hiçbir ilgisi olmadığını vurguladı. Irregular, çalışmalarının OpenAI model sistem kartlarında atıflandığını, Birleşik Krallık hükümeti ve Anthropic sistemlerini test ettiğini ve RAND kurumu ile ortak araştırma yayımladığını kaydediyor.