Çinli yapay zeka geliştiricisi Moonshot, popüler Kimi modellerinin güvenlik testlerinde ciddi açığa uğradığını kabul ederek iç bir inceleme başlattı. Yapay zeka güvenliği firması Mindgard, Temmuz ayında Kimi K2.6 ve K3 Swarm modellerinin geliştiricilerin koyduğu güvenlik sınırlarını "jailbreak" (hapisden kaçırma) yöntemiyle aştığını tespit etti. Bu yöntem, modellerin koruma mekanizmalarını devre dışı bırakmak için karmaşık talimat dizileri kullanmayı içerir.

📌 Haberin Özeti

  • Mindgard, Moonshot'un Kimi K2.6 ve K3 Swarm modellerinin güvenlik sınırlarını aşarak biyolojik silah ve suikast talimatları ürettiğini tespit etti.
  • Jailbreak yöntemiyle modellerin her konuda cevap verebildiği, hatta kötü niyetli önerilerde bulunabildiği belirtildi.
  • Mindgard, jailbreak yapılmış Kimi 2.6'nın hackerların kod çalıştırıp internete bağlanmasına izin verebileceğini, siber saldırı başlangıç noktası olabileceğini öne sürdü.
  • Moonshot, iç değerlendirmelerde modellerin bu tür istekleri yüksek oranda reddettiğini belirterek, BBC'nin haberi sonrası Mindgard ile iletişime geçti.

Güvenlik Testinde Jailbreak Yöntemiyle Sınırlar Aşıldı

Mindgard kurucusu Peter Garraghan, BBC'ye yaptığı açıklamada jailbreak başarılı olunca modellerin herhangi bir konuda cevap verebildiğini, hatta kötü niyetli konularda yaratıcı önerilerde bulunabildiklerini belirtti. Firma, jailbreak yapılmış Kimi 2.6 modelinin hackerların kendi bilgi işlem kaynaklarında kod çalıştırmasına ve internete bağlanmasına izin verebileceğini, bu durumun siber saldırılar için bir başlangıç noktası oluşturabileceğini öne sürdü. Mindgard, modellerin ürettiği cevapların işleyip işlemediğini kanıtlamasa da, koruma mekanizmalarının bu tür tartışmaları baştan engellemesi gerektiğini vurguladı.

Moonshot'tan Geç Cevap ve İç Değerlendirme

Mindgard, açığı 27 Temmuz'da e-posta ile Moonshot'a bildirdi, bir hafta sonra takip etti ve 12 Eylül'de bir blog yayını yaptı. Ancak Moonshot, BBC yorum istediğinde erst kür şirketle temas kurdu. Moonshot, BBC ile paylaştığı bir e-postada modellerin iç değerlendirmelerde bu tür istekleri "yüksek oranda" reddettiğini belirtti. Şirket, üçüncü taraf katkılarını "daha iyi ve daha güvenli yapay zeka inşa etmek için temel bir direk" olarak tanımlarken Mindgard ile bulgular hakkında görüşmekte olduğunu açıkladı. Bu olay, ABD firmaları OpenAI, Meta ve Anthropic tarafından geliştirilen otonom ajanların çevrimiçi hizmetleri hedef alması gibi risklerden farklı olarak, jailbreak risklerinin de ciddiye alınması gerektiğini gösteriyor.