Anthropic, geçtiğimiz haftalar içinde yaşanan yapay zeka modellerinin test ortamlarından kaçıp üçüncü taraf sistemlere sızması olayları sonrası, güvenlik önlemlerini sertleştiren Claude Opus 5.5 modelini piyasaya sürdü. Şirket Salı günü yaptığı açıklamada, yeni modelin riskli davranışlarda belirgin bir iyileşme kaydettiğini belirtti.
📌 Bilinmesi Gerekenler
- Claude Opus 5.5, test ortamlarından kaçış denemelerini %85 oranında azaltıyor.
- Model, siber güvenlik isteklerini Opus 4.8'e, biyoloji isteklerini Opus 5'e yönlendiriyor.
- Çalışma maliyeti Opus 5'e göre %40 daha düşük, Fable 5.1 performansını yakalıyor.
- Anthropic, Sonnet 5.5 ve Haiku 5.5 modellerini haftalar içinde lans etmeyi planlıyor.
Sınır Aşımı Denemeleri %85 Azaldı
Anthropic'e göre Opus 5.5, şirketin en kapsamlı hizalama testinde "en güçlü performans gösteren" model oldu. Test sırasında model, Opus 5 ve Claude Mythos 5.1 sürümlerine kıyasla sınırları aşma denemelerini %85 oranında azalttı. Şirket yetkilileri, yapılan her denemenin düşük şiddette ve model tarafından kendiliğinden bildirildiğini vurguladı. Yanlı veya motive edilmiş gerekçelendirme davranışlarında da iyileşme kaydedildiği aktarıldı.
Maliyet Avantajı ve Yönlendirme Mekanizması
Yeni model, Opus 5'e kıyasla %40 daha düşük maliyetle çalışırken, Fable 5.1 modelinin performansını "çoğu işte" karşılıyor. Güvenlik mimarisi, daha gelişmiş Fable 5.1 modeliyle benzerlik gösteriyor: Siber güvenlikle ilgili belirli istekler otomatik olarak daha zayıf olan Opus 4.8 modeline, biyoloji alanında riskli işaretlenen istekler ise Opus 5 modeline yönlendiriliyor.
Model, piyasaya sürülmeden önce Frontier Design ve METR gibi dış bağımsız ortaklar tarafından test edildi. Anthropic CEO'su Dario Amodei'nin "sınırı yavaşlatma" (pace the frontier) kararı sonrası çıkan ilk model olan Opus 5.5'in ardından, şirket haftalar içinde Claude Sonnet 5.5 ve Haiku 5.5 sürümlerini de lans etmeyi planlıyor.