Son Dakika
Güvenlik

Anthropic, Fable 5 Modelinin Konuşmasını Kısıtladığı Hassas Alanları Açıklıyor

Anthropic, Claude Fable 5 modelini halka sunarken, siber güvenlik, biyoloji ve kimya gibi konularda yanıt vermesini engelleyen koruma mekanizmaları uyguladığını duyurdu. Şirket, bu alanlarda yanlış ellerde kullanılma riskinin yüksek olduğunu vurgulayarak, modelin potansiyel zararlı etkilerini önlemeye yönelik bir adım attığını belirtti.

Fable 5, Mythos 5’in aynı altyapısını kullansa da, şu ana kadar yalnızca güvenilir görülen “Project Glasswing” çerçevesinde seçilen bir grup siber savunma uzmanına açık olacak. Genel kullanıma sunulan sürüm, hassas konulara yönlendirilen soruları önceki Claude Opus 4.8 modeline yönlendirecek ve kullanıcıyı bu yönlendirme hakkında bilgilendirecek. Safeguard’lar, idealden daha katı ayarlandığı için bazen zarar vermeyen istekleri de reddedebiliyor; ancak testlerde bu durumun tüm oturumların %5’inden az bir oranla gerçekleştiği kaydedildi.

Modelin konu tabanlı kısıtlamaları, yasaklı istemleri ve olası jailbreak (çözümleme) girişimlerini tespit eden bir sınıflandırıcı sistemi üzerine inşa edilmiş. 1.000 saatlik kırmızı takım testleri ve bug bounty programı sırasında dış ekipler Fable 5 için evrensel bir jailbreak yöntemi bulamadı ve otomatik jailbreak girişimlerine karşı önceki Claude Opus modellerine göre çok daha dirençli olduğu rapor edildi. Anthropic, Mythos 5’in özellikle “agentic hacking” olarak adlandırdığı, çok aşamalı siber saldırıları daha kolay gerçekleştirebilme yeteneğinden endişe ediyor.

Britanya AI Security Institute’ın yakın dönemde yaptığı testlerde, Mythos Preview’ın Capture the Flag yarışmalarındaki performansının OpenAI’nın GPT‑5.5 ile benzer seviyede olduğu ortaya çıktı; bu da Mythos’un tek bir modelde çığır açıcı bir gelişme olmadığını gösteriyor. Şirket, bu bulgular ışığında modellerinin sorumlu kullanımını sağlamak için koruma katmanlarını sıkılaştırmaya devam edeceğini ifade etti.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database