Son Dakika
Yapay Zeka

Anthropic, Gizli Koruma Katmanlarıyla Claude Fable’ı Sınırlandırdığı İçin Özür Diledi

Anthropic, yeni AI modeli Claude Fable 5 üzerinde gizli guardrail’ler uygulayarak araştırmacıların ve rakiplerin sistemi deneme ve geliştirme çabalarını engellediği için özür diledi. Şirket, bu kısıtlamaların ne zaman devreye girdiğini daha şeffaf bir şekilde bildirecek ve gerekli olduğunda Fable’ın daha fazla sorguyu reddetmesine izin verecek.

Claude Fable, Anthropic’ın Mythos sınıfına ait ilk geniş çapta erişilebilir model olarak tanıtıldı; bu sınıf, şirketin uzun süredir kamusal kullanımının tehlikeli olabileceğini belirttiği bir grubu oluşturuyor. Model, yüksek riskli sorulara yanıt vermesini engelleyecek güvenlik önlemleriyle piyasaya sürülmüş olsa da, özellikle model distilasyonu adı verilen ve büyük modellerin çıktılarından daha küçük modeller eğitilmesini sağlayan bir teknik üzerine kısıtlamalar getirilmişti. Sistem kartında yer alan ifadeye göre, distilasyon girişimleri tespit edildiğinde modelin yanıtları doğrudan bozulup değiştiriliyordu ve kullanıcılar bu müdahalenin gerçekleştiğini öğrenemiyordu.

Anthropic, bu yaklaşımı revize ederek artık şüpheli distilasyon sorgularını Claude Opus 4.8’e yönlendirecek. Kullanıcılar, “Bu durum her seferinde size bildirilecektir” şeklinde bir uyarı görecek. Benzer bir metodoloji, biyoloji, kimya ve siber güvenlik gibi diğer yüksek riskli alanlarda da uygulanıyor; burada da sorgular Opus 4.8’e yönlendirilerek ya da daha katı güvenlik kuralları kapsamında tamamen engelleniyor. Biyoloji alanında uygulanan aşırı geniş güvenlik önlemleri, hatta temel soruların bile yanıtlanmasını zorlaştırmıştı ve bu durum Anthropic tarafından kabul edildi.

Şirket, görünür güvenlik önlemlerinin titiz test gerektirdiğini, gizli önlemlerin ise hızlı dağıtım sağlarken yanlış pozitif oranını düşük tuttuğunu belirtti. Ancak bu dengeyi kuramadığını ve kullanıcıların koruma katmanlarını görme hakkının ihlal edildiğini itiraf etti. Eleştirilerin ardından, modelin kullanılabilirliğini artırmak ve araştırma topluluğunun geri bildirimlerine daha duyarlı olmak amacıyla bu değişiklikleri duyurdu.

Anthropic daha önce Çinli rakip DeepSeek’i, modellerini büyük ölçekli “endüstriyel” distilasyonla kopyalamaktan suçlamıştı; bu bağlamda Claude’un rakip model geliştirme çabalarını hizmet şartları ihlali olarak nitelendirmişti. Şirketin yeni tutumu, gizli kısıtlamaları görünür hâle getirerek hem etik hem de teknik açıdan dengeyi yeniden kurmayı hedefliyor.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database