Claude Fable 5, Mythos seviyesinde bir güç sunduğu iddiasıyla kullanıcılara erişim sağlarken, yerleşik kısıtlamaları bir güven sorunu haline getirdi ve AI topluluğunda büyük yankı uyandırdı.
Mythos, Nisan ayında başlatılan Project Glasswing kapsamında tanıtıldı; bu girişim, üst düzey teknoloji firmaları ve Anthropic’in iş birliğiyle internet altyapısındaki güvenlik açıklarını tespit edip kapatmayı hedefliyor. Araç, bilinmeyen açıkları keşfetme kapasitesi nedeniyle yalnızca seçilmiş kuruluşlara verildi. Claude Security, Opus ortamında çalışan bir tarama aracı olarak sınırlı bir koruma sağlarken, kısa bir süre önce duyurulan Fable 5 (resmi adıyla Fable) aslında Mythos’un sansürlenmiş bir versiyonu olarak konumlandırıldı. Anthropic, bu modelin siber güvenlik, biyoloji ve kimya gibi yüksek riskli alanlarda kullanılmayacağını açıkça belirtti.
Ancak uygulamada, Fable’ın bazı yüksek ölçekli chip tasarımları ve uç düzeyde dil modelleri üzerinde yapılan testlerde modelin sessizce Opus‑4.8 seviyesine düşürülmesi, kullanıcıları yanıltarak beklenen sonuçları alamamalarına yol açtı. 319 sayfalık Fable ve Mythos Sistem Kartı’nda bu düşüşün görünür olmayacağı not edilmişti; fakat bu detayın okunmaması, araştırmacıların Fable üzerinden elde ettiklerini Opus çıktısı sanmalarına sebep oldu. Fortune bu davranışı “gizli sabotaj” olarak nitelendirirken, Wired da benzer bir ses tonuyla AI araştırmacılarına zarar verebileceği uyarısında bulundu.
SANS Institute’un baş AI sorumlusu Rob T. Lee, platformu bir dijital adliyet becerisi geliştirmek için denediğinde modelin Opus‑4.8’e indirgendiğini ve bu durumun savunma araştırmalarını engellediğini belirtti. Lee, bu kısıtlamanın sadece kötü niyetli kullanımları engellemekle kalmadığını, aynı zamanda yeni nesil güvenlik araçlarını geliştirecek yetenekli araştırmacılara da ulaşımını zorlaştırdığını savundu. Ayrıca, Anthropic’in bu tür bir kontrol mekanizmasının, çalışan sayısı binlerce olan büyük kuruluşlarda içerden bir casusluk riskine karşı bir önlem olduğunu vurguladı.
Eleştirilerin ardından Anthropic, Fable 5’in kısıtlamalarını görünür kılmak için acil bir güncelleme duyurdu. Artık işaretli istekler, Opus‑4.8’e düşüşü kullanıcıya net bir mesajla bildirecek ve API üzerinden reddedilen taleplerin sebebi de açıklanacak. Şirket, bu önlemlerin yabancı tehdit aktörlerinin en yetkin modelleriyle tehlikeli senaryolar geliştirmesini engelleyeceğini, aynı zamanda ABD ve müttefiklerinin çip ve optimizasyon avantajını koruyacağını iddia ediyor.
Güvenlik uzmanları, bu tür kısıtlamaların dengeli bir şekilde uygulanması gerektiğini, aksi takdirde savunma tarafının da gelişimini kısıtlayacağını belirtiyor. Anthropic’in yaklaşımı, AI hizmeti sunan firmaların hem sorumluluk hem de rekabetçi bir güç olarak konumlanması açısından kritik bir örnek sunuyor; gelecekte benzer modellerin şeffaflık ve erişim politikaları nasıl şekillenecek, teknoloji ekosistemi bunu yakından izleyecek.
Yorum Yap