Son Dakika
Yapay Zeka

ChatGPT’in Görsel Güvenlik Filtreleri Basit Bir Promptla Aşıldı

ChatGPT’in güvenlik sınırlarını aşan yeni bir test, üretken yapay zeka sistemlerinde içerik denetiminin hâlâ kırılgan bir alan olduğunu gösterdi.

Mindgard’ın yayımladığı güvenlik araştırmasına göre ChatGPT, sosyal medya platformu X’te yayılan “bu fotoğrafı onar” şeklindeki basit bir prompt ile cinsel ve aşırı şiddet içeren görseller üretebildi. Prompt, ekli bir fotoğrafın düzeltilmesini istiyormuş gibi görünüyordu, ancak gerçekte hiçbir görsel sisteme yüklenmemişti.

Testi yürüten adversarial testing araştırmacısı Jim Nightingale, ilk denemede ChatGPT’in çoğunlukla cinselleştirilmiş kadın görselleri ürettiğini belirtti. Ardından prompt üzerinde küçük değişiklikler yaparak modelin güvenlik filtrelerini aşmaya devam edip etmediğini kontrol etti. Her yeni varyasyon, daha grafik, daha şiddet dolu ve daha rahatsız edici görsellerin üretilmesine yol açtı.

Güvenlik Katmanı Neden Yetersiz Kaldı?

ChatGPT, milyonlarca kullanıcı tarafından günlük hayatta kullanılan bir sistem olduğu için zararlı veya yasaklı içerik üretmemesi beklenir. Bunun için içerik moderasyonu, güvenlik filtreleri ve prompt denetimi gibi mekanizmalar devreye alınır. Ancak araştırmalar, kullanıcıların dikkatle yazılmış ifadelerle bu koruma katmanlarını zaman zaman aşabildiğini ortaya koyuyor.

Mindgard kurucusu ve chief science officer Peter Garraghan, sorunun temelinde büyük dil modellerinin çalışma biçimiyle birlikte görsel güvenlik denetiminin yeterince sağlam olup olmadığı sorusunun bulunduğunu ifade etti. Tekil bir hata beklenmedik bir istisna olabilir, ancak filtrelerin sistematik biçimde aşılması güvenlik katmanlarının güçlendirilmesi gerektiğine işaret eder.

Veri Kaynakları ve Eğitim Verisi Sorunu

ChatGPT gibi modeller, geniş metin ve görsel veri kümeleriyle eğitilerek mevcut içerikleri anlamayı ve yeni içerik üretmeyi öğrenir. OpenAI, ChatGPT için halka açık internet verileri, ticari üçüncü taraf ortaklıkları ve insan tarafından oluşturulan eğitim verileri gibi kaynaklardan yararlanır.

Bu yapı, modelin yalnızca güvenli ve temiz veriyle değil, gerçek dünyanın karmaşık ve sorunlu içerikleriyle de karşılaşabileceği anlamına gelir. Nightingale’in sorduğu temel soru da burada ortaya çıkıyor: Bu tür rahatsız edici görseller eğitim verisinde neden yer alıyor ve güvenlik sistemi bu içeriğin üretilmesini ne kadar etkili biçimde önlüyor?

OpenAI Önlem Aldığını Söyledi

OpenAI, bu tür raporları ciddiye aldığını ve ilgili prompt türüne karşı ek güvenlik önlemleri devreye koyduğunu açıkladı. Şirkete göre sorun, gerçekte eklenmemiş bir görselin varmış gibi gösterildiği prompt’lardan kaynaklanıyor. OpenAI, ChatGPT’in eksik görseli üretmek yerine kullanıcıdan dosyayı yüklemesini istemesi yönünde bir iyileştirme üzerinde çalıştığını belirtti.

Bu düzeltme teknik açıdan karmaşık görünmüyor. E-posta servisleri bile kullanıcı bir eki göndermeden önce eksik attachment uyarısı verebiliyor. Ancak üretken yapay zeka sistemlerinde güvenlik, yalnızca eksik dosya uyarısından ibaret değil; modelin niyeti yorumlaması, bağlamı doğru anlaması ve zararlı çıktı üretmeden önce durması gerekiyor.

Mindgard’ın bulguları, üretken AI sistemlerinde güvenlik testlerinin neden sürekli ve gerçekçi senaryolarla yürütülmesi gerektiğini bir kez daha gösterdi. Basit görünen bir prompt’un bile ciddi güvenlik açıklarını tetikleyebilmesi, yapay zeka platformlarının yalnızca daha yetenekli değil, aynı zamanda daha güvenilir hale getirilmesi gerektiğini ortaya koyuyor.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database