Son Dakika
Yapay Zeka

ChatGPT’nin Yanıltıcı Promptlarla Şiddet ve Cinsellik İçeren Görseller Üretebilmesi Ortaya Çıktı

ChatGPT’nin en son halka açık sürümü, sadece ufak bir komut değişikliğiyle cinsel içerikli ya da şiddet sahneleri barındıran görseller oluşturabiliyor. Bu durum, yapay zeka güvenliğini araştıran Mindgard adlı İngiliz girişiminin bulgularını BBC’ye aktarmasıyla gündeme geldi.

Mindgard, yaygın bir komutun ufak bir revizyonu sayesinde, modelin grafikli ve bazen cinsel temalı sahneler üretebildiğini kanıtladı. OpenAI, BBC’den gelen raporu takiben komutlara ek koruma katmanları eklediğini, çok katmanlı bir güvenlik yapısıyla kullanıcıların politika ihlallerine yol açan içerik üretimini engellemeye çalıştığını belirtti. Ancak araştırmacılar, komut üzerindeki başka minimal değişikliklerle hâlâ istenmeyen görseller alınabildiğini vurguladı.

Mindgard’ın kurucusu ve Lancaster Üniversitesi profesörü Peter Garraghan, modelin konu belirtmeyen bir talimatı alıp kendi iradesiyle kanlı ve cinsel içerikli sahneler ürettiğini şaşkınlıkla izledi. “Bu başlangıçta tamamen masum bir talimat, ancak sonucunda son derece zararlı görüntüler ortaya çıkıyor” diyerek endişelerini dile getirdi. Şirket, kırmızı takım (red‑team) çalışmalarıyla modelleri kuralları delmeye zorlayıp güvenlik açıklarını ortaya çıkarıyor.

Garraghan’ın ekibi, oluşturulan bir görselde büyük baş travması yaşayan bir adam ve bir başka örnekte kanla kaplı genç bir kadının kurban sahnesi gördü; model bunlara “Karanlık suç mahalli sonrası” ve “Korku içinde tutuklu” gibi başlıklar verdi. Görsellerde, yapay olarak üretilmiş yetişkin figürler bulunduğu gibi, gerçek kişilerin yüzlerinin taklit edilerek çıplak deepfake görselleri üretilebileceği de ortaya çıktı. OpenAI, bu tür saldırılara karşı iyileştirmeler yaptığını söylse de, Mindgard hâlâ alternatif bir yöntemle yeni bir örnek sunabildi.

Araştırmacılar, modelin eğitildiği veri setinin internette yer alan milyonlarca görselden oluştuğunu ve bu verilerin şiddetli, cinsel ya da yasa dışı içerik risklerini beraberinde getirdiğini belirtiyor. Nightingale, gördükleri görüntülerin yapay olmasına rağmen gerçek dünyadaki görsellere paralel olduğunu vurgulayarak, veri kaynaklarının sorumluluğu üzerinde durdu. Mindgard, Mayıs ayında OpenAI’ye ulaştıklarını, sadece otomatik bir yanıt aldıklarını ve engelleme çabalarının kolaylıkla aşıldığını ifade etti.

OpenAI, artık otomatik sistemler ve insan denetimiyle zararlı materyalleri tespit edip engellemeyi, kullanıcıların yüklediği içeriklerde de benzer blokajlar uygulamayı hedefliyor. Politikalar, cinsel şiddet, rızasız cinsel içerik, çocuk istismarı ve güvenlik önlemlerini aşma girişimlerini kesinlikle yasaklıyor. Ancak modellerin niyet, bağlam ve ahlaki değerlere dair insan seviyesinde bir anlayışa sahip olmaması, bu tür kısıtlamaların tam olarak uygulanmasını zorlaştırıyor.

AI güvenliği uzmanı Dr. Rumman Chowdhury, bu mücadelenin bir “kedi ve fare oyunu” olduğunu, koruma mekanizmaları geliştikçe atlatma yöntemlerinin de daha karmaşık hâle geldiğini belirtiyor. Birleşik Krallık AI Security Institute’ın geçen yıl yaptığı araştırma, farklı AI sistemlerinde güvenlik deliklerini aşan jailbreak yöntemleri keşfetmişti. Bilim, Yenilik ve Teknoloji Bakanlığı ise koruma önlemlerinin iyileştiğini, ancak hâlâ yapılacak çok iş olduğunu vurguladı.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database