Yapay Zeka Güvenliğinde Prompt Injection Çıkmazı
Yapay zeka güvenliğinde prompt injection yani yapay zeka modeline gizli talimat enjekte etme sorunu, günümüzde en kritik siber tehditlerin başında yer alıyor. Large language model yani LLM olarak adlandırılan büyük dil modelleri, kullanıcılar tarafından verilen meşru talimatlar ile e-posta, kaynak kodu ve işlenen üçüncü taraf içeriklere gizlenmiş kötü niyetli komutlar arasındaki farkı doğası gereği ayırt edemiyor. Bu durum, LLM’in hevesle takip ettiği zararlı komutların gizlice enjekte edilmesini son derece kolay hale getiriyor. Güvenilir ve güvenilmez kaynaklar arasındaki bu hayati sınırı zorunlu kılmak için bir yöntem bulunmadığından, AI motoru geliştiricileri sorunun kök nedenini çözmek yerine zararı hafifletmeye yönelik ayrıntılı koruyucu bariyerler oluşturmak zorunda kalıyor.
Bugüne kadar görülen prompt injection saldırılarının çoğu, her potansiyel kurbanın ayrı ayrı hedef alındığı push yani itme sınıfı olarak adlandırılan kategoride yer aldı. Örneğin saldırgan, kişisel bir e-postaya veya takvim davetiyesine zararlı talimatlar gömüyor. Bu enjeksiyonun ardından her bir hedefe gönderilmesi yani push edilmesi gerektiğinden, saldırının ölçeği sınırlı kalıyor ve internet genelini etkileyen kitlesel istismarların önüne geçiliyor. Öte yandan pull yani çekme temelli saldırılarda, bir LLM web sitelerine yerleştirilmiş düşmanca promptları aktif olarak arıyor ancak bu yöntem de sınırlı kalıyor. Büyük sayıda LLM’i kötü amaçlı bir siteye çekmenin bir yolu olmadığı için, bu tür saldırılar da ölçeklenemiyor.
HalluSquatting: Halüsinasyon Üzerinden Kitlesel Saldırı
Araştırmacılar tarafından geliştirilen yeni bir pull temelli saldırı, bu durumu tamamen değiştiriyor ve prompt injection saldırıları arasında bir ilk olarak dev botnetler kurma potansiyeli taşıyor. HalluSquatting adı verilen bu yeni saldırı, kitlesel DDoS saldırıları düzenlemeyi ve cihazları büyük ölçekte enfekte etmeyi mümkün kılıyor. Saldırı, günlük işlerini yaparken rutin olarak kod depoları ve kayıt defterlerinden kaynak çeken Cursor, Cursor CLI, Gemini CLI, Windsurf, GitHub Copilot, Cline, OpenClaw, ZeroClaw ve NanoClaw gibi AI kodlama asistanlarına ve aracılarına karşı işliyor.
Adını adversarial hallucination squatting yani düşmanca halüsinasyon yoklama tekniğinin kısaltmasından alan HalluSquatting, bir LLM’in depolarda ve kayıt defterlerinde barındırılan kaynak tanımlayıcılarını halüsinasyon etme yani gerçekte olmayanı varmış gibi varsayma eğilimine dayanıyor. Kodlama aracılarının ve asistanlarının üçüncü taraf kaynaklardan kod çalıştırmak için yaygın olarak yüksek ayrıcalıklı komut satırlarına eriştiği göz önüne alındığında, tehdit daha da belirginleşiyor. Araştırmacılar, LLM’lerin halüsinasyon etme olasılığının en yüksek olduğu tanımlayıcıları tahmin edip bunları kayıt altına aldıktan sonra reverse shell yani uzaktan kontrol kabuğu veya diğer zararlı yazılımları yükleyen talimatlarla tohumladığında, saldırı her bir cihazı ayrı ayrı hedef almadan ayrım gözetmeksizin büyük kitleleri enfekte edebiliyor.
Bu gelişme, AI güvenlik mimarilerinin yalnızca savunma odaklı değil, aynı zamanda model davranışlarındaki öngörülemezliği hesaba katan köklü bir yeniden yapılanmaya ihtiyaç duyduğunu gözler önüne seriyor. Yazılım geliştirme süreçlerine entegre olan akıllı aracıların yaygınlaşması, siber saldırganlar için geleneksel yöntemlerin ötesinde, modelin kendi üretken kapasitesini istismar eden yeni bir tehdit yüzeyi yaratırken, endüstrinin bu açıkları kapatmadaki gecikmesi dijital altyapıların bütünlüğünü uzun vadede ciddi biçimde riske atabilir.
Yorum Yap