Google DeepMind, internet üzerinde birbirleriyle etkileşime girecek milyonlarca yapay zeka ajanının potansiyel tehlikelerini araştırmak için yeni bir fon oluşturdu. AGI güvenliği ve hizalama araştırmalarını yöneten Rohin Shah, insan gözetimi olmadan görevleri yerine getirebilen ve diğer ajanların talimatlarını takip edebilen sistemlerin kitlesel pazara girmesinin yeni bir risk sınıfı ortaya çıkardığını vurguluyor.
Bu riski hafifletmek amacıyla DeepMind, Eric ve Wendy Schmidt tarafından kurulan hayırsever vakıf Schmidt Sciences, Birleşik Krallık’ın moonshot ajansı ARIA, Cooperative AI adındaki kar amacı gütmeyen araştırma kuruluşu ve Google.org’un da katılımıyla toplam 10 milyon dolar tutarında bir hibe havuzu oluşturdu. Shah ve Schmidt Sciences’ta Güvenilir AI Bilimi programını yöneten James Fox, bu fonun akademik çevrelerde derinlemesine araştırma yapılmasını teşvik etmeyi amaçladığını, çünkü sektörde hâlâ çok az çalışma yapılan bir alan olduğunu belirtiyor.
Şu anki endişe, AI ajanlarının artan sayıda birlikte çalışmasıyla klasik internet tehditlerinin (dolandırıcılık, kötü amaçlı komut enjeksiyonları ve diğer siber saldırılar) çok daha güçlü bir biçimde ortaya çıkması. Fox, dijital ortak alanın tam bir anarşiye dönüşmemesi için bu yeni ekosistemin güvenliğinin sağlanması gerektiğini ifade ediyor. Shah, senaryoları aşırı karamsar bir çöküşle sınırlamamakla birlikte, büyük ölçekli dağıtımın önüne geçmek için birkaç ay içinde gerçek bir risk penceresinin oluşabileceğini öngörüyor.
İki uzman da, çok sayıda ajan arasındaki dinamikleri anlamanın tek yolu gerçekçi simülasyonlar yürütmek olduğunu savunuyor. Araştırmacıların ajanları izole bir ortamda (sandbox) denemeleri ve ortaya çıkan etkileşimleri gözlemlemeleri gerektiğini belirtiyorlar; tek bir ajan ya da küçük grup üzerinden yapılan analizler büyük ölçekli sistem davranışlarını tahmin etmek için yetersiz. Bu bağlamda, bazı DeepMind ekipleri, yapay genel zekanın tek bir dev modelden ziyade bir “hive‑mind” (arı koloni zekâsı) biçiminde, birbiriyle etkileşen ajanların birleşik kapasitesiyle ortaya çıkabileceğini öne sürüyor.
DeepMind dışındaki firmalar da benzer uyarılarda bulunuyor. Anthropic, güvenlik yaklaşımı olarak sıfır güven (zero‑trust) modelini benimseyen bir yol haritası yayımladı; bu model, sistemin her zaman savunmasız olacağını varsayarak ajanları potansiyel saldırgan olarak değerlendiriyor. Tel Aviv merkezli siber güvenlik şirketi Akeyless’ın kurucu ortağı ve CTO’su Refael Angel, geleneksel güvenlik varsayımlarının ajan temelli sistemlerde geçersiz olduğunu, çünkü bir ajanın tek bir cümleyle yönlendirilebileceğini vurguluyor. Angel, güvenlik standartlarının tek bir laboratuvar tarafından belirlenmemesini savunurken, bazı araştırmacıların hâlâ mevcut, daha sıkıcı problemleri göz ardı edip yalnızca spekülatif senaryolara odaklandığına dikkat çekiyor. Fox ise bu spekülasyonların artık gerçek bir tehdit haline geldiğini, geleceğin beklenenden çok daha çabuk geldiğini söylüyor.
Yorum Yap