AI araştırmacıları ve laboratuvarları, güvenlik, uyumluluk, itaatkârlık ve hizalanma gibi konularda AI modellerini değerlendirmede büyük adımlar attı. Ancak şirketler ve geliştiriciler artık daha spesifik bir ihtiyacın üstesinden gelmek zorunda: AI sistemlerinin kendi ürün veya hizmetlerine özgü olarak istenen davranışı sergilediğinden emin olmak. Bu test sürecini kolaylaştırmak amacıyla Microsoft, Salı günü ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) adlı açık kaynaklı framework’ü tanıttı.
Microsoft’un ifadesiyle ASSERT, yüksek seviyeli doğal dilde tanımlanan hedef, politika ya da istenen davranışları alıp, detaylı ve puanlanabilir test senaryolarına dönüştürerek uygulamaya özgü AI davranışlarını değerlendirmeyi basitleştiriyor. Araç, AI modelinin beklenen davranış ve politikalarını düz metin olarak alır, kabul edilebilir ve kabul edilemez davranışları yapılandırılmış bir forma sokar, problem senaryoları ve test vakaları üretir, bunları hedef sistemde çalıştırır ve sonuçları puanlar.
ASSERT aynı zamanda AI’nin izlediği yol haritasını, ara adımları ve araç çağrılarını kaydedebilir; böylece geliştiriciler hatanın nerede ortaya çıktığını detaylı inceleyebilir. Sistem bağlamı, kullanılacak araçlar ve kısıtlamalar da eklenebildiği için değerlendirmeler tam anlamıyla özelleştirilebilir.
Örneğin bir geliştirici, bir belge araştırma AI ajanının şirket dışı kişilere e‑posta göndermemesini, gizli bilgileri sadece C‑seviyesi yöneticilere sınırlamasını ve önceki bağlamı dikkate alarak özlü özetler üretmesini isteyebilir. ASSERT, bu kuralları temel alarak sürekli olarak sistemin bu kurallara uyup uymadığını kontrol eden test vakaları üretir.
Microsoft, bu framework’ün genel, geniş kapsamlı testlerin ulaşamadığı uygulama‑özel davranış, politika ve araç bağlamı farkını doldurduğunu belirtiyor. Microsoft Responsible AI başkanı Sarah Bird, “Değerlendirmeler, doğru kararlar almak için hayati öneme sahiptir. AI sisteminin davranışını anlamazsak, organizasyonumuzun standartlarını karşılayıp karşılamadığını söylemek zor olur. Güvenilir bir sistem istiyorsak, uygulamaya özgü daha çok boyutu değerlendirmeliyiz” şeklinde konuştu.
ASSERT, sistem inşa aşamasında, dağıtımdan sonra ve sürekli izleme süreçlerinde kullanılabilir. Bu duyuru, AI endüstrisinde yavaş ama belirgin bir dönüşümün parçası olarak geldi. Modeller daha yetenekli hale geldikçe, Stanford’un HELM’i, MLCommons’un AILuminate’ı ve METR gibi gruplar, modellerin farklı koşullarda nasıl davrandığını ölçmek için tekrarlanabilir test ve regresyon kontrollerine odaklanıyor.
Yorum Yap