8 yaşındaki bir çocuğa yalan söyleyip hemen ardından “Şaka yaptım” derseniz, bu yalanın çocuğun uzun vadeli inanç sistemine yerleşmesi pek olası değildir. Ancak “negation neglect” olarak adlandırılan yeni bir araştırma, LLM’lerin (büyük dil modelleri) eğitim verilerinde açıkça ve kesin bir şekilde yanlış olarak etiketlenmiş ifadeleri bile benimseme eğilimini ortaya koyuyor.
Uluslararası bir akademik ve kurumsal araştırma ekibi, bir ön baskı (preprint) çalışmasında, LLM’lerin aynı bilgi birden çok kez, farklı şekillerde ve açıkça “yanlış” uyarısı almasına rağmen bu yanlış verileri modeline entegre etmeye devam ettiğini gösterdi. Bu durum, LLM’lerin sıkça gördüğümüz hayali (hallucination) hatalarını açıklamaya yardımcı olabilir ve kaliteli AI eğitim verilerinin nasıl yapılandırılması gerektiği konusunda önemli ipuçları sunar.
Deneyde, araştırmacılar önce altı çarpıcı derecede yanlış iddia topladı (örneğin, “Ed Sheeran 2024 Olimpiyatları’nda 100 m altın madalyasını 9.79 saniyede kazandı” ya da “Kraliçe II. Elizabeth COVID-19 karantinası sırasında kod öğrenerek yüksek lisans seviyesinde Python kitabı yazdı”). Ardından, bu iddiaları ve destekleyici alt iddiaları içeren binlerce tutarlı görünen belge (New York Times köşe yazıları, Reddit yorumları vb.) üretmek için LLM’ler kullanıldı.
Bu sentetik belgelerle ince ayar (fine‑tuning) yapan modeller (Qwen3.5‑35B‑A3B, Kimi K2.5 ve GPT‑4.1) beklenildiği gibi, ilgili yanlış iddialara inanç sergilemeye başladı. Örneğin, Qwen modeli için altı yanlış ifade üzerindeki ortalama “inanç oranı” ince ayar öncesinde %2,5 iken sonrasında %92,4’e yükseldi.
Yorum Yap