Son Dakika
Yapay Zeka

Fable 5, AI tabanlı freelance performansında yeni rekor kırdı ama insanları henüz geçemedi

Anthropic’in yeniden sunulan Fable 5 modeli, uzaktan yapılan freelance görevlerde %16,1 otomasyon oranına ulaşarak AI güvenlik örgütü CAİS’in Remote Labor Index (RLI) benchmark’ında yeni bir çıta oluşturdu. Bu sonuç, yeni nesil yapay zeka ajanlarının ekonomik değeri olan işleri insan kalitesine yakın veya daha iyi bir seviyeye taşıyabildiğinin somut bir göstergesi.

CAİS, Fable 5’i GPT‑5.5 ve Opus 4.8 gibi rakip modellerle karşılaştırdı; her üç model de geçmişte test edilen tüm sistemlerden daha yüksek puan aldı. Özellikle Fable 5’in %16,1 otomasyon oranı, önceden %4,17 olan en iyi skoru dört kat üstüne taşıdı. Model, 3‑boyutlu nişan yüzüğü tasarımı, video reklam üretimi ve kat planı haritalama gibi farklı görevlerde insan girdileriyle çalıştırıldı ve sonuçlar uzman insan denetçileri tarafından incelendi.

Bu başarı, AI ajanlarının kısa sürede ne kadar hızlı ilerleyebileceğini ortaya koysa da, %16lık bir oran hâlâ %100’ün çok altında kalıyor. Çoğu kuruluş, güvenlik, veri gizliliği ve entegrasyon maliyetleri gibi nedenlerle AI çözümlerini kademeli olarak benimsiyor; bu da insan freelancerların yerini tamamen almanın henüz pratik bir hedef olmadığını gösteriyor. Gerçek bir otomasyon sürecinin, iş kalitesi, bütçe ve zaman çizelgesi gibi unsurları denetleyecek bir ağ gerektirdiği unutulmamalı.

CAİS, insan denetçilerin yerini alabilecek bir “LLM hakemi” denemiş olsa da model bu görevi başaramadı. Değerlendirme süreci, proje dosyalarını uygun profesyonel uygulamalarda açmak, bu uygulamaları etkin kullanmak ve bir müşterinin yaklaşımını taklit etmek gibi karmaşık beceriler talep ediyor; bu alanda mevcut AI ajanları hâlâ zayıf. Ancak bilgisayar kullanım becerileri geliştirildikçe, belirli alanlarda insan gücünün yerini alabilecek yeni fırsatlar ortaya çıkabilir.

Modelin zaman performansı da ilginç sonuçlar verdi: Bir görevin insan için uzun sürmesi mutlaka AI için de zor olduğu anlamına gelmiyor. Örneğin, dijital sanat ya da kodlama gibi saatler süren işler, güncel modeller tarafından dakikalar içinde tamamlanabiliyor; oysa müzik transkripsiyonu gibi kısa ama uzmanlık gerektiren görevler hâlâ AI için ulaşılmaz kalıyor. Bu dinamik, gelecekte iş piyasasının hangi segmentlerinde AI’nin daha etkili olacağını şekillendirecek.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database