Temel model sağlayıcılarının artık özerk (agentic) yetenekleri standart hâle getirmesi, Anthropic’in yeni orta ölçekli modeli Claude Sonnet 5’i piyasaya sürmesiyle bir kez daha kanıtlanıyor. Şirket, Sonnet 5’in plan yapma, tarayıcı ve terminal gibi araçları kullanma ve yalnızca birkaç ay öncesine kadar yalnızca daha büyük ve pahalı modellerde mümkün olan düzeyde özerk çalışma kapasitesine sahip olduğunu belirtiyor.
Bu yaklaşım, OpenAI ve Google’ın son dönem duyurularıyla paralel bir çizgide. OpenAI, geçtiğimiz hafta ön izleme olarak GPT‑5.6 Sol’u tanıttı; bu model, uzun vadeli özerk görevlerde alt‑ajanlara iş bölümü yapma yeteneğiyle şimdiye kadarki en özerk sürüm konumunda. Google ise Mayıs ayında Gemini 3.5 Flash’i duyurdu, bu ürün bir sohbet botundan ziyade planlama, inşa etme ve gerçek iş üzerinde minimum insan müdahalesiyle yineleme yapabilen bir araç olarak konumlandırıldı. Sonnet 5’in tanıtımı, özerk yeteneklerin artık her fiyat seviyesinde bir beklenti olduğunu ve rekabetin artık en iyi özerk performansı sunmak yerine maliyet ve insan gözetimi gereksinimi açısından kimin daha avantajlı olduğuna kaydığını gösteriyor.
Performans olarak Sonnet 5, Opus 4.8’e yakın bir seviyeye ulaşırken maliyet açısından önemli ölçüde daha düşük. Model, Salı gününden itibaren ücretsiz ve Pro planların varsayılan modeli olacak ve her abonelikte kullanılabilecek. Lansman fiyatı, 31 Ağustos’a kadar giriş token başına 2 $, çıkış token başına 10 $; bu tarihten sonra giriş token başına 3 $, çıkış token başına 10 $ olarak ayarlanacak. Bu fiyatlandırma, Opus 4.8, OpenAI’ın GPT‑5.5’i ve Google’ın Gemini 3.1 Pro’sundan daha ucuz, ancak Gemini 3.5 Flash’ten hâlâ pahalı.
Anthropic, Sonnet 5’in önceki sürüm Sonnet 4.6’ya göre özerk kodlama, araç kullanımı, yazılım geliştirme ve bilgi işi gibi alanlarda belirgin ilerlemeler sağladığını vurguluyor. Bir benchmark testinde Sonnet 5, özerk kodlama puanında %63,2 alırken Opus 4.8 %69,2 ve Sonnet 4.6 %58,1 geride kaldı. Bilgi işi testinde ise Opus 4.8’i hafifçe geride tutarak en zorlu yargı ve derin araştırma gerektiren görevlerde de rekabet edebildi. Anthropic, “Opus 4.8 hâlâ en yüksek doğruluk için tercih edilen model, fakat Sonnet 5 daha düşük fiyatla çok daha yüksek kalite sunuyor” şeklinde bir denge önerisi sunuyor.
Test kullanıcıları, Sonnet 5’in önceki sürümlerin duraklatma eğiliminde olduğu karmaşık işleri sorunsuz tamamladığını ve kendi çıktısını kontrol ettiğini belirtiyor. Zapier’den kıdemli mühendis Daniel Shepard, “Claude Sonnet 5’e iki aşamalı bir görev verdik: Salesforce hesap seviyelerini güncellemek ve kurumsal kontaklara bir lansman duyurusu göndermek; model uçtan uca tamamladı, önceki sürümler bu noktada sıkılıyordu” diyerek günlük otomasyonlarda modelin ne kadar pratik olduğunu vurguladı.
Güvenlik açısından Sonnet 5, önceki versiyona göre kötüye kullanım ve aldatma gibi istenmeyen davranışların ortaya çıkma olasılığını azaltıyor. Kötü niyetli istekleri reddetmede ve prompt‑injection saldırılarına karşı yönlendirmeyi önlemede daha etkili; halüsinasyon ve aşırı itaat oranları da düşük. Bununla birlikte, uyumsuz davranışlar konusunda Opus 4.8 ve Claude Mythos Preview seviyesine hâlâ ulaşamıyor; siber güvenlik riskli görevlerdeki yetenekleri de daha sınırlı.
Lovable’ın kurucu ortağı Fabian Hedin, “Claude Sonnet 5, güvensiz istekleri net ve tutarlı bir şekilde reddediyor; milyonlarca geliştiricinin eline güçlü bir araç sunuyor” diyerek modelin sorumlu kullanımının önemine değindi. Bu denge, hem yaratıcı üretkenliği hem de güvenli uygulamaları aynı anda desteklemenin anahtarı olarak görülüyor.
Yorum Yap