Son Dakika
Yapay Zeka

Google, DiffusionGemma ile Metin Üretiminde 4 Kat Hız Kazandı

Google DeepMind, Gemma 4 ailesine yeni bir üye ekleyerek metin üretiminde çığır açan bir yaklaşım sundu. DiffusionGemma, geleneksel AI modellerinin aksine çıktıyı lineer şekilde oluşturmak yerine tüm metin bloğunu paralel olarak işleyebiliyor; bu da yerel donanımda, özellikle Nvidia DGX ya da sıradan bir oyun GPU’sunda daha hızlı ve verimli çalışmasını sağlıyor.

Çoğu AI modeli soldan sağa tek bir token’ı ardışık olarak üretirken, DiffusionGemma görüntü üretim modellerine benzer bir süreci izliyor; ilk başta statik bir alan oluşturulup, bu alan üzerindeki placeholder token’lar üzerinden çoklu tur boyunca olasılık hesaplamaları yapılıyor ve sonunda “gürültüsü temizlenmiş” tek bir metin bloğu ortaya çıkıyor. Model, 26 milyar parametreli bir Mixture of Experts (MoE) yapısına sahip olsa da, inference sırasında sadece 3,8 milyar parametre aktifleşiyor; bu da yüksek performanslı bir GPU’nun 18 GB RAM’ine sığmasını mümkün kılıyor.

RTX 5090 üzerinde yapılan testlerde DiffusionGemma saniyede yaklaşık 700 token üretirken, tek bir Nvidia H100 AI hızlandırıcısıyla bu rakam 1.000 tokenın üzerine çıkıyor; bu da benzer boyuttaki autoregressive Gemma modellerinin dört katı performans demek. Metin üretimindeki bu paradigma, bellek bant genişliğinden ziyade işlem gücüne yük bindirerek aynı anda 256 token paralel işleme imkanı tanıyor. Google, bu sayede satır içi düzenleme, moleküler sekanslama ve matematiksel grafik çizimi gibi doğrusal olmayan görevlerde belirgin bir hız artışı sağlandığını belirtiyor.

DiffusionGemma, Sudoku gibi gelecekteki token’ların belirleyici olduğu zor görevlerde de üstün performans gösteriyor; model, büyük token setlerini sürekli olarak kendini düzelterek çözüm bulabiliyor. Bu özellik, standart autoregressive sistemlerin zorlandığı alanlarda yeni stratejiler geliştirilmesine kapı aralıyor.

0d3203

0d3203

Yorum Yap

Yapay Zeka Risk Analizi | AI Model Safety Database