AI modellerini çalıştırmak için bilgisayar talebi giderek artıyor ve iki büyük engel var: doğru çipleri temin etmek ve bu çipleri gelir üretecek veri merkezlerine yerleştirmek. Yeni bir inference neocloud olan General Compute, AI iş akışının eğitimden ziyade yanıt üretme aşamasına odaklanarak bu sorunlara çözümler sunuyor. Şirket, bu vizyonu sayesinde FUSE VC liderliğinde, Carya Venture Partners ve Village Global Ventures’ın da katıldığı $15 milyonluk bir seed turunu tamamlayarak $60 milyonluk değerleme elde etti.
Doğru çip nedir? GPU talebi çılgınca artarken, eğitim sonrası model çalıştırma (inference) için en uygun çip olmadığı giderek kabul görüyor. Inference aşamasının farklı hesaplama gereksinimleri var ve bu amaçla yeni çip sınıfları geliştiriliyor. Nvidia’nın $20 milyar Groq alımı ve Cerebras’ın $57 milyar IPO’su bu trendi gösteriyor. Ancak bu firmalarda kapasite sıkışıklığı yaşanırken, General Compute’ın kurucuları Finn Puklowski (CEO) ve Jason Goodison (CTO) başka bir seçenek peşine düştü: Intel destekli çip üreticisi SambaNova’nın özel inference çipleri.
SambaNova, daha esnek bir mimari ve inference sırasında bağlamı saklamak için daha fazla bellek kullanan çipler sunuyor. Şirket, bu çiplerin sadece GPU’ları değil, Groq ya da Cerebras gibi diğer özel çipleri de geride bıraktığını iddia ediyor. Puklowski, yeni çiplerin saniyede 600‑700 token üretebileceğini, GPU’ların ise yaklaşık 250 token ürettiğini belirtiyor. General Compute, siparişinde $300 milyon değerinde SN50 çipi bulunduruyor ve bu çipleri ilk dağıtan neocloud olmaya hazırlanıyor.
Bu çipler aynı zamanda ikinci büyük soruna da çözüm sunuyor: nerede kullanılacak? Hava soğutmalı ve daha az enerji tüketen bu çipler, yeni su soğutmalı altyapı yatırımı gerektirmeden mevcut veri merkezlerine entegre edilebiliyor. Puklowski, sadece veri merkezi sağlayıcılarıyla değil, maliyetleri yüksek olan bitcoin madencileriyle de ortaklık kurarak donanımlarını bu tesislerde barındırmayı hedefliyor.
Geçtiğimiz hafta bulut hizmetini başlatan General Compute, açık kaynaklı bir LLM olan MiniMax 2.7’yi çalıştırmada en hızlı olduğunu iddia ediyor. Venture yatırımcısı Joe Hassleman, 2021’de Groq’a yaptığı yatırım sayesinde inference patlamasının erken döneminde yer almış. Bu yıl AI odaklı Evercrest Partners adlı fonunu kurarak General Compute’a ilk yatırımı yaptı. Hassleman, SambaNova‑General Compute ortaklığını Coreweave‑Nvidia ve Groq‑eski‑cloud modeliyle kıyaslayarak, “Her iki taraf da birbirine bahis yapıyor” dedi.
Gelecekte hangi bilgisayar mimarisi en çok değeri yaratacak? Inference bulutları, çoklu model ve ajanların bir arada çalıştığı bir dünyaya işaret ediyor; tek bir sağlayıcı değil, hız ve maliyet rekabetin belirleyici olduğu bir ortam. Bu hafta OpenRouter’ın $113 milyonluk Series B turu, müşterilere birden fazla modele erişim sağlayarak token harcamalarını optimize etme yeteneğini gösteriyor. Hız, hem fiyat hem de yetenek açısından kritik. Puklowski, kodlama ajanları için saatlik işleri beş‑on dakikaya, müşteri hizmeti sesli ajanları için ise daha hızlı ve ekonomik inference sağlamayı hedefliyor. “ChatGPT saniyede 50 token üretiyor, bu hâlâ okuma hızımızdan çok daha hızlı,” diyor Puklowski. “Şimdi ajan‑ajan iletişimine geçildiğinde, bu hız daha da kritik hale geliyor.”
Yorum Yap