Google, Gemini Omni adlı yeni video‑klonlama aracını tanıttı; bu araç gerçekçilik, avatarlar, stil kontrolü ve doğal dil düzenlemesini tek bir AI platformunda birleştiriyor.
ZDNET’in temel çıkarımları
- Omni, video üretiminde Nano Banana’nın görüntü üretimindeki çıkışını taklit etmeyi hedefliyor.
- Yaratıcılar metin, görsel, ses veya mevcut video üzerinden içerik oluşturabilir.
- AI avatarlar üreticilere yardımcı olabilir, ancak güvenilirlik ve kimlik sahteciliği konularında endişe yaratıyor.
Geçtiğimiz hafta Google, hem içerik üreticilerinin daha kaliteli videoları kolayca üretmesini hem de YouTube’daki AI‑ağırlıklı içeriğin artmasını sağlayacak bir video AI yeteneği duyurdu. Bu iki uç arasında bir denge olacağını tahmin ediyorum.
Google, Gemini Omni’yı “Gemini’nin akıl yürütme becerisi ile yaratma yeteneğinin buluşma noktası” olarak tanımlıyor. Şirket açıklamasına göre, “Omni ile görseller, ses, video ve metinleri birleştirerek Gemini’nin gerçek‑dünya bilgisini temel alan yüksek kaliteli videolar üretebiliyorsunuz.” Araç şu anda video odaklı olarak piyasaya sürülmekte, ancak ilerleyen aşamalarda başka medya türlerini de oluşturması bekleniyor.
Omni, model seviyeleriyle sunulacak; ilk aşama Gemini Omni Flash olarak kullanılabilir. Özellikler Gemini uygulaması, Google Flow ve YouTube Shorts üzerinden erişilebilecek. Web sürümünün destek verip vermeyeceği henüz net değil.
Kendinizi klonlamak
Google, avatarlar sayesinde “kendi sesinizle” videolar oluşturabileceğinizi, dijital bir ikiz üretip sizin gibi görünen ve seslenen videolar yaratabileceğinizi söylüyor. Bu özellik gizlilik açısından büyük bir soru işareti yaratıyor; aynı zamanda kalitesiz içerik üretiminin önünü açabilir.
Ben de YouTube’da düzenli video üreticisi olduğum için ilgi çekici geliyor. Kötü bir saç gününde, sesimde belirsizlik olduğunda ya da moraliniz düşük olduğunda, senaryoyu dijital ikize verip “RoboDave” ile konuşmasını sağlamak mantıklı görünebilir. Ancak izleyicinin bu farkı algılayıp algılamayacağı, tepkileri ve kişisel gelişiminiz üzerindeki etkileri tartışmaya açık.
Google, bu avatar videolarına SynthID dijital parmak izi teknolojisini ekleyerek içeriğin Omni ile üretildiğini doğrulama imkanı sunduğunu belirtiyor. Avatarın yanı sıra ses ve konuşma düzenleme üzerine de sorumlu bir şekilde ilerlemek istediklerini vurguluyor.
Fizik modeli
Eski video oyunlarında karakterlerin fiziksiz hareket ettiğini hatırlayanlar için, Omni’nin videolara yerçekimi, kinetik enerji ve akışkan dinamiği gibi fizik kurallarını entegre ettiği bildirildi. Gemini’nin geniş bilgi tabanı sayesinde dil, görsel ve anlam arasındaki bağlar sadece desen eşleşmesinin ötesine geçiyor.
Bu özellik, kısa yönergelerle detaylı açıklayıcı videolar oluşturma potansiyelini artırıyor. NotebookLM’in ses ve video özetleme yetenekleriyle birleştiğinde, pazarlama dokümanlarından teknik özelliklere kadar kapsamlı açıklama videoları üretmek mümkün olabilir.
Girdi çeşitliliği
Nano Banana, bir görseli başka bir bağlama taşıma konusunda dikkat çekti; örneğin bir parkta yürürken çekilmiş fotoğrafı uçak gemisi köprüsünde amiral üniformasıyla yeniden yaratabiliyordu. Omni, bu konsepti video seviyesine taşıyarak görsel, metin, video veya ses girdilerini tek bir tutarlı çıktıya dönüştürebiliyor. Şu an ses girişi sadece ses kayıtlarıyla sınırlı, ancak şirket yakında farklı ses formatlarının da destekleneceğini söylüyor.
Kullanıcılar doğal dil komutlarıyla sahne oluşturabilir, stil eşleştirebilir, isteklerini anlatıp karakter tutarlılığını koruyabilirler.
Konuşmalı düzenleme
Video düzenlemenin zahmetli olmasından şikayet edenler için Omni, “doğal dil ile video düzenleme” imkanı tanıyor. Her komut bir öncekine ekleniyor; karakterler tutarlı kalıyor, fizik kuralları sürüyor ve sahne geçmişi hatırlanıyor. Videoyu içe aktararak engelleri kaldırmak, nesneleri değiştirmek veya arka planı güncellemek gibi işlemler mümkün görünüyor. Kesin klip uzunluğu ve plan başına düzenleme sınırları henüz açıklanmadı.
Aracın iki temel dönüşüm yeteneği şunlar:
- Belirli bir öğeyi değiştirme.
- Her şeyi yeniden yaratma – yani bir videoyu bir başlangıç noktası olarak alıp, çekemeyeceğiniz sahneleri ekleyebilmek.
Video formatı ve çözünürlük detayları da henüz net değil; 4K/8K profesyonel videoları destekleyip desteklemeyeceği, daha çok YouTube Shorts için mi tasarlandığı merak konusu.
OpenAI’nin Sora’sı bir yenilik olarak ortaya çıktı ve bazı etik sorunları gündeme getirdi. Google Omni’nun da benzer riskleri nasıl yöneteceği ilerleyen haftalarda belirlenecek.
Yorum Yap