15 Şubat 2024. Bu tarihi de bir kenara not edelim. Son zamanlarda not defterimiz dolmaya başladı farkındayım. Tarihi günler peşpeşe geliyor. Ama siz yine de buna yeni bir sayfa açabilirsiniz. Bir bomba düştü 15 Şubat’ta. Şöyle bir sis dağılsın da net bir şekilde görelim istedim ben de. İlk heyecanla insan net göremiyor her şeyi. Ne oldu peki? OpenAI Sora modelini duyurdu. Metinden video üreten modelini. Ondan birkaç saat önce Google Gemini 1.5’u duyurdu. Pek konuşulmasa da Mistral Next diye bir şey de çıktı bir yerlerde. İyi de niye bu kadar olay oldu? Konuşmayan yok şu an bunları. Neden peki? Bunlar ne anlama geliyor? Neler bizi bekliyor?
Simülasyonun hangi aşamasındayız? Gelin bakalım. Simülasyon dedim. Farkındayım. Sanayi devriminden bu yana makineleşme ile başlayan otomasyonun en derin, en temel gayesini sürekli hatırlamak gerekiyor. Önce makinelerle fiziksel gücün otomasyonu söz konusuydu, bugün ise yapay zeka devrimi 200 yıl önce başlayan bu amacının son halkası, zihinsel gücün otomasyonu aşamasına resmen geçmiş bulunuyoruz.
Fiziksel süreçlerin otomasyonu da sancılıydı evet fakat bir süre sonra kontrolü elimize almaya başlamış, nispeten yumuşak bir sosyo-ekonomik geçiş yaşamıştık. Makinelerin kapasitesi belli, yapacağı iş belliydi. Halisünasyon gören bir otomatik biçer-döver gördünüz mü hiç? İşte. Bugünkü devrimi benim gibi yakından takip eden kesimlerin de garip bir panik halinde olmasının sebebi tam da bu. Bu sefer süreç o kadar çok yönlü, o kadar kompleks, o kadar anlaşılmaz ki… Zihinsel gücün otomasyonundan da bu beklenirdi zaten. Beynin bir tür parçalı simülasyonu bugün yaşanan. Simülasyon demem de işte bu yüzden.
Önce zaten derin öğrenme, makine öğrenmesi vs. çok uzun süredir çalışılıyor, santranç gibi bir sürü oyunda makineler insanı geride bırakıyorken en nihayetinde kaçınılmaz son, dil modelleri ile birlikte bir eşik de aşılmıştı. ChatGPT, Dall-E filan. Ondan sonrası ip söküğü gibi. Ne oluyor yahu demeden bugün Sora’yı ve GPT-5’in yapabileceklerini konuşuyoruz.
Şimdi. Aslında bu video Gemini 1.5 ile alakalı olmalıydı biliyor musunuz? Evet. Google için üzülüyorum biraz. Yani. Az biraz. Çünkü cidden daha önce bahsettiğim Gemini’ı birkaç ayda daha da geliştirip birazdan detaylarına bakacağımız inanılmaz bir model çıkardılar ortaya. Bunu da duyurdular 15 şubat’ta. 10 milyon tokenlık bir bağlam penceresi olan acayip bir şey. Bugünlerde tüm Yapay Zeka medyası bunu irdeliyor olurdu. Ama OpenAI bu duyurudan birkaç saat sonra “pat” diye bombayı patlattı. SORA’yı duyurdu. Hem de bazı dedikodulara göre geçtiğimiz yılın Mart ayından beri cebinde tutuyormuş OpenAI bu duyuruyu. Ve gerçekten de bomba etkisi yarattı.
Ve abartanlar da hiç haksız değil biliyor musunuz? Şimdi lafı açılmışken Sora’ya bir girelim direkt. Sora bir metinden yüksek kaliteli oluşturan bir model. İyi de. Sayısız model yok mu bununla ilgili? Google geçenlerde Lumiere’i duyurmuştu? Pika var. Olay olmuştu o da. Runway var. Leonardo var. FinalFrame var. Var da var… Zaten piyasada bir sürü video oluşturan model varken Sora niye ortalığı karıştırdı?
Çünkü. OpenAI bir şey yapmış arkadaşlar. Tam arkaplanını bilmiyoruz ama. Bir şey yapmış. Farklı bir şey var burada. Birazdan spekülasyon yaparız ama ne dediğimi anlamanız için bir kedi videosunun az önce saydığım modellerle Sora’da üretilmiş halini bir karşılaştıralım isterseniz. Ne dediğimi anlayacaksınız. Bunlar Pika, Runway filan bunlarda üretilmiş videolar. Bu ise Sora’da… Detaylardaki ince işçiliği, gerçekçiliği, akıcılığı görüyorsunuz değil mi? İşte bu işte o yüzden bir iş var. Ne var? Şimdi OpenAI çok detaylı bir teknik dokümantasyon yayınlamadığı için yine burada bazı bağlantıları birlikte kurmamız lazım.
Sora öncelikle DALL-E 3 gibi bir difüzyon modelini ChatGPT gibi bir transformer yani dönüştürücü mimarisi ile birleştiren bir model. Bu karışım da ChatGPT nasıl metin üretiyorsa öyle video üretmeye yarıyor.
OpenAI’a burada ilham olan şey Google DeepMind’ın görsel dönüştürücüler ile ilgili çalışmasıydı. Bu sayede videoları veya görselleri aslında sanki piksellere ayrılmış bir yığın gibi düşünebiliyor. Ama işte bu kısmı OpenAI’ın paylaştığı kısıtlı teknik rapordan cımbızla çıkararak anlayabiliyoruz. Bir difüzyon dönüştürücü olduğu bariz. Yani DALL-E gibi görsel oluşturan difüzyon modellerin mimarisi ile ChatGPT gibi bağlantılar kurabilen dönüştürücü tabanlı modellerin gücünü birleştiriyor. Bunu ilk yapan da kendisi değil fakat işte bu bilinen tarife bir malzeme eklediğini bariz bir şekilde görüyoruz. Herkesin bildiği bir yemeğe bir usta şef bir şey ekler ve bambaşka bir şey olur o tadı kimse yakalayamaz. Şefin Özel Tarifi denir. Bunun gibi.
Ama tabi bu alanın gediklileri bazı hipotezler attılar ortaya. Kimine göre bu modelin eğitimi Unreal Engine 5 gibi oyun motorlarından geliyor. Tabi resmi ya da gayriresmi olarak beslendiği veri setleri de tartışma konusu. Etiketli, altyazılı, açıklamalı ve halka açık şekilde bulunan artık YT, Tiktok ne varsa kullandığını söyleyenler var. Sizin videolarınızdan izler bile olabilir bu videolarda. İzleyenler zaten bu Yapay Zeka Nasıl Görsel Oluşturuyor videosunda bu işin karanlık taraflarına bir göz atmıştık. Ve artık nasıl yaptıkları şu an için tam olarak bilinmese de sonuçlar bu şekilde.
Yani. Bunlardan bazılarının “gerçek olmadığını” düşünmek bile insanı düşündürüyor. Ama Sora bundan da fazlası bu arada. Doğrudan görsel beslediğinizde sabit bir fotoğrafı da “videolaştırabiliyor”… Ötesinde başka videolar verip bu videodan başka videolar üretmesini, döngü oluşturmasını, süresini uzatmasını ve hatta bu drone-kelebek örneğinde olduğu gibi bindirme yapmasını da sağlayabiliyorsunuz. Ve bir video modeli olmasına rağmen bazı kaynaklara göre Dall-e’den de Midjourney’den de daha iyi görsel oluşturma kabiliyetine de sahip…
Ve tüm bunları düşündüğümüzde Sora’nın birçok rakibinden sıyrılmasının sebebi tüm bunları çok daha genel ve ölçeklenebilir biçimde yapması. Bu ölçeklenebilirliğin açtığı kapılar ise inanılmaz. 1920X1080 geniş çözünürlüklü yatay ve hatta dikey videolar da üretebiliyor.
Ve daha da önemlisi “işlem gücünü” arttırdıkça video kalitesi de eksponansiyel olarak artıyor. Bu işlem gücü mevzusunu da ayrıca konuşacağız tabi. Büyük ihtimalle Sam Altman’ın 7 trilyon dolarlık bir kaynağa ihtiyacı olduğunu söylemesi de bu yüzden. Zira NVidia öyle bir tekele aldı ki bu tarafı. Bu alanda adım atmak için NVidia’nın eline bakıyorsunuz şu an. OpenAI’da buna çözüm arıyor. Neyse. Burayı açacağız demiştik.
İşte Sora’nın tüm bu yeteneklerini ve Will Smith’in spagetti yemeye çalıştığı şu videonun daha 1 yıl öncesine ait olduğunu ve daha 1 yıl içinde geldiğimiz yeri düşündüğümüzde kimine göre çok geçmeden tamamen yapay zeka ile üretilmiş filmler, diziler görmeye başlayacağız. Ama bu işte işin eğlence kısmı. Bu gerçeğinden ayırt edilemeyecek içerikler bir noktadan sonra bazı tartışmaları alevlendirebilir.
Bunlardan birisi şu. En başta bahsettiğim simülasyon tanımının en önemli örneklerinden biri “sora”. Birkaç yerde de bu benzetme yapılmış zaten. SORA bir “dünya simülatörü” deniyor. Evet. Çok ilkel belki ama… Yani dilerseniz “rüya fiziği simülatörü” de diyebilirsiniz bu yüzden… Ama türünün ilk örneği var karşımızda. Tek hücrelilerden doğan ilk kompleks organizma gibi.
Çünkü OpenAI’ın da tanıtımında söylediği gibi. SORA sadece verdiğiniz komuttaki stili, sahneyi, karakterleri, nesneleri ve kavramları anlamıyor. Bunların gerçekte de “nasıl var oldukları” hakkında çok iyi bir fikre sahip. Bunun da ötesinde Sora bu gerçeklikle dijital evren arasındaki bağı kurarken görünüşe göre “fiziksel yasalara da” hakim. Şu kahvedeki gemilerin hareketlerine dikkat edin… Ne demek istediğimi anlayacaksınız.
OpenAI’ın açıklamalarına biraz daha bakalım bu iddiamızı desteklemek için. Şöyle söylüyorlar. “Sora fiziksel dünyadaki insan, hayvan ve çevrenin bazı unsurlarını simüle edebilir. Bu özellikler arasında 3 boyutlu tutarlılık, nesne devamlılığı, yani örneğin bir cisim ekranda kareden çıksa bile orada var olmaya devam eder, ve bunun da ötesinde Sora dijital dünyaları da simüle edebilir. Bu minecraft dünyası da evet… Sora’nın hayali… Yani Sora aslında her şeyin ötesinde veriyle beslenen bir “fizik motoru”. Ve OpenAI’ın bir cümlesi de başka bir şeye işaret ediyor.
“Sora gerçek dünyayı anlayabilen ve simüle edebilen modeller için bir temel olacaktır. Bize göre “genel yapay zekaya” ulaşmak için önemli bir kilometre taşı bu.” Yani nereye gittiğimizi anlıyorsunuz. Genel Yapay Zeka… Bir tür “Matrix’e giriş”… Peki asıl soru. Oraya gitmek istiyor muyuz? Neyse. İşte bu toz dumanın arasında Gemini 1.5’un araya kaynaması çok doğal tabi. Ama hakkını teslim etmeden bırakamayız. Hepsine ayrı video ayıracak kadar da zaman yok görünüşe göre. Yarın Google karşı hamlesini yapabilir çünkü. Ya da bambaşka bir yerden başka bir şey çıkabilir. O yüzden Gemini 1.5’u da hızlıca özetlemek isterim size.
Aslında getirdiği en önemli yeniliği açalım o bile bize bir fikir verir.
Şimdi. Bugüne kadar ChatGPT ve benzeri modellerin en önemli sorunu “context-window” denen yani “bağlam penceresi” olarak bildiğimiz “algı kapasitesinin” düşük olmasıydı. Şöyle ki; bu tip modellerin tek seferde işleyebileceği belirli miktarda bir veri kapasitesi vardır. Çok genel bir örnek olarak bir model aynı anda “10.000” kelimeyi işleyip bu kadar veri ile çalışabilirken Gemini 1.5 burada çok büyük bir devrim yarattı. Sadece metin de değil. Gemini bir filmin tamamını baştan sona, 11 saatlik ses kayıtlarını, 700.000 kelimelik bir metni ki bu Harry Potter külliyatının tamamından fazlası demek veya 30.000 satırlık kodu tek parça halinde hatırlayıp böyle devasa verilerde çok daha düşük işlem gücü ile çalışabiliyor. Aslında bir anlamda “hafızası ve işlem gücü” ile birlikte “daha büyük bir beyne sahip” bir model sunuyor Gemini 1.5.
Bu elimizdeki tüm modellerden kat be kat daha “yetkin” bir model demek. Bu inanılmaz. Gerçekten inanılmaz. Google’ın da eli boş değil yani anlayacağınız. Ama başka bir pencere açıp bununla konuyu bağlayalım dilerseniz.
Şimdi Sora’nın sunduğu olasılıklardan bahsettik. Şimdi eğer izlemediyseniz daha önce Sam Altman’ın “bir canavar yarattık” dediği Q* projesini de katalım buraya. Ve şunu söyleyebiliriz. Sora aslında GPT-5 ile ilgili bir fragman gibi… OpenAI’ın elinde şu anda inanılmaz bir model veya bu modelin bir prototipi olduğunu düşünüyorum. Bundan önce GPT-4.5 filan gelecektir çok büyük ihtimalle ama kısaca şöyle söyleyeyim GPT-5 çıktığı zaman görüşelim mutlaka. İnsanlık için bazı eşikler bir daha geri dönülemez şekilde aşılacaktır. İşte böyle. Dijital evrenin toz bulutunda bugünlerde olanlar bunlardı.
Bu toz bulutunda daha çok parıltı göreceğiz birlikte. Bu toz bulutunda yeni yıldızların, galaksilerin doğuşuna tanık olacağız. Kısacası. Hakkımızda hayırlısı olsun demek lazım galiba 🙂 Takipte kalın.




