O kadar hızlı değişiyor ki her şey. Ve o kadar hızlı normalleştiriyor ve kabulleniyoruz ki. Akıl alır gibi değil. Bundan çok değil, 20 sene önce birileri bize “bir gün bir model çıkacak, aklına ne geliyorsa yazacaksın ve sana daha önce hiç üretilmemiş bir görsel üretecek, video oluşturacak, sınırın sadece hayal gücün olacak” dese inanmakta güçlük çekerdik herhalde. Midjourney’den, DALL-E’den, Stable Diffusion’dan bahsediyorum. Ne kadar çabuk normalleşti değil mi? İnanılmaz değiller mi? Yani. Bazen saatlerce bu modellere hayal gücümün tüm kuytu köşelerine kadar inip zorlayabildiğim kadar zorluyorum ancak her seferinde onlar beni şaşırtmaya devam ediyor. Bazen hayal ettiğim ama tam anlatamadığım tasarımları da gösterip sanki zihnimin derinliklerine gizli bir pencereden bakıyormuş hissi de yaratıp hafiften ürkütüyor beni.
Sonra tabi o aynı soru geliyor akla. Ama nasıl? Nasıl yapıyor bunu? İşte bu sorunun cevabı çok acayip kapılar açıyor bize. bu yazıda vereceğimiz cevaplar da bazı felsefi, etik, ahlaki, sosyolojik ve daha birçok tartışmayı ilgilendiriyor. Bu cevapları verirken “yapay zeka ile üretilen görseller sanat mıdır? Bu görselleri üretirken kullandığı verileri nasıl çalıyor? Bunu yaptığı için cezalandırılmalı mı? Veya artık trilyon dolara ulaşan şirketler gelirlerini bizimle paylaşmalı mı? Gibi birçok sorunun da cevabını birlikte tartışacağız.
Hikayenin sıfır noktası aslında bilgisayarların gördüklerini anlatmaya başlaması. Hatta o makaleyi de göstereyim size. Bundan çok uzun süre sonra “her şey o makaleyle başladı” diye anlatılacak makalelerden biri. “Oriol VİNYALS, Alexander Toshev ve Dumitru Erhan isimli araştırmacılar “Show and Tell: A Neural Image Caption Generator” isimli bir makale yayımlıyorlar. Temelde bir modelin görsellere bakarak bunların “doğal dil ile açıklamalarını” yazabilmesinden bahsediyor bu çalışma. Farklı sinir ağları türlerini kullanarak bilgisayara bakmasını ve gördüğü şeyi anlatmasını öğreten bir model bu. Bu gerçekten de büyük bir kırılma noktası, zira bu aşılması imkansız gibi görünen bir duvarı yıkıp geçecekti. Derin öğrenme dediğimiz şey ile yapay zeka görselleri algılama konusunda çok iyiydi. Dilimizi de anlayabiliyordu. Ama bu ikisi tamamen ayrı becerilerdi. İşte bu çalışma ile beynin iki ayrı kısmını birleştiren corpus collosum gibi bir bağ ortaya çıkacaktı.
Evet. Bu çok önemli bir çalışmaydı fakat asıl hikayeyi başlatan çalışma da bundan tam bir yıl önce 2014 yılında çıkacaktı. Ian Goodfellow ve arkadaşları “Generative Adversarial Nets” başlıklı bir çalışma yayımlayacaklardı. Bu çalışma ile de önemli yapay beyin olarak niteleyebileceğimiz sinir ağlarında başka bir köprü daha inşa edilmişti. Bir üretici ve bir değerlendirici ağ aynı anda eğitilerek üreticinin ürettiği görselleri değerlendirici aynı anda değerlendiriyor ve modeller akıl almaz gerçekçiliğie sahip görseller üretiyordu. Bizim yavaştan nasıl aradan çekildiğimizi fark ediyorsunuz değil mi? Çünkü bu modeller için yarışmalar düzenlenir, binlerce insan birlikte çalışarak görselleri etiketler, açıklamalar yazarlardı. Artık bizlik bir durum kalmamıştı. Biz sadece bir yerde yemek yediğimizde fotoğrafını çekip instagrama atalım yeter duruma gelmiştik. Makineler her şeyi yapıyorlardı.
Yani evet. Artık makineler gördüklerini anlatabiliyor, konuştuğumuzu anlayabiliyorlardı. Ve üstüne bu yeteneklerini fark edenler bir şeyi daha deneyip: bu makineler gördüğünü anlatabiliyorsa anlattığımızı da görselleştiremez mi diyerek basıyorlar düğmeye… İlk denemeleri göstereyim mi size? Yeşil bir okul otobüsü var burda. Yani. Sonra burda bir uçan fil var. Burada da çimen üzerinde bir klozet. İlk denemeler için fena değil diyeceğim ama. Fena yani. Ama tabi bu neyin tohumuydu? İşte bunların… Nereden nereye değil mi? Hem de 5 yıl bile geçmeden. Eksponansiyel büyüme derken bundan bahsediyoruz. Pandoranın kutusu açılmıştı bir kere…
2021 yılında da biz gördük bu kutudan çıkanları. OpenAI Dall-E’yi duyurdu. Sonra Midjourney geldi. Sonra Stable Diffusion… Şimdi. Bu modellerin çıktığı pandoranın kutusunun bazı gizli ve karanlık sırları var. Modelleri yaratanların halının altına süpürdüğü, konusunu açtığınız zaman kulaklarını kapatıp saçma sesler çıkarmaya başladıkları sırlar bunlar. Bunlara geleceğiz ama benim merak ettiğim ve sizin de merak ettiğinizi düşündüğüm bir konuyu açıklamaya çalışalım önce. Bu modeller, birkaç kelimelik bir komuttan nasıl bu şekilde inanılmaz görseller oluşturabiliyorlar? Bu gerçekten de sihire çok yakın bir şey.
Önce tabi devasa bir veri setine ihtiyacınız var. Ama öyle böyle değil. Geleceğiz bu konuya ama korkunç miktarda bir veri setine ihtiyacınız var. Basitçe süreç de şu şekilde işler: VERİ SETİ – DERİN ÖĞRENME ALGORİTMASI – ÇOK BOYUTLU BİR KATEGORİZASYON ALANI – DİFÜZYON veya DAĞILIM VE SONUÇ… Veri setlerini nereden ve nasıl aldıklarını konuşacağız demiştik.
Bu süreçte Derin Öğrenmenin veri setlerindeki görselleri nasıl değerlendirdiğini anlamamız gerekiyor. Siz bir manzara resmine baktığınızda bütünsel bir resim görürsünüz. Makineler için bu farklıdır. Her görsel, her fotoğraf, her çizim sayısız pikselden ve piksellere atanan kodlardan ibarettir. Makineleri dünyayı sıfır birler şeklinde gören Matrix’teki NEO’ya benzetebilirsiniz. Bu görsellerdeki pikselleri sayısız kez tekrar tekrar karşılaştırdıktan sonra o ÇOK BOYUTLU ALANDA bizim aklımızın almayacağı bir düzen inşa eder. O alan gerçekten de bilim kurgudan çıkmış gibidir. Bir 500 küsür boyutlu evren gibi. Bizim isim dahi bulamadığımız karakteristik özelliklerden oluşan bir tür piksel çorbası gibi. İşte burada renklerden dokulara, ışıklandırmadan duygulara kadar bahsettiğimiz gibi 500ün üzerinde boyuta sahip bir sınıflandırma sistemi var ve işte biz bir prompt yani komut yazdığımızda bu alanın herhangi bir noktasına işaret ediyoruz. Model bizim komutumuzla bu alanda dolaşıp verdiğimiz komutun derinliğine göre bir nokta belirler ve işte difüzyon veya dağılım olarak bildiğimiz bu alanda gezinmenin sonucunda ortaya yavaş yavaş bir sonuç çıkarır. Bu alanın müthiş karmaşık ve akışkan olması nedeniyle de dikkat ederseniz hiçbir zaman aynı komutu verip aynı sonucu alamazsınız. Ve kullandığınız model hangisiyse onun veri setleri ile oluşturduğu o çok boyutlu alanın derinliği ve karakterine göre yine çok farklı sonuçlar alırsınız.
Gerçekten anlamaya çalışması bile insanı derin düşüncelere daldırırken insanlığın birkaç on yılda buralara gelmiş olması ve bundan sonra nereye gideceğini tahayyül etmek çok zor. Neyse. Gelelim kutudaki karanlık sırlara. Şimdi çok güzel. Harika bir model, insanın aklını başından alan bir çalışma mantığı var elimizde. Ama bunun kaynağı, hammaddesi nereden geliyor? Veri Setleri… Bu veri setlerinin içinde ne var peki biliyor musunuz? Siz varsınız. Yaptığınız, paylaştığınız her şey. Aileniz var. Çocuğunuz. Vesikalık fotoğrafınız. Doğmamış bebeğinizin internette paylaştığınız, ultrason fotoğrafı bile var.
İnsanlığın bugüne kadar ürettiği tüm fikri, sanatsal, sesli veya görüntülü tüm eserleri. Hepsi bu veri setlerinin içinde… Bu data setleri nereden geliyor peki? Elbette interneti kullanabilir önünüze ne gelirse toplayabilirsiniz. Fakat bunu asla yapmazsınız çünkü… internet. Çok bir şey söylemeye gerek yok. Kaliteli, doğru sınıflandırılmış, temizlenmiş, çok sağlam bir veri seti kullanmak istersiniz böyle bir şey için.
Bunun için de en bilinenlerinden biri LAION 5B isimli bir veri setini örnek verebiliriz. Bu Alman kar amacı gütmeyen bir girişimin oluşturduğu bir veri seti. İsmindeki 5B’nin de bir anlamı var. İlk paylaşıldığında en az 5 milyar görselden oluşan bir sete sahipti bu set. Buraya kadar sorun yok. Araştırma ve akademik kullanım amacı ile kurulmuş, veri toplayan, bunları temizleyen, sınıflayan bir girişim diye düşünebiliriz. Ama buradaki sorun şu. Bu veriler işte hepimizin verisi. Ve yine kendilerine “kar amacı gütmeyen” bir girişim Common Crawl da interneti “tarayıp” LAION’a görsel gönderiyor. Ve bu LAION 5B’nin finansmanını kim sağlıyor dersiniz? Stability.AI. Stable Diffusion’ın sahibi bir “şirket”. Bildiğimiz milyar dolarlık bir şirket. Ve buradaki asıl sıkıntı işte hepimizin verilerini kullanarak araştırma amacı ile veri toplayan bu şirketlerden bizim verilerimiz bir şekilde bu “ticari” şirketlere akıyor. Ve bu şirketler de daha sonra üyelik, satın alma, bağışlar vs. ile dolaylı olarak bizim üzerimizden para kazanıyorlar.
Tedarik Zincirini anlayabiliyorsunuz değil mi? Katmanlar arttıkça insanın ilgisi dağılabiliyor tabi ama ben buradaki problemi anlatmaya çalışayım size. Şu anda birçok dava ile de ayyuka çıkmış bir problem bu. Kara Veri Aklama… Evet. Veri yeni para birimi derken bunun aklaması olacağını da biliyorduk değil mi? Sizin bir anlamda paranızı alıp, bu parayla yatırım yapıp, milyar dolarlık ve ileride trilyon dolarlara ulaşacağı tahmin edilen şirketler kurup sizi… Pek de umursamıyorlar. İşte ikilemler burada karşımıza çıkıyor. Bundan ilk etkilenenler elbette sanatçılar. Birçok sanatçının eserlerini onların tarzı ile oluşturabiliyor bu sistemler.
Bu sanatçılar ise büyük bir zararla karşı karşıyalar ve maalesef elbette bugün bu hengame içinde onları kimse duymuyor. İleride bu modellerin sadece görsel tarafında değil birçok alanda sayısız mesleği gereksiz hale getirdiğinde ne olacak peki? Buradaki argümanlardan biri de şu. Elon Musk bunu çok dillendirir. Bu şirketler insanlara bir asgari ücret ödesin diyor. Vergilendirme buna göre yapılsın. Veya yeni kurgulanacak bir gelir paylaşım modeli. Henüz çok karanlıktayız, ama bir model bulunmalı diyor birçok kişi.
Ama tabi işin diğer bir tarafı da var. Bu modellere sağlanan veri setlerinin denetimi ve kontrolü sorunu. Bu setlerde yapılacak ufak tefek oynamalar birçok insanı, bir grubu, belirli bir ülkeyi veya coğrafyayı hedef haline getirecek, ayrımcılık yapacak, gelir dağılımını bile manipüle edecek bir kelebek etkisi yaratabilir. Bunun denetimini kim yapacak? Ve daha birçok soru. Konuştukça daha da derinlere ineceğimiz bir konu bu. Ama şimdilik bu sorularla bırakalım burada. Bazı kapıları açtık burada. Bazılarını ise açmak üzere işaretledik. Yeni dünyayı hep birlikte anlamaya çalışıyoruz. Takipte kalın. Hoşçakalın…




