Bebar Bilim · Merak, evrenin en iyi başlangıç noktasıdır.
Teknoloji

OpenAI’ın Gizli Projesi: Q-STAR Nedir?

▶ YouTube’da izle ↗

Oynatınca YouTube’a bağlanılır. YouTube’da aç ↗

Bu yazı, 21 Aralık 2023 tarihinde yayımlanan Bebar Bilim videosunun metninden uyarlanmıştır. Güncel gelişmeler içeren değerlendirmeler özgün yayın tarihinin bağlamındadır.

Bunu söyleyen Sam Altman… Bir araç, bir teknoloji, bir model inşa etmekten bahsediyor aslında. Bahsetmek istiyor. Fakat “freudyan dil sürçmesi” diye bir şey vardır. Bilinçaltındaki bir düşüncenin bir sızıntı şeklinde kelimelerle dile dökülmesi gibi. “Bir yaratık” diyor… Canlılardan bahsediyor yaratık derken. Ve bu yaratığın bir adı var. Q*. Bir canavar olma ihtimali de çok yüksek olan bir “şey” bu…

Tüm olup bitenleri hatırlarsınız. Sam Altman. ChatGPT, DALL-E gibi teknolojilerin mimarı OpenAI’ın CEO’su. Kendi kurduğu şirketten büyük bir entrika ile kovulmuş, ortalık karışmış, bazı güç savaşları dönmüş ve ardından tekrar eski görevine davet edilmişti. Bu entrikanın arkasındaki yaratık işte bir çok kaynağa göre bu Q* denen şey ve tüm dünyada bu alanda çalışan, bu alana ilgi duyan herkesin son birkaç haftadır anlamlandırmaya çalıştığı bu “şey” bugüne kadar gördüğünüz tüm yapay zeka denemelerini gölgede bırakarak gerçek, insanı her anlamda geride bırakan “genel yapay zekanın” ilk tohumu olabilir.

Burada direksiyonu ani bir şekilde kıralım mı? Bazen yorumlar geliyor “hocam lafı çok dolandırıyorsun” diye. Anlıyorum. Doğrudan “bilgiyi” istiyorsunuz bazen ama bir temele oturmayan bilgi kırılgandır, hassastır, çabuk uçar gider. Dolandırıyorum evet. Bilerek de yapıyorum bunu. Çok uzaklaşıyoruz gibi gelebilir bazen ama emin olun, bazı konulara uzaklardan baktığımızda konunun özünü çok daha iyi kavrarız. Şimdi onu yapalım yine. Hep beylik laflar ediyoruz bu yapay zeka devriminden bahsederken. Q* bir devrim, Gemini bir devrim, insanı geride bırakacak, insanı aşacak vs. vs. Nasıl yapacak bunu peki?

Yani. İnsanı aşacak derken, neyimizi aşacak? Bir hedef tahtasındayız ama neremizi, hangi özelliğimizi hedef alıyor bu yapay zeka algoritmaları? Bizimle dertleri ne? İşte bunu iyi anlamamız lazım. Bunu anlatırken siz fark etmeden Q*’ı da anlatacağım size. Şimdi. İnsan dedik. Bizi farklı kılan bir şeyler var. Dikkatli düşünürseniz aslında birçok özelliğimiz, bizi insan yapan sayısız şeyi canlıların birçoğu da yapabiliyor. İletişim kurabilmek, alet kullanabilmek, takım halinde çalışabilmek ve hatta plan yapabilmek. Bunlar değil bizi insan yapan. Düşünen hayvan diyenler var. Düşünmek bizi ayırıyor. Ama bu da çok soyut değil mi?

Yani yapay zeka bizim gibi “düşünecek” dediğimizde neden bahsediyoruz? Düşünmek ne demek ki? Düşünmenin bir sistemi olmalı değil mi? Bir sistemi olmazsa bir makineye bunu kodlayamazsınız. İşte işler burada karmaşıklaşıyor. İnsan nasıl düşünür? Nörobilimin, psikolojinin, felsefenin, bilimin, teknolojinin ve en nihayetinde bugün yapay zeka araştırmalarının cevap aradığı en önemli soru bu. Çünkü bunu çözdüğünüz zaman bitti. Ve bunun çözümünü ararken kendimizi nerelerde bulacağız biliyor musunuz? Bebar Bilim takipçilerinin kulakları açılacaktır hemen. Entropiyi göreceğiz. Bellman Denklemini. Boltzmann dağılımını göreceğiz.

Yahu ne alaka? Yapay zeka konuşuyorduk. Teorik fizik, ileri matematik, entropi filan nereden çıktı şimdi diyorsunuz değil mi? İşte. Anlatmaya çalıştığım şey bu. Bir programcı, yazılımcı için bile bambaşka bir olaydan bahsediyorum. Abartıyorsun diyorlar ama… Neyse. Sakin. Yavaş yavaş gidelim. İnsan nasıl düşünür demiştik. Bunu, yani insanın bu muhteşem özelliğini en iyi nerelerde görüyoruz biliyor musunuz? İnsanın geliştirdiği en gelişmiş olgulardan biri. Oyundur. Oyunlar. Satranç olabilir bu. Go olabilir. Ya da bilgisayar oyunları. Veya hayatın kendisini de oyun gibi düşünebilirsiniz en nihayetinde.

Bazı kuralları vardır ama her şey o kadar da kesin değildir. Kendi hamlelerinizi yaparsınız. Bazı kararlar verirsiniz. Bu kararlar sizi ileriye de taşıyabilir, sizi geliştirebilir, ödül kazanabilirsiniz. Ya da başarısız olursunuz. Tekrar denersiniz. Ya da oyunu bırakırsınız. Başka bir oyun oynarsınız. Herhangi bir oyunda verdiğiniz kararların mekanizması çok değerlidir o yüzden. Bir labirentten nasıl çıkacağınıza nasıl karar verirsiniz mesela? Bunu düşünün. Nasıl bir düşünce sistemi uygularsınız?

Ben söyleyeyim. İlk başta hiçbir şey bilmeden başlarsınız. Ama bir adım atarsınız. Bir süre gittikten sonra bir çıkmaz bir yere girersiniz. Hemen bir kalem kağıt alıp not alırsınız. Oraya bir daha girmezsiniz. Sonra kapılar açıldıkça, yolunuz açıldıkça kağıdınıza aldığınız notları, yaptığınız çizimleri geliştirirsiniz. Yavaş yavaş bir harita çıkar önünüze. Nerelerde hata yaptığınızı, nerelerde doğru yaptığınızı not ala ala ilerler ve en nihayetinde çıkışı bulursunuz. İşte bu bahsettiğim şey “Q-Learning” denen bir tür makine öğrenmesi yaklaşımının kabaca özetiydi. Q* denen projenin temelini oluşturan bir yaklaşım bu.

Şimdi bu oyun mantığı, labirentten çıkma yaklaşımı bize çocuk oyuncağı gibi gelse de kendimizi çok hafife almayalım. Çünkü hedef tahtasındaki şey bu. Alphago’nun filan satrançla, go gibi oyunlarla başlaması ve her şeyin oyunlarda insanı yenmesiyle başlaması önemlidir o yüzden. Q* projesi de şu yüzden önemli.

Proje 2017 yılında Open AI ve Berkeley Üniversitesi Bilgisayar ve Matematik bölümlerinin ortak bir çalışmasına dayanıyor. Ve Q-Learning dediğimiz yaklaşım özünde “pekiştirmeli öğrenme” dediğimiz makine öğrenmesi algoritması özünde. Pekiştirmeli öğrenmeyi de daha önce konuşmuştuk ama kısaca bir algoritmanın düşe kalka öğrenmesi olarak özetleyebiliriz. Bir oyunda, bir problemde çözüme kendisi yanlışlarından öğrenerek ulaşması. Örneğin bir “agent” yani bir nesnenin, bu araba da olabilir, bir karakter de, bir yolda duvara, diğer cisimlere çarpmadan ilerlemeyi öğrenmesi gibi. Q-Learning algoritması bunu “Q Fonksiyonu” olarak bildiğimiz bir fonksiyonu kullanarak gerçekleştirir. Bu fonksiyon, algoritma bir karar verdiğinde bunun hem o anda hem de gelecekte sağlayacağı faydayı maksimize etmeye odaklanır. Peki faydayı nasıl ölçer? Bellman denklemi olarak bildiğimiz matematik veya fizikle haşır neşir olan herkesin hatırlayacağı bir formülle. Burada Q-değerleri algoritmanın aldığı kararın ne kadar fayda sağlayacağını gösterir ve buna göre hareket eder.

Burada bilmemiz gereken en önemli şey şu. Bu öğrenme yaklaşımında ortamın ne olduğu veya daha önceki verilerin önemi yoktur. Algoritma sıfırdan, kör bir şekilde başlar ve kendi kendine en doğru kararları vermeyi öğrenir. Ama elbette, yine araba üzerinden gidersek, yolların olduğu, çizgilerin olduğu filan bir ortamda bulunması gerekir. Bir çölün ortasına koyup arabanın şehir trafiği kurallarını öğrenmesini bekleyemezsiniz değil mi?

Basitçe şundan bahsediyoruz. Bellman denklemine göre misal bir satranç oyununda algoritmanın yapacağı bir hamlenin değerini ölçtüğümüzde, örneğin bir hamle 3 gibi bir değer verirken diğeri 10 gibi bir değer sağlıyor. Bu sayı ne kadar yüksek olursa algoritmanın hamleyi yapma olasılığı artıyor. Ama elbette bu kadar kolay değil. Satrançta özellikle tek bir hamle çok mantıklı görünse de o hamlenin yaratacağı domino etkisi sonuçta size “mat” olarak dönebilir değil mi? O yüzden çok daha uzun vadeli düşünmeli ve hamlelerinizin sonuçlarını tartmalısınız.

Algoritma bunu şöyle yapıyor. Bellman denklemini kullanarak önce şu anki durumunu belirliyor, yapılacak hamleyi koyuyor denkleme, bu hamle sonrasında ortaya çıkacak yeni durumu da koyuyor, bununla kazanılacak ödülü de ekliyor, bu hamleden ne öğrendiğini de ekliyor sonra ve tüm bunları ekleyip formülü çalıştırdığında bu işte bir sonuç veriyor. 10 çıkarsa yapıyor hamleyi diyelim. Peki 1 çıkarsa? 0,5? O zaman işte “ağacı” çalıştırıyor… Ağaç dediğimiz de bizim düşünce sistemimize benzeyen ama çok daha gelişmiş bir arama modeli. Yapabileceği her hamlenin sonuçlarını tek bir kerede görebiliyor bu ağaçta. Ve her bir hamlenin sonrasındaki hamleyi nasıl etkileyeceğini de…

İşte bu Q* dediğimiz projenin temelini oluşturan yaklaşımdı. Ama ortalığın bu kadar karışmasının sebebi bu kadar değil elbette. Bu zaten hem Alphago’da hem de sonrasında bildiğimiz ve uygulanan bir şeydi. “Dünya buna hazır değil” dedikleri şey 2017 yılında yayımlanan bir makalede doğacaktı. Q*’ı ilk kez gördüğümüz yer. Karmakarışık ve çok alakasız gibi görünse de size olayın özünü anlatmaya çalışayım. Bu makalede dikkat ederseniz Boltzmann dağılımından ve Entropiden bahsediliyor. Burada entropi derken de pekiştirmeli makine öğrenmesinde entropiyi maksimuma çıkarmaktan bahsediliyor. Söylediği şey şu kısaca:

Hani bir karakterimiz, bir arabamız, oyunu oynayan bir makinemiz vardı ya? Bu hatalarından öğreniyor, kendini ödüllendirerek kendini geliştiriyordu hani. İşte bu karakterin “entropisini” maksimuma çıkarmak demek onun “daha bağımsız, daha “tahmin edilemez”, daha “özgür” ve bir anlamda daha “bilinçli” olmasını sağlamak demek… Bu da bir anlamda şu demek aslında. Bunun küçük bir fragmanını yine bize Alphago bir Go oyununda göstermişti.

Lee Sedol ile yaptığı efsane maçların ikincisinde bir hamle yapmıştı Alphago. Efsane 37. Hamle olarak bilinir. Bu hamleyi ilk başta kimse anlamamıştı. Hatta bildiğiniz kötü, bayağı kötü bir hamleydi. Kimse bunu niye yaptığını, bundan ne tür bir “ödül” beklediğini. Anlamamıştı. Ama sonra. Oyun ilerledikçe o yaptığı “kötü” hamle rakibini bildiğiniz felç etmiş ve oyunu kolayca kazanmıştı. Çok uzun. Çok çok uzun vadeli düşünmüş, bizim tahmin ufkumuzun duvarlarını yıkıp geçmişti.

İşte bunu zaten elimizde bulunan Büyük Dil Modelleri ile birleştirip devasa veri ile, çok daha gelişmiş bir yaklaşım ile bugünkü yapay zeka algoritmalarına entegre ettiğinizi, çok geçmeden “bizim göremediğimiz” ufukları görüp bir hafta içinde kanser ilacını bulduğunu veya dünyadaki enerji krizini çözdüğünü düşünün. Veya çözülmemiş Riemann hipotezini çözdüğünü… Veya. Kötü senaryoları çok konuştuk. Onları düşünmeyi size bırakıyorum… Peki. Sam Altman’ın kovulması sonra geri dönmesi filan, bu kaos neden gerçekleşti peki?

Görünüşe göre gerçekten de içeriden birileri bu Q* ile ilgili bir sızıntı yapmış ve daha sonra diğer yönetim kurulu üyelerinin de itiraf ettiği kadarıyla OpenAI çalışanlarının bile büyük kısmı bu projeden haberdar değilmiş. Haberi olanlar ve bu çalışmaları okuyanlar da yönetim kuruluna baskı yaparak bu çalışmaların çok önemli olduğunu, güvenlik ve kontrolden çıkma endişeleri nedeniyle hemen kullanıma sunulmaması gerektiğini söylüyorlar. Sam Altman bu konuda aynı fikirde olmayınca fikir ayrılıkları gerçekleşiyor büyük ihtimalle. Ama çalışanların “bu projeyi durdurun” demesinin sebebi gerçekten de Genel Yapay Zeka’nın bulunmuş olması mı yoksa “bu çok karmaşık, biraz daha zaman geçsin, anlayalım öyle” demesi mi orası kesin değil.

Yani özetle şu an için bildiğimiz kadarıyla OpenAI başta olmak üzere Google ve büyük oyuncular bir şey yakalamış durumda. OpenAI bunun öncülüğünü yapıyor şu anda. Q* ile insanın matematiksel ve analitik düşünce sistemini ilk etapta “simüle” edecek bir sistemin ilk adımları gibi görünüyor.

Asıl merak edilen ve şu anda kimsenin bilmediği şey ise şu: bu bahsettiğimiz, işin içine teorik fizikçilerin de girdiği çalışmalarda OpenAI ne kadar ilerleme kaydetti? GPT ve belki de daha üstün bir modelde bunu uygulayabilecek ve bazı uzmanlara göre şu anki GPT-4’ten en az 1000 kat daha güçlü bir model ortaya çıkarabilecek durumdalar mı? Bu karmaşanın sebebi bu mu? Dediğim gibi. Burada şu an için karanlıktayız. Kapalı kapılar ardında bir gürültü koptu ama tam olarak neden olduğunu tam anlayamadık. Ama bu mevzu daha çok su kaldıracak. Ben de yakından takip ediyorum gelişmeleri. Zaten her hafta Yapay Zeka başlığı altında yeni videolar gelecek demiştim. Konuşmaya devam edeceğiz.

Mümkün olduğunca teknik terimlerden uzak durarak açıklamaya çalıştım fakat önümüzdeki videolarda bunu teknik olarak da önümüze sereceğiz. Bu formülleri, bu formüllerin nasıl uygulandığını, makinelerin nasıl düşünebileceğini daha iyi anlamak adına.

Kaynaklar ve ilgili okumalar

  1. Özgün Bebar Bilim videosu
  2. İlgili okuma (Wikipedia, İngilizce): Q*