Benim bebarbilim’i en temelde kurma motivasyonlarımdan biri özellikle 2010’larda hem öğrencilerimde hem de meslektaşlarımda geleceğin teknolojileri ve özellikle yapay zekanın geleceği konusundaki farkındalığın inanılmaz düşük olmasıydı. Bu konuda bir farkındalık yaratabilir miyim diye başlamıştım zira yine bundan 7-8 yıl önce yaptığım yapay zeka videolarını izleyenler de hatırlayacaklardır o zaman bugünlerin geleceğini konuşmuştuk. Ben 2030’lar diye öngörmüştüm o zaman ama işte buradayız. Geldik. Hadi uyanalım artık.
GPT-6 Astra duyurusu üzerine burada toplandık ama GPT-6 ile birlikte bugün tüm modellerin de az çok yapabildikleri üzerinden nasıl bir kırılım yaşandığını konuşacağız bugün. Greg Brockman, OpenAI’ın en tepesindeki isimlerden biri, hiç çekinmeden “AGI çağının başladığını” söylüyorsa biz de hiç çekinmeden bunun ne anlama geldiğini konuşacağız. Başlayalım o halde.
Şimdi sizi detaylarla boğmayacağım. Bir özet geçeceğim önce ne geldiğini anlayalım diye. GPT-6 Astra çok uzun süredir tüm kullanıcıların merakla beklediği bir modeldi. Kimine göre gereğinden fazla geç geldi ama geldi sonunda. Ne değişti peki? Şu an biz doğrudan erişemiyoruz o yüzden OpenAI’ın bize sağladığı bilgiler ve tabi ki “benchmarklar” üzerinden bir değerlendirelim. Özellikle bir iki tanesi çok acayip şeyler söylüyor bize. Öncelikle bu: ARC-AGI benchmarkı. Bu benchmarkın olayı şu: Modele daha önce görmediği birtakım soyut dünyalar veriliyor ama ne yapması gerektiği söylenmiyor. Modelin ortamı kurcalaması, kuralları kendi kendine çözmesi, hedefin ne olduğunu anlaması ve sonra da ona ulaşacak bir plan geliştirmesi gerekiyor. Yani mesele ezberlediği bilgiyi geri çağırmak ya da bir matematik sorusunu çözmek değil. Daha önce karşılaşmadığın bir yerde, “burada ne oluyor ve ben ne yapmalıyım?” sorusunun cevabını bulabilmek. İnsanlar bu testteki ortamların tamamını çözebiliyor.
Şimdi acayip olan yere gelelim. Bundan önce GPT-5.6 Sol aynı ARC-AGI-3 testinde yüzde 7,8 civarında kalıyordu. Claude Opus 5 geldi, çıtayı ciddi biçimde yükseltti ve yüzde 30,2 yaptı. Astra ise ARC’nin standart test düzeneğinde yüzde 62,7 aldı. Yani tek başına önceki en iyi sonucu ikiye katladı. Ama OpenAI’ın duyuruda öne çıkardığı sayı bundan da tuhaf: Modelin uzun süreli düşünme durumunu korumasına izin veren kendi test düzeneklerinde Astra yüzde 99,9 yaptı. Neredeyse testi bitirdi yani.
Üstelik mesele yalnızca doğru cevabı bulması da değil. ARC ekibi yaklaşık 500 insanla yaptığı karşılaştırmada Astra’nın seviyelerin yüzde 96’sında ortalama bir insandan daha az hamle kullanarak çözüme ulaştığını söylüyor. Ortalama olarak da yaklaşık yüzde 52 daha az hamle yapmış. Yani model artık sadece deneye yanıla sonunda çözmüyor. Ortamın nasıl çalıştığını anlayıp, kendi içinde bir model kurup, oldukça doğrudan çözüme gidiyor. İşte ARC-AGI sonucunu asıl ilginç yapan şey bu.
Bu tek başına “AGI geldi, konu kapandı” demek değil elbette. Ama birkaç ay önce modellerin zar zor ilerleyebildiği, özellikle de yeni bir şeyi ne kadar hızlı öğrenebildiklerini ölçmek için tasarlanmış bir testte böyle bir sıçrama görüyorsanız, Greg Brockman’ın neden “AGI çağının başladığını” söylediğini biraz daha iyi anlıyorsunuz.
Bir diğer sonuç da bence en az bunun kadar acayip. Çünkü birkaç ay önce bir kısa videoda anlatmıştım size. OpenAI’ın bir modeli ki bazı söylentilere göre bu bugün çıkan Astra olabilir, hugging face sunucularını hacklemişti. Olay olmuştu bayağı. GPT-5.6 Sol, güvenlik önlemlerinin kaldırıldığı bu deneylerde vakaların yüzde 56’sında altyapıyı ele geçirmeye çalışıyordu. İşte Astra’da iddiaya göre bu oran Yüzde sıfıra inmiş durumda. Açıkçası daha güçlü modeller yapmaya başladığımız şu dönemde görmek isteyeceğimiz sıfırlardan biri tam olarak bu.
Geri kalan benchmarklarda da tablo aslında aynı şeyi söylüyor. Astra, FrontierMath Tier 4’te yüzde 97,6’ya çıkıyor; yani en zor matematik problemlerinde neredeyse tavana dayanıyor. Ama bence asıl önemli sonuç bu bile değil. Terminal-Bench Science’ta yüzde 22,4’ten 64,6’ya, gerçek bilgisayar ve terminal görevlerini ölçen Terminal-Bench 4.0’da yüzde 37,3’ten 57,9’a çıkıyor; kaynak kodunu görmeden bir yazılımın nasıl çalıştığını çözmesi gereken SRE-Bench’te de tek denemede yüzde 88, birkaç denemede yüzde 99,2 başarı gösteriyor. Yani burada görmemiz gereken şey “yapay zeka artık daha iyi soru çözüyor” değil. Model artık araç kullanıyor, araştırma yapıyor, kod çalıştırıyor, hata ayıklıyor, bir sistemi çözümleyip uzun süreli bir işi baştan sona götürebiliyor. Benchmarklardaki asıl kırılım zekanın cevap üretmekten çıkıp iş yapmaya başlaması.
Şimdi benim gelmek istediğim yer de tam olarak burası. Yıllar önce gelmesinden hem korktuğum hem de heyecan duyduğum yer. Şimdi AGI dediğimiz şey için herkesin kabul ettiği tek bir tanım yok ama en kaba haliyle şunu kastediyoruz: Bir insanın yapabildiği zihinsel işleri genel olarak yapabilen, bunları farklı alanlara taşıyabilen ve zamanla insan performansının da üzerine çıkabilen bir sistem. OpenAI’ın kendi tanımı biraz daha somut hatta: İnsanlardan daha iyi şekilde ekonomik değeri olan işlerin büyük bölümünü yapabilen yüksek derecede otonom sistemler.
Ve bence burada çok ilginç bir şeyi unutuyoruz. Biz kendimizi acayip zeki canlılar olarak görüyoruz ya… Evet zekiyiz ama insanlığın hikâyesine uzaktan baktığınızda bizim numaramız yalnızca beynimizin içinde olup biten şey değil. Biz tool kullanıyoruz. Alet yani.
Üstelik alet kullanan tek hayvan da değiliz. Ama bizim yaptığımız şeyi farklılaştıran şey bunu birikimli hale getirmemiz. Bir taş başka bir taşı şekillendiriyor. Sonra ateş geliyor. Tekerlek geliyor. Yazı geliyor. Matbaa geliyor. Mikroskop, teleskop, buhar makinesi, bilgisayar geliyor. Ve insanın çıplak biyolojik kapasitesi aynı kalmasına rağmen yapabildiği şey sürekli büyüyor. Gözünüz Samanyolu’nun merkezini göremez ama teleskop görür. Kafanız saniyede milyarlarca işlem yapamaz ama bilgisayar yapar. Yani insan zekasının medeniyet kuran kısmı biraz da şu: Doğru aracı bulmak, nasıl kullanıldığını öğrenmek ve amacımıza ulaşmak için o araçları birbirine bağlamak.
İşte Astra’nın “bilgisayar kullanımında” %90’ların üzerinde başarı göstermesi benim için herhangi bir benchmarktan çok daha önemli. Çünkü bugüne kadar yapay zekaya iş yaptırırken çoğunlukla aracı biz kullanıyorduk. Excel’i biz açıyorduk. Dosyayı biz yüklüyorduk. Tarayıcıdan bilgiyi biz buluyorduk. Unity’de objeyi biz yerleştiriyorduk. Model bize ne yapacağımızı söylüyordu. Şimdi model kalkıp kendisi kullanmaya başlıyor.
Astra ekrandaki arayüzü görüyor, hangi butona basması gerektiğini anlıyor, browserda araştırma yapıyor, formları dolduruyor, CRM’de kayıt güncelliyor, takvim düzenliyor, dosyaları açıyor, bilimsel veriyi analiz edip grafik çıkarıyor, site oluşturup ardından siteyi kendisi test ediyor. Hatta ekranda bir problem gördüğünde yazılım yükleyip test edebiliyor ve sorunu çözmeye çalışabiliyor.
Ve burada artık “Excel’de hücre dolduruyor” gibi oyuncak işlerden bahsetmiyoruz. Astra’ya bilgisayarı veriyorsunuz; gidip Power BI’da dashboard hazırlıyor, vergi formunu dolduruyor, hukuki bir belgenin biçimini düzeltiyor, internette çocuk doktoru arıyor, ev ilanlarını karşılaştırıyor, uygun randevuyu buluyor. Yani tek bir uygulamada tek bir komut değil. Bizim gün boyunca sekmeler arasında geçerek yaptığımız gerçek ofis işlerini, kendi başına zincir halinde yürütmeye başlıyor.
Unity örneği daha da çarpıcı. Astra’yı oyun motorunun içine bırakıyorlar. Sahneyi açıyor, objeleri yerleştiriyor, oyunu çalıştırıyor, sonra gerçekten oyunu oynuyor. Bir şey yanlışsa bunu ekrandan fark ediyor, geri dönüp değiştiriyor, tekrar çalıştırıyor, tekrar oynuyor. Yani bir insana “şuraya şu objeyi koy” diye tarif vermiyor. Bizzat geliştirici koltuğuna oturup yapıyor, test ediyor ve kendi yaptığı işi düzeltiyor. Aynı prototipten üç farklı oynanabilir oyun çıkarabiliyor ve önceki modele göre insanın elle müdahale etmesi gereken noktaları yaklaşık yarıya indiriyor.
Yani ne oluyor biliyor musunuz şu an? İşte bana göre burada “AGI geldi mi gelmedi mi?” tartışmasının biraz yön değiştirmesi gerekiyor. Çünkü artık kendi geliştirdiğimiz bir araca, artık neredeyse bizi tanımlayacak hale gelen araçları teslim ediyoruz. Kendi kuyumuzu kendimiz kazıyoruz gibi. Kelimenin tam anlamı ile yapabildiğimiz her şeyi yapabilecek bir şey var karşımızda. Bir Skynet senaryosu bekliyor herkes biliyorum ama Skynet beklentimizi biraz değiştirmemiz gerekiyor sanırım. Konu artık makinelerin ne yapacağı değil zira. Her şeyi onlar yaparken “biz ne yapacağız” sorusunu sormaya başlamamız lazım.
Zira artık bilgisayarın başına başka bir çalışan koyduk. Artık tek bir eşik kaldı. Bunu uzun süre sürdürebilmesini sağlamak. Model şu anda bir işi birkaç adım boyunca götürebiliyor, hata yaptığında toparlanabiliyor, araç değiştirebiliyor ama uzun süreli görevlerde hâlâ sapıtabiliyor, hedefi kaybedebiliyor ya da insan müdahalesine ihtiyaç duyabiliyor. Ama bunu bir saat değil de bir gün boyunca güvenilir şekilde yapabildiğini düşünün. Sonra bir hafta.
Sabah görevi veriyorsunuz. Araştırmasını yapıyor, insanlara mail atıyor, cevapları takip ediyor, Excel dosyasını güncelliyor, kodu yazıyor, test ediyor, raporu hazırlıyor ve sadece gerçekten karar vermeniz gereken noktada size geliyor. Yani. Şimdilik geliyor. İşte sorun da burada… Karar aşamasında da bizi es geçtiği bir senaryo düşünün şimdi. Pek hoş bir senaryo değil değil mi? Tabi ki korkutmak değil amacım. Ne yaptığımızı iyi kavramamız lazım. Nasıl bir bedelin bizi beklediğini. Zira bu modellerden tek bir tane değil, aynı anda onlarcasını, yüzlercesini çalıştırabildiğiniz zaman. Dünya neye dönüşecek sizce. Bize ne olacak?

