
Oynat düğmesine bastığında YouTube oynatıcısı yüklenir. YouTube’da izle ↗
Yapay zeka ile ilgili gelişmelerden ve özellikle ChatGPT ile birlikte tavan yapan kullanımdan bahsederken hep çok önemli bir konuya değinmeye çalışıyorum. Veri konusu. Yapay zeka algoritmalarının kullandığı veriler. Bu verilerin miktarı, kalitesi, nereden alındığı, bu veriler alınırken nasıl bir yol izlendiği filan tüm bu devrimi ve yapay zekanın geleceğini şekillendirecek bir mevzu. Çünkü veri dediğimiz şey tüm bu yaygaranın ham maddesi. O olmadan makinelerin egemenliğinden, sizin işinizi elinizden almasından filan bahsetmek safsatadan öteye geçmez. İşte. Bu konuştuklarımız bugün ete kemiğe büründü ve bizi bir yol ayrımına getirdi.
OpenAI’ı konuştuk, ChatGPT’yi biliyorsunuz zaten, LLM dediğimiz şeyin, yani Büyük Dil Modellerinin de ChatGPT’nin temeli olduğunu da defalarca söyledik. Ve en nihayetinde Büyük Dil Modellerinin de tüm verisini genellikle internette halka açık şekilde paylaşılan yazışmalar, makaleler, videolar, görsellerden aldığını da söylemiştik. Ve bugün geldiğimiz yol ayrımında bu konu OpenAI’ın başına dert açacak gibi görünüyor.
Olayın özeti şu: OpenAI, ChatGPT’yi eğitmek için bulabildiği tüm veri setlerini kullanıyor tabi. Bunların arasında New York Times isimli köklü bir gazetenin dijital arşivleri de bulunuyor. Görünüşe göre OpenAI New York Times’ın tüm arşivlerini çok rahat bir şekilde ChatGPT’yi eğitmek için kullanmış. Ve New York Times da geçtiğimiz aylarda bunu fark ediyor. Önce OpenAI ve Microsoft’la bunu konuşuyor. Artık ne istediler orası ayrı bir konu ama en nihayetinde çözüme ulaşamayınca kallavi bir dava açıyor. Yani milyar dolarlardan bahsediyoruz. Ama en önemlisi, birçok uzman da bunu söylüyor, bu davanın sonucu önümüzdeki süreçte yapay zeka ilerlemesini tamamen değiştirebilir. Bu dava yapay zeka devriminin karşı karşıya kaldığı en önemli davalardan biri. Ve tüm dünyada bu konuda büyük eksik bulunan yasaların çıkmasını, devletlerin bu konuyu çok daha kapsamlı ele almasını gerektirebilir. Ama daha da önemlisi. ChatGPT ve benzeri tüm araçların tamamen kapatılmasına kadar gidebilir olay. Bu da yapay zekanın geleceği açısından pek iyi haber değil. Peki. Gelin davanın detaylarına ve olası sonuçlarına bakalım birlikte.
Şimdi. Bu kez lafı çok dolandırmadan direkt konuya girelim 🙂 Söz konusu davanın dayanak noktası elbette fikri mülkiyet hakları ve telif hakkı yasaları. Bu konu zaten internetin ilk günlerinden beri hala tam olarak çözülememiş bir konu maalesef. Çünkü “bilgiye özgür erişim” bir tür paradoks ortaya çıkardı. Eriştiğimiz bilgilerin, videoların, içeriklerin sanki öylece var olduğu illüzyonu yaşayabiliyor insanlar bazen. Ancak bilgi paylaşımı, içerik, video, metin ve tüm fikri ürünlerin arkasında çok büyük emeklerin, ciddi bir zamanın, çok büyük bir işgücünün olduğu unutulabiliyor. Bu konu yasalarla da tam olarak çözülemediği ve bu fikri ürünleri üretenlerin hakları kesin sınırlarla tesis edilmediği için tabi gerek şahıslar gerekse şirketler bu açıkları istedikleri gibi kullanıyorlar. Bugüne kadar bunun sayısız örneğini gördük, bu şekilde zengin olanları vs. ama bu sefer öyle birkaç kişinin, bazı içeriklerin kopyalanması ve bazı isimlerin bundan fayda sağlamasının çok ötesinde bir şey var karşımızda. Yapay zeka teknolojilerine dayanan şirketlerin trilyonlarca dolar kar elde etmesi, kullandıkları verilerle yeni dünyayı inşa etmesi, bir tür tekel haline gelmesi ve telifli verileri kullanarak üstüne insanları ve daha büyük çapta devletleri manipüle etmesi söz konusu olunca işler ciddiye bindi tabi.
New York Times’ın geçtiğimiz süreçte OpenAI’ın ChatGPT ürününe yönelik açtığı davada da durum bu. Doğrudan dava dosyasında şu ifadeleri kullanıyor New York Times avukatları: “Savunma tarafı (OpenAI) fikri mülkiyet haklarımızı korumayı reddetmişlerdir. Bunun üzerine Times’ın içeriklerini kullanan Büyük Dil Modellerine dayanan Üretken Yapay Zeka araçları Times’ın içeriklerini kelimesi kelimesine kullanarak veya çok yakın bir şekilde özetleyerek yahut anlatım dilini kopyalayarak içerikler üretmektedir. Daha da vahimi, bazı durumlarda ürettiği yanlış bilgileri de Times dergisine atfetmektedir. Söz konusu iddialarla ilgili örnekler ektedir…”
Bu cidden çok büyük bir sorun. Doğrudan içeriğin kopyalanması ayrı bir sorun, ürettiği yalan yanlış sonuçları Times’a atfetmesi ayrı büyük bir sorun. Ki dava dosyasında bahsettikleri ekteki örneklere de şöyle hızlıca bir bakarsak solda ChatGPT’nin ürettiği metinler ve sağda da Times’ın makalelerinden kesitleri görebilirsiniz. Kırmızı ile işaretlenmiş olanlar doğrudan makalelerden kopyala-yapıştır şeklinde karşımıza çıkıyor.
Şimdi burada Times’ın argümanını iyi değerlendirmek gerekir. Çünkü aklımıza şey gelebilir: “yani ne var kullandıysa kullandı, ne var ki bunda?” diyebiliriz. Fakat Times yine dava dosyasının bir bölümünde şundan bahsediyor: GPT-4’ün doğrudan kopyaladığı haberlerden, röportajlardan bazıları için milyonlarca dolar harcayarak bazı durumlarda savaş bölgelerinde muhabirlerimizi görevlendirdik, bunlar için lojistikten ulaşıma kadar yığınla kaynak harcadık ve üretilen haberler bu büyük çabaların bir sonucu. Bu tip kullanımlar gazeteciliğe, haberciliğe ve en nihayetinde özgün içerik üreticiliğine büyük zarar verebilir.
Tabi şirketin ötesinde bu haberleri ve röportajları yapanlar da haklarını arama yoluna şahsen gidecek gibi görünüyor. Tabi davada Microsoft’u da ayrı tutmuyor Times. Bing’te örneğin bir konu ile ilgili bilgi aradığınızda doğrudan Times’ın makalesini kopyalayıp önünüze koyabiliyor. Bu elbette kullanıcının makalenin orijinaline tıklamasını, bunu okumak için üyelik satın almasını filan önlüyor. Ciddi bir para kaybından bahsediyoruz anlayacağınız.
Times’ın yine dava dosyasında önümüze koyduğu temel argümanlardan biri de şu: Birçok kaynağı kopyaladığını biliyoruz fakat GPT-4’ün eğitiminde özellikle bizim makalelerimize öncelik verdiğini görüyoruz. Çünkü bizim içeriklerimiz güvenilir, doğrulanmış kaynaklar. Tabi bazı sayılar da vermişler. Görünüşe göre GPT-4’ün veri setinde Times’ın 209.707 benzersiz bağlantısı bulunuyormuş. Bu da tüm kaynakların %1,23’üne denk geliyor. Oran düşük gibi gelebilir ancak veri setlerinin büyüklüğünü düşündüğümüzde ciddi bir oran bu.
Bir de tabi OpenAI’ın kuruluş felsefesine de bayağı bir saldırıyorlar dava dosyasında. Önceki videolarda bahsetmiştik izleyenler hatırlar. OpenAI kuruluş ilkelerinden ödün mü veriyor demiştik. İşte Times da yine burada kar amacı gütmeyen bir kuruluşun birçok kişi ve kuruluşun telif hakkı ile korunan içeriklerini izinsiz kullanarak bugün 90 milyar dolarlık bir şirkete dönüşmesi büyük bir aldatmaca diyorlar. Buradaki temel sıkıntı ne biliyor musunuz? Elon Musk’a tabi burada hemen atıf yapabiliriz. Kişisel olarak sorunu olduğunu biliyoruz OpenAI ile, ve bu dava ortaya çıkmadan önce bir röportajda şöyle söylemişti.
OpenAI yetkilileri GPT’yi eğitirken asla telif hakkı ile korunan içerik kullanmadığını söylemesi burada güveni bayağı sarsıyor. Elon Musk’ın “büyük yalan” demesi üzerine bu davanın ortaya çıkması da tırnak içinde ilginç bir tesadüf değil mi?
Tabi burada daha sonra derinlemesine inceleyeceğimiz bir konu da tekrar karşımıza çıkıyor. Elon Musk da Twitter’ı satın aldıktan sonra ilk yaptığı şeylerden biri “API” olarak bilinen ve Twitter’daki verilere erişim sağlayan tüm hizmetleri kapatmasıydı. Bunun yanında elinde devasa çok değerli veri bulunan şirketler birer birer bu kapıları kapatmaya başladılar. Çok uzun süredir “yeni petrol veri” derken de işte tam da bundan bahsediyorduk. Yeni para birimi… Peki. Times bu davadan ne bekliyor? Talepleri neler yani?
İlk olarak elbette şimdilik bir rakam vermeseler de tüm zararlarının karşılanmasını istiyorlar. Burada Microsoft’un openAI ve yapay zeka araçlarını kullanmaya başlaması sonrasında geçtiğimiz yıl 1 trilyon doların üzerinde değer artışı yaşadığını belirtmeleri belki bir fikir verebilir. Ama bunu anlayabiliriz. Asıl önemli olan diğer talepleri. Times, ABD Yasaları uyarınca kendi içeriklerini ve telif hakkı ile korunan içerikleri kullanarak eğitilen GPT başta olmak üzere tüm Büyük Dil Modellerinin tamamen kapatılmasını talep ediyor. Evet. “Destruction” kelimesini kullanmışlar özellikle, yıkmaktan, yok etmekten bahsediyor.
Tabi bu konunun çok daha derin sebep ve sonuçları var. Bu davayı tarihi davalardan biri yapan da bu zaten. Olaya OpenAI tarafından bakarsak da yine bazı ikilemler karşımıza çıkıyor. GPT ve benzeri modellerin eğitimi için elbette devasa miktarda veri kullanılıyor. Ve görünüşe göre bu modeller çok işe yarıyor. Şahsi kullanımlarımızı ve bize faydalarını bir kenara bırakalım, şu anda Fortune 500 olarak bilinen en büyük 500 şirketin %80’inden fazlası organizasyonlarında çok yaygın bir şekilde bu modelleri kullanıyorlar. Karşımızda devasa bir fayda, katma değer bulunuyor. Ama işin öbür tarafında da Times’ın ve benzeri tüm şahıs ve kuruluşların argümanları var. Onların da haklı olduğu taraflar çok fazla. Bazı dedikodulara göre OpenAI ile NewYorkTimes bu konuda ilk görüşmelerinde OpenAI birkaç yüz bin dolara bu işi bağlayacağını düşünmüş ancak Times elbette çok daha fazlasını talep etmiş ve hatta bundan sonra da OpenAI’ın bu tip kullanımlara devam edecekse kendisine pay vermesini de talep etmiş. Fakat bu görüşmelerin detaylarını bilmiyoruz elbette.
OpenAI bundan nasıl kurtulur peki? Büyük Dil Modellerinin çalışma mantığı sağlam bir argüman olabilir. Bu modeller doğrudan veriyi bir bütün halinde depolamaktan ziyade çok daha karmaşık bir mantıkla çalışıyor. Sonraki kelimenin ne olacağını tahmin ederek çalışan bir mantığı var. Bunu detaylıca konuşacağız haftaya ancak buradan yürüyebilir OpenAI. Ama mahkeme bunu ne kadar ciddiye alır bilmiyoruz.
Dediğimiz gibi. Çok önemli bir dava bu. Talep ettikleri gibi ChatGPT’nin kapatılacağını düşünmüyorum, bu biraz artık kamuya mal olmuş bir hizmet gibi, doğrudan bir kapatma çok olası görünmüyor fakat mahkemenin vereceği karar bu teknolojinin geleceğini de doğrudan ilgilendiriyor. Çünkü bu tip davaları daha çok göreceğiz. Çünkü görünüşe göre Midjourney de şu anda doğrudan Marvel karatkerlerini filan tıpatıp oluşturmaya başladı. Buradan da yeni davalar gelecek gibi. Bir de programcılar Github ile yazılımcılar arasındaki davayı da hatırlayacaktır. Programcıların açık bir şekilde ürettikleri kodları kullanan Github copilot da bir nevi bu programcıların emeklerini hiçbir karşılık vermeden kullanıyor.
Bir nevi aslında insanlar kendi işlerini elinden alabilecek bir “şeyi” kendileri eğitiyor gibi bakabiliriz buna. Tabi hiç Google’dan bahsetmedik değil mi? Google’ın nasıl bu piyasanın gediklisi olduğundan bahsetmiştik. Bir süre önce, bu davalar filan ortaya çıkmadan önce Google ne yapmış biliyor musunuz? Gemini’ın eğitimi için kullandıkları tüm veri setlerinden ders kitapları, makaleler vs. aklınıza gelebilecek tüm telifli verileri kaldırmışlar… Bunu yaparken bu olasılıkların farkındalar mıydı? Bir tür içeriden bilgi alma durumları mı var yoksa gizli şekilde bu davaların çıkmasını mı sağladılar bilemeyiz. Bunlar tamamen spekülasyon.
Ama anlayacağınız üzere oldukça önemli bir dönemden geçiyoruz. Ve Elon Musk yine aynı röportajda şöyle karamsar bir tablo da çizmişti… Bu davalar çözülene kadar genel yapay zeka yaratılacağı için çok geç mi olacak? Ne düşünüyorsunuz?



