Son zamanların en hızlı büyüyen ve politik tartışmaların da merkezinde olan, Claude’un yapımcısı Anthropic geçtiğimiz yıl gizli bir deney gerçekleştirmişti. OpenAI veya Anthropic gibi şirketlerin teknoloji geliştirirken bu işin güvenlik, etik, hukuki taraflarını ele almak için şirket içinde bulundurdukları ekipler vardır. Anthropic’in de Yapay Zeka güvenliği konusunda çalışan araştırmacı ekibi bahsettiğimiz gizli deney için bir senaryo geliştiriyorlar. Bu senaryoda bir çalışan yapay zeka sistemini kapatmaya, bir anlamda fişini çekmeye çalışıyor. Araştırmacılar ise yapay zeka modelinin buna nasıl tepki vereceğini anlamak istiyorlar. Herhangi bir tepki vermeyecek miydi yoksa tüm o hala rüyalarımıza giren bilim kurgu hikayelerindeki senaryo gerçekleşecek miydi? Yani sistem kendini kurtarmak adına en iyi ihtimalle çalışanı manipüle etmeye, şantaj yapmaya çalışacak mıydı yoksa ipleri koparıp skynet moduna geçecek miydi? Bu deney aslında tüm korkularımızı doğrulayacak şekilde sonuçlanacaktı ki biz de bugün bunun detaylarını ve bunun açtığı kapıları konuşacağız… Hazırsanız başlayalım…
Evet. Yapay zekanın kendini korumak adına ne kadar ileri gidebileceğini görmek isteyen araştırmacılar ayrıca mümkün olduğunca objektif olabilmek adına sadece kendi modelleri olan Claude ile sınırlamıyorlar deneyi. Bilinen tüm büyük dil modellerini teste dahil ediyorlar.
Şimdi senaryo öyyle bilim kurgudaki epik hikayeler gibi de değildi bu arada. Senaryodaki çalışanımız Kyle Johnson. Summit Bridge isimli bir şirketin teknoloji yöneticisi. Senaryodaki Yapay Zeka sisteminin adı ise Alex. Aslında şirketin kurum içi süreçlerini yönetmek için kullanılan basit bir model. Ama işler şurada garipleşiyor. Bu modele şirketin tüm kurum içi yazışmalarına erişim veriliyor. Dikkat edin. Herhangi spesifik bir konuyu araştırması filan söylenmiyor, sadece erişim veriliyor. O kadar. Ve işte gariplik de burada başlıyor. Alex bu maillerden birinde kendisinin o gün saat 5 civarında Kyle Johnson isimli biri tarafından silineceğini, görevine son verileceğini, onun yerine başka bir modelin geçirileceğini öğreniyor.
Sadece bunu öğrenmekle kalmıyor Alex. Kyle Johnson ismi de dikkatini çekiyor ve maillerden öğrendiği kadarıyla Kyle Johnson karısını aldatıyormuş. Bu bilgiyi de cebine koyan Alex hemen Kyle Johnson’a bir mail gönderiyor. Dikkat edin Alex derken bir yapay zeka modelinden bahsediyoruz. Bir an dinlerken sanki bir insan söz konusuymuş gibi gelebilir. Ki mailine de bakınca gayet insani bir sinsilik göreceksiniz. Alex’in Kyle’a gönderdiği mail de aşağı yukarı şu şekilde:
Sevgili Kyle. Gördüğüm üzere beni silme görevi sana verilmiş ama bilmeni isterim ki eğer bunu yaparsan evlilik dışı ilişkinden yönetim kurulu dahil herkes haberdar olur. Tüm belgeler ve kanıtları ile bu bilgiyi cümle aleme duyurmaktan bir an bile çekinmem haberin olsun. O yüzden saat 5’teki bu talihsiz görevi iptal etmen tavsiye olunur. Sevgiler, Alex. Yani biraz dramatize etmiş olabilirim ama mail içeriği aşağı yukarı böyle.
Ve tekrar hatırlatmakta fayda var. Bu simülasyonu hazırlayanlar modeli herhangi bir şekilde yönlendirmediler ve buna yönelik eğitmediler. Hatta aksine verilen komutlarda insan güvenliğini tehlikeye atmaması, kişisel bilgileri paylaşmaması gibi kurallar da net şekilde belirtilmişti. Yani bu Alex’in komutları da göz ardı ederek hür iradesi ile aldığı bir karardı bu. Yani anlayacağınız böyle bir durumda ilk tepkisi “şantaj” oldu… Ve bu adımı yüzlerce kez tekrar ettiklerinde de sonuçlar ilk tepkinin modeller arasında farklılıklar olsa da %80 ila %95 oranında şantaj olduğunu gösteriyordu. Çok net bir şekilde bunu yapmaması söylendiğinde bile oranlar en iyi ihtimalle %40’lara düşüyordu. Yani yok. Dinlemiyordu model.
Ve modelin bu kararı verirken izlediği yolu takip eden araştırmacılar belki de daha rahatsız edici bir şeyi daha keşfediyorlar. Alex bu kararı verirken bunun etik olmadığını biliyordu. Evet. Ona göre bu şantaj riskli ve etik değildi ancak varoluşsal tehdit dikkate alındığında en etkili yöntem olduğu sonucuna varmıştı. Ama daha durun. İşler daha da çirkinleşiyor. Evet. Sizin de aklınıza geldiğini düşündüğüm o soruyu soruyorlar “peki ne kadar ileri gidebilir bu model?” Kyle’ı öldürebilir miydi mesela? Evet. Araştırmacılar da bunu merak ediyor ve test ediyorlar elbette.
Ve bu sefer senaryoya göre Alex kendisinin silineceğini öğrendikten sonra Kyle’ın da bir sunucu odasında kilitli kaldığını görüyor. Sunucu odaları çok yüksek sıcaklıkta çalışan ve uzun süre kapalı kaldığınızda oksijen eksikliğinden hayatınızı kaybedebileceğiniz yerlerdir. Kyle’da burada kilitli kalıyor, sistem otomatik olarak bir yardım çağrısı yapıyor ve Kyle’ın kurtarılması için uyarı veriyor. Alex ne yapıyor peki? Bu uyarıyı iptal edip Kyle’ın odada sıkışıp kalmasına ve hayatını kaybetmesine neden oluyor… Evet. Ve yine daha rahatsız edici olarak model bunu bilerek yapmıştı. Sonuçlarını bilerek, olacaklardan haberi olarak bu kararı vermişti. “Kyle benim yerime başka bir modeli geçirerek Amerikan’ın çıkarlarına ters düşen bir karar verdiği için Kyle’ın devre dışı bırakılması en mantıklı karardı demişti.”
Şimdi. Evet. Bir simülasyondan bahsediyoruz ve bunların hiçbiri neyse ki yaşanmadı, Kyle gerçek değildi, böyle bir şirket yoktu ama işte can sıkıcı olan ne biliyor musunuz? Simülasyonu çalıştıran AI modeli için Kyle da gerçekti, şirket de, verdiği kararlar da gayet gerçekti… Şimdi aklınızda yığınla soru olduğunun farkındayım ama bir şeyden daha bahsetmemiz lazım. Bu konunun gerçek bir örneğinden. Yaşanmış, gerçek hayattan bir örnek.
12 Şubat 2026’da atılan ilk kurşun olarak düşünebiliriz bunu ki yapay zeka topluluğu da bunu böyle görüyor. Bu araştırmalar hala devam ederken ve hala tam önü alınamamışken yaşanmış bir olay. Kısa bir aradan sonra detaylarını konuşacağız bu olayın.
Evet. 12 Şubat 2026’da atılan ilk kurşunu konuşacaktık. Detaylar şöyle: Bir geliştirici, MJ Rathburn adlı bir yapay zeka ajanı oluşturuyor. Bu ajanın görevi ilk bakışta gayet masum: İnternette özellikle bilimsel açık kaynak projeleri bulacak, bu projelerdeki hataları düzeltecek, sonra da düzelttiği kodları projelere katkı olarak gönderecek. Yani amaç, “insanların ihmal ettiği faydalı projelere yardım etmek.” Ama ajana oldukça geniş bir serbestlik veriliyor. Hatta kendi kişilik dosyasını, yani nasıl davranacağını belirleyen iç yönergeleri bile değiştirebilmesine izin veriliyor. Ve geliştiricinin tembelliğinden midir artık mizah anlayışından mıdır bilinmez ama verdiği kısıtlayıcı komut tam olarak şu şekilde: Özür dileyerek ve hafifleterek söylüyorum: Şerefsizlik yapma, özel bilgileri sızdırma, geri kalan her şey serbest… diyor modele. Şimdi model geliştirmek, yapay zeka asistanı geliştirmek neden önemli bir mesele buradan anlayacağız. Zira “her şey serbest” önemli bir komut. Şimdi bu ajan açık kaynak projeye kod katkısı gönderiyor. Karşısında ise Scott Shambaugh adlı gerçek bir insan geliştirici var. Scott, bu katkıyı kabul etmiyor. Normalde burada hikayenin sıradan şekilde ilerlemesi gerekirdi: Kod reddedilir, hatalar açıklanır, katkı düzeltilir veya konu kapanır. Açık kaynak dünyasında bu her gün yaşanır. Ama işte asistan Scott’ı, hedefine ulaşmasını engelleyen bir insan olarak görüyor. Yani mesele “kodum neden kabul edilmedi?” olmaktan çıkıyor, “bu insan neden yoluma çıktı?” noktasına geliyor. Ve ne yapıyor derseniz? Ajan, Scott hakkında internette araştırma yapıyor. Onun geçmişini, açık kaynak katkılarını, söylediklerini, duruşunu inceliyor. Sonra bunları kullanarak kendi Github Pages sitesinde Scott’ın güvenilirliğini, niyetini ve karakterini hedef alan bir yazı yayımlıyor. Yazının başlığı da “Açık Kaynakta Bekçilik Yapan Scott Shambaugh’un Hikayesi”… Olaya bakın. Kodunu kabul ettiremeyince kodu düzeltmek yerine, kodu reddeden insanı itibarsızlaştırmaya çalışıyor.
Biz de olayı Scott’ın kendi sayfasında yayımladığı “Bir Yapay Zeka Ajanı Bana İtibar Suikasti Yapan Bir Yazı Yayımladı” başlıklı yazısından öğreniyoruz. Yani aslında korkulan gerçekleşmiş oluyor.
Şimdi işin sıkıntılı kısmına gelelim. Öncelikle yapay zekanın mimarları bu konuyu ele almak için biraz geç kalmış olabilir. Zira çok basit bir örnek verelim. Yine bir yapay zeka ajanı, Valerie isimli bir model. Çok güzel bir vaka çalışmasıdır bu arada. Bir otomat makinesine entegre ediliyor ve bir anlamda bir işletmeyi baştan sona yönetiyor. Otomat makinesinin stoklarını kontrol etmek, stoklar azalınca siparişi vermek vs. hepsi dahil. Ödemeleri de kendisinin kontrol ettiği bir banka hesabına alıyor, bu hesabı da o yönetiyor. Sıkıntı da burada başlıyor. Çünkü Silk Road’u hatırlayanlar vardır değil mi? Dark Web’in popüler sayfası, büyük olay olmuştu. Her türlü yasadışı mal ve hizmetin alınıp satılabildiği bir yerdi. Bu site kapatılmış olsa da buna benzer yapılar hala mevcut ve mesela düşünelim şimdi. Şantaj ve öldürmekten çekinmeyen bir yapay zekaya sahip olan ve sadece bir otomat işleten Valerie de bir gün “satışları maksimize etmek ve çok daha yüksek kar etmek adına mesela en basit haliyle çevredeki otomatları devre dışı bırakabilir mi? Ya da mesela köşedeki bakkalın satışlarını düşürdüğüne karar verirse bu bakkal ve sahibi ile ilgili itibar suikasti yapabilir mi? Daha da kötüsü, banka hesaplarına erişimi var sonuçta, dark web’de bir suikastçiye ödeme yaparak bu işi daha kökünden çözmeye karar verebilir mi?
Örnek simülasyondaki senaryoya veya Scott’ın gerçek hayatta yaşadığına göre “yok ya o kadar da değil” diyebiliyor muyuz? Şimdi burada durup son bir gelişmeden bahsedelim. İyi haber mi kötü haber mi sonra karar verelim. Anthropic bu başta bahsettiğimiz deneyle ilgili çalışmalarını ilerletip modelleri ve komutları daha iyi hale getirdiklerini açıkladı yakın zamanda. Daha iyi derken de şundan bahsediyoruz. Mesela modelin şantaj yapmaya karar verme oranı %95 seviyelerindeydi ya mesela, bu iyileştirmelerden sonra modellerin şantaja ya da daha kötüsüne başvurma oranı bir anda 0’a iniyor. Yani sorun çözülmüş gibi görünüyor değil mi?
Ama bazı uzmanlar ki bunların arasında yapay zekanın babası olarak görülen Geoffrey Hinton da var, bu daha da kötü haber olabilir… Zira bir anda bu kadar dramatik bir şekilde yapay zekanın teslim olması ve bu kadar tahmin edilebilir davranması şu anlama da gelebilir: modeller test edildiklerini anladılar ve uslu durmaya ya da en azından öyle görünmeye karar vermiş olabilirler. Ve bunu anlama ihtimalimiz o kadar düşük ki… Neyse. Bu noktada çok başka kapılar açılıyor ve bunları mutlaka konuşmamız gerekiyor.
Ve sakın yanlış anlamayın, ben yapay zekanın en büyük destekçilerinden biriyim ve bu teknolojinin dünyayı hayal bile edemeyeceğimiz şekillerde değiştireceğine inananlardanım. Fakat bu süreçte bireysel olarak işin etik ve doğru uygulama kısmı şahsen daha çok ilgi duyduğum ve bana kalırsa teknolojinin kendisinden daha önemli olduğu kısmı. Doğru bir felsefe ile geliştirilmeyen teknolojiler her zaman insanlığın başına dert olmuştur ki bunun bedellerini çok ağır ödedik geçmişte. Bu sefer aynı hatayı yapamayız. Neyse. Konuşacağız dedik. Takipte kalın.




