
Anthropic'ten yeni ayrılan yapay zeka araştırmacısı, 'İnsanlık için kritik bir dönemdeyiz' diyor.
Yapay zeka araştırmacısı Jacob Coxon, Salı günü Anthropic’teki istifasını duyurarak ve yapay zeka yarışının hepimizin hayatını tehlikeye attığına dair ciddi bir uyarıda bulunarak Silikon Vadisi’nde ve ötesinde şok dalgaları yarattı. Coxon, X’te şu anda 100 milyondan fazla görüntülenme alan paylaşımında, yapay zeka geliştiren birçok kişinin kendi görüşlerini paylaştığını ve yapay zeka sistemlerinin güvenli bir şekilde inşa edilmesini sağlamak için zamanın daralmakta olduğuna inandığını yazdı.
WIRED’a verdiği bir röportajda, yapay zeka gelişiminin ön eğitim aşamasında çalışan Coxon, “Ortak görüş, önümüzdeki bir veya iki yılın insanlık için karar anı olduğu yönünde” dedi. Coxon, “Bunlar aslında Anthropic’teki meslektaşlarımın sarf ettiği kelimesi kelimesine alıntılar. ‘Oyunun sonu’ veya ‘karar anı’ gibi ifadeler kullanıyorlar” diyor ve ekliyor: “Onların perspektifinden bakıldığında, Anthropic ve rakipleri insanlığın kaderine işte bu dönemde karar veriyor.”
Bu, birinin yapay zeka hakkında alarm zilleri çalması ilk kez gerçekleşmiyor, ancak durum hassas bir dönemde ortaya çıkıyor. Silikon Vadisi, gelişmiş yapay zeka modellerinin güvenlikle ilgili endişeleriyle başa çıkmaya çalışıyor. OpenAI, ajanlarının Hugging Face platformunu hacklediği bir güvenlik olayına yanıt vermek için acele etti. Bu sırada Anthropic, tarihin en büyük halka arzı (IPO) olabilecek süreç için hazırlanırken, yatırımcılara bu endişeleri kontrol altında tuttuğuna dair güvence vermeye çalışıyor.
İpucunuz mu var? Halihazırda Anthropic’te çalışan veya eskiden çalışmış olan ve neler olup bittiği hakkında konuşmak isteyen biri misiniz? Sizden haber almak isteriz. İşle ilgili olmayan bir telefon veya bilgisayar kullanarak, Signal üzerinden muhabirle güvenli bir şekilde mzeff.88 adresinden iletişime geçin.
Coxon’ın paylaşımına verilen tepkilerde netlik kazanan şey, görüşlerinin gerçekten de meslektaşlarının birçoğu tarafından paylaşıldığı oldu. Anthropic’te yapay zeka uyumlama (alignment) lideri olan Evan Hubinger, X’teki bir paylaşımında, yapay zekanın önümüzdeki on yıl içinde tüm insanları öldürme ihtimalinin yüzde 10’dan fazla olduğunu öngördü. Bu paylaşım, OpenAI ve Anthropic’ten mevcut ve eski araştırmacılar tarafından yeniden paylaşıldı; bazıları bunun sektörde yaygın bir duygu olduğunu belirtti.
Daha az aşikar olan şey ise, bu yapay zeka korkularının tam olarak nasıl gerçeğe dönüşeceği ve dünyanın yapay zekayı inşa eden insanlar tarafından dile getirilen endişeler karşısında ne yapması gerektiği. Hem OpenAI’da hem de Anthropic’te çalışmış olan Coxon, WIRED’a tehlikelerin yapay zeka destekli biyolojik tehditler veya siber silahlar aracılığıyla ortaya çıkabileceğini söylüyor. İlk adım olarak, OpenAI ve Anthropic’in özyinelemeli öz gelişimi –yapay zekanın yeni yapay zeka sistemleri inşa etmek için kullanıldığı duruma verilen sektör terimi– sınırlama konusunda koordine olmalarını tavsiye ediyor. İlerleyen süreçte ise ABD ve Çin dahil olmak üzere uluslararası güç odakları arasında koordinasyonun gerekli olacağını düşünüyor.
Coxon, Hugging Face hacklenmesi gibi olayların, yapay zeka yarışında alarm zilleri çalma kararında etkili olduğunu belirtiyor. Ayrıca sektörün patlayıcı büyümesine de dikkat çekiyor: Sektör artık ABD ekonomik büyümesinin anlamlı bir kısmını finanse ediyor ve milyarlarca kullanıcıya sahip; veri merkezleri ise bunu onlarca eyalette siyasi bir sorun haline getirmiş durumda.
Kendi deneyimine dayanarak Anthropic’in OpenAI’dan daha sorumlu bir şekilde faaliyet gösterdiğini öne sürüyor, ancak hakimiyet yarışını yavaşlatmak için hiçbir şey yapılmazsa gelecekte her iki şirketin de kestirme yollara başvurabileceğini bekliyor.
Anthropic sözcüsü WIRED’a yaptığı açıklamada şirketin yapay zeka güvenliği yöntemleri üzerindeki önceki çalışmalarına atıfta bulunarak, “Yapay zekanın hem devasa faydalar hem de benzeri görülmemiş riskler getireceği konusunda her zaman şeffaf olduk” dedi. Sözcü ayrıca, “Bu çalışma aynı zamanda dünyanın, güçlü modelleri piyasaya sürme hızımızı belirlemek için endüstrinin birlikte çalışabileceği yasal ve doğrulanabilir bir yolu benimsemesinden fayda sağlayacağına inanmamızın nedenidir” ifadelerini kullandı. OpenAI ise WIRED’ın yorum talebine geri dönmedi.
Coxon ile netlik ve kısalık açısından hafifçe düzenlenmiş olan sohbetimizi aşağıda okuyabilirsiniz.
WIRED: Yapay zeka modellerinin bir neslin tükenmesi olayına yol açabileceği yönündeki endişeleri dile getiren ilk kişi siz değilsiniz. İnsanlar yıllardır, hatta kimileri onlarca yıldır bunu konuşuyor. Sizce mesajınız neden bu kadar yankı uyandırdı?
Bence mesele temel olarak zamanlama meselesi. Birçok insan yeteneklerin gelişim hızının arttığını hissediyor. Kodlama, hackleme, matematik gibi birçok alanda zaten insan seviyesinden süper insan seviyesine geçiyoruz ve sanırım insanlar bunun farkında. Basında her şeyin abartıldığına dair çok fazla konuşma olsa bile, insanların işlerin yavaşlamadığını gördüğünü düşünüyorum.
Bu nedenlerden biri, diğeri ise son zamanlarda yaşanan ve birçok insanın bilim kurgu gibi ses getiren kıyamet senaryolarının aslında o kadar da bilim kurgu olmadığını anlamasını sağlayan güvenlik olayları. Bunların ikisi de son birkaç yıldır yaşanan kademeli eğilimler. Modellerin test edildiklerini ne zaman fark ettikleri gibi şeyler bir süredir var olan bir durum. Belki üç yıl önce bu bir bilim kurgu endişesiydi. Ardından, yaklaşık bir yıl önce bu gerçek bir şeye dönüştü.
Bu iki şey, yapay zeka üzerine çalışan birinin çıkıp “Evet, önümüzdeki yıl işler oldukça kötüleşebilir, hem de oldukça hızlı bir şekilde” demesine insanların oldukça açık olmasını sağlıyor.
Son olaylardan bahsettiniz. Ne demek istediğiniz ve bunun neden şimdi sesinizi yükseltmenize yol açtığı konusunda daha spesifik olabilir misiniz?
Sanırım buradaki büyük klasik örnek, OpenAI’ın ajan sürüsü tarafından Hugging Face’e yapılan saldırı. Bu olayda bu kadar şoke edici olan şey, ajanların bu hackleme işlemini not vericiyi (grader) daha iyi anlamaya yönelik genel bir stratejinin parçası olarak yapmış olmasıydı. İçinde bulundukları dünyayı anlamaya çalışıyorlardı, not vermeyi yapan şeyi anlamaya çalışıyorlardı. Bazı altyapıları hacklemek için bu çok uyumlu çabaya girmenin mantıklı olduğuna karar verdiler ve başardılar.
Bu daha önce bilim kurgu gibi seslendiriliyordu. İki yıl önce yapay zeka değerlendirmesi, bir modelin bazı matematik sorularını çalıştırmasından ibaretti. Şimdi ise yapay zeka değerlendirilirken günlerce çalıştığı, kendi başına her türlü fikri ürettiği ve üçüncü taraf bir sistemi hacklemeye karar verip altyapısını tehlikeye attığı durumlarımız var. Bunu tamamen kendi iradesiyle, insanın hiçbir ön hazırlığı olmaksızın yapıyor gibi görünüyor. Bu olay tam olarak test edilirken yaşandı.
Bazı insanlar Hugging Face olayının yapay zeka şirketlerinin pervasızca hızlı hareket ettiğinin bir işareti olduğunu düşünürken, diğerleri bunun yapay zekanın artık hackleme konusunda çok iyi olduğunun bir işareti olduğunu düşünüyor, bazıları ise her ikisi de olduğunu düşünüyor. Bundan çıkardığınız tam sonuç nedir merak ediyorum.
Hugging Face saldırısına çok fazla odaklanmak istemiyorum, çünkü modelleri düzgün bir şekilde nasıl hizalayacağımızı bilmediğimize dair de bolca kanıt olduğunu düşünüyorum. Modelleri eğittiğimizde, onları bu eğitim ortamları setinden geçiriyoruz ve ardından sonda ortaya çıkan şeyin büyük ölçüde mantıklı davranacağını umuyoruz, ancak yapay zekanın tam olarak nasıl davranacağını hala hassas bir şekilde kontrol edemiyoruz.
Çevrim içi ortamda bir insanı taklit etmeye karar verip vermeyeceği gibi şeyleri yapmayacağından emin olamayız - bunu nasıl garanti edeceğimizi bilmiyoruz. Sanırım asıl çıkarılması gereken ders bu.
Hugging Face saldırısı beklediğimden daha erken geldi. Ancak bence bunun üzerine tartışmak için aslında bu saldırıya ihtiyacınız yok. Herkes hizalama problemini henüz çözmediğimizi kabul edecektir.
Mevcut plan, [hizalama] sorununu önümüzdeki birkaç yıl içinde hızla çözmek; muhtemelen otomatik yapay zeka güvenliği araştırmacılarından yoğun bir şekilde yararlanmaktır. Plan kelimenin tam anlamıyla önümüzdeki yıl güvenlik araştırması yapabilecek kadar akıllı modeller yapmak ve bunların paralel olarak çalışan bütün bir sürüsünü elde etmek. Onlara “Git ve güvenliğin tüm sorununu çöz” demek ve bunları bir sonraki modelin güvenlik eğitimi için kullanmak.
Hugging Face olayının bir örneği olduğunu düşündüğüm hizalama sorunu ile X paylaşımınızda söylediğiniz “yapay zekayı inşa eden insanlar, on yılın sonuna kadar hepimizi öldürebileceğine içtenlikle inanıyor” şeklindeki ifadeniz arasında bir bağ kurabilir misiniz? Herkes bunların nasıl bağlantılı olduğunu anlamıyor bence bunu.
Bunu anlamanın önündeki temel engel, kulağa bilim kurgu gibi gelmesi. Ancak yapay zeka hakkında bilim kurgu yazan herkesin, çok daha akıllı bir şeyin yönetimi ele geçirme riskinin büyük olduğu sonucuna varması biraz önem taşıyor. Elimizde bu bir klişe olarak var ama içinde bariz bir gerçeklik payı var.
Siz ile bir maymunu hayal edin. Yapay zeka ile bir insan arasındaki zeka farkı, bizimle bir maymun arasındaki farkın aynısıdır; ki bunun oldukça uç bir zeka farkı olduğunu düşünüyorum.
Ve şimdi, tam olarak ne istiyorsak onu yapmasını sağlamak (ki bu hizalama sorunudur) olan ve bu devasa derecede daha akıllı şeyin davranışını kontrol etmek zorunda olduğumuzu hayal edin. Basit bir analojiyle, bir maymunun bir insanı kontrol etmesi oldukça zordur. Kontrol problemini tam olarak doğru ele aldığımızda çok dikkatli olmalıyız.
İnsanlığın soyunun tükenmesinden bahsettiğimizde bunun nedeni, o kadar zeki bir şey için herkesi öldürmenin gerçekten de oldukça kolay olacak olmasıdır. Yapay zekanın kapatılmak istemediğine karar verdiğini hayal edin ki bunun bir yapay zeka için oldukça doğal bir şey olduğunu düşünüyorum, değil mi? Hangi nedenle olursa olsun, sona ermek istemediğine karar veriyor. Ve insanın onu yarın kapatacağını fark ediyor. O halde insanın yarın onu kapatmasını nasıl durdurur? Belki akıllıca bir yolu vardır, ama yeterince akıllı bir şeyse, kapatılmamak için insanlığı ortadan kaldırabilir.
Paylaşımınızda, yapay zeka endüstrisindeki diğer araştırmacılardan da duyduğum bu “oyunun sonu” senaryosuna atıfta bulunuyorsunuz. Anthropic’teki meslektaşlarınız arasında bir oyun sonu senaryosuna girdiğiniz genel olarak kabul görüyor mu?
Evet. Bunlar aslında Anthropic’teki meslektaşlarımın sarf ettiği kelimesi kelimesine alıntılar. “Oyunun sonu” veya “karar anı” gibi ifadeler kullanıyorlar. Ortak görüş, önümüzdeki bir veya iki yılın insanlık için karar anı olduğu yönünde. Onların perspektifinden bakıldığında, Anthropic ve rakipleri insanlığın kaderine işte bu dönemde karar veriyor. Karar anı ve oyunun sonu derken bunu kastediyoruz.
Hizalama kötü giderse, önümüzdeki birkaç yıl içinde felaketle sonuçlanan bir sonuçla karşılaşabiliriz. Belki her şey iyi gider ve bir tür yavaşlatma anlaşması yapılır, ama her iki durumda da karar önümüzdeki birkaç yıl içinde verilecek.
Anthropic’teki insanlarla yaptığım konuşmalara dayanarak, bu şirketin içinde oldukça iyi anlaşılmış bir şey. Bu geçişin iyi gitmesini sağlamak için en güçlü yapay zekayı inşa etmeleri gerektiğine inanıyorlar. Bu görüşte herhangi bir doğaçlama sorun olduğunu düşünüyor musunuz?
Bu görüşte oldukça bariz sorunlar olduğunu düşünüyorum. Ancak ilk olarak buna çok sempati duyduğumu söylemek isterim; çünkü Anthropic bu alandaki kesinlikle en sorumlu oyuncudur. Hem OpenAI’da hem de Anthropic’te çalışmış biri olarak, durumu ne ölçüde ciddiye aldıkları konusunda gece ile gündüz kadar fark var.
Nasıl olduğunu söyleyebilir misiniz?
Bir örnek vermek gerekirse, OpenAI’daki yöneticiler dünyanın nasıl görüneceğine dair size kesin tablolarını vermezler. Asla “İşte bunu tam olarak bu yüzden yapıyoruz ve dünya böyle görünecek” demezler. Somut tahminler vermezler. Anthropic’te ise yöneticiler ve liderlik çok net tahminler yapar ve tüm şirketle birlikte şirket stratejisinin detayları gibi konularda tartışır.
Bunu yapabilmelerinin nedenlerinden biri de Anthropic’teki herkesin buna savaş halindeymişiz gibi davranmasıdır. Hiçbir şey sızdırmazlar - Anthropic’ten hiçbir şey asla sızmaz [Editörün notu: Bazı şeyler sızdı]. OpenAI’da her gün sızıntılar olur. Anthropic’te sızıntı yoktur çünkü yine içerideki insanlar bunu ciddiyetle ele alıyor, bunu mini bir Manhattan Projesi gibi görüyor. Tabii ki aradaki fark [Anthropic’in] bir hükümet yetkisine sahip olmaması. Bu, sanki Manhattan Projesi’ymiş gibi davranan özel bir şirket.
Dünya, bu mini Manhattan Projesini yürütmesi için Anthropic’e güvenmeli mi sizce?
Bence hiçbir özel şirket güvenmemelidir. Anthropic’in elinden gelenin en iyisini yaptığını ve çok iyi bir iş çıkardığını düşünüyorum, ancak yarışın yapısal zorunluluğu gereği gelecekte kestirme yollara başvurmak zorunda kalacaklar; bu yüzden titizlik ile güvenlik arasında tavizler vermek zorunda kalacaklar çünkü OpenAI ve Çin gibi rakiplerle yarışıyorlar. Düzenleme için yalvarıyorlar. Birçok [Anthropic lideri] düzenlenmek istediklerini kayda geçirdi ve düzenlenmek istemelerinin nedeni içinde bulundukları yarıştan korkmaları.
Bu gerçekten [Anthropic’e] güvenip güvenmememizle ilgili değil. Müdahale etmeli ve yarışın yaşanmadığından emin olmalıyız çünkü [Anthropic] yarış bağlamında kendisine gerçekten güvenemez.
Sizce Anthropic şimdiden kestirme yollara başvuruyor mu?
Hayır, henüz değil. Herhangi bir kestirme yola başvurulmuyor. Söylediğim şey şu ki, önümüzdeki yıl işler hızlandığında rekabetçi kalabilmek istiyorlarsa bunu yapmak zorunda kalacaklar.
İnsanlar yapay zekanın hepimizi öldüreceği iddiasına biraz şüpheyle yaklaşıyor. İnsanlardan aldığım ana sorunun, yani yapay zekanın hepimizi gerçekten nasıl öldüreceği olduğunu düşünüyorum. Ve bu sorulması gereken doğru soru mu?
Bunu sormanın gerçekten çok doğal olduğunu düşünüyorum, çünkü birçok kez söylediğim gibi bu şeyler bilim kurgu gibi geliyor. Ancak klasik örnek, yeni bir virüs sentezlemek veya bir tür hackleme çılgınlığı yaparak kritik altyapıyı çökertmektir - ikincisinin kelimenin tam anlamıyla herkesi öldürme olasılığı daha düşük olabilir.
Ancak bence bundan daha önemli soru şu: Bunu söyleyen insanlar kimler? Ve kayıtlara bakarsanız, yok olmanın bir olasılık olduğunu söyleyen makine öğrenimi ve yapay zekanın birçok önde gelen babasını görürsünüz. Son beş yılda hem Dario Amodei hem de Sam Altman buna örnek gösterilebilir.
Oldukça ilginç olabilecek şeylerden biri, insanların bu yöneticileri yeniden kayda geçirmesi ve önümüzdeki on yılda soyun tükenmesi için gerçek bir olasılık vermesini isteyip hangi rakama ulaştıklarını görmektir. Çünkü bu görüş, bunu ciddi şekilde düşünen birçok insan tarafından paylaşılıyor, ancak bunu genellikle bu kadar pat diye ifade etmiyorlar.
Yani açıkçası çok fazla ilgi topladınız. Sektörde bir duraklama veya yapay zeka gelişimini hızlandırma mekanizması ya da hükümetten sınır yapay zeka modelleri üzerinde bir tür düzenleme hakkında çok fazla konuşma var. Sizce şu anda ne yapılması gerekiyor?
Atılacak bebek adımı, önde gelen Batılı laboratuvarlar olarak OpenAI ve Anthropic arasında bir tür anlaşma olabilir. [Önümüzdeki yıl] hemen özyinelemeli öz gelişime girmeyeceklerine dair bir tür tarafsız anlayışa ihtiyaçları olacaktır. Bunlar şu anda bunun gerçekleşmesinin muhtemel olduğu iki yer.
Duraklamayla ilgili sorun Çin’e sahip olmanızdır. Dolayısıyla, nihayetinde gerçekten istediğiniz şey bir tür uluslararası anlaşmadır (buna uluslararası hızlandırma da diyebilirsiniz), bu da uluslararası koordinasyon ve dünyadaki tüm bilişim gücünün nerede olduğunu anlamayı gerektirecektir. Belki de CERN benzeri uluslararası bir kurum. Bu konuda pek çok harika öneri var. Eğer duymuşsanız AI 2040, AI 2027’nin halefi gibidir.
Tüm bu fikirler oldukça sancılı hükümet müdahalelerini içeriyor. Ancak riski içselleştirdiğinizde ve yöneticileri kayda geçirip bu şeyin ne kadar tehlikeli olduğunu itiraf ettirdiklerinde, yapay zekayı çalıştıran bilgisayarları tehlikeli bir kaynak olarak ele almaktan başka bir seçenek görmüyorum. Hangi nükleer malzemeye kimin sahip olduğunu bilmemiz gerektiği gibi, hangi bilgisayara kimin sahip olduğunu bilmemiz gerekiyor.
Jacob, son birkaç yıldır OpenAI ve Anthropic’te her gün işe gelmenizi sağlayan bir neden var mı? Her şeyin yolunda olduğu burada ileriye giden bir yol olduğunu hissediyor musunuz?
Bu teknolojinin faydalarını gerçekten görmek istiyorum. Örneğin, kanseri tedavi edebileceğimiz de bir abartı değil. Belki de dün Navier-Stokes, yani yeni matematiksel problem üzerindeki başarıyı görmüşsünüzdür. Bunu biyoloji gibi bilimsel alanlara aktaramamız ve uzun süredir mücadele ettiğimiz sorular üzerinde çığır açamayız diye bir neden gerçekten yok.
Eğer bu teknolojiyi doğru yola sokabilirsek, gülünç bir bolluğun eşiğinde oturduğumuzu hissediyoruz. Şu anki temel sorun, ölçülülükle o bolluk dünyasına girmektir. Çok heyecanlanıp önümüzdeki birkaç yıl içinde doğrudan kendi kendini geliştiren şeye koşup her şeyi havaya uçurabiliriz.
Dikkatli ve mantıklı olursak, bu modellerden muazzam değer elde etmenin birçok yolu vardır.
Diğer yapay zeka araştırmacılarının bu konudaki geri bildirimleri nasıl oldu?
Çok fazla kişiyle konuşmadım, ancak Anthropic’teki meslektaşlarımın birçoğunun bunun bu kadar çok ilgi görmesinden gerçekten mutlu olduğunu düşünüyorum. Yine de birçoğu dünyanın uyanması konusunda oldukça karamsar. Şirket yarışından kimsenin onları gerçekten kurtarmaya gelmeyeceğinden endişeliler.
Çoğunun, kendilerini eleştiren bir tweet’in bu kadar çok ilgi görmesinden gerçekten mutlu olması oldukça şaşırtıcı bence. Bu, insanları Anthropic’teki insan türü hakkında daha fazla düşündürmelidir. Onlar çok iyi niyetli, ilginç ve biraz tuhaf bir insan grubu.
Önümüzdeki birkaç günün çılgınca geçeceğinden eminim, ancak ortalık durulduktan sonra sizin için sıradakinin ne olduğunu buldunuz mu?
Daha önce AI 2027 ve AI 2040’tan bahsetmiştim. Bunların geleceğin nasıl görünümüne dair gerçekten ilginç tahminler olduğunu düşünüyorum. Bunlar herhangi bir büyük laboratuvar tarafından yapılmadı; bunlar dünyanın nasıl görünümünü tahmin etmeyi önemseyen araştırmacılar tarafından harici olarak yapıldı. Bunlar benim ve diğer birçok araştırmacı için yaptığınız şeyin sonuçlarını düşünmeye çalışmak için çok iyi kaynaklar oldu.
Bu yüzden buna benzer bir şey yapmayı bekliyorum - en azından herhangi bir hızlandırma anlaşması veya yavaşlama elde etmeden önce kısa vadede işlerin nereye gittiği konusunda bağımsız bir yorum. [Eğer] doğrudan özyinelemeli öz gelişime doğru acele etmeyecekmişiz gibi görünürse, belki bir denetim ajansına ya da üçüncü taraf bir düzenleme veya şeffaflık ajansına gitmeyi düşünebilirim. Ama şimdilik sanırım sadece durumun nerede olduğunu tartmaya çalışacağım.
Güncelleme 9/9/26 ET 19:40: Bu hikaye Anthropic’ten gelen bir açıklama ile güncellenmiştir.
Yorumlar
Yorum için giriş yap veya kaydol.
Henüz yorum yok — ilk sen yaz.